使用codegeex快速生成python数据处理函数需四步:一、构造含数据样例与函数签名的结构化提示词;二、用三引号提供上下文增强准确性;三、分步生成原子操作再整合;四、校验边界情况并手动修正。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望使用CodeGeeX快速生成Python数据处理函数,例如清洗缺失值、标准化字段、转换数据类型或筛选条件逻辑,则可通过提示词精准触发其代码生成能力。以下是实现该目标的具体操作路径:
一、构造结构化提示词
CodeGeeX依赖高质量提示词理解用户意图,需明确输入数据特征、清洗目标与输出格式。提示词应包含数据样例、问题描述及期望函数签名。
1、在CodeGeeX编辑器或支持插件的IDE中新建Python文件,光标置于空行。
2、输入以“请写一个Python函数”开头的自然语言指令,例如:“请写一个Python函数,接收pandas DataFrame,将列名转为小写,填充数值列的NaN为该列中位数,字符串列的NaN替换为'unknown',返回处理后DataFrame”。
3、确保提示中包含至少一项具体操作(如“填充NaN”“转小写”“删除重复行”),避免模糊表述如“优化数据”。
二、利用上下文增强生成准确性
提供少量真实数据结构信息可显著提升生成代码的可用性,CodeGeeX能据此推断列类型与常见异常模式。
1、在提示词上方插入三引号包裹的示例数据片段,例如:"""示例输入df.columns: ['UserID', 'AGE', 'CITY'],其中AGE为数值型,CITY为字符串型"""。
2、若已存在原始数据变量名(如df),在提示中直接引用该名称,例如:“对变量df执行以下清洗:……”。
3、添加约束条件,例如:“不使用sklearn,仅用pandas和numpy”,防止引入不兼容依赖。
三、分步生成多逻辑函数
当清洗流程含多个独立环节时,可拆解为原子操作分别生成,再组合成完整函数,降低单次生成失败率。
1、先单独请求缺失值处理逻辑:“写一个函数,输入Series,若dtype为数值则用中位数填充,否则用'unknown'填充”。
2、再请求列名标准化逻辑:“写一个函数,将列表中的字符串全部转为小写并用下划线连接”。
3、最后整合调用关系,手动补全主函数框架,将前述两个子函数嵌入对应位置。
四、校验与修正生成代码
CodeGeeX输出的代码可能未覆盖边界情况,需结合实际数据结构验证关键行为,尤其关注空DataFrame、全NaN列等极端输入。
1、复制生成函数到本地环境,在Jupyter Notebook中运行:df_test = pd.DataFrame({'A': [1, None, 3], 'B': ['x', None, 'z']})。
2、检查返回结果是否符合预期,重点观察:None值是否被正确替换、列名是否小写、数据类型是否保持不变。
3、若出现AttributeError,定位报错行,将对应操作替换为显式类型判断,例如将.fillna(df[col].median())改为if pd.api.types.is_numeric_dtype(df[col]): ...。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











