☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜
可变要素已封装为见名知义占位符并绑定五段式结构:1. 字段声明:列出【input_file_path】全部列名及类型;2. 异常现象:分述【string_null_column】、【negative_amount_column】、【date_column】的脏数据表现;3. 清洗规则:每条含“列名+条件→动作”完整链路;4. 验证方式:用pandas代码验证;5. 输出约束:明确保留列与索引状态。
你需要在codeium中反复生成数据清洗规则,但每次都要重写提示词、调整字段名、补全业务逻辑,稍有遗漏就产出无法执行的空洞描述。直接复制旧提示词又常因文件路径变更或样例数据更新导致规则错位,比如把orders_2026q1.csv的清洗逻辑套用到orders_2026q2.csv上,结果customer_id列的"null"字符串没被识别,amount列的负值阈值也没按新业务要求重设。
提取可变要素并封装为占位符
打开任意一份已验证有效的清洗提示词,逐行扫描所有可能变动的内容:原始文件路径、列头结构、脏数据样例、业务约束阈值、动作动词选择。把这些全部替换成大写英文+下划线格式的占位符,例如把【data/orders_2026Q2.csv】改为【INPUT_FILE_PATH】,把“customer_id列含字符串'NULL'”改为“【STRING_NULL_COLUMN】列含字符串'NULL'”。
【STRING_NULL_COLUMN】和【NEGATIVE_AMOUNT_COLUMN】必须首次出现时加粗,后续出现不加粗;禁止使用VAR1、COL_A这类模糊标识,命名必须见名知义。
样例数据前三行也需参数化:把“1001,"NULL",299.99,"30/May/2026 14:22"”替换为“【SAMPLE_ROW_1】”,确保Codeium不会把固定样例当成硬编码规则来源。
绑定五段式结构输出契约
在提示词末尾强制声明输出必须严格遵循以下结构,每段标题后紧跟冒号,不得换行、不得缩进:
1. 字段声明:列出【INPUT_FILE_PATH】中全部列名,按CSV首行顺序排列,每列后标注数据类型(str/float/datetime);
2. 异常现象:针对【STRING_NULL_COLUMN】、【NEGATIVE_AMOUNT_COLUMN】、【DATE_COLUMN】三类字段,分别写出真实观察到的脏数据表现;
3. 清洗规则:每条规则必须含“列名 + 条件 → 动作”完整链路,动作动词仅限转为空、替换为、删除整行、标记为异常、截断至X位小数;
4. 验证方式:说明如何用pandas代码验证规则生效,例如df[【STRING_NULL_COLUMN】].isna().sum()应为0;
5. 输出约束:指定最终DataFrame必须保留的列、索引状态、是否重置索引。
任何偏离该结构的输出视为无效,Codeium必须重试——这一步不加占位符,是固定契约。
注入业务逻辑自适应指令
方法一:动态字段判断
若【DATE_COLUMN】存在且其样例含“/”“-”“月”任一字符,则在“清洗规则”段中强制加入日期解析语句:pd.to_datetime(df[【DATE_COLUMN】], infer_datetime_format=False, errors='coerce');否则跳过此项。
方法二:阈值映射表
根据【AMOUNT_NEGATIVE_THRESHOLD】取值(-0.01/-1.0/-5.0),自动设定删除条件:-0.01→amount
方法三:空值处理校验
生成前先确认【NULL_REPRESENTATION】是否为空。若非空(如["NULL","N/A","null"]),须将每个字符串作为独立条件写入清洗规则,例如【STRING_NULL_COLUMN】 == "NULL" → 转为空;【STRING_NULL_COLUMN】 == "N/A" → 转为空。
嵌入失败案例反向锚定
以下写法不可接受:
✘ “对缺失值进行处理” → 缺失值在哪列?是空字符串、NULL、还是'N/A'?处理方式是填充均值、前向填充,还是删除整行?
✘ “统一日期格式” → 原始格式是‘2026/05/30’还是‘30-May-2026’?
✘ “金额列做清洗” → 哪一列?阈值是多少?负值是否允许?动作是截断、删除还是标记?
【INPUT_FILE_PATH】必须作为首个占位符出现在提示词顶部,不可省略。











