新手可用三步法让claude精准识别脏数据:第一步指定其为数据质控分析师且只标记不修改;第二步提供含具体非法值的字段样例;第三步强制输出“if…then标记为【xxx】”格式规则。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

刚接触数据清洗的新手常被脏数据类型搞晕,看到“2024-02-30”“NULL ”“13:65:00”就不知从哪下手,更别说让Claude生成可落地的清洗规则。
用三句话教会Claude识别常见脏数据
第一步:明确告诉Claude你只处理“诊断型”任务——不改数据,只标记问题。直接写:“你是一位数据质控分析师,不修改原始数据,仅输出检测逻辑。”
第二步:扔给它三个带真实错误的字段样例,比如“订单日期字段含‘2024-02-30’‘2023/13/01’‘—’”,“下单时间字段含‘13:65:00’‘25:00:00’‘空格+NULL’”,“用户昵称字段含‘ ’‘\t\t’‘???’”。【必须写具体非法值,不能只说“日期错误”或“格式不对”】
第三步:强制指定输出格式为纯文本列表,每条以“IF…THEN标记为【XXX】”开头,例如“IF 订单日期包含‘/’ THEN标记为【日期分隔符错误】”。这能防止Claude自作主张输出Python代码或JSON结构。
新手可抄的三组即用型提示词模板
方法一:基础字段校验(适合Excel或CSV初筛)
“请为以下三列生成检测规则:①手机号(11位纯数字),②注册时间(ISO格式YYYY-MM-DD HH:MM:SS),③用户等级(仅允许‘VIP’‘普通’‘试用’)。对每个字段,列出一条IF…THEN标记语句,用中文描述异常情形。”
方法二:空值与伪空值识别(新手最容易漏掉的坑)
“字段值为‘NULL’‘null’‘N/A’‘—’‘ ’‘\t’‘’时,均视为无效空值。请为‘收货地址’列写一条检测规则:IF 值属于上述任意一种 THEN标记为【空值混杂】。”
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
方法三:数值越界快检(避开手工逐行比对)
“年龄字段理论范围是0–120。请生成一条规则:IF 年龄<0 OR 年龄>120 THEN标记为【年龄越界】。注意:跳过非数字字符,只对可转为整数的值做判断。”
让Claude输出可直接粘贴进SQL的清洗指令
第一步:在提示词开头定义角色和动作目标——“你是一名ETL工程师,负责将清洗规则转化为Spark SQL可执行语句。”
第二步:给出原始字段名和期望清洗效果,例如:“user_name字段需统一转为小写,并去除首尾空格;status字段中‘active’‘ACTIVATED’‘on’全部映射为‘ACTIVE’。”
第三步:追加语法约束:“所有规则必须使用Spark SQL内置函数,如lower()、trim()、regexp_replace()、case when,禁止使用Python或Pandas语法。”
这一步操作起来很简单,把上面三句话拼成一段文字提交给Claude,它就会输出类似“SELECT lower(trim(user_name)) AS user_name, CASE WHEN status IN ('active','ACTIVATED','on') THEN 'ACTIVE' ELSE status END AS status FROM raw_table”的结果。










