要让chatgpt生成贴近真实系统的mock数据,需明确角色与上下文、嵌入业务约束、指定输出格式、注入真实分布规律、绑定关联逻辑、强制异常样本、复用真实枚举与命名习惯。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要让ChatGPT生成的mock数据在字段命名、数值分布、业务逻辑和边界情况上贴近真实系统,不能只写“生成10条用户数据”,必须嵌入领域约束、组织惯例和校验规则。
明确角色与上下文
第一步:在提示词开头用单句定义模型身份。例如:“你是一名有5年电商中台经验的数据产品经理,正在为订单履约模块设计测试数据。”
第二步:紧接着给出该业务域的真实约束。比如:“所有订单必须满足:下单时间早于支付时间,支付时间早于发货时间;优惠券ID以‘COUPON_’开头且长度固定12位;收货手机号必须为中国大陆11位号码,且不能以14、17、19开头(避开虚拟运营商号段)。”
第三步:指定输出格式要求。例如:“每条数据用JSON对象表示,字段顺序按数据库表物理列序排列,不加注释,不加空行。”
注入真实分布规律
方法一:用百分比+典型值描述字段分布。例如:“status字段取值为‘created’(45%)、‘paid’(38%)、‘shipped’(12%)、‘cancelled’(5%),其中cancelled订单的cancel_reason必须从[‘地址错误’、‘用户主动取消’、‘库存不足’]中三选一,且‘库存不足’仅出现在status为‘paid’的订单中。”
方法二:绑定关联字段逻辑。例如:“user_level字段为‘VIP3’时,discount_rate必须≥0.15且≤0.22;user_level为‘new’时,first_order_time必须等于order_time,且coupon_used必须为false。”
用于在用户想通过浏览器自动化与 Google Gemini 或 ChatGPT 交互时。触发短语包括“ask Gemini”“ask ChatGPT”“ask GPT”“让...”。
【user_id必须由6位数字+2位大写字母组成,例如‘824173AB’,不可使用‘O’‘I’字母,避免与数字0、1混淆】
强制加入业务异常样本
在总数中预留5%~10%的异常数据,并明确定义异常类型。例如:“生成20条订单数据,其中2条为异常样本:1条是payment_amount为负数(模拟退款冲正错误),1条是shipping_address为空但status=‘shipped’(模拟下游系统字段丢失)。”
这一步不能笼统说“包含一些错误数据”,必须写出具体字段、错误值、发生场景,否则模型会生成无意义的乱码或默认忽略。
复用真实枚举与命名习惯
不要让模型自由编造枚举值。直接提供真实列表:“province字段只能是:[‘广东省’, ‘浙江省’, ‘上海市’, ‘北京市’, ‘四川省’];city字段需与province强匹配,如province=‘广东省’时,city只能从[‘广州市’, ‘深圳市’, ‘东莞市’]中选。”
字段命名采用团队实际用名而非通用英文。例如写“pay_channel_code”而不是“payment_method”,写“inv_status”而不是“invoice_status”,因为真实表里就是这么缩写的。
注意:若业务中存在多语言字段(如product_name_en/product_name_zh),必须同时声明两者内容逻辑关系,例如“product_name_zh为‘无线降噪耳机’时,product_name_en必须为‘Wireless Noise-Cancelling Headphones’,不可自由翻译。”










