数据口径文档需用结构化提示词锁定定义边界:①业务定义、②计算逻辑、③边界说明,强制表格输出并标注“待确认”,否定式排除歧义,绑定具体字段及时区规则,输出符合confluence格式要求。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

写数据口径文档时,ChatGPT容易把“日活用户”理解成去重设备数,而业务实际按手机号去重——这种偏差会导致下游报表全错。必须用结构化提示词锁定定义边界、约束输出格式、排除歧义解释。
明确数据口径的三大核心要素
第一步:在提示词开头直接声明【必须严格包含以下三部分,缺一不可】:
① 业务定义(一句话说清“它到底是什么”,不许用术语套术语);
② 计算逻辑(字段来源、过滤条件、去重维度、时间粒度);
③ 边界说明(哪些情况算、哪些不算,举两个真实反例)。
第二步:强制要求用表格输出,表头固定为「要素类别|内容|说明」,禁止用段落描述。表格能天然抑制ChatGPT自由发挥,避免它把“用户登录即计入”这种模糊表述当定义。
第三步:插入一个硬性约束句:“若原始需求中未提供某要素信息,必须写‘待确认’并标注需向谁确认,不得自行推测或留空。”这一步卡住它瞎编的冲动——很多偏差就源于AI填补了本该人工决策的空白。
封死常见歧义点的写法
方法一:用否定式排除干扰项
在定义后紧跟一句:“不包括:测试账号、模拟请求流量、未完成实名认证的游客态行为。”比单纯说“只统计真实用户”有效十倍,因为ChatGPT对“真实”有自己一套脑补逻辑。
用于在用户想通过浏览器自动化与 Google Gemini 或 ChatGPT 交互时。触发短语包括“ask Gemini”“ask ChatGPT”“ask GPT”“让...”。
方法二:绑定具体字段和表名
写明“取数来源为dwd_user_login_inc表中的user_id字段,经dim_user_info表关联后,以mobile_hash去重”。它看到具体表名和字段,就不会擅自改成device_id或open_id。
方法三:时间窗口必须带时区和截断规则
写成“统计T-1日00:00:00至23:59:59(北京时间),按事件发生时间(event_time)截断,非服务器日志生成时间(log_time)”。不写清楚,它默认用ETL任务执行时间,口径立刻漂移。
让ChatGPT输出可直接粘贴进Confluence的格式
第一步:要求用三级标题分隔模块,格式为### 【业务定义】、### 【计算逻辑】、### 【边界说明】。
第二步:在提示词末尾加一句:“所有中文标点使用全角,数字与单位间不加空格(如‘100万用户’而非‘100万 用户’),表格内不换行,禁用Markdown以外的任何格式符号。”
第三步:给一个最小化示例(仅两行),例如:
### 【业务定义】
过去24小时内,完成至少一次支付成功的自然人用户数。
### 【计算逻辑】
| 字段 | 来源表 | 说明 |
|---|---|---|
| user_id | dwd_payment_success_inc | 从支付成功事件流实时写入 |
这个示例会锚定它的格式感知,比纯文字指令管用。










