数据口径文档需明确平台与人群限制:首句锁定具体平台及特有字段(如抖音enter_from),并列“且”连接cdp人群标签id或宽表字段,缺一则无法通过数据rd评审。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要在通义千问中生成一份数据口径文档,但默认输出常忽略具体平台(如抖音、淘宝、微信小程序)和人群限制(如18–25岁新客、高净值复购用户),导致文档无法直接用于数仓建模或BI取数对齐。
明确嵌入平台限制的提示词写法
第一步:在需求描述开头就锁定平台名称,不要用“某平台”“主流App”等模糊表述。例如写“抖音小店订单表中的支付成功口径”,而非“电商订单表的支付成功口径”。
第二步:紧接说明该平台特有的字段逻辑。抖音有enter_from字段区分直播间/短视频跳转,淘宝有traffic_source,微信小程序依赖scene值——必须写出你实际要用的字段名和典型枚举值,比如“抖音订单需排除enter_from = 'search'的搜索直达单”。
第三步:若涉及多平台对比,用表格结构强制分离。提示词中加入“请按以下格式输出:|平台|数据源表名|关键过滤条件|是否含测试账号流量|”,这样模型不会把抖音和快手的去重逻辑混在一起。
精准表达人群限制的三种写法
方法一:用业务角色+行为阈值定义,避免年龄/地域等静态标签堆砌。例如:“近90天首次完成支付且客单价≥299元的女性用户”,而不是“25–35岁、一线城市的女性”。前者可直接映射到数仓用户宽表的first_pay_date和last_90d_avg_order_amt字段。
方法二:引用已有的人群包ID或标签体系。写明“采用CDP系统中标签ID为U_TAG_782的人群包(定义:过去7天打开APP≥3次且点击过会员页)”,模型会优先匹配该ID对应的技术口径,而非自行编造规则。
方法三:对易混淆人群加否定排除。比如要“非员工测试账号”,不能只写“排除内部员工”,而要写“排除user_id在dim_user_type表中user_type = 'EMPLOYEE_TEST'的所有记录”,【不写表名和字段名会导致模型用通用逻辑替代,结果不可控】。
组合平台与人群限制的实操指令
把平台和人群作为并列约束条件写进同一句主干,中间用“且”连接,不换行、不加括号。例如:“请定义小红书笔记互动数据口径:统计2024年Q2内,小红书App客户端产生的笔记点赞、收藏、评论行为,且用户属于CDP标签ID为U_TAG_419的人群(近30天浏览美妆类目≥5次的18–24岁学生)。”
这句里,“小红书App客户端”锁定了平台采集端,“CDP标签ID为U_TAG_419”锁定了人群技术来源,“近30天浏览美妆类目≥5次的18–24岁学生”是该标签的业务解释——三者缺一不可,漏掉ID就会让模型自由发挥人群逻辑。
最后检查提示词是否包含至少一个平台特有字段名和一个人群标签ID或宽表字段名。没有这两项,生成的口径文档大概率无法通过数据RD评审。











