基础数据分析框架,含方法论优先与统计严谨性检查清单,支持假设检验与描述统计
数据分析助手(免费版)是一项面向实际任务的技能,主要用于没有决策目标的分析只是算术;本免费版提供基础的数据分析框架,帮助你在分析前明确决策目标,在分析后规范输出结论;
证伪条件 :什么结果会改变你的判断?数据盘点 :你实际拥有什么数据 vs 你希望拥有什么数据?时间窗口 :哪个时间段与决策相关?输入 : 用户提供方法论优先。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。
从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。
没有决策目标的分析只是算术。本免费版提供基础的数据分析框架,帮助你在分析前明确决策目标,在分析后规范输出结论。
在处理数据之前,必须先回答四个问题:
输入: 用户提供方法论优先框架所需的指令和必要参数。
升级提示:多重比较校正(Bonferroni)、不确定性量化(置信区间报告)、完整分析陷阱识别表(辛普森悖论、幸存者偏差、p值操纵等6类陷阱)为付费版专享功能。
输入: 用户提供统计严谨性检查清单所需的指令和必要参数。 输出: 返回统计严谨性检查清单的执行结果,包含操作状态和输出数据。
| 问题类型 | 推荐方法 | 关键输出 |
|---|---|---|
| "X和Y是否有差异?" | 假设检验(t检验/卡方检验) | p值 + 效应量 |
| "什么因素预测Z?" | 回归/相关分析 | 回归系数 + R² |
升级提示:队列分析(留存曲线)、用户分群(画像比较)、异常检测(标记异常点)为付费版专享功能。
升级提示:声明局限分析、推荐下一步实验设计为付费版专享功能。
输入: 用户提供输出规范所需的指令和必要参数。 输出: 返回输出规范的执行结果,包含操作状态和输出数据。
本skill还覆盖以下能力场景: 基础数据分析框架、含方法论优先与统、支持假设检验与描、述统计、数据分析助手免费、提供基础的数据分、析框架与统计检查、核心能力包括、对照组公平性、描述统计、高级功能、分析陷阱识别全表、风险升级机制。这些能力在上述核心功能中均有对应处理逻辑。
执行结果以Markdown格式返回,包含操作状态(成功/失败)、处理摘要和具体输出数据。失败时返回错误码和错误信息,便于定位问题。
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由Agent内置LLM提供 |
需要配置对应API Key,详见上文环境配置章节
API Key配置方式:
export API_KEY="your_api_key_here"
配置后需重启会话或开启新终端生效。API Key应妥善保管,避免泄露到版本控制系统。
-value: 命令参数,用于指定操作选项-test: 命令参数,用于指定操作选项问题: 实验组转化率 3.2%,对照组 2.8%,样本各 5000 人,是否显著?
分析:
- 比例差异检验 (z-test)
- p-value = 0.043 < 0.05,统计显著
- 效应量: 相对提升 14.3%
- 结论: 统计显著,建议进一步评估业务意义
问题: 上月销售额的整体分布如何?
分析:
- 均值: ¥45,230
- 中位数: ¥38,500
- 标准差: ¥12,400
- 偏度: 1.2(右偏,存在高订单拉高均值)
- 结论: 中位数低于均值,分布右偏,关注大额订单影响
| 错误场景 | 原因 | 处理方式 |
|---|---|---|
| 小样本过度解读 | N<30 时置信区间过宽 | 报告置信区间宽度,标注"样本量不足" |
| 对照组不公平 | 不同时间段或条件下的对比 | 确保对比组在相同时间段、相似条件下 |
| 效应量被忽略 | 仅看 p 值不看实际提升幅度 | 同时报告 p 值和效应量(如相对提升%) |
| 点估计无不确定性 | 仅报告"提升15%"未给区间 | 报告置信区间,如"提升12-18%(95% CI)" |
| 预设结论确认偏误 | 用户试图"证明"已有结论 | 先列出证伪条件,再执行分析 |
A: 不一定。还需检查效应量是否具有业务意义,置信区间下界是否远离0。
A: 可以做描述性统计,但推断性结论需特别谨慎。建议使用非参数检验并明确标注"样本量不足"。
A: 辛普森悖论的完整识别与规避方法为付费版专享功能。免费版建议手动按关键维度(设备、渠道等)拆分后检查趋势是否反转。
A: 应写"提升12-18%(95%置信区间)"。点估计不传达不确定性,区间估计让决策者知道结论的可靠程度。
A: p 值操纵的完整校正方法(Bonferroni 校正、预注册假设)为付费版专享。免费版建议在分析前明确列出要检验的指标,避免事后追加检验。