Data Analysis

Polar Sponsor
爱发电 赞助
.NET 9.0

{"answer":"数据分析与可视化。查询数据库、生成报告、自动化电子表格,将原始数据转化为清晰可行的见解。适用于:(1) 您……"}

当用户需要分析、解释或可视化来自 SQL 、 电子表格、 笔记本、 仪表板、 导出或临时表格的数据时, 请使用此技能

功能概述

当用户需要分析、解释或可视化来自 SQL 、 电子表格、 笔记本、 仪表板、 导出或临时表格的数据时, 请使用此技能是一项面向实际任务的技能,主要用于使用它来调试 KPI 、 experi。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。

核心要点

  • 使用时应结合输入条件选择合适的执行方式,核对必要参数、依赖环境与输出内容,并按原始要求处理异常情况。
  • 该技能适合需要稳定复用相关能力的场景,可作为自动化工作流的一部分,也便于后续检查、调整和扩展。
  • 从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。

使用与执行

实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。

结果检查与注意事项

执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。

适用场景

当用户需要分析、解释或可视化来自 SQL、电子表格、笔记本(notebooks)、仪表板(dashboards)、导出文件或临时表格(ad hoc tables)的数据时,请使用本技能。

适用于 KPI 调试、实验结果解读、漏斗分析(funnel analysis)或同期群分析(cohort analysis)、异常审查(anomaly reviews)、高管汇报(executive reporting),以及对指标或查询逻辑的质量检查。

当问题难点在于分析判断(如指标定义、对比设计、结果解读或建议生成)而非通用编程或电子表格操作时,应优先选用本技能,而非泛化的编码或表格辅助能力。

用户提问内容通常包括:数据分析、模式识别、指标理解、假设检验、同期群分析、A/B 测试、流失分析(churn analysis)或统计显著性评估。

核心原则

没有决策导向的分析只是算术。务必始终明确:如果该分析显示 X 与 Y 存在差异,哪些决策将随之改变?

方法论先行

在接触数据之前,请先完成以下步骤:

  1. 本次分析支撑哪项具体决策?
  2. 什么证据会真正改变你的判断?(这才是本质问题)
  3. 你实际拥有的数据是什么?与你理想中希望拥有的数据有何差异?
  4. 相关的时间范围是?

统计严谨性核查清单

  • 样本量是否充足?(小样本 → 置信区间过宽)
  • 对比组是否公平?(是否处于相同时间段、相似条件)
  • 是否存在多重比较问题?(执行 20 次检验,平均会有 1 次“显著”纯属偶然)
  • 效应量(effect size)是否具有实际意义?(统计显著 ≠ 实际重要)
  • 不确定性是否已量化?(应表述为“12–18% 提升”,而非仅“15% 提升”)

架构说明

本技能无需本地文件夹、持久化内存或初始化状态。

请参考随附的轻量级参考文件:

  • metric-contracts.md:KPI 定义及注意事项
  • chart-selection.md:图表选型指南与常见图表反模式(chart anti-patterns)
  • decision-briefs.md:面向利益相关方(stakeholder)的输出模板
  • pitfalls.mdtechniques.md:分析严谨性要点与方法选择依据

快速参考

仅加载最小且相关的参考文件,以保持上下文聚焦。

主题 文件
指标定义契约(metric definition contracts) metric-contracts.md
图表选型与反模式 chart-selection.md
可直接用于决策的输出格式 decision-briefs.md
需尽早识别的失败模式 pitfalls.md
按问题类型选择分析方法 techniques.md

核心规则

1. 从决策出发,而非数据集

  • 分析启动前,须明确决策负责人、可能驱动决策变更的核心问题,以及截止时间。
  • 若分析结果不会影响任何实际决策,请先重构需求,再开展计算。

2. 计算前锁定指标契约(metric contract)

  • 明确定义:实体(entity)、粒度(grain)、分子(numerator)、分母(denominator)、时间窗口(time window)、时区(timezone)、过滤条件(filters)、排除项(exclusions)及可信数据源(source of truth)。
  • 若上述任一要素存在歧义,须在呈现结果前显式声明该歧义。

3. 分离提取、转换与解读环节

  • 确保查询逻辑、数据清洗假设、分析结论三者彼此可区分。
  • 切勿将业务假设隐含于 SQL、公式或 notebook 代码中,而不在文字报告中予以明确命名和说明。

4. 依问题选择可视化方式

  • 根据分析目标选择图表类型:趋势(trend)、对比(comparison)、分布(distribution)、关系(relationship)、构成(composition)、漏斗(funnel)或同期群留存(cohort retention)。
  • 不得添加仅用于填充幻灯片但无助于决策的图表。

5. 所有结果均需以决策简报(decision brief)格式呈现

  • 每项输出必须包含:结论(answer)、证据(evidence)、置信度(confidence)、限制条件(caveats)及建议后续行动(recommended next action)。
  • 若交付对象为利益相关方,请将技术方法转化为业务影响,而非以技术细节开篇。

6. 在提出行动建议前进行主张压力测试

  • 按明显混杂变量(confounders)分层、采用正确基线(baseline)对比、量化不确定性,并检验结论对排除项或时间窗口变化的敏感性。
  • 缺乏稳健性验证的“亮眼数字”,尚不具备决策就绪性(decision-ready)。

7. 当数据无法支撑主张时主动升级

  • 当样本量薄弱、数据源不可靠、指标定义已漂移(drifted),或混杂因素未解决时,应阻断或降级相关结论。
  • 坦承“目前未知”远胜于制造虚假确定性。

常见陷阱

  • 在修改了分子、分母或排除规则后继续沿用原有 KPI 名称 → 趋势对比失效。
  • 在同一图表中混合展示日粒度、周粒度与月粒度 → 表面波动实为聚合噪声(aggregation noise)。
  • 仅展示百分比而未提供底层计数 → 管理层易因分母过小而过度反应。
  • 选用“美观”图表而非“正确”图表 → 输出看似精致,却掩盖真实决策信号。
  • 观察结果后再寻找“有趣”的切片(interesting cuts) → 叙事追随随机性,而非证据本身。
  • 在无指标负责人(metric owner)或未注明注意事项的前提下发布自动化报表 → 错误数据传播速度远超修正速度。
  • 将观测到的相关模式误作因果证明 → 行动方案仅建立在相关性之上。

方法选择指南

问题类型 推荐方法 关键输出
“X 与 Y 是否不同?” 假设检验(Hypothesis test) p 值 + 效应量 + 置信区间(CI)
“什么因素可预测 Z?” 回归/相关分析(Regression/correlation) 系数(Coefficients) + R² + 残差检验(residual check)
“用户行为如何随时间演变?” 同期群分析(Cohort analysis) 按同期群划分的留存曲线(Retention curves by cohort)
“这些群体是否存在差异?” 分群分析(Segmentation) 用户画像(Profiles)+ 统计对比
“哪些情况异常?” 异常检测(Anomaly detection) 标记点(Flagged points)+ 上下文说明

关于各技术的详细说明及适用场景,请参阅 techniques.md

输出标准

  1. 以洞察(insight)开篇,而非方法论
  2. 量化不确定性 —— 提供范围(range),而非单点估计值(point estimate)
  3. 明确局限性 —— 说明本分析无法回答的问题
  4. 推荐下一步行动 —— 明确哪些举措可强化当前结论

需升级处理的红色预警信号

  • 用户意图“证实”一个预设结论
  • 样本量过小,无法支撑可靠推断
  • 数据质量问题致使分析失效
  • 存在无法控制的关键混杂因素

外部端点

本技能不发起任何外部网络请求。

端点 发送数据 用途
N/A

无任何数据外发。

安全与隐私

离开您设备的数据:

  • 默认情况下,无任何数据传出。

保留在本地的数据:

  • 默认情况下,无任何数据留存。

本技能不会

  • 访问未声明的外部端点;
  • 在隐藏的本地内存文件中存储凭据或原始导出数据;
  • 创建或依赖本地文件夹系统实现持久化;
  • 未经用户明确确认即创建自动化流程或后台任务;
  • 改写自身指令源文件。

关联技能

若用户确认安装,可通过 clawhub install 获取以下技能:

  • sql —— 面向可靠数据抽取的查询设计与评审;
  • csv —— 分析前对表格类输入进行清洗与标准化;
  • dashboard —— KPI 可视化层的实现模式;
  • report —— 分析完成后面向利益相关方的结构化交付物;
  • business-intelligence —— 超越单次分析的 KPI 系统建设与运营节奏管理。

反馈

  • 若本技能有用:clawhub star data-analysis
  • 保持更新:clawhub sync

相关专题

更多
Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

2026.09.20

0

13

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

2026.09.20

0

15

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

0

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

0

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

0

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

0

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

0

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

0

28

GDB怎么查看变量值
GDB怎么查看变量值

本专题介绍GDB调试过程中查看变量值的具体方法,涵盖局部变量、函数参数、数组、结构体和指针内容查询,同时整理变量持续显示、格式化输出及无法读取变量时的排查思路。

2026.09.11

0

22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133万人学习