全功能中文数据分析平台,支持时序分解、假设检验、大数据集批处理与自定义报告模板。
中文数据分析(专业版)是一项面向实际任务的技能,主要用于2.1 数据读取全封装(免费版基础 + 企业级扩展);CSV / Excel / JSON;
本地数据库;PostgreSQL / MySQL;pd.read_sql + SQLAlchemy;企业数据库;ClickHouse。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。
从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
| 数据源 | 代码片段 | 适用场景 |
|---|---|---|
| CSV / Excel / JSON | pd.read_csv / read_excel / read_json |
文件数据 |
| SQLite | pd.read_sql |
本地数据库 |
PostgreSQL / MySQL |
pd.read_sql + SQLAlchemy |
企业数据库 |
| ClickHouse | clickhouse-driver |
OLAP 分析 |
| REST API | requests.get |
第三方接口 |
| 数据湖 | pyarrow / duckdb |
Parquet/Arrow 文件 |
输出: 返回1 数据读取全封装(免费版基础 + 企业级扩展)的执行结果,包含操作状态和输出数据。
resample('D/W/M') 按日/周/月聚合rolling(window=7).mean() 移动平均与标准差diff() / pct_change()seasonal_decompose 趋势-季节-残差分解处理: 按照skill规范执行2 时间序列分析操作,遵循单一意图原则。 输出: 返回2 时间序列分析的执行结果,包含操作状态和输出数据。
| 检验类型 | 适用场景 | 关键产出 |
|---|---|---|
| t 检验(独立/配对) | 均值差异 | t 值 + p 值 + 效应量 |
| 卡方检验 | 类别关联 | χ² + p 值 + Cramer's V |
| 方差分析(ANOVA) | 多组均值对比 | F 值 + p 值 + 事后检验 |
| Mann-Whitney U | 非正态分布 | U 值 + p 值 |
| 多重比较校正 | 批量检验 | Bonferroni / BH 校正后 p 值 |
| 效应量 | 业务重要性 | Cohen's d / 优势比 + 置信区间 |
输入: 用户提供3 假设检验与 A/B 测试所需的指令和必要参数。 输出: 返回3 假设检验与 A/B 测试的执行结果,包含操作状态和输出数据。
输入: 用户提供4 大数据批处理所需的指令和必要参数。 输出: 返回4 大数据批处理的执行结果,包含操作状态和输出数据。
输入: 用户提供5 自定义报告模板所需的指令和必要参数。 处理: 按照skill规范执行5 自定义报告模板操作,遵循单一意图原则。
PostgreSQL:支持窗口函数、CTE、JSONB、物化视图输入: 用户提供7 企业数据库深度集成所需的指令和必要参数。 处理: 按照skill规范执行7 企业数据库深度集成操作,遵循单一意图原则。 输出: 返回7 企业数据库深度集成的执行结果,包含操作状态和输出数据。
本skill还覆盖以下能力场景: 全功能中文数据分、析平台、支持时序分解、大数据集批处理与、中文数据分析专业、版面向专业数据分、工程师与数据团队、负责人、提供完整的数据分、析生产线能力、核心能力、涵盖免费版全部能、无条数与功能限制、效应量与置信区间、大数据集批处理、千万级数据增量计、模板引擎、定时分析任务与邮、自动化周报、与企业数据库深度。这些能力在上述核心功能中均有对应处理逻辑。
| 角色 | 场景 | 关键能力 | 输出形态 |
|---|---|---|---|
| 数据分析师 | A/B 实验结论判定 | 假设检验 + 多重比较校正 | 结论表 + 决策建议 |
| BI 工程师 | 大屏数据底表生产 | 大数据批处理 + 增量更新 | 物化视图 + 数据集 |
| 数据团队负责人 | 周报/月报自动化 | 定时任务 + 邮件分发 | PDF 报告 + 邮件 |
| 业务决策者 | 关键指标预测 | 时序分解 + Prophet 预测 | 预测曲线 + 置信区间 |
1. 每周一 09:00 定时任务触发
2. 自动从 PostgreSQL 拉取上周销售数据(增量)
3. 执行数据清洗与时序分解
4. 渲染 Jinja2 报告模板生成 PDF
5. 邮件分发至增长团队邮件组
6. 任务执行结果写入审计日志
预计上手时间:< 120 秒(企业数据源需配置凭证)。
请对销售数据做时序分析:
1. 数据源: postgres(凭证从环境变量读取)
2. 表: daily_sales(2023-01-01 至 2024-12-31)
3. 关注: 月度趋势 + 季节性 + 2025 年预测
4. 输出: 分解图 + 预测曲线 + PDF 报告
请判定 A/B 测试:
5. 实验组: 10000 人,转化率 5.2%
6. 对照组: 9980 人,转化率 4.7%
7. 要求: t 检验 + 效应量 + 95% 置信区间
8. 输出: 结论 + 决策建议 + 报告卡片
请配置每周一定时任务:
9. 数据源: PostgreSQL 销售明细表
10. 分析: 上周销售汇总 + Top 10 商品 + 异动归因
11. 模板: 电商行业模板 + 公司品牌
12. 分发: 邮件 + 企业 IM Webhook
13. 失败重试: 3 次,指数退避
| 参数名 | 类型 | 必填 | 说明 |
|---|---|---|---|
| content | string | 是 | 相关说明 |
| content | string | 否 | 相关说明, 默认: 默认值 |
| content | string | 否 | 相关说明, 可选值: json/text/markdown |
| style | string | 否 | 输出风格, 参考 references/style.md |
{
"success": true,
"data": {
result: "相关说明",
result: "相关说明",
result: "相关说明",
"metadata": {
"template_used": "reviewer",
"word_count": 0,
"style": "专业"
}
},
"error": null
}
输出模板参考: assets/output.json
| 错误场景 | 原因 | 处理方式 |
|---|---|---|
| 配置错误 | 参数缺失或格式错误 | 检查依赖说明中的配置要求 |
| 运行时错误 | 运行环境不满足 | 确认运行环境符合依赖说明 |
| 网络错误 | 连接超时或不可达 | 执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案 |
| 依赖项 | 类型 | 是否必需 | 获取方式 |
|---|---|---|---|
| LLM API | API | 必需 | 由 Agent 内置 LLM 提供 |
| pandas | Python 库 | 必需 | pip install pandas |
| numpy | Python 库 | 必需 | pip install numpy |
| scipy | Python 库 | 必需 | pip install scipy(假设检验) |
| statsmodels | Python 库 | 必需 | pip install statsmodels(时序分解) |
| prophet | Python 库 | 可选 | pip install prophet(预测) |
| matplotlib | Python 库 | 必需 | pip install matplotlib(可视化) |
| seaborn | Python 库 | 可选 | pip install seaborn |
| sqlalchemy | Python 库 | 必需 | pip install sqlalchemy(数据库) |
| psycopg2 | Python 库 | 可选 | pip install psycopg2-binary(PostgreSQL) |
| clickhouse-driver | Python 库 | 可选 | pip install clickhouse-driver(ClickHouse) |
| dask | Python 库 | 可选 | pip install dask(大数据) |
| polars | Python 库 | 可选 | pip install polars(高性能) |
| jinja2 | Python 库 | 必需 | pip install jinja2(报告模板) |
| pyarrow | Python 库 | 可选 | pip install pyarrow(Parquet) |
| duckdb | Python 库 | 可选 | pip install duckdb(多源联表) |
DB_HOST/DB_USER/DB_PASSWORD 等环境变量传入SMTP_HOST/SMTP_USER/SMTP_PASSWORD 等环境变量传入IM_WEBHOOK_URL 等环境变量传入d:skills.skill-credentials 目录(已 gitignore)输入:
{
"content": "示例数据",
"content": "示例数据",
"style": "示例数据"
}
输出:
示例数据
输入:
{
"content": "示例数据",
"content": "示例数据",
"style": "示例数据"
}
输出:
示例数据
输入:
{
"content": "示例数据"
}
输出:
示例数据
A: 单机模式支持千万级行(Dask/Polars 后端),集群模式可处理亿级。增量计算可显著降低重复成本。
A: 短期(7-30 天)预测准确度较高(MAPE < 10%);中长期(>90 天)建议结合业务判断。Prophet 适合有季节性的数据,ARIMA 适合平稳数据。
A: 专业版自动应用 BH 校正控制 FDR。严格场景(医疗/金融)可切换 Bonferroni。
A: 支持 data-analyst-chinese、相关信息、相关信息、相关信息、相关信息 等变量,详见模板文档。
A: 查看审计日志中的执行历史,关注数据源连接、SQL 执行、模板渲染三阶段。失败自动重试 3 次,仍失败则告警。
A: 支持输出物化视图供 Tableau / Power BI / Metabase 消费,也可输出 Parquet 文件供数据湖使用。
A: 凭证统一走环境变量,禁止硬编码;数据库账号最小权限原则;报告可加水印与访问控制;审计日志完整保留。
A: 专业版支持通过 MCP工具协议接入外部数据源与计算后端,可在 mcp_servers 配置块中注册 MCP server 与 MCP端点,融入 MCP生态共享分析能力。
A: 通过 duckdb 或 ETL 工具将多源数据归一至统一 Arrow/Parquet 格式后,可使用 SQL 联表查询。
A: 企业版支持团队席位授权与 SSO 集成,具体联系销售团队。
| 错误场景 | 原因 | 处理方式 |
|---|---|---|
| LLM响应超时或无响应 | 网络延迟或模型负载过高 | 执行ping命令测试网络连通性,检查防火墙和代理设置连接,执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令请求;确认Agent平台LLM服务正常 |
| 输入内容格式不正确 | 用户输入不符合skill预期格式 | 检查输入是否符合skill使用说明中的格式要求,参考示例章节 |
| 执行结果与预期不符 | 指令描述不够明确或上下文不足 | 提供更详细的指令描述,补充必要的上下文信息 |
| 命令执行失败 | 运行环境不满足要求或权限不足 | 确认运行环境符合依赖说明中的要求;检查命令权限设置 |
-
-
-
相关专题
热门下载
相关下载
精品课程
共6课时 | 54.6万人学习
共89课时 | 133.1万人学习
共49课时 | 82万人学习