数据分析专家(专业版)

Polar Sponsor
爱发电 赞助
.NET 9.0

全功能委派式分析平台,支持大数据流式处理、多任务编排、结果缓存与企业数据库集成。

数据分析专家(专业版)

功能概述

数据分析专家(专业版)是一项面向实际任务的技能,主要用于2.1 任务理解框架(完整版);数据来自哪里;

核心要点

  • 支持多源(文件+数据库+API);
  • 想得到什么结论;
  • 自动拆解为子目标;

使用与执行

用什么方法;推荐多种方法并对比;多格式(图表+报告+数据集);时间/资源/质量约束;成本预估与资源调度;输入 : 用户提供1 任务理解框架(完整版)所需的指令和必要参数;

结果检查与注意事项

2.2 大数据流式处理。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。

数据分析专家(专业版)

核心能力

2.1 任务理解框架(完整版)

要素 说明 进阶要点
分析对象 数据来自哪里 支持多源(文件+数据库+API)
分析目标 想得到什么结论 自动拆解为子目标
分析方法 用什么方法 推荐多种方法并对比
输出形态 产出什么 多格式(图表+报告+数据集)
约束条件 时间/资源/质量约束 成本预估与资源调度

输入: 用户提供1 任务理解框架(完整版)所需的指令和必要参数。

2.2 大数据流式处理

  • 分块读取:chunksize 参数分块加载,避免内存溢出
  • 生成器模式:yield 流式产出中间结果
  • 内存监控:实时监控内存使用,超阈值自动溢写磁盘
  • 数据类型优化:category / int32 等优化内存占用
  • Dask/Polars 后端:千万级数据并行计算

处理: 按照skill规范执行2 大数据流式处理操作,遵循单一意图原则。

2.3 多任务编排

  • 依赖图定义:显式声明任务间依赖关系
  • 并行执行:无依赖任务自动并行
  • 检查点恢复:每个任务完成后落盘,失败可断点续跑
  • 幂等保证:同任务多次执行结果一致
  • 失败策略:单任务失败重试 N 次,仍失败则跳过并告警
  • 资源调度:CPU/内存/IO 资源配额管理

输入: 用户提供3 多任务编排所需的指令和必要参数。

2.4 结果缓存与复用

  • 输入指纹:基于数据哈希 + 任务参数生成缓存键
  • 多级缓存:内存 → 本地磁盘 → 远程缓存(Redis)
  • 命中率指标:监控缓存命中率,优化缓存策略
  • 失效策略:数据更新或参数变更自动失效
  • 手动刷新:支持 force_refresh=True 跳过缓存

处理: 按照skill规范执行4 结果缓存与复用操作,遵循单一意图原则。

2.5 定时任务与自动化分发

  • cron 调度:标准 5 段式 cron 表达式
  • 数据源自动拉取:任务触发时拉取最新数据
  • 报告自动生成:执行 → 渲染 → 输出
  • 多渠道分发:邮件 / 企业 IM / Webhook / OSS
  • 失败重试:指数退避,最多 3 次
  • 审计日志:任务执行历史与结果留痕

2.6 自定义输出模板

  • Jinja2 引擎:支持条件、循环、宏定义
  • 多格式输出:Markdown / HTML / PDF / PPT
  • 品牌化:自定义 Logo、配色、字体
  • 模板库:内置 5 套行业模板
  • 变量插值:动态嵌入图表、表格、结论卡片

输入: 用户提供6 自定义输出模板所需的指令和必要参数。 处理: 按照skill规范执行6 自定义输出模板操作,遵循单一意图原则。

2.7 企业数据库集成

  • PostgreSQL:窗口函数、CTE、JSONB、物化视图
  • MySQL:读写分离与连接池
  • ClickHouse:OLAP 高速聚合
  • 数据湖:Parquet/Arrow/DuckDB
  • 凭证安全:统一通过环境变量传入

输入: 用户提供7 企业数据库集成所需的指令和必要参数。 处理: 按照skill规范执行7 企业数据库集成操作,遵循单一意图原则。 输出: 返回7 企业数据库集成的执行结果,包含操作状态和输出数据。

2.8 模板变量高级用法

基础变量: $DATE$ / $USER$ / $WORKDIR$
会话变量: $SESSION_GROUP_ID$
环境变量: ${ENV_VAR_NAME}
模板循环: {% for item in items %}...{% endfor %}
条件渲染: {% if condition %}...{% endif %}
宏定义:   {% macro render_chart(data) %}...{% endmacro %}

处理: 按照skill规范执行8 模板变量高级用法操作,遵循单一意图原则。 输出: 返回8 模板变量高级用法的执行结果,包含操作状态和输出数据。

能力覆盖范围

本skill还覆盖以下能力场景: 全功能委派式分析、支持大数据流式处、结果缓存与企业数、数据分析专家专业、版面向需要把复杂、数据分析任务、Agent、完成的专业用户与、提供完整的多任务、大数据处理与企业、级集成能力、核心能力、涵盖免费版全部能、无文件大小与任务、复杂度限制、基于分块读取与生、级文件、相同输入命中缓存、避免重复计算、多渠道通知。这些能力在上述核心功能中均有对应处理逻辑。

适用场景

3.1 按角色场景矩阵

角色 场景 关键能力 输出形态
数据分析师 多步骤归因分析 多任务编排 + 检查点 结论树 + 报告
BI 工程师 大屏底表生产 大数据流式 + 数据库集成 物化视图 + 数据集
数据团队负责人 周报自动化 定时任务 + 邮件分发 PDF 报告 + 邮件
业务决策者 关键指标监控 缓存复用 + 阈值告警 看板 + 告警卡片

示例

1. 业务人员委派:"分析上周销售下滑原因"
2. Agent 拆解为子任务:
   - 任务1: 拉取上周销售数据(数据库)
   - 任务2: 计算环比与同比(依赖1)
   - 任务3: 按品类/区域/渠道拆分(依赖2)
   - 任务4: 生成归因报告(依赖3)
3. 并行执行无依赖任务,串行执行有依赖任务
4. 每个任务落盘检查点
5. 失败任务重试 3 次,仍失败则跳过并告警
6. 最终生成 PDF 报告并邮件分发

使用流程

预计上手时间:< 120 秒(企业数据源需配置凭证)。

4.1 大数据分析任务

请分析这份日志数据:
1. 数据源: access_logs.parquet(约 5GB)
2. 时间范围: 2024-12-01 至 2024-12-31
3. 关注: 异常访问模式与高频接口
4. 约束: 流式处理,避免内存溢出
5. 输出: 异常清单 + 频次表 + PDF 报告

4.2 多任务编排

请编排多任务分析:
6. 任务1: 从 PostgreSQL 拉取销售数据(数据库)
7. 任务2: 拉取商品主数据(数据库,与1并行)
8. 任务3: 关联销售与商品(依赖1+2)
9. 任务4: 按品类汇总(依赖3)
10. 任务5: 生成报告(依赖4)
11. 检查点: 每个任务完成后落盘
12. 失败策略: 重试 3 次,仍失败则告警

4.3 定时报告任务

请配置每日监控任务:
13. 数据源: PostgreSQL 销售明细表
14. 频率: 每日 09:00 自动拉取昨日数据
15. 分析: 销售汇总 + Top 10 商品 + 异动归因
16. 模板: 电商行业模板 + 公司品牌
17. 分发: 邮件 + 企业 IM Webhook
18. 缓存: 7 天内相同请求命中缓存

输入格式

参数名 类型 必填 说明
content string 相关说明
content string 相关说明, 默认: 默认值
content string 相关说明, 可选值: json/text/markdown
style string 输出风格, 参考 references/style.md

输出格式

{
  "success": true,
  "data": {
    result: "相关说明",
    result: "相关说明",
    result: "相关说明",
    "metadata": {
      "template_used": "reviewer",
      "word_count": 0,
      "style": "专业"
    }
  },
  "error": null
}

输出模板参考: assets/output.json

异常处理

错误场景 原因 处理方式
配置错误 参数缺失或格式错误 检查依赖说明中的配置要求
运行时错误 运行环境不满足 确认运行环境符合依赖说明
网络错误 连接超时或不可达 执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案

依赖说明

运行环境

  • Agent平台: 支持SKILL.md的任意AI Agent(Claude Code / Cursor / Codex / Gemini CLI等)
  • 操作系统: Windows / macOS / Linux

依赖项

依赖项 类型 是否必需 获取方式
LLM API API 必需 由Agent内置LLM提供

API Key 配置

需要配置对应API Key,详见上文环境配置章节

可用性分类

  • 分类: MD+EXEC()

API Key配置方式:

export API_KEY="your_api_key_here"

配置后需重启会话或开启新终端生效。API Key应妥善保管,避免泄露到版本控制系统。

案例展示

示例1: 基础用法

输入:

{
  "content": "示例数据",
  "content": "示例数据",
  "style": "示例数据"
}

输出:

示例数据

示例2: 进阶用法

输入:

{
  "content": "示例数据",
  "content": "示例数据",
  "style": "示例数据"
}

输出:

示例数据

示例3: 边界情况 - 边界情况

输入:

{
  "content": "示例数据"
}

输出:

示例数据

常见问题

Q1: 专业版支持多大的文件?

A: 流式处理模式支持 GB 级文件,Dask/Polars 后端支持千万级行。增量计算可显著降低重复成本。

依赖说明

A: 在配置文件中用 depends_on 字段声明依赖,Agent 会自动构建依赖图,无依赖任务自动并行执行。

Q3: 结果缓存如何工作?

A: 基于输入数据哈希 + 任务参数生成缓存键。命中缓存直接返回结果,跳过计算。数据或参数变更自动失效。

Q4: 定时任务失败如何处理?

A: 单任务失败自动重试 3 次(指数退避),仍失败则跳过并触发告警。检查点机制保证已成功任务不重算。

Q5: 企业数据库如何接入?

A: 通过环境变量传入 DB_HOST/DB_USER/DB_PASSWORD 等凭证,配置文件引用即可。禁止硬编码。

Q6: 报告模板支持哪些变量?

A: 支持基础变量、环境变量、Jinja2 循环与条件、宏定义等,详见模板文档。

Q7: 多源数据如何联合分析?

A: 通过 duckdb 或 ETL 工具将多源数据归一至 Arrow/Parquet 格式,可使用 SQL 联表查询。

Q8: 是否支持 MCP工具扩展?

A: 专业版支持通过 MCP工具协议接入外部数据源与计算后端,可在 mcp_servers 配置块中注册 MCP server 与 MCP端点,融入 MCP生态共享分析能力。

Q9: 资源如何调度?

A: 支持为每个任务设置 CPU/内存/IO 配额,避免单任务耗尽资源影响其他任务。

Q10: 如何保障数据安全?

A: 凭证统一走环境变量,禁止硬编码;数据库账号最小权限原则;报告可加水印与访问控制;审计日志完整保留。

错误处理

错误场景 原因 处理方式
LLM响应超时或无响应 网络延迟或模型负载过高 执行ping命令测试网络连通性,检查防火墙和代理设置连接,执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令请求;确认Agent平台LLM服务正常
输入内容格式不正确 用户输入不符合skill预期格式 检查输入是否符合skill使用说明中的格式要求,参考示例章节
执行结果与预期不符 指令描述不够明确或上下文不足 提供更详细的指令描述,补充必要的上下文信息
命令执行失败 运行环境不满足要求或权限不足 确认运行环境符合依赖说明中的要求;检查命令权限设置

已知限制

-

-

-

相关专题

更多
Vibeknow在线使用入口合集
Vibeknow在线使用入口合集

本专题汇总了Vibeknow在线创作视频的官方入口及网页版使用教程,涵盖PPT、PDF、Word等文档一键转讲解视频的核心操作,并整理了免费版水印规则与手机端浏览器访问指南,助你快速将知识内容视频化。

2026.09.21

0

20

NumPy随机数文件读写与dtype数据类型
NumPy随机数文件读写与dtype数据类型

本专题整理 NumPy 随机数、文件读写与 dtype 数据类型相关教程,覆盖 Generator/random、随机数种子、正态分布采样、npy/npz/CSV/TXT 保存读取、loadtxt/savetxt、memmap、大文件处理、astype 类型转换、结构化 dtype、整数溢出和精度丢失等场景。

2026.09.21

0

24

NumPy矩阵运算与线性代数计算
NumPy矩阵运算与线性代数计算

本专题整理 NumPy 矩阵运算与线性代数计算相关教程,覆盖矩阵乘法、dot 与 @ 运算符、逆矩阵、行列式、特征值与特征向量、SVD、线性方程组、欧氏距离、矩阵分解和大规模矩阵性能优化等内容,帮助读者掌握 np.linalg 与矩阵计算实战。

2026.09.21

0

20

NumPy广播机制数学运算与统计分析
NumPy广播机制数学运算与统计分析

本专题整理 NumPy 广播机制、数组数学运算与统计分析相关教程,覆盖广播规则、维度对齐、矩阵与数组加减除法、向量化计算、均值方差、分位数、中位数、直方图和 unique 频次统计等场景,帮助读者掌握 ndarray 高效计算与统计处理方法。

2026.09.21

0

17

NumPy数组创建索引切片与数据选择
NumPy数组创建索引切片与数据选择

本专题整理 NumPy 数组创建、索引、切片与数据选择相关教程,覆盖 np.array、zeros/ones、多维数组形状、基础切片、花式索引、布尔索引、条件筛选、视图与副本等常用场景,帮助读者系统掌握 ndarray 数据构造与高效提取方法。

2026.09.21

0

12

Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

2026.09.20

0

13

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

2026.09.20

0

15

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

0

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

0

10

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.1万人学习