中文数据分析(免费版)

Polar Sponsor
爱发电 赞助
.NET 9.0

中文语境数据清洗、统计分析与可视化建议,适合数据分析师、产品经理与运营快速上手。

tools

功能概述

tools是一项面向实际任务的技能,主要用于中文数据分析 免费版;中文数据分析免费版专为中文业务场景打造,覆盖数据读取、清洗、统计分析与可视化全流程;

核心要点

  • 所有代码模板预置中文字体与中文标题,解决"图表中文乱码"这一长期痛点,让数据分析师、产品经理、运营人员能够在 60 秒内启动一次完整分析;
  • 免费版聚焦日常分析的高频能力,适合 100 万行以内的数据集与。
  • 它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。

使用与执行

从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;

结果检查与注意事项

若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。

tags:

  • 信息检索
  • 中文场景
  • 可视化
  • 集成工具 tools:
  • read
  • exec

中文数据分析 免费版

一、概述

中文数据分析免费版专为中文业务场景打造,覆盖数据读取、清洗、统计分析与可视化全流程。所有代码模板预置中文字体与中文标题,解决"图表中文乱码"这一长期痛点,让数据分析师、产品经理、运营人员能够在 60 秒内启动一次完整分析。

免费版聚焦日常分析的高频能力,适合 100 万行以内的数据集与单次分析任务。

核心能力

2.1 数据读取统一封装

数据源 代码片段 适用场景
CSV pd.read_csv('data.csv') 通用文本数据
Excel pd.read_excel('data.xlsx', sheet_name='Sheet1') 财务/运营报表
JSON pd.read_json('data.json') API 返回数据
SQLite pd.read_sql('SELECT * FROM t', conn) 本地数据库
API requests.get(url).json() 第三方接口

输入: 用户提供1 数据读取统一封装所需的指令和必要参数。 处理: 按照skill规范执行1 数据读取统一封装操作,遵循单一意图原则。 输出: 返回1 数据读取统一封装的执行结果,包含操作状态和输出数据。

2.2 数据清洗模板

  • 缺失值处理:isnull().sum() 统计、dropna() 删除、fillna() 填充(0/均值/众数)
  • 重复值处理:duplicated().sum() 统计、drop_duplicates() 删除(可按列去重)
  • 类型转换:to_datetimeastype(float)astype(category)
  • 异常值处理:IQR 法(1.5 倍四分位距)自动过滤
  • 文本规范化:strip()lower()replace() 链式处理

输入: 用户提供2 数据清洗模板所需的指令和必要参数。 处理: 按照skill规范执行2 数据清洗模板操作,遵循单一意图原则。 输出: 返回2 数据清洗模板的执行结果,包含操作状态和输出数据。

2.3 统计分析方法库

方法 代码 用途
描述统计 df.describe() 中心趋势与离散度
分位数 df['col'].quantile([.25,.5,.75]) 分布形态
偏度峰度 df['col'].skew() / kurt() 正态性诊断
相关矩阵 df.corr() 变量关系
分组聚合 df.groupby('cat').agg(...) 多维汇总
交叉表 pd.crosstab(df['a'], df['b']) 类别关联

输入: 用户提供3 统计分析方法库所需的指令和必要参数。 处理: 按照skill规范执行3 统计分析方法库操作,遵循单一意图原则。 输出: 返回3 统计分析方法库的执行结果,包含操作状态和输出数据。

2.4 中文可视化模板

所有图表预置 SimHei 字体与负号修正,无需额外配置:

  • 折线图(趋势)、柱状图(对比)、散点图(关系)
  • 直方图(分布)、箱线图(离群)、热力图(相关)
  • 高级:分组柱状、小提琴图、散点矩阵、置信区间带

输入: 用户提供4 中文可视化模板所需的指令和必要参数。 处理: 按照skill规范执行4 中文可视化模板操作,遵循单一意图原则。 输出: 返回4 中文可视化模板的执行结果,包含操作状态和输出数据。

2.5 分析报告模板

6 段式结构化报告:数据概览 → 关键指标 → 分布特征 → Top N → 趋势分析 → 业务建议。

输入: 用户提供5 分析报告模板所需的指令和必要参数。 处理: 按照skill规范执行5 分析报告模板操作,遵循单一意图原则。 输出: 返回5 分析报告模板的执行结果,包含操作状态和输出数据。

  • 执行此能力时使用input_params参数,支持创建/查询/导出操作 能力覆盖范围:本skill的核心能力覆盖以下场景关键词:中文语境数据清洗、统计分析与可视化、适合数据分析师、产品经理与运营快、速上手、中文数据分析免费、版面向中文用户的、数据分析日常工作、提供开箱即用的数、代码模板、核心能力、等多种来源一键加、类型转换的标准化、相关分析、可视化代码生成、箱线等中文图表模、分析报告自动生成、段式结构化报告模等。这些关键词对应description中声明的使用场景,均已在上述能力点中提供对应的操作支持。

适用场景

角色 典型场景 输出形态
数据分析师 销售明细周度复盘 清洗后数据 + 图表 + Markdown 报告
产品经理 用户行为漏斗分析 漏斗图 + 转化率 + 改进建议
运营专员 促销活动效果评估 对比图 + 增长率 + 结论
财务人员 月度财务汇总 分类汇总表 + 趋势图

不适用场景

以下场景中文数据分析(免费版)不适合处理:

  • 实时流数据处理
  • 小规模数据手动分析
  • 非结构化文本情感分析

触发条件

需要数据分析、报表生成、统计洞察、数据可视化时使用。不适用于非本工具能力范围的需求。

使用流程

预计上手时间:< 60 秒

直接以中文向 Agent 描述任务,以下为可复制模板:

请分析 sales.csv:
1. 字段: date, region, product, sales, units
2. 时间范围: 2024-01-01 至 2024-12-31
3. 关注: 华东地区月度销售趋势,以及 Top 5 商品
4. 输出: 折线图 + Top 5 表 + Markdown 报告

示例

5.1 数据读取

import pandas as pd

df = pd.read_csv('data.csv')          # CSV
df = pd.read_excel('data.xlsx', sheet_name='Sheet1')  # Excel
df = pd.read_json('data.json')        # JSON

import sqlite3
conn = sqlite3.connect('database.db')
df = pd.read_sql('SELECT * FROM table', conn)

5.2 数据预览

print(df.shape)        # 行列数
print(df.columns)      # 列名
print(df.dtypes)       # 数据类型
print(df.info())       # 详细信息
print(df.head())       # 前 5 行
print(df.describe())   # 数值列统计

5.3 数据清洗

df.isnull().sum()                       # 统计缺失
df.dropna()                             # 删除缺失行
df.fillna(0)                            # 填充 0
df['col'].fillna(df['col'].mean())      # 填充均值
df['col'].fillna(df['col'].mode()[0])   # 填充众数

df.duplicated().sum()                   # 统计重复
df.drop_duplicates()                    # 删除重复

df['date'] = pd.to_datetime(df['date'])
df['price'] = df['price'].astype(float)

# IQR 异常值过滤
Q1 = df['col'].quantile(0.25)
Q3 = df['col'].quantile(0.75)
IQR = Q3 - Q1
df = df[(df['col'] >= Q1 - 1.5*IQR) & (df['col'] <= Q3 + 1.5*IQR)]

5.4 统计分析

df['col'].mean()      # 均值
df['col'].median()    # 中位数
df['col'].std()       # 标准差
df['col'].skew()      # 偏度
df['col'].kurt()      # 峰度

df.corr()             # 相关矩阵
df.corr()['target']   # 与目标的相关性

df.groupby('category').agg({
    'sales': ['sum', 'mean', 'count'],
    'profit': 'mean'
})

pd.crosstab(df['col1'], df['col2'])

5.5 中文可视化

import matplotlib.pyplot as plt
import seaborn as sns

plt.rcParams['font.sans-serif'] = ['SimHei']
plt.rcParams['axes.unicode_minus'] = False

plt.figure(figsize=(10, 6))
plt.plot(df['date'], df['value'])
plt.title('趋势图')
plt.xlabel('日期')
plt.ylabel('数值')
plt.show()

sns.heatmap(df.corr(), annot=True, cmap='coolwarm', center=0)
plt.show()

5.6 报告生成模板

def generate_report(df):
    """生成数据分析报告"""
    return f"""
## 1. 数据概览
- 数据量: {len(df)} 行 × {len(df.columns)} 列
- 缺失值: {df.isnull().sum().sum()} 个

## 2. 关键指标
- 总销售额: ¥{df['sales'].sum():,.2f}
- 平均订单: ¥{df['sales'].mean():,.2f}

## 3. 分布特征
- 偏度: {df['sales'].skew():.2f}
- 标准差: {df['sales'].std():,.2f}

## 4. Top 5 类别
{df.groupby('category')['sales'].sum().sort_values(ascending=False).head().to_markdown()}

## 5. 趋势分析
- 环比增长: {df['sales'].pct_change().mean()*100:.2f}%

## 6. 建议
1. 重点推广 Top 3 类别
2. 优化低转化品类
3. 关注季节性波动
"""

六、最佳实践

  • 先预览后处理:用 head/info/describe 三件套先了解数据全貌
  • 备份原数据:清洗前 df.copy() 保留原始数据
  • 类型先行:先 to_datetimeastype 规范类型,再做统计
  • 中文图表:务必预置 SimHei 字体,否则中文乱码
  • 结果验证:统计结论与业务直觉对照,异常需复核
  • 可视化简洁:一张图只表达一个观点,避免信息过载

常见问题

Q1: 中文图表显示为方框怎么办?

A: 在脚本开头加上:

plt.rcParams['font.sans-serif'] = ['SimHei']
plt.rcParams['axes.unicode_minus'] = False

Q2: 大数据集内存不够怎么办?

A: 免费版推荐处理 100 万行以内。更大规模建议使用专业版的 Dask/Polars 后端与增量读取。

Q3: Excel 多 Sheet 如何读取?

A: pd.read_excel('file.xlsx', sheet_name=None) 会返回所有 Sheet 的字典。

Q4: 缺失值应该删除还是填充?

A: 缺失率 <5% 可删除;5-30% 适合用均值/中位数/众数填充;>30% 建议作为单独类别或用模型预测填充。

Q5: 异常值如何判定?

A: 推荐 IQR 法(1.5 倍四分位距外为异常);正态分布数据可用 3σ 原则;业务场景可结合常识阈值。

已知限制

本免费体验版限制以下高级功能:

  • 禁用时间序列分解与季节性分析
  • 禁用假设检验与 A/B 测试自动化
  • 禁用大数据集(>100 万行)批处理
  • 禁用自定义报告模板与品牌化输出
  • 禁用定时任务与邮件分发
  • 禁用与外部数据库(如 PostgreSQL)的深度集成

解锁全部功能请使用专业版:data-analyst-chinese-pro

  • 当前为免费版本,如需完整功能请升级到付费版获取全部能力

依赖说明

运行环境

  • Agent 平台: 任意支持 SKILL.md 的 AI Agent(Claude Code / Cursor / Codex / Gemini CLI 等)
  • 操作系统: Windows / macOS / Linux
  • Python: 3.8+

第三方依赖

依赖项 类型 是否必需 获取方式
LLM API API 必需 由 Agent 内置 LLM 提供
pandas Python 库 必需 pip install pandas
numpy Python 库 必需 pip install numpy
matplotlib Python 库 可选 pip install matplotlib(可视化)
seaborn Python 库 可选 pip install seaborn(高级可视化)
openpyxl Python 库 可选 pip install openpyxl(Excel 读写)
tabulate Python 库 可选 pip install tabulate(Markdown 表格)

API Key 配置

  • 本 Skill 基于自然语言指令,无需额外 API Key
  • 如对接外部 API,需用户自行提供对应的访问凭证,通过环境变量传入,禁止在对话或脚本中明文硬编码

可用性分类

  • 分类: MD+EXEC(纯 Markdown 指令,部分功能需要 exec 命令行执行能力)
  • 说明: 基于自然语言驱动的 AI Skill,通过中文场景化模板加速数据分析日常工作

错误处理

错误场景 原因 处理方式
配置错误 参数缺失或格式错误 检查依赖说明中的配置要求
运行时错误 运行环境不满足 确认运行环境符合依赖说明
网络错误 连接超时或不可达 执行ping命令测试网络连通性,检查防火墙和代理设置连接后执行ping命令测试网络连通性,检查防火墙和代理设置连接后重新执行命令,参考国内替代方案

相关专题

更多
Aionclaw智能助手介绍
Aionclaw智能助手介绍

本专题汇总了AionClaw(AI龙虾助手)的功能介绍与在线使用入口。AionClaw是杭州趣猿人工智能有限公司推出的桌面级AI智能体,能直接在电脑上读写文件、运行脚本、操作浏览器,自动交付Word、PPT、Excel等成品。

2026.09.20

0

13

AionClaw AI智能体与电脑自动化任务执行功能使用教程
AionClaw AI智能体与电脑自动化任务执行功能使用教程

AionClaw专题整理AI智能体与电脑自动化相关功能使用教程,涵盖安装部署、AI任务执行、Skills技能、文件处理、浏览器控制、电脑操作、持久记忆、聊天工具连接以及办公、编程和内容创作等功能,帮助用户快速掌握AionClaw的实际使用方法。

2026.09.20

0

15

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

0

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

0

10

Pandas时间序列分析与可视化报表
Pandas时间序列分析与可视化报表

本专题整理Pandas日期转换、时间索引、重采样、滚动窗口、时区处理、plot绘图、Styler表格样式和报表输出方法。

2026.09.16

0

23

Pandas数据筛选索引与清洗处理
Pandas数据筛选索引与清洗处理

本专题整理Pandas中的loc、iloc、条件筛选、query查询、缺失值处理、重复值删除、类型转换和字符串列清洗方法。

2026.09.16

0

25

Pandas数据读取导入与文件导出处理
Pandas数据读取导入与文件导出处理

本专题整理Pandas读取CSV、Excel、JSON、SQL、Parquet等文件的方法,以及to_csv、to_excel、to_sql和to_parquet等常用数据导出流程。

2026.09.16

0

27

GDB怎么设置断点
GDB怎么设置断点

本专题介绍GDB按照函数名、源代码行号和文件位置设置断点的方法,详细说明run、continue、next、step等命令的配合使用,帮助定位程序崩溃、逻辑异常及代码未按预期执行的问题。

2026.09.11

0

28

GDB怎么查看变量值
GDB怎么查看变量值

本专题介绍GDB调试过程中查看变量值的具体方法,涵盖局部变量、函数参数、数组、结构体和指针内容查询,同时整理变量持续显示、格式化输出及无法读取变量时的排查思路。

2026.09.11

0

22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133万人学习