微信聊天分析助手 v2.1.0 — 完全本地运行的隐私保护工具。 分析聊天记录,推断 MBTI 与大五人格,检测情感趋势,生成可视化报告。 支持 jieba 精准分词、否定识别、反讽检测、风险预警。 内置 RAG 检索增强预测和多智能体博弈模拟,完全本地化、零数据外传。 可选 MiroFish 群体智能引擎增强对话预测。
微信聊天分析助手 v2.1.0是一项面向实际任务的技能,主要用于v2.1.0 — 完全本地运行、模块化架构、AI 增强的隐私保护工具;v2.1.0 更新(相对 v2.0.0);
从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。
执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。
v2.1.0 — 完全本地运行、模块化架构、AI 增强的隐私保护工具
mirofish/ 本地图谱包 — 修复 graph-stats 崩溃(ZepLocalGraph:stdlib sqlite3 + jieba,零新依赖)--input 与 txt 导入按 utf-8-sig → utf-8 → gb18030 自动识别,GBK 导出文件不再崩溃analyze-v2 / predict-v2 逐个显示 [i/6] xxx ... 完成 (0.12s)analyze-v2 --export — 全部分析结果 + 消息统计导出为 JSONanalyze-v2 --html / report-v2 — 完全自包含单文件 HTML 报告(内联 CSS + SVG 图表,零外部资源,离线可开)demo 一键体验 — 分析内置示例并生成 HTML 报告,30 秒体验全流程doctor 环境自检 — Python 版本/依赖/config/data 目录/终端编码逐项检查 + 修复建议-h 行为不变)core/ / analyzers/ / predictors/ / rag/ / mirofish/发送者: 内容 或 [时间] 发送者: 内容)。config.json 启用。v2.1.0 模块化结构(保留 v1.2.0 命令的完全兼容):
| 模块 | 说明 | 状态 |
|---|---|---|
core/ |
核心抽象层(Message/Result/AnalyzerBase/PredictorBase + 编码检测工具) | 🆕 v2.0.0 |
analyzers/ |
6 个独立分析器(mbti/bigfive/sentiment/risk/scenario/pattern) | 🆕 v2.0.0 |
analyzers/lexicon/ |
词典资源(HowNet/否定词/程度副词/Emoji) | 🆕 v2.0.0 |
predictors/ |
3 个预测器 + Ensemble(rule/rag/mirofish) | 🆕 v2.0.0 |
rag/ |
RAG 引擎(embedder/vector_store/retriever) | 🆕 v2.0.0 |
mirofish/ |
本地图谱包(ZepLocalGraph:sqlite3 + jieba,替代 Zep Cloud) | 🆕 v2.1.0 |
scripts/mirofish/ |
MiroFish 群体智能引擎(services/utils) | 🆕 v2.0.0 |
predictors/mirofish_predictor.py |
MiroFish 预测器(多 Agent 博弈模拟) | 🆕 v2.0.0 |
scripts/v2_report_generator.py |
v2 单文件离线 HTML 报告 + 一句话总结 | 🆕 v2.1.0 |
scripts/text_analyzer.py |
旧版规则分析(v1.2.0,向后兼容) | ♻️ 保留 |
scripts/conversation_predictor.py |
旧版对话预测(v1.2.0) | ♻️ 保留 |
scripts/llm_analyzer.py |
LLM API 增强(v1.2.0,默认关闭) | ♻️ 保留 |
scripts/report_generator.py |
HTML/Word/PPTX 报告生成 | ♻️ 保留 |
scripts/data_manager.py |
SQLite 数据存储 | ♻️ 保留 |
scripts/file_importer.py |
多格式文件解析(v2.1.0 编码自动检测) | ♻️ 升级 |
scripts/web_server.py |
Flask Web 服务(v1.2.0) | ♻️ 保留 |
scripts/scheduler.py |
定时任务调度 | ♻️ 保留 |
scripts/main.py |
CLI 入口(v1.2.0 + v2.0.0 + v2.1.0 多模式) | ♻️ 升级 |
scripts/archive_v1/ |
v1.2.0 完整快照(可回滚) | 📦 归档 |
# 一键体验:分析内置示例并生成 HTML 报告(30 秒上手) python scripts/main.py demo # 环境自检(依赖/config/目录/编码逐项检查) python scripts/main.py doctor # 交互式向导(无参数启动) python scripts/main.py # 用最近一次 analyze-v2 的结果生成单文件离线 HTML 报告 python scripts/main.py report-v2 python scripts/main.py report-v2 --output 我的报告.html
# 查看版本信息 python scripts/main.py version # 模块化分析(jieba + 否定识别 + 反讽检测 + 进度反馈) python scripts/main.py analyze-v2 --paste python scripts/main.py analyze-v2 --input 聊天记录.txt # 自动识别 utf-8/GBK 编码 python scripts/main.py analyze-v2 --file 聊天记录.docx # v2.1.0:导出 JSON / 生成单文件 HTML 报告 python scripts/main.py analyze-v2 --input 聊天记录.txt --export result.json python scripts/main.py analyze-v2 --input 聊天记录.txt --html report.html # 三层融合预测(Rule + RAG + MiroFish) python scripts/main.py predict-v2 --paste python scripts/main.py predict-v2 --input 聊天记录.txt # 查看 MiroFish 本地图谱统计 python scripts/main.py graph-stats
# v1.2.0 分析(保留) python scripts/main.py analyze --paste python scripts/main.py analyze --input 1.txt # v1.2.0 报告(保留) python scripts/main.py report --report-type html python scripts/main.py report --report-type all # v1.2.0 定时任务(保留) python scripts/main.py schedule --list python scripts/main.py schedule --add --name 我的任务 --period weekly # v1.2.0 Web 服务(保留) python scripts/main.py serve --port 5000 # v1.2.0 日历(保留) python scripts/main.py calendar --list python scripts/main.py calendar --upcoming --days 30
config.json 中设 "rag.enabled": false。config.json 中设 "mirofish.enabled": true。# 安装 RAG 依赖(约 1-2 分钟) pip install -r requirements-rag.txt # 首次运行会自动下载 embedding 模型(50-100MB) python scripts/main.py analyze-v2 --paste # 模型下载后存储在 data/models/,之后完全离线
| 分析器 | 文件 | 关键升级 |
|---|---|---|
| MBTI | analyzers/mbti_analyzer.py |
维度差距 + 样本量综合置信度;稳定性评分 |
| 大五 | analyzers/bigfive_analyzer.py |
归一化;雷达图数据;补全 neuroticism low 词 |
| 情感 | analyzers/sentiment_analyzer.py |
否定识别(窗口=3);程度副词加权;反讽检测;Emoji 映射;HowNet 词典 |
| 风险 | analyzers/risk_analyzer.py |
反讽识别("投资个生日礼物");否定排除;时序突发;上下文累积 |
| 场景 | analyzers/scenario_analyzer.py |
4 场景(romantic/work/social/important);权重排序 |
| 模式 | analyzers/pattern_analyzer.py |
修复 v1.2.0 的 reply_speed 丢失 bug;问号/感叹号比例;主动率 |
| 预测器 | 文件 | 说明 |
|---|---|---|
| Rule | predictors/rule_predictor.py |
16 MBTI × 5 模板 + 场景 + 关键词触发 |
| RAG | predictors/rag_predictor.py |
检索 top-K 相似历史对话作为 few-shot |
| MiroFish | predictors/mirofish_predictor.py |
8 Agent × N 轮模拟 + 多轮辩论 + 加权投票 |
| Ensemble | predictors/ensemble.py |
加权融合:相同文本合并 + 策略加成 |
完全自包含:内联 CSS + SVG 图表(大五雷达/情感环形/词条与场景条形图), 零 CDN、零外部资源,双击即可离线打开。包含 MBTI 卡片、大五雷达、 情感占比、高频词、对话模式统计、风险分级卡片、场景权重、一句话总结、生成时间戳。
# 分析时直接生成 python scripts/main.py analyze-v2 --input 聊天记录.txt --html report.html # 或用最近一次 analyze-v2 的结果生成(输出到 data/reports/) python scripts/main.py report-v2
支持 HTML / Word (.docx) / PPTX 格式。
# v1.2.0 命令 python scripts/main.py report --report-type html python scripts/main.py report --report-type word python scripts/main.py report --report-type pptx python scripts/main.py report --report-type all
data/ 目录下config.json 中 privacy.telemetry=false、external_api=falseconfig.json(v2.1.0){
"version": "2.1.0",
"rag": {
"enabled": true,
"model_name": "BAAI/bge-small-zh-v1.5"
},
"mirofish": {
"enabled": false,
"max_agents": 5
},
"privacy": {
"telemetry": false,
"external_api": false
}
}
.env(可选,v1.2.0 兼容)LLM_API_KEY=your_api_key_here LLM_BASE_URL=https://api.deepseek.com LLM_MODEL=deepseek-chat
v2.0.0 默认不读取
.env,如需启用 LLM 增强请同时设置config.json的llm.enabled=true。
Q: v1.2.0 的命令还能用吗?
A: 完全兼容。analyze/report/schedule/serve/calendar 全部保留,行为不变。
Q: 微信导出的 txt 是 GBK 编码,读取报错?
A: v2.1.0 起 --input 和 txt 导入会自动识别 utf-8-sig / utf-8 / gb18030,直接传入即可。
Q: 大五人格全是 100% 正常吗? A: v2.1.0 已修复归一化:小样本会收缩到 50 附近,信号充分时落在 15~85 区间,区分度更好。
Q: 如何生成可视化报告?
A: analyze-v2 --html report.html 或先 analyze-v2 再 report-v2,生成完全离线的单文件 HTML。
Q: v2 和 v1.2.0 的分析结果不一致? A: 正常。v2 引入 jieba 分词、否定识别等,分析更准确。
Q: 首次运行很慢? A: RAG 首次需下载 embedding 模型(50-100MB),之后秒开。
Q: 不想用 RAG?
A: config.json 中设 "rag.enabled": false。
Q: 不想用云端 LLM?
A: v2.0.0 默认禁用。config.json 中确认 llm.enabled=false。
Q: MiroFish 怎么启用?
A: config.json 中设 "mirofish.enabled": true,然后运行 predict-v2。
Q: 环境出问题怎么排查?
A: 运行 python scripts/main.py doctor,逐项检查并给出修复建议。
Q: 如何回滚到 v1.2.0?
A: mv scripts scripts_v2 && mv scripts/archive_v1/v1.2.0 scripts(如有 v1.2.0 备份)。
# 核心依赖(必须) pip install -r requirements.txt # RAG 引擎(可选但推荐) pip install -r requirements-rag.txt # Web 仪表盘(未来路线图) pip install -r requirements-web.txt # 一键配置(首次使用推荐) python scripts/main_setup.py
| 文件 | 用途 | 状态 |
|---|---|---|
requirements.txt |
核心功能(jieba/Flask/docx/pptx) | ✅ 必装 |
requirements-rag.txt |
RAG 引擎(sentence-transformers/chromadb) | 🆕 v2.0.0 可选 |
requirements-web.txt |
FastAPI(未来路线图) | ⏳ 规划中 |
scripts/mirofish/requirements.txt |
MiroFish 高级功能 | 可选 |
可选增强:
openai-whisper — 语音转文字easyocr — 图片 OCR