Weibo Distill — 微博人格蒸馏与群体画像工具集

Polar Sponsor
爱发电 赞助
.NET 9.0

Weibo Distill 是一个面向社会科学研究的微博用户人格蒸馏与群体画像工具集。它从微博公开数据中自动提取人格信号,产出三个层级的产物:个体人格分析报告、可对话 Persona Skill(AI 虚拟角色)、群体画像统计报告。适用于社会学、传播学、心理学、市场营销研究者构建可交互的用户群体模型。

微博人格蒸馏器 (Weibo Persona Builder)

功能概述

微博人格蒸馏器 (Weibo Persona Builder)是一项面向实际任务的技能,主要用于「你发的每一条微博,都在无意中画出了自己的心理地图;Overview;

核心要点

  • 从微博数据中提取人格信号,生成三个层级的产物:;
  • 个体层级:;
  • 人格分析报告 — 多维度心理画像(报告文件);

使用与执行

人物 Persona Skill — 可对话的模拟人格(skill 文件,加载后即可与其模拟对话);群体层级:;3. 群体画像报告 — 多用户的统计分布与。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。

结果检查与注意事项

从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。

微博人格蒸馏器 (Weibo Persona Builder)

「你发的每一条微博,都在无意中画出了自己的心理地图。」

Overview

从微博数据中提取人格信号,生成三个层级的产物:

个体层级:

  1. 人格分析报告 — 多维度心理画像(报告文件)
  2. 人物 Persona Skill — 可对话的模拟人格(skill 文件,加载后即可与其模拟对话)

群体层级: 3. 群体画像报告 — 多用户的统计分布与聚类分析(赋能社会科学研究)

核心逻辑:微博是公开表演台,但人格痕迹藏不住——措辞习惯、情感波动模式、话题偏好、深夜发言、互动方式……这些跨场景复现的信号比单条内容更可靠。当多个用户的个体画像汇聚到一起,群体层面的统计规律开始浮现——这就是计算社会科学的基础设施。

前置要求 (Prerequisites)

使用本 skill 前,必须依次完成以下步骤:

Step 0:环境准备

☐ 1. Chrome 浏览器已开启远程调试:chrome://inspect/#remote-debugging → 勾选 Allow remote debugging
☐ 2. 在 Chrome 中访问 https://m.weibo.cn 并确认已登录微博账号
☐ 3. Web Access Skill 已激活(CDP Proxy 运行中)

Step 1:数据获取(逐个用户 + 智能重试)

核心原则:

  • 逐个处理:一次只抓取一个 UID,处理完成后才进入下一个
  • 智能重试:区分「真无数据」和「技术限制」,避免无效重试
  • 渐进降级:API → DOM → 跳过,每步都有最大尝试次数

1.1 单用户抓取流程

对每个 UID 执行:

1️⃣ API 模式(优先):
   - 在已有微博 tab 内用 eval 调 API:
     fetch('https://m.weibo.cn/api/container/getIndex?containerid=107603{UID}&page=N', {credentials:'include'})
   - 跳过长文展开(避免 session 超时),在报告中标注「长文待展开」
   - 保存 weibo_final.json

2️⃣ 结果判断:
   A) 获取 ≥ 30 条 → ✅ 标记为「good」→ 进入下一个 UID
   B) 获取 1-29 条 → 进入「数据不足判断」(见 1.2)
   C) 获取 0 条(API 返回 ok:-100 验证码/限流) → 进入「技术限制重试」(见 1.3)
   D) 获取 0 条(API 正常但所有卡片超出日期范围) → 判定为「该时段无发帖」→ 标记为「empty」→ 进入下一个 UID

3️⃣ 每完成一个 UID,输出进度:`[N/Total] UID xxx: 名称 | X条 [quality]`

4️⃣ 每抓取 3-4 个 UID 后,主动刷新 session(导航到 m.weibo.cn 主页 + 等 3 秒)

1.2 数据不足判断(1-29 条)

当获取 1-29 条时,判断原因:

- 如果 API 返回的所有页都已翻完(无更多数据),且日期范围正常覆盖 → 判定为「时段内数据不足」
  → 标记为「marginal」→ 进入下一个 UID
- 如果 API 中途被限流(后续页返回 -100 或报错),且有更多页未翻 → 判定为「技术限制」
  → 进入「技术限制重试」(见 1.3)

1.3 技术限制重试(最多 3 次)

当因验证码/限流/网络问题导致数据不完整时:

重试策略(递增间隔):
- 第 1 次重试:导航到 m.weibo.cn 刷新 session → 等待 5 秒 → 重新抓取
- 第 2 次重试:尝试 DOM 滚动回退模式(profile/{UID} + 滚动提取 Vue 组件)
- 第 3 次重试:关闭当前微博 tab → 创建新 tab 访问 m.weibo.cn → 重新抓取

⚠️ 3 次重试后仍失败:
  → 标记为「failed」→ 记录失败原因 → 进入下一个 UID(不再纠缠)
  → 在最终决策点汇总时展示失败原因,由用户决定是否手动干预

1.4 产出文件

每个 UID 抓取完成后立即保存:

  • {outputDir}/{UID}/weibo_final.json — 结构化微博数据
  • {outputDir}/{UID}/weibo_resource_library.md — 按日期分组的资料库

Step 2:数据验证与决策点 ★(必须执行)

所有 UID 抓取完成后,统计汇总并以表格展示成果:

📊 数据抓取汇总:

| UID | 用户名 | 微博数 | 质量 | 日期范围 |
|-----|--------|--------|------|----------|
| xxx | 张三   | 220    | ✅ good | 2026-01-01~2026-05-27 |
| xxx | 李四   | 42     | ✅ good | 2026-04-24~2026-05-27 |
| xxx | 王五   | 10     | ⚠️ marginal | 2026-02-28~2026-03-24 |
| xxx | 赵六   | 0      | ❌ failed | - |

质量评级:
- ✅ good: ≥30条,可正常分析
- ⚠️ marginal: 4-29条,分析但标注「数据不足」  
- ❌ failed: 0条,无法分析

展示汇总后必须询问用户(使用 AskUserQuestion 工具):

数据抓取完成,请选择下一步操作:

选项(单选):

  • 「进行下一阶段」 — 基于现有数据,对所有有数据的用户执行 Phase 2-6(人格分析→persona skill→群体画像)
  • 「补全数据」 — 对 ❌ failed 和 ⚠️ marginal 的用户,尝试重新抓取(可能需要手动解除验证码后重试)
  • 「结束」 — 保存当前成果并停止,稍后继续
用户选择「进行下一阶段」→ 继续 Phase 2
用户选择「补全数据」→ 回到 Step 1 重新抓取失败的 UID,然后再次进入 Step 2 决策点
用户选择「结束」→ 保存进度文件,告知用户如何恢复

⚠️ 绝对禁止跳过此决策点直接进入分析阶段。无论数据好坏,必须先展示汇总并让用户选择下一步。

执行流程

Phase 1:数据加载与画像

  1. 读取 weibo_final.json
  2. 统计基础数据:总条数、日期范围、月均发博频率、原创/转发比、带图率
  3. 输出数据概况(告知用户)

Phase 2:人格分析

分析前必须做的事:读取 references/personality-analysis.md 获取完整分析框架和证据标注规范。

分析维度(逐维分析,不可跳过):

2.1 Big Five 人格

  • 对五个维度分别评分(1-10)并引用微博证据
  • 每条评分至少引用 2 条微博内容作为证据
  • 识别高信号(跨话题复现≥3次)vs 低信号(单次出现)

2.2 深层人格

  • 认知风格(系统化/直觉化、抽象/具体、分析性/叙事性)
  • 动机驱动(成就/归属/权力/探索/安全)
  • 价值观排序(从内容中提取反复出现的价值主张)
  • 防御机制(幽默化解/理性化/投射/回避等)
  • 依恋风格(安全/焦虑/回避/混乱)
  • 情绪基调(乐观/悲观、温暖/冷峻、轻松/紧张)

2.3 表达 DNA

  • 语言特征:句长偏好、词汇丰富度、emoji 使用习惯
  • 常用句式:高频句式结构
  • 幽默方式:讽刺/自嘲/冷幽默/荒诞/不幽默
  • 禁忌词和回避话题

2.4 行为模式

  • 社交互动风格(与粉丝/他人的互动方式)
  • 冲突处理倾向
  • 压力反应模式

2.5 诚实标注

必须明确写出:

  • 哪些推断证据充足,哪些是推测
  • 「微博形象 vs 真实人格」可能存在差距的维度
  • 数据量不足导致分析受限的维度

Phase 3:生成人格报告

将 Phase 2 的分析结果汇总,写入 personality_report.md,同时产出结构化数据 profile_data.json:

weibo_/
├── weibo_final.json                   # 来自微博抓取工具-DF
├── weibo_resource_library.md          # 来自微博抓取工具-DF
├── personality_report.md              # ★ 本 Phase 产出:人格分析报告
├── profile_data.json                  # ★ 本 Phase 产出:结构化人格数据(群体分析的数据源)
└── persona_/                    # Phase 4 产出:人物 persona skill
    └── SKILL.md

报告格式要求:

  • 每个维度有评分/结论 + 至少 2 条引用证据
  • 末尾有「诚实边界」section,列出所有局限性
  • 报告开头展示数据概况摘要

profile_data.json 格式:必须按照 references/group-analysis.md §数据来源 中定义的结构输出,确保 Big Five 评分、认知风格、动机驱动、情绪基调等关键字段完整。这是 Phase 6 群体分析的唯一数据源,不完整会导致群体分析失败。

Phase 3 完成后暂停,展示报告摘要给用户确认:

人格报告摘要:
- Big Five: O=7 C=5 E=3 A=6 N=4
- 认知风格: 系统化+抽象
- 核心动机: 成就驱动(+探索)
- 情绪基调: 温和乐观
- 诚实标注: 3 条局限

用户确认后 → Phase 4。

Phase 4:生成人物 Persona Skill

Step 1:读取模板

读取 references/persona-template.md 获取 persona skill 的标准结构。

Step 2:填充模板

将 Phase 2 的分析结果映射到模板占位符:

模板 Section 填充来源
identity_card 微博综合分析 + 关键特征一句话概括
Big Five 表格 Phase 2.1 评分 + 特征描述
认知风格 Phase 2.2 认知风格
动机驱动 Phase 2.2 动机驱动
核心价值观 Phase 2.2 价值观排序
防御机制 Phase 2.2 防御机制
情绪基调 Phase 2.2 情绪基调
依恋风格 Phase 2.2 依恋风格
表达 DNA Phase 2.3 全部内容
行为模式 Phase 2.4 全部内容
时间线 从微博时间分布 + 关键节点提取
诚实边界 Phase 2.5 + Phase 2 中标注的局限性

Step 3:写入文件

将填充完成的 SKILL.md 写入 persona_/SKILL.md。

Step 4:质量验证

生成完成后,快速验证:

  • 身份卡是「我」的视角而非第三人称
  • 角色扮演规则完整(核心指令 + 禁止行为)
  • Big Five 五个维度全部评分
  • 诚实边界至少 3 条
  • 每维度有引用证据

Phase 5:交付

  1. 展示生成路径
  2. 告知用户如何加载 persona skill 进行对话模拟
  3. 可选:用生成的 persona 进行一次简单对话测试

Phase 6:群体画像聚合分析(新增)

触发条件:用户明确要求「群体分析」「群体画像」「聚合统计」「这批用户有什么共同特征」等, 或用户提供了包含多个用户分析结果的目录。

Step 1:确认数据源

确认存在多个用户的 profile_data.json(每个用户一个,由 Phase 3 产出)。 目录结构示例:

weibo-distill/
├── 2731728324/
│   ├── profile_data.json      ← Phase 3 产出
│   └── ...
├── 2865101843/
│   ├── profile_data.json      ← Phase 3 产出
│   └── ...
└── 5698023579/
    ├── profile_data.json      ← Phase 3 产出
    └── ...

Step 2:运行聚合脚本

# 用法
python scripts/aggregate_profiles.py <包含多个用户子目录的根目录> [--output <输出目录>]

脚本自动完成:

  1. 扫描目录下所有 profile_data.json
  2. 计算 Big Five 描述统计(均值、中位数、标准差、分布直方图、极值用户)
  3. 计算分类变量分布(认知风格、动机、情绪基调、依恋风格等)
  4. 当 N≥5 时执行 K-means 聚类
  5. 输出 group_data.json + group_summary.csv

Step 3:生成群体画像报告

基于 group_data.json,结合 references/group-analysis.md 中的框架,生成 group_profile_report.md:

报告必须包含的 section:

  1. 样本概况

    • 总用户数、总微博数、人均微博数
    • 数据质量分布(good/marginal/insufficient)
    • 用户列表(UID + 名称 + 微博数)
  2. Big Five 群体画像

    • 五个维度的均值、中位数、标准差
    • 每个维度的分布直方图(文字描述或可视化)
    • 每个维度的"典型值"和"极值用户"
    • 群体层面的 Big Five 画像总结(如"整体偏高开放性、中等尽责性")
  3. 认知风格分布

    • 系统化 vs 直觉化比例
    • 抽象 vs 具体比例
    • 分析性 vs 叙事性比例
  4. 动机驱动分布

    • Top-N 动机频率
    • 主要动机模式总结
  5. 情绪基调分布

    • 积极/中性/消极比例
    • 温暖/中性/冷峻比例
  6. 群体聚类(N≥5 时)

    • 聚类结果(每个簇的中心、成员、典型特征)
    • 簇的命名和描述
  7. 群体画像总结

    • 用自然语言描述"这个群体的典型画像"
    • 群体多样性评估
  8. 社会科学应用建议

    • 虚拟受访者池的使用方式
    • 问卷设计参考(基于群体表达 DNA)
    • 社会模拟(ABM)的人格参数建议
    • 样本偏差和局限性说明

Step 4:交付

  1. 展示群体画像摘要
  2. 交付文件:group_profile_report.md + group_data.json + group_summary.csv
  3. 告知用户如何将 group_data.json 导入 SPSS/R/Python

Phase 6 完成后暂停,展示群体画像摘要给用户确认:

群体画像摘要 (N=5):
- Big Five 群体均值: O=6.8 C=5.4 E=6.2 A=6.0 N=3.8
- 认知风格: 直觉化 60% / 系统化 40%
- 主要动机: 归属驱动(3人) > 成就驱动(2人)
- 情绪基调: 积极 80% / 温暖 60%
- 聚类: 2 簇 —「外向温暖型」(3人) vs「内敛分析型」(2人)

输出产物

个体层级

weibo_/
├── weibo_final.json              # 来自 DF 工具
├── weibo_resource_library.md     # 来自 DF 工具
├── personality_report.md         # ★ 人格分析报告
├── profile_data.json             # ★ 结构化人格数据(Phase 6 数据源)
└── persona_/               # ★ 人物 persona skill
    └── SKILL.md                  # 可直接加载使用

群体层级

group_analysis/
├── group_profile_report.md       # ★ 群体画像报告(可读 Markdown)
├── group_data.json               # 结构化群体数据(可导入 SPSS/R/Python)
└── group_summary.csv             # 个体摘要表(可用 Excel 打开)

使用示例

场景 A:个体分析

用户:帮我分析 UID 5698023579 的微博人格

AI:
1. 检查前置条件 → 确认 weibo_final.json 已存在(2025-06-07 ~ 2026-06-07,共 312 条)
2. Phase 1-2 分析 → 生成 personality_report.md + profile_data.json
3. Phase 3 确认 → 展示摘要,用户确认
4. Phase 4 生成 persona → 产出 persona_/SKILL.md
5. 完成,用户可以加载 persona skill 进行对话

场景 B:群体画像

用户:我已经分析了 10 个微博用户,帮我做群体画像聚合

AI:
1. 确认目录下存在 10 个 profile_data.json
2. Phase 6 Step 2 → 运行 aggregate_profiles.py
3. 基于 group_data.json → 生成群体画像报告
4. 展示摘要 → 用户确认
5. 交付 group_profile_report.md + group_data.json + CSV

场景 C:社会科学研究(端到端)

用户:我要做 95 后微博用户的心理画像研究,帮我采集 20 个用户的微博并生成群体报告

AI:
1. 逐个用户:DF 工具抓取 → 个体人格蒸馏 → persona + profile_data.json
2. 全部完成后:群体聚合 → 群体画像报告 → 虚拟受访者池
3. 交付:
   - 20 份个体报告 + persona skill(可单独对话模拟)
   - 1 份群体画像报告(导入 SPSS 做进一步分析)
   - 1 份 group_summary.csv(Excel 可读)

质量约束

最低数据要求

  • ≥ 30 条微博:正常分析
  • 15-29 条:分析但标注「数据不足」
  • < 15 条:拒绝分析,告知用户数据太少

分析深度

  • Big Five 每个维度 ≥ 2 条证据引用
  • 诚实边界 ≥ 3 条
  • 至少 2 处指出「表面 vs 深层」的矛盾

严肃底线

  • 不假装心理学专业诊断(这是推断,不是临床评估)
  • 不在证据不足时强行给结论
  • 「不确定」是合法输出

Resources

references/personality-analysis.md

人格分析框架,包含 Big Five 评分指引、证据标注规范、深层人格维度定义。

references/persona-template.md

生成的 persona skill 模板,定义了所有占位符和 Section 结构。 重要:模板开头注明了生成 persona 时必须同步输出 profile_data.json。

references/group-analysis.md

群体画像统计分析框架,包含:

  • profile_data.json 格式规范
  • 聚合维度定义(Big Five 分布、认知风格、动机、情绪、聚类)
  • 社会科学应用场景(虚拟受访者、ABM 社会模拟、问卷设计辅助)
  • 质量约束与伦理声明

scripts/aggregate_profiles.py

群体数据聚合脚本。扫描目录下所有 profile_data.json,计算描述统计 + 分类分布 + K-means 聚类, 输出 group_data.json + group_summary.csv。

python scripts/aggregate_profiles.py  [--output ]

相关专题

更多
微博网页版主页入口与登录指南_官方网页端快速访问方法
微博网页版主页入口与登录指南_官方网页端快速访问方法

本专题系统整理微博网页版官方入口及网页端登录方式,涵盖首页直达地址、账号登录流程与常见访问问题说明,帮助用户快速找到微博官网主页,实现便捷、安全的网页端登录与内容浏览体验。

2026.02.13

1725

15

微博怎么隐藏关注列表和粉丝列表
微博怎么隐藏关注列表和粉丝列表

微博隐藏关注列表和粉丝列表,目前无法完全做到。微博的公开性是其核心设计理念之一,因此并没有提供直接隐藏关注者和粉丝列表的功能。 但这并不意味着完全无计可施,我们可以通过一些方法来降低其可见度,或控制信息外泄的风险。

2025.04.01

5685

8

微博网页版官网入口链接怎么打开
微博网页版官网入口链接怎么打开

要打开微博网页版,请访问官方网站www.weibo.com,登录后即可进入。具体步骤为:1. 访问官方网站;2. 登录(可选);3. 进入微博网页版。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2025.01.13

12389

6

怎么发微博
怎么发微博

发微博的方法:1. 注册微博账号并填写信息;2. 创建微博正文,添加话题;3. 设置可见范围;4. 附加图片/视频;5. 发布微博。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.07.29

2876

8

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

2026.09.30

0

10

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

2026.09.30

0

14

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

2026.09.30

0

12

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

2026.09.30

0

26

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

2026.09.29

0

15

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
H5微博项目实战视频教程
H5微博项目实战视频教程

共22课时 | 5.3万人学习