利用sharegpt构建幻觉标注体系需四步:一、提取含时间/数值/专有名词等高风险语义片段;二、双标注员分别判别上下文与外源性幻觉,专家仲裁分歧;三、对真实回复做时间/人名/机构名三类扰动生成负样本;四、为每条幻觉标注嵌入维基锚点或api证据及离线快照哈希。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您正在开展AI幻觉检测研究,但缺乏可用于标注和验证模型错误输出的高质量对话基准,则可能是由于现有数据集未覆盖真实场景下的虚构陈述模式。以下是利用ShareGPT数据集构建幻觉标注体系的操作步骤:
一、基于原始对话提取高风险语义片段
ShareGPT数据集包含大量真实用户与AI助手的多轮交互记录,其中部分回复已隐含事实性偏差或逻辑断裂,可作为幻觉样本的天然来源。需从中定位易产生外源性幻觉的语义单元,例如涉及时间、数值、专有名词、因果关系的断言性语句。
1、遍历ShareGPT JSON文件中的每个"messages"列表,筛选role为"assistant"且content长度超过30字符的条目。
2、对每条assistant回复应用规则过滤:匹配正则表达式“(于|在|截至)[0-9]{4}年”、“共[0-9]+[个|种|次]”、“由[^\n,。;]+研发”等典型事实锚点结构。
3、将匹配成功的回复连同其前序user提问、相关images路径(如有)打包为独立样本单元,存入待标注队列。
二、引入双维度人工标注协议
为避免单一判断标准导致标注噪声,需对同一语义片段同步评估其是否构成幻觉及其幻觉类型,确保标注结果可区分上下文幻觉与外源性幻觉。
1、第一标注员判断该assistant回复是否与user提问中明确提供的信息矛盾,若矛盾则标记为上下文幻觉。
2、第二标注员脱离对话上下文,仅依据外部可信知识源(如维基百科快照、权威机构公开数据库)核查回复中所有实体、事件、数值的真实性,若无法验证或证伪则标记为外源性幻觉。
3、两名标注员结果不一致时,交由第三名领域专家仲裁,并记录分歧原因至元数据字段"annotation_conflict_reason"。
三、构建对抗性负样本增强集
原始ShareGPT数据中幻觉样本比例偏低,需通过可控扰动生成补充负样本,提升检测模型对细微虚构模式的敏感度。
1、对已标注为真实的assistant回复,使用预设扰动模板进行替换:将“2023年发布”改为“2025年发布”,将“张伟”替换为“李明”,将“北京协和医院”替换为“上海华山医院”。
2、每条原始回复生成3种扰动变体,分别对应时间篡改、人名替换、机构名替换三类常见幻觉模式。
3、将扰动后文本与原始user提问重新组合,添加字段"perturbation_type":"time_fabrication"等标识,纳入负样本库。
四、嵌入可追溯的事实核查锚点
为支持后续自动化检测模块回溯依据,需在标注过程中强制插入结构化事实核查线索,使每条幻觉标注具备可验证路径。
1、对标注为外源性幻觉的每条内容,在JSON样本中新增"fact_check_evidence"字段,填入对应维基百科页面标题及章节锚点,例如"COVID-19疫情时间线#2020年"。
2、若核查依赖数值型数据库,则记录具体API端点与查询参数,如"https://data.who.int/dataset/covid-19?filter=country:CN&year=2022"。
3、所有evidence链接必须经离线快照存档,并将存档哈希值写入"evidence_snapshot_hash"字段。










