应人工核查、正则扫描、ner识别及启用sharegpt内置过滤四步脱敏:逐项检查邮箱、手机号、身份证号、内网路径等敏感字段,用正则批量匹配pii,调用本地ner模型识别隐性实体,最后开启平台预上传检测。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您打算将与AI模型的对话分享至ShareGPT等公开平台,但担心其中混入银行卡号、手机号、邮箱、身份证片段或内部系统路径等隐私内容,则可能是由于未对原始对话进行敏感信息筛查。以下是避免在公开对话中暴露隐私数据的操作建议:
一、人工逐项核查关键字段
该方法依赖操作者对常见敏感信息模式的识别能力,适用于对话轮次较少、结构清晰的样本,可快速定位高风险文本单元。
1、打开待分享的对话JSON文件或导出文本,重点扫描human与gpt消息中是否出现“@”符号后跟域名格式的字符串;
2、查找连续4位以上数字组合,尤其关注前后紧邻“ID”“号”“card”“code”“key”等关键词的数值段;
3、检查是否存在形如“/home/user/xxx”“C:\Projects\confidential”“https://internal-api.example.com”等路径或内网地址;
4、确认所有姓名、城市、机构名称是否为虚构或已替换为通用代称(如“某银行”“张工程师”需改为“某金融机构”“技术负责人”)。
二、使用正则表达式批量扫描
该方法通过预设规则引擎自动匹配典型PII模式,在本地执行,不上传数据,兼顾效率与隐私安全。
1、复制对话全文至纯文本编辑器(如VS Code),启用正则搜索模式;
2、依次输入以下表达式并标记匹配项:[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+.[a-zA-Z]{2,}(邮箱);
3、输入表达式:d{11}(手机号)、d{17}[dXx](身份证号)、(?i)(api[_-]?key|secret|token|password|credential)s*[:=]s*['"].+?['"](密钥类字段);
4、对所有匹配结果逐条确认是否为真实敏感信息,是则立即删除或替换为占位符(如“[EMAIL]”“[PHONE]”)。
三、调用本地NER工具识别实体
该方法利用轻量级命名实体识别模型识别姓名、组织、地点、日期等类别,能发现隐性敏感上下文,例如“我昨天在XX医院做了核酸检测”中的机构名与行为关联可能构成身份线索。
1、安装spaCy中文模型(zh_core_web_sm)或使用Flair预训练NER模型;
2、将对话文本按轮次切分为独立句子,逐句送入NER管道处理;
3、筛选输出中类型为PERSON、ORG、GPE、FAC、DATE的实体,并结合上下文判断是否需脱敏;
4、对确认需隐藏的实体,统一替换为对应泛化标签(如“[PERSON]”“[ORG]”),保留原始语义结构不变。
四、启用ShareGPT内置敏感词过滤开关
ShareGPT平台自2026年4月起提供客户端侧实时检测功能,可在提交前拦截含高危特征的对话,无需额外部署环境。
1、登录ShareGPT官网,进入“Settings”→“Privacy Preferences”页面;
2、开启Enable pre-upload PII scan选项,并勾选“Email”“Phone Number”“ID Number”三项默认规则;
3、粘贴对话内容至分享编辑框,点击“Preview & Scan”按钮;
4、界面将高亮标出疑似敏感片段,点击每个标记可查看替换建议,确认后自动应用脱敏并生成净化版预览。











