在多人对话中识别和追踪说话者,将说话者标签映射到姓名,并管理语音命令授权级别。
感知语言- id是一项面向实际任务的技能,主要用于多人对话的语音识别和管理;跟踪在对话中说些什么;
该技能适合需要稳定复用相关能力的场景,可作为自动化工作流的一部分,也便于后续检查、调整和扩展。从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;
若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。
面向多人对话的说话人识别与管理功能。
追踪对话中每位说话人的发言内容;将匿名说话人标签(如 SPEAKER_0、SPEAKER_1)映射至真实姓名;维护说话人档案;并控制语音指令的授权执行权限。
is_user 标志,用于标识主说话人)is_user 标志用于识别佩戴 Omi pendant 的人员为主说话人位于 percept/data/speakers.json:
{
"SPEAKER_00": {
"name": "David",
"is_owner": true,
"approved": true
},
"SPEAKER_01": {
"name": "Rob",
"is_owner": false,
"approved": true
}
}
可通过 Percept 控制台(端口 8960)→ Settings → Speakers 进行管理。
is_owner: true):拥有全部指令权限,始终被授权approved: true):可触发唤醒词相关指令计划引入 pyannote 说话人日志分割(speaker diarization),使用 192 维声纹嵌入向量,通过余弦相似度实现自动说话人识别。当前说话人映射仍需手动配置。
相关专题
热门下载
相关下载
精品课程
共6课时 | 54.6万人学习
共89课时 | 133.4万人学习
共49课时 | 82.2万人学习