读创/深圳商报记者 陈姝
6月1日,阿里云宣布通义大模型进展,聚焦音视频内容的AI新品“通义听悟”正式上线,成为国内首个开放公测的大模型应用产品。
通义听悟接入了通义千问大模型的理解与摘要能力,可成为用户工作学习中的得力AI助手,帮助随时随地高效完成对音视频内容的转写、检索、摘要和整理,比如用大模型自动做笔记、整理访谈、提取PPT等。公测期间,用户可领取100小时以上听悟免费转写时长。
“换一种方式,让音视频可以被轻松阅读、整理和分享。”阿里云CTO周靖人介绍,听悟是一款工作学习AI助手,它瞄准具有高知识附加值的音视频内容场景,比如开会、上课、访谈、培训、面试、直播、看视频、听播客等,能通过大模型等最新AI技术快速提炼和沉淀知识。
[caption id="attachment_3846381" align="alignnone" width="1000"]
通义听悟可自动为音视频生成全文摘要、章节概括、发言总结[/caption]
听悟展示了现场演示,其中包含十多项人工智能功能,可以全面提高从音视频转化为图文形式的知识转移效率。除了“听力好”,能高准确度生成会议记录、区分不同发言人,这个AI助手“悟性也极高”,大模型可以一秒给音视频划分章节并形成摘要、总结全文及每个发言人观点、整理关注重点和待办事项。近期即将推出大模型,其中包括一键提取PPT、对多个音视频内容进行AI提问和概括特定段落等功能。
[caption id="attachment_3846394" align="alignnone" width="736"]
通义听悟Chrome插件将在近期对所有用户开放下载[/caption]
针对一些细分场景,听悟还设置了不少“宝藏功能”:打开Chrome插件,外语学习者和听障人士可以借助双语悬浮字幕条随时随地看无字幕视频,日程冲突时,听悟还可成为职场人士的“开会替身”,在静音情况下入会AI可代为记录会议、整理要点;转写结果可下载为字幕文件,方便新媒体从业者视频后期制作;听悟梳理的问答回顾可以让记者、分析师、律师、HR等群体整理访谈更高效。
听悟与阿里云盘打通,一键就能转写云盘上的音视频内容,公测期间注册的听悟用户后续还将获得更大的阿里云盘存储空间,在云盘内在线播放视频时也可自动出字幕。
周靖人介绍,听悟集成了阿里最先进的语音和语言技术。其内置阿里新一代工业级语音识别模型,识别准确率在多个权威中文数据集上名列第一;融合自研语音语义多模态说话人算法,能对10人以上说话场景进行角色区分;接入通义千问大模型后,能够对上万字的音视频内容进行摘要总结,事实准确与要点完备性国内领先,支持跨多音视频内容的精准问答理解。
审读:谭录岗
以上是【原创】用大模型自动做笔记、提取PPT、整理访谈 阿里云AI新产品“通义听悟”开放公测的详细内容。更多信息请关注PHP中文网其他相关文章!