nova ai通过nova lite、pro、micro及多模态嵌入模型链路,实现会议录音转纪要、图文混合理解、长视频结构化摘要、实时语音闭环与跨模态检索一体化处理。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想让一段会议录音自动转成带时间戳的纪要,再根据纪要生成配图PPT,最后导出为带语音解说的短视频——Nova AI现在能用一套模型链路完成全部动作,无需切换工具或手动粘贴。
用Nova Lite处理图文混合输入
打开Amazon Bedrock控制台→选择Nova Lite模型→在输入框中直接粘贴一段含截图链接的Markdown笔记,例如“见图1:产品架构图(https://xxx.png);问题:模块A响应延迟超200ms”。
Nova Lite会自动下载并理解该图像内容,将视觉信息与文字描述对齐分析。这一步不能跳过图像加载等待,【若图片链接失效或跨域受限,模型将忽略图像部分,仅处理文字】。
点击“Run”后,输出结果会明确标注哪些结论来自图像、哪些来自文本,比如“模块A延迟异常(图1中红色高亮区域)”。
用Nova Pro解析长视频并提取结构化摘要
方法一:上传MP4文件至Bedrock S3桶→在Nova Pro推理接口中填写S3 URI路径→设置参数"chunking_strategy": "scene_change"→提交请求。
方法二:调用Nova Pro异步API,传入视频URL和{"max_segments": 8, "include_audio_transcript": true}→获取job_id→轮询status直到返回completed。
注意:视频必须是H.264编码且分辨率≤4K,否则预处理阶段会失败并返回空嵌入向量。
用Nova Micro+Transcribe+Polly构建实时语音闭环
第一步:用户语音输入经RTC插件送入Amazon Transcribe,生成带标点和说话人分离的文本流。
第二步:文本流实时喂给Nova Micro模型,执行意图识别与指令拆解,例如把“把刚才说的三点方案发邮件给张经理”解析为{action: "send_email", recipients: ["zhang@xxx.com"], content_ref: "summary_0710_1105"}。
第三步:系统调用Amazon Polly合成语音,同时将Nova Micro输出的结构化指令交由后端服务执行,语音与操作同步发生,延迟控制在800ms内。
这一步操作起来很简单,直接把文件拖进去就行。
用Nova多模态嵌入实现跨模态检索
准备三类数据:100份PDF技术文档、200张设备实拍图、50段产线巡检视频片段。
统一调用Nova多模态嵌入API,对全部数据生成8192维嵌入向量,存入Amazon OpenSearch Service集群。
用户输入“电机过热报警但红外图未显示异常”,系统自动将该文本转为嵌入向量,在向量库中搜索最接近的图像与视频片段,返回匹配度Top3结果及对应文档页码。
嵌入向量维度必须严格一致,【混用512维与8192维向量会导致检索完全失效】。











