在人工智能加速迈向实时交互的新阶段,京东正式对外开源其关键研发成果——实时视频视觉语言交互模型 joyai-vl-interaction。作为全球首个实现全栈开源的交互式视觉模型,该系统不仅深度集成 vllm-omni 技术框架,更象征着 ai 助手正从传统“等待指令”的被动模式,全面升级为“边看边理解、边看边表达”的主动感知范式。
相较以往需用户发出提问后才启动画面分析的延迟机制,JoyAI-VL-Interaction 展现出显著的主动性。它可对持续输入的视频流进行不间断感知与理解,并智能决策介入对话的时机与节奏——该说时精准响应,该静时悄然守候,从而构建出更拟人、更连贯的人机交互体验。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

这一突破性实时处理能力,对动态场景下的信息响应尤为关键。传统视频理解方案普遍依赖“录制→上传→离线分析”的串行流程,在安防巡检、赛事直播、远程教学等强时效性应用中常显力不从心。而 JoyAI-VL-Interaction 直接面向正在播放的视频流开展即时推理,真正达成视觉变化与语义响应的毫秒级同步。
尤为值得关注的是其创新的“后台委托”架构。当遇到代码生成、多步逻辑推演或外部工具调用等高复杂度任务时,模型可自主将计算密集型子任务调度至后台 Agent 执行,前台模型则始终专注维持对当前视频画面的实时追踪与语义解析。这种“前台观察 + 后台协同”的双轨运行机制,确保了复杂操作过程中人机沟通不中断、不卡顿。
在部署灵活性方面,该模型原生兼容 USB 摄像头、RTMP 直播流、IPC 监控信号等多种视频源输入,并开放 ASR 语音识别、TTS 语音合成、长期记忆模块及第三方 API 的即插即换能力,便于开发者按实际业务需求快速定制与扩展。
据京东公开的盲测结果,在覆盖监控告警、跨语言口译、时间敏感事件识别等 58 类真实流式交互场景的真人评测中,JoyAI-VL-Interaction 综合表现优异:总体胜率大幅超越主流竞品,尤其在由细微视觉线索触发的多轮深度交互任务中展现出突出优势。无论面向前沿科研探索,还是落地于智能安防、沉浸式电商导购、AR 眼镜交互等规模化产业场景,这一开源模型都为开发者提供了坚实、开放且高度可塑的技术底座。











