德国人工智能新锐企业黑森林实验室(black forest labs)正式推出全新多模态基础模型——flux3。该模型依托自主研发的 self-flow 架构,集成了专为图像、视频、音频及动作任务定制的编解码器,首次实现了对物理世界与数字空间的统一感知与协同生成。
最引人瞩目的突破在于音视频的原生同步能力。Flux3是业界首个原生支持高质量音频生成的多模态大模型,单次推理即可输出长达20秒、音画严格对齐的多媒体内容,功能涵盖文本到音视频、图像到音视频、视频到视频、基于关键帧的智能转场,以及多角色语音交互等复杂场景。对一个模型而言,将“听觉理解”与“视觉理解”深度耦合于同一技术底座,标志着其已超越传统单模态局限,迈入真正的跨感官智能阶段。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Gemini Notebook网页版是一款基于AI的智能笔记工具,其核心功能是让用户上传个人文档(如PDF、文本等),并以此为基础进行交互。它能针对你的资料进行总结、解答疑问、生成新内容,让信息处理更高效。该版本为在线使用,无需下载安装。
在早期基准测试中,Flux3在720p分辨率、10秒时长的视频生成任务中表现强劲:相较Luma Ray3.2胜率达93%,领先Runway Gen-4.5达77%;即便面对Seedance2.0与Gemini Omni Flash等当前顶尖多模态模型,仍保持小幅但稳定的性能优势。
更进一步,Flux3的能力正从虚拟世界延伸至真实产线。黑森林实验室携手机器人公司Mimic Robotics,联合打造面向工业场景的动作生成模型Flux-mimic,目前已在奥迪汽车工厂开展实际生产流程验证——多模态智能真正落地实体作业环节。在发布策略上,BFL采取渐进式路线:Flux3Video 已率先开放使用;Flux3Image 与开源权重版本 “Flux3Dev” 也将于近期陆续上线。










