black forest labs正式以“早期访问(early access)”形式发布全新多模态基础模型flux3,该模型采用统一架构,实现图像、视频与音频的联合学习。其技术底座在原有self-flow(自监督流匹配)学习框架基础上完成升级,支持视频、图像与音频三模态同步训练,并在flux.1与flux.2系列成果之上,显著拓展至更广泛的多模态生成与理解任务。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

性能表现强劲,原生音轨实时生成
FLUX3可在单次推理中直接输出最长20秒的高清视频,并同步生成匹配的原生音频。功能覆盖文生视频、图生视频、视频生视频、输入视频+音频续写、关键帧插值转视频、多语言语音对话,以及多镜头逻辑串联等多样化创作场景。在人工评估中,针对带音频的10秒720p视频生成任务,FLUX3相较Grok Imagine Video胜率达69%,对比Seedance 2.0与Gemini Omni Flash胜率均达52%,整体性能优势显著。
Gemini Notebook网页版是一款基于AI的智能笔记工具,其核心功能是让用户上传个人文档(如PDF、文本等),并以此为基础进行交互。它能针对你的资料进行总结、解答疑问、生成新内容,让信息处理更高效。该版本为在线使用,无需下载安装。
图像能力扎实,探索机器人行为建模新路径
图像层面,FLUX3支持高质量图像生成与精细化编辑,兼容多种艺术风格、宽高比及分辨率规格。尤为值得关注的是,Black Forest Labs已与Mimic Robotics达成合作,正推进FLUX3在机器人行为预测方向的应用研究——将多模态AI能力从虚拟内容生成延伸至具身智能体控制领域。此举标志着FLUX3正从创意生成工具,加速演进为贯通数字空间与物理世界的通用型多模态智能引擎。










