Kimi K3与DeepSeek V4之间,隔着原生多模态的时间差

星敏大大_9157

星敏大大_9157

2026-08-06

250人浏览

转载

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

kimi k3与deepseek v4之间,隔着原生多模态的时间差

 

文 | 李炤锋

编辑 | 张雨忻

“长链任务如果只通过代码层面的反馈,误差可能会不断累积,最终效果会非常差。”谈及原生多模态的意义,一位多模态研究员表示,“视觉是一种更准确的反馈,也更贴近用户意图。”

过去一年,Coding与Agent能力不断改写大模型的排名,也成为AI最快兑现商业价值的场景之一。与此同时,随着Agent开始接管更多长链任务,越来越多的通用大模型开始匹配原生多模态能力。

今年1月,OpenAI发布的一份企业使用报告显示,在研发岗位最常使用的三类ChatGPT工具中,图片上传排在搜索和数据分析之后,位列第三。

随着Agent开始生成网页、操作软件并检查运行结果,视觉的作用正在逐步进化:它不再只是用户交给模型的一张图片,也开始成为模型检查工作、发现错误和调整行动的反馈。

刚刚过去的7月,月之暗面发布Kimi K3。这款总参数2.8万亿、支持100万token上下文的MoE(混合专家模型),在Coding和长程Agent能力之外,出色的原生多模态能力是K3的另一个标签。

所谓原生多模态,是让图像、文字等数据从预训练或持续预训练阶段就共同塑造主模型,并在后训练中继续优化,最终参与Agent(智能体)的感知与决策。

K3发布后曾以1679分登顶Arena Frontend Code榜单。该榜单由用户盲选模型生成的可交互网页进行排名,评判的不只是代码能否运行,也包括页面的最终效果。

浏览器开发平台Puter曾在测试网页中制造5处视觉偏差,K3对照目标页与运行页截图,全部找出且没有误报。得益于出色的原生多模态能力,K3能够看懂代码运行后的视觉问题,为下一轮修改提供依据。Kimi方面将这种在代码与截图之间反复迭代的方式称为“vision in the loop”:模型写完代码后查看页面,再根据视觉结果继续调整。

这些都离不开模型的多模态能力。

除了月之暗面,阿里和字节也沿着原生多模态路线,将视觉作为通用模型的基础能力,在最新的Qwen3.8-Max和Doubao-Seed-2.1上,可以看到视觉理解和多模态输入都作为主要功能出现。

而在国产模型头部梯队的另一边,DeepSeek、智谱和腾讯混元的最新通用基座则仍以文本输入为主。

此前,DeepSeek创始人梁文锋曾说:“把AI训练做好,并不需要世界模型,甚至不用多模态。”但他同时表示:“多模态最终还是要做的。”

这两句话并不矛盾。各家公司对多模态的长期价值没有太大分歧,真正的分歧在于时机和代价。

在Coding快速迭代的阶段,要不要同步训练视觉,以及为此投入多少模型容量、数据和算力,正在影响国产头部模型的技术路线。

 

 Agent为什么需要眼睛

做原生多模态,到底有没有必要?随着当下Agent的任务链越来越长,这个问题开始变得愈发具体。

“很多时候我就喜欢截图输入。”一位来自某头部基模团队的研究员表示,“可能文本也能做到同样的需求,但是你得花很多上下文去描述视觉关系。”

视觉输入能够带来更多便利,但不同用户对它的感知并不相同。“一般人可能感觉不到,但对于开发者群体而言,有多模态还是很方便。”

不过,这种需求并不只属于开发者。上述研究员提到,他身边一些并非AI从业者的用户,使用模型最多的场景之一就是制作PPT。“更专业的人可能需要更多能力、更多模态,但普通用户也会在具体场景里用到它。”

纯文本模型本身仍然“看不见”。实际系统可以调用OCR或独立VLM(视觉语言模型),先把图片转换成文字、标签、坐标或结构化字段,再交给文本模型推理。这些工具可以通过Agent框架或MCP接入,用“外挂”的形式获得视觉能力。

从这个角度来看,“如何让Agent获得视觉输入能力”这个命题,不仅是一个基模研发问题,也是一道产品题。

如果系统调得足够好,上游一个大的语言模型做中枢,下游放一个小一些的视觉模型,就像老板把一件小事分配给员工,足以解决大量普通任务。

但在多模态研究员看来,这种模块化方案仍有边界。“如果调用一个工具,总归还是两个模型:一个LLM是‘瞎子’,下游配一个能看清楚的小弟。”他解释道,原生多模态模型内部的视觉输入与语言主干之间“通信的通道会更宽”,而不是先把画面压缩成文字,再交给另一个模型判断。

这种差异也会延伸到后训练。“如果模型自己能做,肯定是更好的事情。”陈屿说,原生多模态模型可以在视觉强化学习中重新读取自己生成的页面或图像,把视觉结果纳入同一条训练轨迹;如果依赖外部工具,感知结果还要在两个模型之间传递。

而在需要反复查看屏幕的长链任务中,这种差别会更明显。外接视觉工具要先把画面转成文字,再交给主模型判断;原生多模态模型可以直接看懂页面变化,接着直接决定下一步怎么做。

在交流中,一位研究员向智能涌现回忆起第一次让GPT-5.6 Sol操作PC端Agent时,那种“震撼”的感受。GPT-5.6 Sol不仅能自动打开浏览器,还能处理认证与权限,将本地代码推上平台,甚至直接登录训练平台并启动任务。

威利森评价,模型“知道很多诀窍”,为了完成目标,几乎会把能用的办法都用上。

“如果没有原生多模态,模型就没有眼睛,反馈也只局限于文本。”上述多模态研究员说,“但很多面向用户的输出都是视觉的,比如网页、图片和视频,模型需要理解这些结果,再给自己反馈。”

事实上,对于视觉究竟只是模型完成任务的一种工具,还是理解世界不可缺少的部分,一直以来业内并没有达成共识。

OpenAI联合创始人、前首席科学家伊利亚·苏茨克维(Ilya Sutskever)曾把文本称为“世界的一种投射”:人类已经把大量现实规律压缩进语言,模型持续学习文本,仍可能获得对世界的理解。

图灵奖得主、Meta首席人工智能科学家杨立昆(Yann LeCun)的判断几乎相反:“绝大多数人类知识,并没有以文本形式表达出来。”语言只是经过人类筛选和概括的信息;模型要理解物体、空间和行动,最终仍要从图像、视频和现实交互中学习。

One API key for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more
One API key for 70+ AI models. Route to GPT, Claude, Gemini, Qwen, Deepseek, Grok and more

统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。

下载

文本是高度概括过的信息,图像和视频更像原始信号。原始信号包含文字没有记录的世界,也需要更多数据、算力和耐心,才能被提炼成可以泛化的知识。

“多模态肯定不是决定性的,但它很重要。”一位模型研究员说,“基础的图片、视频答题已经做得比较饱和了。下一步应该把多模态放进贴近生产的实际场景和复杂任务中。”

另一方面,随着Agent生态在大众用户间全面普及,用户对旗舰模型的期待也在变化。

6月底,智谱首席科学家唐杰在X平台向用户征集“下一版GLM必须加入哪些新功能”,评论区反复出现的答案就是“视觉”。

此前,曾有多位业内人士向智能涌现表示,智谱与腾讯混元的下一代通用基座模型,都可能进一步向原生多模态迈进。

趋势已经出现,但是否要全面强化原生多模态路线,基模团队们还面临着一个资源分配的问题。

 

模型长出眼睛的代价

“对于LLM(大语言模型)来说,多模态更像是一个挂件。”一位来自某头部基模厂商的研究员说,“模型发展的核心不是多模态,而是完成任务的能力。”

从完成任务的角度看,模型看得更多,不等于干活能力一定更强。一个更现实的问题是:LLM加入多模态能力后,甚至有可能削弱原有的语言、推理和Coding能力。

“任务越多,越难平衡。”一位多模态研究员表示,“只做一个任务,可以一直往一个方向调;同时做两个任务(视觉+文本),要么模型更大一点,要么数据更多一点。”

给模型接入视觉,并非简单增加一个输入接口。图像与文字的数据结构、信息密度和学习速度不同。当它们共同训练同一套主干参数时,视觉数据会与文本、代码、数学和推理争夺模型容量,不同训练目标也可能相互干扰。

Kimi K2.5技术报告在一项融合时机的消融实验中记录了这种影响:如果在训练中后期才加入视觉数据,模型的文本能力会先下降,再逐渐恢复。

“如果想做统一原生多模态模型,付出的资源肯定是1+1大于2。”上述研究员表示,“不是把两个单独模型的训练量和参数加起来,就能得到一样的效果。”

除了训练难之外,原生多模态在拓宽使用场景的同时,也意味着更多算力消耗。

苹果公司的MM1(多模态大模型)技术报告发现,视觉编码器、图像分辨率和视觉token数量都会影响模型效果;更高的分辨率和更多视觉token,通常也带来更高的训练与推理开销。

对于只需读取几个字段的任务,让通用模型反复查看整张图片,未必比OCR(光学字符识别)或专业模型来得划算。

K3就是眼下最直观的样本。这款同时追求视觉、Coding和Agent能力的“水桶模型”,总参数达到2.8万亿,每个token激活约1040亿参数。

从训练方式看,K3延续了类似K2.5的early fusion(早期融合)路线。K2.5的实验显示,在图文token总量固定时,较早、以较低比例引入视觉,通常优于训练后期再接入。其最终方案在约15万亿混合图文token的联合预训练中,始终按固定比例混合文本与视觉数据。

K3还从零训练了约4亿参数的视觉编码器MoonViT-V2,不再依赖SigLIP(图文对比预训练模型)的初始化权重,并让视觉表示直接进入下一token预测目标。技术报告称,这一做法在保持视觉效果的同时提高了训练稳定性。

“多模态数据每多一点,文本理解、Coding或者数学可能就会变差,后面还得继续调比例。考验的是基模团队合版的能力。”一位研究员这样总结道。

在K3发布几周后,DeepSeek拿出了另一种答案。DeepSeek V4-Flash正式版总参数2840亿、每个token激活130亿,分别约为K3的十分之一和八分之一。它没有调整架构和参数规模,而是把更新集中在后训练。

在DeepSeek公布的多项Coding和Agent评测中,正式版大幅超过预览版,甚至超过此前的V4-Pro预览版。在考察网页开发与多轮工具操作的Arena WebDev榜单上,它的公开得分也一度升至1577分,接近GLM-5.2,前面只剩K3、Claude Fable 5和GPT-5.6 Sol等少数模型。

DeepSeek V4-Flash证明,在不加入视觉、也不大幅扩张参数规模的情况下,后训练仍能显著提升Coding等核心任务能力。

当这条路线还在快速产生回报时,基模公司应该把多少资源提前留给视觉,似乎还没有统一答案。

与此同时,阿里方面刚刚发布的Qwen3.8-Max,又选择了与K3相近的“大而全”方向:总参数2.4万亿、每个token激活950亿,同时承载原生视觉、Coding和Cowork能力。

不难看出,基模厂商的技术路线选择,不完全由技术结论决定。对此,业内人士表示:“每家公司选择多大的模型、选择什么卖点,最后可能都是那几个人,或者说是老板说了算。”

核心成员的研究背景、产品场景和训练成本,都会影响一家公司的优先级。

人才市场也在感知行业内发生的变化。智能涌现了解到,K3发布后,月之暗面公司附近的咖啡馆和餐厅里,多了一些猎头的身影,“多模态”成为了他们前来拜访的关键词。

但这不意味着所有公司都会立即跟进超大参数+原生多模态的路线,更不意味着多模态会取代Coding成为竞争中心。

多位业内人士认为,Coding才是上牌桌的门槛,如果Coding冲不上去,可能就没有未来的机会。

对于一众国产基模厂商而言,这并非源于对AGI长期路线的分歧,更像是对发展时机和代价的不同考量。至少在眼下,排名、产品与商业化的压力,仍更多落在Coding和Agent能力上。

这场竞争像是同时拨动了两个时钟:Coding与Agent的排名几个月甚至几周就会变化,而模型从语言走向世界却需要更漫长的进化周期。

前一个时钟决定谁能跟上眼下的速度,后一个时钟,或许决定这些公司最终能够抵达哪里。

相关专题

更多
DeepSeek官方入口
DeepSeek官方入口

DeepSeek,一个综合性的搜索引擎,提供来自学术数据库、新闻网站和社交媒体的广泛结果。访问 DeepSeek 的官方网站。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2025.02.17

38609

6

deepseek在线提问
deepseek在线提问

本合集汇总了DeepSeek在线提问技巧与免登录使用入口,助你快速上手AI对话、写作、分析等功能。阅读专题下面的文章了解更多详细内容。

2026.02.27

1129

50

DeepSeek 入门与快速上手指南
DeepSeek 入门与快速上手指南

面向 AI 工具新手,从 DeepSeek 的账号注册、网页端与客户端使用讲起,介绍 DeepSeek-V3、DeepSeek-R1 等模型的能力定位与选择建议、对话提示词(Prompt)编写技巧、深度思考模式与联网搜索功能的使用场景、API Key 申请与首次接口调用流程,帮助用户快速上手 DeepSeek 并将其融入日常工作与学习。

2026.05.12

2269

18

DeepSeek API开发与应用集成教程合集
DeepSeek API开发与应用集成教程合集

系统讲解 DeepSeek 开放平台 API 的开发与集成方法,涵盖 API Key 鉴权与请求签名、Chat Completions 接口参数详解(temperature/top_p/max_tokens)、多轮对话上下文管理、流式输出(SSE Streaming)的前后端实现、Function Call 函数调用与外部工具对接、Embeddings 文本向量接口的使用、Python requests / openai SDK / J

2026.05.12

351

19

DeepSeek 提示词工程与高效使用教程合集
DeepSeek 提示词工程与高效使用教程合集

聚焦如何通过提示词工程充分发挥 DeepSeek 的能力上限,涵盖基础 Prompt 结构(角色/任务/格式/约束)设计、System Prompt 系统指令的最佳实践、Few-shot 示例引导与 Zero-shot 直接提问的场景选择、思维链(Chain of Thought)逐步推理引导、复杂任务的分步拆解策略、输出格式控制(JSON/Markdown/表格)、避免幻觉与提升准确率的约束技巧、DeepSeek-R1 深度推理模式的

2026.05.12

427

26

DeepSeek本地部署与私有化方案
DeepSeek本地部署与私有化方案

面向有数据隐私需求的开发者与企业,讲解 DeepSeek 开源模型的本地化部署方案,涵盖 DeepSeek-R1 各蒸馏版本(1.5B/7B/8B/14B/32B/70B)的硬件需求与能力对比、Ollama 一键本地运行与模型管理、vLLM 高性能推理服务部署、llama.cpp 量化推理(GGUF 格式/Q4/Q8 量化)在消费级显卡上的实践、Hugging Face Transformers 加载与微调、Docker 容器化部署、多

2026.05.12

302

21

DeepSeek行业应用场景实战
DeepSeek行业应用场景实战

以实际业务场景为导向,展示 DeepSeek 在不同行业中的落地应用方案,涵盖代码开发辅助(代码生成/审查/重构/单元测试编写)、长文写作与内容创作(报告/文案/论文大纲)、Excel 数据分析与可视化建议、智能客服机器人搭建(意图识别/多轮对话/知识库检索)、RAG 检索增强生成实现企业知识库问答、合同与法律文本审查、教育领域个性化辅导,帮助用户将 DeepSeek 转化为切实的生产力工具。

2026.05.12

472

17

DeepSeek 与主流 AI 大模型对比评测
DeepSeek 与主流 AI 大模型对比评测

从多个维度对 DeepSeek 与市场主流大语言模型进行客观对比,涵盖模型参数规模与架构差异(MoE 混合专家架构)、中文理解与生成能力对比、英文与多语言表现、数学推理与代码能力基准评测(MMLU/HumanEval/GSM8K)、长文本处理与上下文窗口对比、API 定价与性价比分析、响应速度与并发能力、开源生态与私有化部署灵活性,帮助用户根据自身需求在 DeepSeek、ChatGPT、Claude、Gemini、Llama 等模型中

2026.05.12

225

12

Kimi AI 长文本分析与深度阅读保姆级指南
Kimi AI 长文本分析与深度阅读保姆级指南

本专题深度解析 Kimi AI 核心长文本处理能力,教你如何利用 AI 快速分析 20 万字以上的复杂报告、财报及学术论文,大幅提升深度阅读与信息提取效率。

2026.05.26

401

22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Kimi K2.6学习视频
Kimi K2.6学习视频

共1课时 | 150人学习

KIMI官方手册
KIMI官方手册

共0课时 | 0人学习

腾讯元宝使用手册
腾讯元宝使用手册

共0课时 | 0人学习