当大模型开始从对话走向真实世界,仅靠文本反馈已无法应对日益复杂的任务链。视觉正从一种辅助输入,蜕变为长链智能体(Agent)自我纠错的核心手段。这条路径的领先者月之暗面,在刚刚过去的7月发布了Kimi K3,用原生多模态能力重新定义了Agent的可靠性,也让行业对“视觉是否必须”的争论有了更清晰的答案。
Kimi K3:用视觉闭环改写代码生成范式
Kimi K3是一款总参数达2.8万亿、支持100万token上下文的混合专家模型(MoE)。在Coding和长程Agent能力广受关注的同时,其原生多模态设计尤为亮眼。所谓原生多模态,是指图像、文字等数据从预训练阶段起就共同塑造主模型参数,并在后续强化学习中持续优化,最终让视觉感知直接参与智能体的决策与行动。
这种设计在代码生成场景中展现出惊人效果。K3发布后,以1679分登顶Arena Frontend Code榜单——该榜单由用户盲选模型生成的可交互网页进行排名,评判标准不仅看代码能否运行,更看重页面的最终效果。在浏览器开发平台Puter的一项测试中,对方故意在示例网页中制造了5处视觉偏差,K3对照目标页与运行页截图,全部找出且没有误报。
Kimi团队将这种在代码与截图之间反复迭代的方法称为“vision in the loop”:模型写完代码后直接查看页面效果,再根据视觉结果继续调整。这种能力已非单纯的图像理解,而是模型用视觉作为反馈,像人类开发者一样审视自己的作品,再决定下一步修改方向。
路线分歧:原生多模态还是“外挂眼睛”?
在Kimi K3之外,阿里和字节也沿着原生多模态路线推进,最新的Qwen3.8-Max和Doubao-Seed-2.1均将视觉理解和多模态输入作为主要功能。而在国产模型头部梯队的另一边,DeepSeek、智谱和腾讯混元的最新通用基座仍以文本输入为主。DeepSeek创始人梁文锋曾坦言:“把AI训练做好,并不需要世界模型,甚至不用多模态”,但他同时表示:“多模态最终还是要做的。”
这两句话并不矛盾。各家公司对多模态的长期价值并无太大分歧,真正的分歧在于时机和代价。在Coding能力快速迭代的当下,要不要同步训练视觉,以及为此投入多少模型容量、数据和算力,正在影响国产头部模型的技术路线选择。
一个现实的问题是,纯文本模型本身仍然“看不见”。实际系统可以通过调用独立视觉语言模型(VLM)或OCR工具,先把图片转换成文字,再交给文本模型推理,这种“外挂”方式足以解决大量普通任务。但多位研究员指出,随着Agent的任务链越来越长,这种模块化方案开始暴露出边界。
原生多模态模型内部的视觉输入与语言主干之间通信通道更宽,不会先把画面压缩成文字再交给另一个模型判断。在需要反复查看屏幕的长链任务中,这种差别更加明显:外接视觉工具需要不断转换格式,积累的误差可能让长链任务最终偏差极大;而原生多模态模型可以直接看懂页面变化,直接决定下一步行动。一位多模态研究员形容:“视觉是一种更准确的反馈,也更贴近用户意图。”
视觉反馈已是刚需,但代价不菲
OpenAI今年1月发布的企业使用报告显示,在研发岗位最常使用的三类ChatGPT工具中,图片上传排在搜索和数据分析之后,位列第三。随着Agent开始生成网页、操作软件并检查运行结果,视觉的作用已从用户交给模型的一张图片,进化为模型检查工作、发现错误和调整行动的反馈。
这种需求不仅限于开发者。有研究员发现,普通用户使用模型最多的场景之一就是制作PPT,而视觉输入能极大减少用文本描述视觉关系的繁琐。智谱首席科学家唐杰6月底在X平台向用户征集“下一版GLM必须加入的新功能”,评论区反复出现的答案就是“视觉”。多位业内人士透露,智谱与腾讯混元的下一代通用基座模型,都可能进一步向原生多模态迈进。
然而,给模型“装上眼睛”的代价不容忽视。图像与文字的数据结构、信息密度和学习速度不同,当它们共同训练同一套主干参数时,视觉数据会与文本、代码、数学和推理争夺模型容量,不同训练目标也可能相互干扰,甚至可能削弱原有的语言和推理能力。Kimi K2.5技术报告中的消融实验显示,如果在训练中后期才加入视觉数据,模型的文本能力会先下降,再逐渐恢复。苹果公司的MM1技术报告也发现,视觉编码器、图像分辨率和视觉token数量都会影响模型效果,更高的分辨率和更多视觉token意味着更大的算力消耗。
“如果想做统一原生多模态模型,付出的资源肯定是1+1大于2。”一位研究员直言,这不是把两个单独模型的训练量和参数简单相加就能得到同等效果。在资源有限的前提下,究竟优先投入文本推理和Coding能力,还是同步训练视觉,成了每家公司必须做出的选择。
行业意义:Agent的“感官革命”正在加速
原生多模态正从一项技术选项,演变为长链Agent的必备能力。当大模型开始承担更多连续操作任务时,视觉反馈不仅降低误差累积,也让模型的行为更贴近人类直觉。那些早期投入原生多模态路线的团队,已经开始在代码生成、网页设计等贴近生产的环境中证明其价值。
与此同时,用户对旗舰模型的期待也在变化。随着Agent生态在大众用户间普及,模型能否“看懂”屏幕、图片和操作结果,将直接影响产品体验和商业落地速度。尽管资源分配和训练难度仍是现实挑战,但趋势已经清晰:下一阶段的大模型竞争,将不仅是推理能力的比拼,更是感官能力的争夺。谁先让模型真正拥有“眼睛”,谁就可能定义Agent的能力上限。