载入中… | 今日精选 · 实时更新
每日精选全球 AI 与科技资讯
编辑部 · 北京时间 每日 08:00 更新
首页

腾讯混元核心人物出走:多模态理解退潮,世界模型接棒?

· · 阅读 5 分钟

腾讯混元大模型的核心人物之一,正悄然离场。近期,腾讯混元多模态理解负责人胡瀚已提出离职,这标志着腾讯AI战略在经历了一轮自上而下的资源重组后,正将重心从成熟的多模态理解技术,转向更具前瞻性的世界模型和基础模型能力提升。胡瀚的离开,或许只是腾讯AI在“追赶”路上,不得不做出的取舍。

胡瀚离场:从微软亚洲研究院到腾讯的短暂旅程

胡瀚的履历在AI圈并不陌生。他曾是微软亚洲研究院视觉计算组的首席研究员,在计算机视觉领域深耕多年。2025年初,他加入腾讯,负责视觉大模型的研究。随后,他转入大语言模型部旗下的“Frontier”前沿技术研究组,专攻多模态理解,直接向腾讯大语言模型部负责人姚顺雨汇报。值得注意的是,胡瀚在腾讯期间还承担了世界模型的研发工作。

如今,随着胡瀚的离职,他此前的团队或将迎来转型。据知情人士透露,姚顺雨正在密集梳理旗下团队,胡瀚所在的研究组大概率将聚焦于世界模型的前沿研究。这意味着,曾经被视为腾讯AI核心竞争力的多模态理解方向,正在被重新定位。

姚顺雨的“提速”与混元路线的重塑

自2026年年中以来,腾讯混元体系的人员调整从未停止。7月初,前OpenAI研究院、麻省理工学院博士田永龙加入大语言模型部,将接替胡瀚负责视觉语言模型(VLM)方向的研发。这一人事变动,是姚顺雨上任后“补全短板、提升混元基模能力至第一梯队”战略的缩影。

姚顺雨的到来,让腾讯AI的资源分配逻辑发生了根本性变化。他的一大举措,是将人才、算力全部聚焦于大语言模型部负责的基础模型研发。例如,腾讯撤销AI Lab后,核心研发人员全部并入大语言模型部;同时,从字节Seed Infra团队和后训练团队引入数名关键人才。这些动作的目标只有一个:让混元基模的能力快速追上行业第一梯队。

在6月的腾讯云AI产业应用大会上,腾讯集团高级执行副总裁汤道生曾向姚顺雨抛出尖锐问题:“很多人说腾讯在AI上慢了,你觉得我们真的慢了吗?”姚顺雨内心显然比外界更焦虑。据混元研究员透露,他多次向腾讯高管争取更多算力资源。另一个细节是,在Hy3模型发布前一个月,因数据出现问题,姚顺雨罕见地用严厉措辞告诫团队:“数据非常重要。如果下次再出现这样的情况,直接走人。”

多模态理解:从“现金牛”到“鸡肋”的转变

胡瀚的离职,并非个人职业选择那么简单,它折射出腾讯对多模态理解技术收益的重新评估。

一方面,多模态理解技术本身已趋于成熟。文字、图像、视频识别准确率普遍能达到85%以上,技术红利逐渐消退。真正的难点在于视觉推理——即让模型理解图像和视频背后的含义,这一步需要依赖语言模型的推理能力,而非单纯的多模态理解研究。换言之,继续投入资源攻克多模态理解,边际收益已经十分有限。

另一方面,多模态理解的商业化前景并不明朗。虽然计算机视觉技术曾一度与腾讯的广告、游戏、影音等“现金牛”业务紧密结合,但多模态理解所对应的“识图”“看图写话”等场景,很难直接转化为用户付费意愿。一位元宝产品经理直言:“没有用户愿意为识图付费,市面上有大把免费可替代的产品。用户真正愿意付费的,是文档处理、PPT制作、研报制作这些办公场景。”而这些场景背后,需要的是模型的推理、编码、Agent能力。

算力有限,腾讯不得不做出取舍

腾讯的算力资源与字节、阿里相比并不占优。2025年腾讯财报显示,全年资本开支为792亿元;而阿里截至2026年3月的财年资本开支达到1260亿元;字节2026年更计划将AI基础设施投入最高推至700亿美元。在这样“僧多粥少”的局面下,腾讯必须把有限的资源投入到最有可能产生突破的方向上。

姚顺雨的选择是:暂缓技术红利有限的多模态理解研究,聚焦于更代表未来的前沿方向,尤其是世界模型和基础模型能力。7月6日,他交出了加入腾讯后的第一份正式答卷——大模型Hy3。在同等参数量的中等尺寸模型中,Hy3已经能与GLM-5.2、DeepSeek V4 Pro掰手腕。这证明,姚顺雨的组织重组、基建体系重构、回归基模的战略,在短短半年内,已让混元具备了上AI第一梯队牌桌的资格。

胡瀚的离职,或许只是腾讯AI战略调整的一个注脚。当大语言模型部和世界模型成为新的聚焦点,那些曾经风光无限的多模态理解团队,将如何转型?腾讯能否在算力劣势下,凭借精准的战略聚焦实现弯道超车?这一切,都将在姚顺雨接下来的棋局中逐渐揭晓。