载入中… | 今日精选 · 实时更新
每日精选全球 AI 与科技资讯
编辑部 · 北京时间 每日 08:00 更新
首页

免训练剪掉80% Token,紫东太初给多模态模型来了一次”满血瘦身”

· · 阅读 5 分钟

大模型跑起来有多贵?Token消耗是绕不开的成本大山。尤其在多模态场景下,图像、视频带来的Token开销往往是纯文本的数十倍。紫东太初团队最近放出一招”核心集剪枝”,让多模态模型在少用80% Token的情况下,能力表现依然不掉线,而且免训练、开箱即用。这招”满血瘦身术”直击行业痛点,给高成本的多模态推理带来了一种新的打开方式。

剪掉的是冗余,留下的是”核心”

多模态模型在处理图文混合输入时,视觉编码器会把图像切分成大量Patch,每个Patch对应一个Token。一张高分辨率图片动辄产生数百甚至上千个Token,而其中真正对理解任务起关键作用的往往只是一小部分,大量Token属于背景、纹理等冗余信息。GMC核心集剪枝方法的核心思路,就是在不重新训练模型的前提下,从这些Token中精准识别并保留”核心集”——也就是对模型决策贡献最大的那一小撮Token,其余的全部丢掉。

免训练是关键,开箱即用才实用

以往常见的模型压缩手段,比如结构化剪枝、蒸馏、量化,大多需要重新训练或微调,这意味着巨大的算力开销和调参成本。而紫东太初这次推出的方法主打”免训练”,模型权重原封不动,只是通过一种高效的选取策略,在推理阶段动态决定哪些Token可以不用参与计算。这种即插即用的特性,让它可以像外挂一样直接套用到现有模型上,不需要动模型架构,也不需要重新跑训练流程,部署门槛大幅降低。

80%的缩减,是怎么做到的

团队给出的数据是”少80% Token仍满血保真”。简单算一笔账:如果原本一个多模态任务需要1000个Token,剪枝后只需要200个,计算量直接降了一个量级。更难得的不是剪得多,而是剪完之后能力不塌方。在常见的多模态基准测试中,剪枝后的模型在图文检索、视觉问答、图像描述等任务上,效果与原始模型基本持平,部分任务甚至略有提升。这说明被剪掉的部分确实大多是”噪音”,而保留下来的核心集有效承载了决定性语义信息。

多模态推理成本,有望被重新定义

这项工作的行业意义,远不止”省了一笔电费”。多模态大模型之所以落地难,推理成本高是主要障碍之一。对于需要处理大量图片、视频的AI应用——比如智能客服、内容审核、自动驾驶、医疗影像分析——Token消耗直接换算成真金白银的算力账单。如果能在大幅压缩Token的同时保持效果,意味着同样一台GPU服务器能支撑的服务量级成倍上升,单位推理成本断崖式下降。

更值得关注的是”免训练”这个属性带来的连锁反应。当下大模型迭代速度极快,一套需要重新训练才能生效的优化方案,往往还没等部署完就被下一代模型淘汰了。而免训练的剪枝方法,天然具备快速适配新模型的能力,这使它更像一种通用的”加速外挂”,可以在不同架构、不同任务间快速迁移。

效率与效果的平衡,是未来大模型的必修课

大模型的竞争正在从单纯的”参数竞赛”转向”效率竞赛”。参数规模不再是唯一指标,能不能在有限算力下跑出更好效果,正在成为衡量模型实用价值的关键维度。GMC核心集剪枝代表了一种新思路:与其无脑堆算力,不如往模型里加”智能调度”——让每一分算力都花在刀刃上。这种以效率为导向的方法论,可能会成为多模态模型走向规模化应用的重要推手。

当然,这套方法目前主要针对视觉Token的冗余,对于文本Token、跨模态交互中的动态稀疏性,还有待进一步探索。但方向已经铺开:让模型更懂”抓重点”,比单纯变大变深更有性价比。紫东太初这步棋,或许正在为多模态大模型的低成本落地,踩出一条新路。