载入中… | 今日精选 · 实时更新
每日精选全球 AI 与科技资讯
编辑部 · 北京时间 每日 08:00 更新
首页

拆解大模型权重:数据成本仅1%的新可解释性路径

· · 阅读 5 分钟

大模型的能力越来越强,但“黑箱”难题始终困扰着研究者和开发者——我们能否在不重新训练一个替代网络的前提下,真正理解模型内部是如何决策的?日前,至知研究院提出了一条全新的可解释性路线:直接拆解模型的权重参数,所需数据成本不到传统方法的1%,而且无需额外训练任何辅助网络。

为什么“再训练一个解释器”这条路走不通?

当前主流的可解释性方法,无论是基于注意力机制的归因分析,还是通过训练一个“代理模型”来近似原始模型的行为,都绕不开一个核心矛盾:解释器本身也是一个黑箱。例如,研究者常常训练一个更小的神经网络(如线性探针或决策树)来模仿大模型的输出,试图从中提取规则。但问题是,这个替代网络本身仍需依赖大量标注数据(通常需要原始训练数据的10%~30%),且其解释能力受限于替代网络的表达能力——一旦替代网络不够复杂,就会丢失原始模型的细微特征;而如果替代网络过于复杂,又陷入新的不可解释循环。

更关键的是,再训练一个网络意味着引入了额外的计算开销和偏差。大模型的可解释性本应服务于安全与信任,但若解释过程本身就需要耗费大量资源,甚至可能因训练数据分布不一致而产生误导性结论,那就失去了实际意义。

至知研究院的新思路:直接“拆解权重”

至知研究院的团队另辟蹊径,不再依赖“训练—解释”的套路,而是直接对模型权重进行结构化解构。他们发现,大模型中的权重矩阵并非完全随机,而是呈现出低秩、稀疏、可分解的数学结构。通过一种名为“权重子空间分解”的技术,研究者可以将一个复杂的全连接层或注意力头的权重矩阵,拆解成若干独立的正交分量,每个分量对应一个特定的“功能模块”。

具体来说,这种方法分为三步:
1. 奇异值分解(SVD):对每一层的权重矩阵进行奇异值分解,提取出贡献最大的若干奇异向量。
2. 功能映射:将这些奇异向量与输入样本的激活模式进行关联,发现每个向量实际上对应了模型在处理特定语义特征(如“颜色”、“形状”、“情感”等)时的响应模式。
3. 无需反向传播:整个分析过程仅需前向传播,不需要反向传播或梯度计算,因此数据成本极低——只需少量(不到原始训练数据1%)的随机样本,即可完成对模型行为模式的全面映射。

实验表明,在GPT-2和BERT-base上,这种方法能以95%以上的准确率预测模型在特定输入下的决策路径,且解释结果的粒度可以精细到单个神经元级别的贡献。

为什么数据成本不到1%?

传统方法中,若要训练一个高质量的替代网络,通常需要覆盖原始训练数据中各类分布的代表性样本,数据量至少要达到数万条。而至知研究院的方法不需要训练任何模型,它只是对已有的权重进行数学分解。所需的少量样本仅用于验证分解结果与真实行为的一致性,而非用于训练。因此,数据成本实质上只是“验证成本”,这让它在大规模部署时具备了极高的性价比。

更重要的是,这种方法天然具有可迁移性。一旦某类模型(如所有Transformer架构)的权重分解模式被建立,后续新模型只需简单套用解析框架,无需重新收集数据,即可快速获得其可解释性报告。

对大模型落地意味着什么?

从行业角度看,这一突破有望解决两个关键痛点:安全审计领域适配

安全审计:金融、医疗等高风险行业在部署大模型前,必须确保模型不会因某些隐藏的偏见(如种族、性别)而做出错误决策。传统方法需要大量模拟数据来探测偏见,而权重分解可以直接从模型内部“揪出”与偏见相关的特征分量,审计效率提升百倍。
领域适配:当企业将通用大模型微调至特定行业时,往往需要知道哪些参数被修改了、修改后是否引入了新风险。权重分解能清晰展示微调前后每个分量的变化,让开发者像“看电路图”一样理解模型的演变。

不过,该方法目前仍面临局限:对于参数规模超过千亿的模型,权重矩阵的奇异值分解计算量依然较大(约数小时),且对非结构化注意力机制(如某些稀疏注意力)的解析尚不成熟。但至知研究院表示,他们正在优化算法并尝试与硬件加速结合,预计未来一年内能将解析时间压缩到分钟级。

可解释性不是大模型的“附加题”,而是通往可信AI的必答题。至知研究院的这条新路线,让我们看到一种更轻量、更本质的解法——不再用黑箱解释黑箱,而是直接拆解黑箱的骨架。 当数据成本降到1%,意味着可解释性不再是少数团队才能负担得起的奢侈品,而可能成为每个大模型出厂前的标准配置。