当业界普遍认为图形处理器并不适合处理日益复杂的智能体任务时,一家名为 Kog 的法国初创公司却提出了截然不同的看法:GPU 的潜力远未被充分挖掘,问题不在于硬件本身,而在于我们如何“压榨”它。
被误解的 GPU:从“显卡”到“推理引擎”
过去十年,GPU 凭借其强大的并行计算能力,在深度学习的训练阶段扮演了无可替代的角色。然而,当模型从“训练”进入“推理”阶段,尤其是面对需要多步推理、工具调用、状态回溯的“Agent 工作流”时,许多工程师开始抱怨 GPU 效率低下——显存频繁溢出、计算资源浪费、延迟难以忍受。于是,CPU、NPU 甚至专用 ASIC 被推上前台,GPU 似乎被贴上了“不适合推理”的标签。
但 Kog 认为,这更像是一种“认知上的懒惰”。GPU 的核心优势在于大量线程的并行执行,而 Agent 工作流中常见的串行依赖、条件分支、动态图结构,恰恰是传统 GPU 编程模型难以高效处理的。但这并不意味着 GPU 天然不适合,而是现有软件栈和调度策略未能充分适配。
深入 GPU 底层:Kog 的“压榨”之道
Kog 并没有选择重新设计硬件,而是将目光投向 GPU 的“皮肤之下”——更细粒度的资源调度、更智能的显存管理、以及更贴近硬件特性的算子融合。具体而言,他们正在做三件事:
– 动态显存优化:传统的显存分配策略往往“一次性拉满”,导致大量显存在空闲时被占用。Kog 的方案允许 GPU 在推理过程中按需释放和回收显存,甚至能利用 NVLink 等高速互联在多个 GPU 之间实时迁移数据,从而支持更大规模的 Agent 上下文。
– 异步计算与流水线:Agent 工作流中往往包含多个并行子任务(如同时调用多个工具、查询多个数据库)。Kog 通过将 GPU 的计算单元划分为多个“虚拟引擎”,让每个子任务独立运行,并在任务间实现零开销切换,大幅提升整体吞吐。
– 硬件特性适配:现代 GPU(如 NVIDIA H100、B200)内置了 Transformer Engine、稀疏计算单元等专用模块。Kog 的运行时层能自动识别 Agent 工作流中的矩阵运算模式,将计算精准映射到这些专用硬件上,避免通用计算路径带来的效率损失。
行业意义:Agent 时代的基础设施之争
随着大模型从“聊天机器人”演变为“自主执行任务的智能体”,Agent 工作流的计算需求正在爆发。一个典型的 Agent 可能需要调用 API、解析文档、执行代码、规划步骤,每一步都可能涉及模型推理。如果每次推理都依赖 CPU 或专用芯片,成本、延迟和部署复杂度都会陡增。
Kog 的尝试其实是在回答一个关键问题:我们能否在不改变现有硬件生态的前提下,让 GPU 成为 Agent 推理的主力? 如果答案是肯定的,那么企业无需大举采购昂贵的专用推理芯片,只需在现有 GPU 集群上部署优化软件,就能获得数倍于当前的推理能力。这对于推动 Agent 应用的规模化落地意义重大。
当然,Kog 的方案并非没有挑战。GPU 的底层调度权限受限于硬件厂商的驱动接口,深度优化需要与 NVIDIA、AMD 等公司密切合作。此外,Agent 工作流的多样性意味着没有任何一种“通用优化”能覆盖所有场景。但至少,Kog 给出了一个值得深思的方向:当大家都在抱怨“工具不对”时,也许只是我们还没学会如何用好它。
随着推理优化成为新的竞争焦点,类似 Kog 这样的初创公司或将重新定义“GPU 适合做什么”的行业共识,而 Agent 工作流的计算瓶颈,也可能会在软件创新的推动下悄然消解。