载入中… | 今日精选 · 实时更新
每日精选全球 AI 与科技资讯
编辑部 · 北京时间 每日 08:00 更新
首页

Databricks估值飙至1880亿美元,开源AI模型如何改写行业规则?

· · 阅读 5 分钟

当一家以大数据基础设施起家的公司,悄然将估值推至1880亿美元,并公开宣称“我们是一家AI公司”时,整个科技行业都必须重新审视一个事实:AI领域的“第二幕”已经拉开——而Databricks正是这场演出的主角。就在最新一轮融资中,Databricks不但刷新了自身估值记录,更发布了一项引人注目的研究成果:在代码生成任务中,开源权重AI模型在成本效益上已显著优于传统闭源方案。

从“数据平台”到“AI公司”的华丽转身

Databricks的崛起轨迹,几乎是过去十年企业软件与AI浪潮交汇的缩影。2013年,公司由Apache Spark的创始团队创立,最初聚焦于大数据分析平台。但随着机器学习与深度学习的爆发,Databricks逐步将重心转向AI基础设施——从MLflow、Delta Lake到统一的数据与AI平台,其产品矩阵不断向模型训练、部署和推理渗透。

真正让行业侧目的,是Databricks在2023年收购MosaicML——一个专注于高效训练和部署开源LLM(大语言模型)的初创公司。这笔交易不仅带来了技术,更带来了“开源权重模型”这一战略方向。此后,Databricks推出了Dolly 2.0、Mosaic ML Pre-trained Models等一系列开源模型,迅速在AI社区获得关注。如今,公司估值从2024年的430亿美元飙升至1880亿美元,仅用两年时间便翻了四倍多,成为AI领域估值最高的非上市公司之一。

开源权重模型:成本优势的实证研究

Databricks此次发布的研究,直接瞄准了企业级AI应用中最关键的痛点——成本。研究团队对比了开源权重模型(如Llama 3、Mistral等)与闭源模型(如GPT-4、Claude 3.5)在代码生成任务上的表现,并详细计算了总拥有成本(TCO)。结果显示,在相同准确率等级下,开源权重模型的推理成本仅为闭源模型的1/5到1/10,且训练成本更低——这得益于开源社区对模型架构的持续优化和MoE(混合专家)等技术的成熟。

更重要的是,研究指出,对于大多数企业代码生成场景(如自动补全、bug修复、单元测试生成),开源模型在性能上已能匹配甚至超越部分闭源模型,而无需依赖外部API,从而避免了数据隐私、延迟和供应商锁定等问题。Databricks的结论直指核心:开源权重模型正在成为企业AI落地的“性价比之王”。

估值飙升背后的三重驱动力

Databricks估值突破1800亿美元,并非仅仅依靠概念炒作。其背后有三大实质性支撑:

客户迁移浪潮:随着企业从“探索AI”转向“大规模部署AI”,对统一数据+AI平台的需求激增。Databricks的Lakehouse架构(数据湖+数据仓库融合)天然适配AI工作流,大量客户从传统数据仓库迁移至其平台。
开源模型商业化:Databricks将开源模型作为“钩子”,通过提供托管服务、企业级支持和定制化优化来收费。这种模式比单纯卖SaaS更具粘性,且能持续吸引开发者和数据科学家。
生态护城河:Databricks拥有全球最大的Spark社区,且与MosaicML、Hugging Face等开源生态深度绑定。其产品支持几乎所有主流开源模型,用户无需切换平台即可完成从数据准备到模型部署的全流程。

行业意义:AI领域的“权力转移”信号

Databricks的成功,折射出AI行业正在发生的结构性变化。过去,AI的“第一幕”由OpenAI、Google等闭源模型巨头主导,它们通过API收费,控制着最先进的模型能力。而“第二幕”则属于开源模型与数据基础设施的整合者——Databricks、Anthropic(部分开源)、Meta(Llama)等正在重塑规则。

对于企业用户而言,这意味着不再只有“花钱买API”一条路。开源权重模型允许企业在下游任务上微调、私有化部署,甚至完全控制模型权重。Databricks的研究恰好证明了,在代码生成这类高频、高成本场景中,开源模型完全可以替代闭源方案,且成本优势巨大。这将对整个AI产业链产生深远影响:云服务商、模型提供商、数据平台之间的竞争将更加激烈。

当然,Databricks并非没有挑战。其估值已超过许多传统软件巨头,盈利压力巨大;同时,开源模型社区分散,维护成本高昂。但无论如何,1880亿美元的估值已经向市场传递了一个清晰信号:在AI的下一阶段,谁掌握了数据、模型和成本效率的平衡,谁就能赢得企业的长期信任。而Databricks正以“开源+平台”的双轮驱动,成为这场游戏中最不可忽视的玩家。