国家数据局近日披露,截至2025年6月底,全国已建成高质量数据集12万个,总体量超过1565拍字节(PB),较一季度末增长超60%。这一体量相当于中国国家图书馆数字资源总量的547倍,标志着我国人工智能发展的数据基础设施迈入规模化、高质量供给新阶段。
数据总量跃升,AI训练“燃料”储备充足
高质量数据集是人工智能模型训练、推理与优化的核心基础。据国家数据局介绍,目前覆盖科学研究、工业制造、医疗卫生、教育教学等关键行业领域的数据集已形成规模效应。1565PB的数据总量,相比一季度末的约978PB增长了超过60%,增速显著。按市场估算,训练一个先进的大语言模型通常需要数TB到数十TB的高质量数据,现有数据集足以支撑多行业、多模态AI模型的持续迭代。
这一数据规模不仅体现了数据采集与汇聚能力的提升,更反映出我国在数据标准化、清洗、标注等环节的体系化进展。高质量数据集并非简单堆砌原始数据,而是经过筛选、脱敏、标注后形成的结构化资源,其价值远高于普通数据。
数据标注产业同步推进,7个先行先试城市成型
数据标注是高质量数据集建设的关键环节,直接影响AI模型的准确性与可用性。国家数据局同步披露,四川成都、辽宁沈阳、安徽合肥、湖南长沙、海南海口、河北保定、山西大同七个数据标注先行先试城市,截至今年6月底标注规模已超119PB,数据标注从业人员达14万人。
这一数字表明,数据标注已从零散的小作坊模式转向专业化、规模化、产业化发展。七个城市各具产业特色:成都依托电子信息产业优势,沈阳聚焦工业数据标注,合肥则在医疗健康领域发力,形成区域协同与差异化竞争格局。14万从业人员的规模,也意味着数据标注已成为吸纳就业的新兴数字职业,未来随着AI应用深化,人才需求将进一步扩大。
政策明确:构建“数据供给—模型迭代”价值闭环
国家数据局表示,下一步将深化构建服务人工智能的高质量数据供给体系,核心思路是“以模型应用牵引数据供给、以数据驱动模型迭代”,并推动实现数据集有偿使用的价值闭环。
这一政策导向意义重大。过去,数据供给往往存在“有数据但不适用、适用但无回报”的困境,导致数据持有方缺乏开放动力。通过建立有偿使用机制,数据所有者可通过授权获得收益,从而激励更多高质量数据进入流通环节。同时,“以模型应用牵引数据供给”意味着数据集的建设将更贴近实际场景需求,避免“为建而建”的浪费。
行业意义:数据生态成熟度决定AI竞争力
数据、算法、算力并称为AI三要素。近年来,我国在算力基础设施(如智算中心)和算法模型(如大模型开源生态)上取得显著进展,但数据层面的短板一度制约着AI能力的上限。高质量数据集的规模化建设,直接填补了这一缺口。
从国际竞争看,全球AI领先国家均在加速构建高质量数据体系。例如,欧盟通过《数据治理法案》推动公共数据开放,美国则依托科技巨头积累的私有数据构建壁垒。我国通过政府主导的数据集建设与产业政策引导,有望在公共数据、行业数据领域形成独特优势,为中小企业及科研机构提供低成本、高质量的数据资源,降低AI开发门槛。
此外,数据标注产业的规范化发展,也为数据安全与隐私保护提供了制度保障。先行先试城市的数据标注规模与从业人员数量,表明我国在数据治理的“最后一公里”已形成规模化实践,这对于实现AI伦理合规、防止数据滥用同样至关重要。
总体来看,12万个高质量数据集及1565PB的数据体量,不仅是一个数字里程碑,更预示着我国AI产业从“模型驱动”向“数据驱动”的深度转型正在加速。当数据供给从“有没有”转向“好不好”,从“免费开放”走向“有偿闭环”,AI发展的底层逻辑将更加可持续。