2026年7月16日,由北京交通大学经济管理学院、北京交通大学信息管理理论与技术国际研究中心(ICIR)主办的“数据工厂研讨暨《数据工厂白皮书》发布会”在北京交通大学成功举行。国家数据专家咨询委员会委员、北京交通大学教授张向宏代表华为、北京数据集团、贵州大数据集团等33家编制单位和80余位作者对白皮书进行了详细解读。
白皮书显示,2025年是人工智能从“训练”走向“应用”的起点。2025年国内AI推理数据量达101.34EB,首次超越98.14EB的训练数据量,标志着人工智能已正式跨过学习阶段、步入规模化应用阶段。AI越强大,数据要素化就越紧迫、越根本。数据已超过算力和算法成为人工智能发展的第一关键要素,数据驱动成为人工智能四大特征的第一显著特征。
白皮书认为,高质量数据集的规模和质量不仅直接影响人工智能大模型的“智商”水平,更是人工智能在千行百业广泛应用的关键“瓶颈”,已成为企业的核心竞争力和真正的“护城河”。高质量数据集匮乏的深层原因在于生产方式滞后。当前,大部分高质量数据集的生产仍处于“作坊式”阶段。如何实现高质量数据集的规模化、标准化、设施化生产,已成为制约人工智能技术水平进一步提升和深度落地产业场景的关键瓶颈,已成为决定人工智能应用普及程度的核心。

来源:《数据工厂白皮书》
白皮书指出,正如工业社会的水有水厂、电有电厂一样,数智社会也必须有数据工厂。数据工厂是面向人工智能大模型应用,开展高质量数据集规模化、体系化、设施化生产的一种基本业态,是国家数据基础设施的基本构成单元,是高质量数据集规模化生产设施,是突破人工智能发展瓶颈的有效手段,是数据全生命周期的综合产业形态。各地各行业建设的存力中心、模数空间、语料超级工厂等模式正加速向数据工厂演进,并在供给、生产、应用等环节形成了可资借鉴的成熟经验。
白皮书指出,数据工厂可以用“335443”这组数字表示。第一个“3”,即三项组成,数据工厂由储备车间、生产车间和中试车间等三部分构成;第二个“3”,即三种类型,数据工厂有集中式数据工厂、半集中式数据工厂和分布式数据工厂三种形态;“5”,即五大特征,数据工厂呈现出多样化、规模化、标准化、体系化、AI化等五大特征;第一个“4”,即四种建设模式,数据工厂有数据标注企业迭代、数据存储基地升级、人工智能企业延伸和技术企业创新创立等四种主要建设模式;第二个“4”,即四种运营机制,数据工厂应应探索采用保障模式、定制模式、结对子模式、电商模式等四种运营机制;第三个“3”,即三种部署策略,数据工厂应与国家数据基础设施协同部署,在国家基础设施底座应部署通识数据集的数据工厂,在重要功能设施应部署行业通识数据集数据工厂,在各业务节点应部署行业专识数据集数据工厂。
白皮书提出,作为数智社会的一种新兴业态,数据工厂的建设、运营、发展和完善,需要政策、标准、技术、平台等四方面体系性保障。应加快出台促进数据工厂创新发展的政策文件,启动数据资源汇聚整合、数据集生产、质量评估、流通应用等全链条标准研制,突破非结构化数据采集、海量数据存储、智能化数据加工、数据集质量评估等关键技术瓶颈,建设数据资源汇聚、数据集生产、数据流通、人工智能训练等支撑平台。




