智能经济时代,工业大模型正成为人工智能赋能新型工业化的重要引擎,工业高质量数据是其持续迭代升级的关键“燃料”。《中华人民共和国国民经济和社会发展第十五个五年规划纲要》明确提出,“加快建设人工智能语料库,面向能源、交通、制造、教育、健康、金融等领域建设高质量数据集”。工业和信息化部等八部门印发的《“人工智能+制造”专项行动实施意见》提出,到2027年打造100个工业领域高质量数据集、推出1000个高水平工业智能体、推广500个典型应用场景;启动工业数据筑基行动,推动高质量行业数据集建设。工业语料具有专业性强、建设投入大、协同难度高等特点,单靠市场自发供给难以快速形成规模。山东立足制造业大省优势,以重点行业语料库“揭榜挂帅”为抓手,探索政府引导、企业主体、产研协同的工业语料开发利用机制,形成了具有代表性的地方实践样本。本文结合政策部署、相关研究和山东调研,梳理工业语料建设需求与痛点,总结“揭榜挂帅”实践路径,研判可持续供给面临的问题及演进趋势,并提出推动工业高质量数据集规模化建设的政策建议。
一、工业大模型深度应用呼唤高质量工业语料体系
当前,全球人工智能竞争正加速从“卷算力”转向“卷数据”,模型能力的持续提升越来越取决于训练数据的规模、质量与组织方式。与通用语料相比,工业数据具有多元异构、多级分布、深度耦合等特点,数据工程投入在部分智能化改造项目中占比可达50%-60%,业内形成“七分在数据、三分在模型”的判断。高质量工业语料已不只是模型训练的基础资源,更是工业智能化持续演进的关键基础设施:一是把知识沉淀下来,将分散于个人经验、纸质文档和异构系统中的隐性知识转化为可积累、可传承、可审计的组织级数据资产;二是把模型训练好,通过机理准确、标签一致、场景对齐的高质量数据供给,降低垂直大模型训练成本,提升其专业理解和复杂场景适应能力;三是让模型持续进化,通过误报漏报样本归集、人工纠偏和新工况难例回流,形成“数据—训练—应用—反馈—再训练”的工作闭环,推动模型从“一次训练”转向持续迭代。由于工业语料具有知识密度高、专业壁垒高、获取难度大、跨主体协同难等特征,已成为主要工业国家和国内先进地区竞相布局的新型战略资源。
二、山东重点行业语料库“揭榜挂帅”的实践路径
(一)以“需求张榜、团队揭榜”重构语料生产组织方式
2025年,山东省工业和信息化厅、省财政厅启动重点行业语料库“揭榜挂帅”,张榜环节聚焦基础理论研究、产品研发设计、生产管理运行、过程质量检测等关键工业场景,公开发布语料建设需求;揭榜环节不唯身份、只论能力,鼓励最接近数据源头、最熟悉产业场景的企业和团队牵头建设,从源头破解工业语料“谁来采、谁来标、谁来建、谁来用”的组织难题。其建设逻辑与国家后续推动以联合体方式开展工业高质量数据集建设的方向衔接。山东通过“需求牵引、能力竞争、产业主体负责”的机制,将语料建设从单纯的数据工程转向面向实际工业需求的协同创新,为国家层面探索高质量工业数据集建设组织机制提供了地方样本。
(二)构建覆盖数据、模型、算力、场景的政策工具体系
围绕工业人工智能落地中“数据贵、模型难、算力缺、场景少”等堵点,山东逐步形成覆盖数据、模型、算力、场景的政策“组合拳”,先后出台《关于加快人工智能赋能重点领域高质量发展的推进方案》《关于支持人工智能全产业链创新发展的若干政策措施》《山东省“人工智能+制造”行动方案(2026—2028年)》等政策文件,为高质量数据集建设搭建制度框架。2025年9月,省工业和信息化厅、财政厅印发《山东省省级“语料券”奖补资金管理办法及实施细则》(鲁工信发〔2025〕5号),每年遴选不超过20个行业语料库重点项目,每个给予最高75万元奖补,验收评价为“优秀”的再奖75万元。同时配套“模型券”支持垂直领域大模型攻关,“算力券”降低算力使用成本。2026年进一步推出场景券,对主动开放应用场景资源的企业给予激励。随后通过财政资金统筹整合和政策迭代,提高语料库及大模型项目奖补力度,并设立人工智能产业发展基金,推动政策支持由单点补贴向全链条生态培育转变。2025年11月,省级财政统筹整合10亿元资金(其中当年新增2亿元),进一步优化模型券、语料券等奖补政策,将行业语料库重点项目最高奖补提升至150万元,大模型项目最高不超过100万元,并设立总规模20亿元的人工智能产业发展基金。从政策设计导向看,其核心不是简单“给钱建库”,而是通过财政资金撬动企业投入、促进供需对接,加快形成“数据生产—模型训练—算力支撑—场景应用”的产业闭环,推动工业语料由政策驱动逐步走向市场化、自我造血。
(三)形成多元主体协同的建设格局
2025年10月28日,山东发布首批20个重点行业语料库“揭榜挂帅”项目,推动链主企业、行业龙头、工业互联网平台与科研机构共同构成建设主体,让“最懂行业的主体建设行业的库”,把数据责任、行业知识和建设能力统一到同一主体。如,滨化集团牵头建设精细化工行业语料库,山东海化集团承担盐化工行业语料库,山东海科化工聚焦石油加工制造;中国移动山东公司联合中移齐鲁创新院建设钢铁行业语料库;中通客车、荣成康派斯分别承担车辆制造、专用车辆制造语料库;科捷智能牵头智能制造装备语料库,鲁南制药承担医药行业语料库;威海天力电源、山东云电链、玫德集团则分别布局电子信息制造、输变电装备和金属制品行业。中国工业互联网研究院山东分院持续参与产业数据标准研究、第三方测评体系建设和项目跟踪评估,为机制设计与项目建设提供研究支撑。
三、重点行业语料库“揭榜挂帅”建设的阶段性成效
(一)行业覆盖扩大,质量管控闭环初步形成
截至目前,山东已分两批累计遴选建设35个重点行业语料库,实现31个制造业门类全覆盖,基本形成重点行业语料供给框架。2026年8月,省工业和信息化厅、省财政厅启动项目验收,围绕规模与丰富度、适配性与推广度、安全性与合规性、场景适配性四个维度开展评审,并按优秀、合格、不合格分类评级;项目申报阶段即明确语料数据量不低于10万条,验收须通过第三方测评,对不达标项目收回奖补资金。相较于单纯考核“建了多少数据”,山东更加突出“模型能不能用、场景好不好用”,初步形成“标准约束—第三方测评—结果验收—奖补挂钩”的质量管控闭环,体现了“以用定建、以评促建”的治理思路。
(二)场景牵引应用,工业语料从“数据资源”向“知识资产”跃迁
山东部分行业语料库已从数据汇聚进入场景应用阶段,呈现“建库—建模—应用”同步推进的特征。在钢铁行业,中国移动山东公司(日照分公司)联合日照钢铁将工艺手册、设备档案、检修案例、行业标准和专家经验等多源数据加工为行业专属知识体系,知识检索效率提升30%,并进一步孵化日照钢铁智擎大模型,实现生产经验从个人掌握向组织沉淀、从知识资产向模型能力转化。在造纸行业,瞬捷数字科技依托造纸行业AI语料库开展建设,归集制浆工艺、设备故障、环保台账等行业专属多模态数据,完成专业化标注。依托该语料底座训练行业模型,支撑纸机断纸故障预警、工艺参数调优等场景,实践中实现吨纸能耗下降12%,推动造纸工艺经验向可复用组织知识资产转化。在化塑高分子行业,山东化塑云商建设化塑高分子行业AI语料库,语料库汇聚配方试验记录、改性工艺、缺陷样本等垂直领域数据,语料条目达到项目验收标准。基于语料迭代的工业智能体,用于新材料配方推演、制品缺陷根因研判,缩短新材料研发试错周期,助力塑化行业研发与生产提质增效。
更值得关注的是,语料建设正在由单点项目向行业纵深拓展。滨州围绕高端铝产业建设高质量数据集,训练出智铝行业大模型,实现电解槽工况预判与槽况智能诊断;潍坊探索以芦笋产业数据集赋能特色农业;青岛港将调度人员经验进行数据化沉淀,实现个人经验向组织知识转化。国内头部企业的实践也表明,行业语料规模化建设能够显著降低企业重复采集、重复标注成本。如,中国石化整合近13万册技术文件、200余万张生产图像和500TB以上视频,形成162万余条高质量问答对,支撑1600余个智能应用在线开发;钢铁、纺织等行业探索跨企业样本共建,也显示出行业共性语料在摊薄数据建设成本、提升模型专业能力方面的潜力。由此,工业语料正在完成从“数据集合”向“行业知识基础设施”的跃迁。
(三)产业带动效应显现,“数据—模型—场景”生态加快形成
随着语料底座不断夯实,山东工业人工智能初步形成“数据供给—模型研发—算力支撑—场景应用”的产业化链条。截至2026年上半年,全省通过第三方机构测评的大模型产品达317个,其中51个通过国家生成式人工智能服务备案;122个工业领域“揭榜挂帅”行业大模型实现41个工业大类全覆盖;全省算力总规模达23.18EFLOPS,智能算力占比超过51%;2522家企业通过数据管理能力成熟度(DCMM)贯标评估,数量稳居全国首位。产业规模同步快速增长。2025年山东人工智能核心产业营业收入达1289.3亿元,同比增长39.2%,约占全国总量的10%,其中大模型产业收入63.8亿元、同比增长104.5%;2026年上半年,人工智能核心产业营收已突破850亿元、同比增长33.2%。这些变化表明,语料建设的价值并不止于“多建几个数据集”,其真正意义在于打通从数据资源到模型能力、从模型能力到工业场景、再从场景反馈反哺数据的循环链条。山东的实践初步验证了一个趋势:高质量语料正在由人工智能产业的“幕后资源”,加速转变为撬动模型能力提升和产业规模扩张的关键基础设施。
四、工业语料可持续供给的问题与趋势研判
(一)工业语料供给面临“采、汇、用”三重瓶颈
与互联网文本相比,工业语料具有强机理、强时序多模态、故障样本长尾稀缺、核心工艺敏感四方面特殊属性,工业数据内嵌于生产现场与企业业务系统,不属于互联网公开数据,无法通过网络爬取方式获取,需依托工厂现场采集、治理沉淀形成。从行业方法论看,瓶颈贯穿“采、集、用”三个环节。一是采集难,数据“出不了厂、跨不了域”。企业内部PLC、DCS、MES、ERP等异构系统协议不一,跨企业数据又受制于确权、授权和收益分配规则不健全,“不愿供、不敢供”现象普遍。二是汇聚难,数据“连得上、语义却不通”。工业语料不仅需要数据汇聚,更需要将设备状态、工艺参数、质量结果、故障机理等进行统一标注和知识关联。一项复杂多模态数据集的专业标注往往需要十至二十位行业专家协同投入,行业术语、本体和接口标准不统一,导致点对点对接成果难以复用。三是应用难,语料“建得出、用不好、规模化难”。模型场景跨企业迁移时数据治理成本往往高于部署成本,专业化封装不足使场景难以产品化、规模化,并且尚未完成从“物理汇聚”到“语义贯通”的跨越,数据汇聚不等于数据连通,系统集成不等于语义贯通。
(二)工业语料发展三方面趋势研判
随着工业大模型和工业智能体加速进入生产现场,工业语料的战略价值正在发生变化,未来供给模式将呈现三方面转变。一是供给方式由“一次性建库”转向“持续性营库”。工业知识并非静态资源,设备、工艺、产品和故障模式持续变化,决定了工业语料必须具备持续采集、动态标注、版本管理、质量评估、难例回流和效果反馈能力。未来竞争的关键不再是谁“建了多大的库”,而是谁能够形成持续产生高质量语料的运营机制,推动工业语料由静态数据集向动态“语料生产线”转变。二是组织模式由“单点自建”转向“链主牵引、跨域协同”。面对单个企业数据规模有限、专业标注能力不足等问题,工业语料供给将更多依托产业链、行业联合体和可信数据空间组织生产,通过“原始数据不出域、模型协同训练、数据价值共享”等方式,推动上下游企业从数据孤岛走向语料协同。特别是链主企业掌握场景、标准和产业组织能力,有望成为连接中小企业数据、行业知识与模型能力的关键节点。三是价值形态由“成本投入”转向“资产运营”。随着数据资产入表、数据集开发利用和数据交易机制逐步完善,高质量工业语料有望从企业AI项目中的隐性成本,转变为具有明确质量、权属、使用范围和收益规则的可运营资源。未来,工业语料的价值实现将不再主要依赖财政资金“建库”,而是更多通过语料开发、授权使用、场景服务和价值分成形成市场化回报,推动工业语料供给由“项目制建设”迈向“市场化运营”。
五、推动工业语料高质量开发利用的对策建议
(一)强化持续运营与标准评测,夯实供给质量
按照“分业推进、分级建设、分类供给”思路,推动工业语料从项目化建设向长期运营转变。发挥链主企业统筹牵引作用,围绕产业链共性场景牵头建设协同数据集,组织上下游企业共同参与数据采集、标注和验证;针对中小企业数据基础薄弱、专业能力不足等问题,依托公共平台提供“小、快、轻、准”的低成本语料服务,降低使用门槛。企业内部建立语料版本管理、质量监测、难例回流和效果反馈机制,推动语料库与工业模型同步迭代、持续优化。依托中国工业互联网研究院山东分院等专业机构,对照《工业高质量数据集研究报告》相关指标框架,完善覆盖数据质量、标注质量、知识含量、场景适配、应用效果的评价体系,探索建立工业语料分级认证和第三方测评机制,同时加强培养既懂工业机理、又懂数据工程和模型应用的复合型人才,为工业语料持续生产提供专业支撑。
(二)强化市场驱动与体系互联,提升语料流通利用效益
以数据资产入表、数据交易和场景应用为牵引,加快推动工业语料由“内部成本项”向“可运营产品”转变。总结推广青岛大数据交易中心“数据+模型”交易备案实践,探索工业语料产品的质量认证、挂牌交易、授权使用和收益分成机制,培育专业化数据开发、治理、评测和交易服务商,逐步形成“语料生产—质量评测—产品封装—市场交易—价值反馈”的产业生态,让市场机制逐步发现和形成高质量语料价格,推动财政支持由直接补贴“建库”向支持标准、平台和应用生态转变。与此同时,落实工业数据筑基行动部署,加强地方平台与重点行业数据可信互联平台衔接,推动国家标准与地方标准互认、数据集与接口规范互通、语料产品跨域复用。抓住潍柴动力装备高质量数据集建设先行先试联合体入围工信部“工业数据筑基行动”专项行动的契机,率先探索跨企业语料接口、质量评价和授权流通规范,形成可复制推广的产业协同模式,防止各地“各建一库、各立一标、各自交易”,把原有企业数据孤岛演变成新的“地方语料孤岛群”。
六、结语
工业大模型的竞争,表面是模型之争,深层是语料之争、机制之争。山东以“揭榜挂帅”组织语料生产、以“语料券”“模型券”“算力券”“场景券”组合政策激励投入,锚定质量、以场景落地和交易探索兑现价值,初步形成了从语料生产、质量提升到场景验证、价值实现的闭环。35个行业语料库在钢铁、化工、汽车、装备、医药等产业一线陆续落地表明,工业数据这座富矿并非无法开采,关键在于建立一套让行业主体愿意供、让语料质量有标准、让数据价值能兑现的长效机制。
从更长周期看,随着算力供给持续扩张、基础模型加速开源,模型能力的通用差距将逐步收窄,而高质量工业语料及其持续运营能力,将越来越成为决定行业大模型能力上限的关键变量。紧扣“人工智能+制造”专项行动目标要求,应坚持需求牵引、标准先行、市场运作、持续运营,以持续运营夯实供给能力,以标准评测锚定语料质量,以市场机制兑现数据价值,以可信互联放大流通效益,推动分散在车间、设备和工艺流程中的工业知识持续沉淀、加工和复用,把“车间里的真经”转化为大模型真正读得懂、学得会、用得上的工业智能能力,为新型工业化筑牢高质量数据底座。
作者信息
徐 昊,中国工业互联网研究院山东分院负责人,长期从事工业互联网、人工智能等领域的研究工作,参与智能制造领域多项部委和地方规划编制、标准体系建设及省级重点专项项目实施。
董熠璇,中国工业互联网研究院山东分院,中级工程师,研究方向为工业互联网、人工智能大模型、产业链数字化等,参与山东省多项省级产业规划、标准体系建设及省级重点专项项目实施。
马维维,中国工业互联网研究院山东分院政策研究部负责人,高级工程师,研究方向为工业互联网、人工智能产业、制造业数字化转型等,山东省数字经济标准化技术委员会委员,智能制造能力成熟度评估师。近年来深度参与多项企业数字化转型规划及实施项目,主要参与国家工业互联网大数据中心山东分中心建设。申报软著10项,专利2项,发表论文10余篇。
金永花,中国工业互联网研究院政策研究所,正高级研究员,经济学博士,研究方向为智能经济、数字化转型、产业链供应链、安全应急产业等,工业和信息化部安全应急装备标准化工作组委员,发表论文30余篇,完成8部专著和合著,牵头20余项部省级课题,参与多项国家重大政策文件起草。