点击右上角微信好友

朋友圈

点击浏览器下方“”分享微信好友Safari浏览器请点击“”按钮

文化人 天下事
正在阅读: 【学思践悟】依托高价值场景促进人工智能高质量数据集建设
首页> 光明日报 > 正文

【学思践悟】依托高价值场景促进人工智能高质量数据集建设

来源:光明网-《光明日报》2026-08-07 03:10

调查问题加载中,请稍候。
若长时间无响应,请刷新本页面

  【学思践悟】

  作者:郝 政(山东省习近平新时代中国特色社会主义思想研究中心特约研究员、山东青年政治学院副教授)陈 阵(安徽省委党校党的建设与国家治理研究院副研究员)

  当前,随着人工智能走进千行百业的具体场景,模型的性能跃升越来越依赖数据与场景的深度耦合。习近平总书记在2026世界人工智能大会暨人工智能全球治理高级别会议开幕式上的主旨讲话中强调,“全面促进人工智能科技创新、产业发展、场景应用”。“十五五”规划纲要提出,“依托高价值场景推动模型应用落地和迭代升级”。随着《关于深入实施“人工智能+”行动的意见》《关于推进行业高质量数据集建设行动的实施方案》等政策文件围绕高质量数据集建设作出针对性部署,高价值场景在高质量数据集建设中的作用愈发凸显。

  当前,大模型、多模态、智能体快速演进,决定模型落地效果的不再是通用语料数据的简单堆积,而是能否围绕具体任务形成高知识密度、高匹配度、高反馈性的专用数据供给。在这种趋势下,离开真实场景,数据往往只能停留在被动获取的资源形态;进入真实场景,数据才能沉淀为模型能力、转化为产业能力、上升为治理能力。例如,医疗领域中某肺结节检测模型训练数据集仅利用1万多例数据和亚毫米级病灶边界勾画的标注信息,便使早期肺癌筛查中的假阳性率大幅下降;工业质检场景中某企业通过合成数据等技术生成了10万种“极端缺陷样本”,有效弥补了真实生产中罕见缺陷数据不足,使产品质量缺陷识别覆盖率大幅提升。面对我国数据资源丰富、产业体系完备、市场空间巨大的叠加优势,需要更加注重数据的代表性、多样性和场景适配性,以高价值场景促进人工智能高质量数据集建设。

  所谓高价值场景,是数据集合与模型应用相互作用、持续演进的实践空间,是界定任务边界、筛选有效样本、检验模型性能、改进治理风险的重要载体。高质量数据集是指经过采集、加工等数据处理,可直接用于开发和训练人工智能模型、有效提升模型表现的数据集合,通常能够体现出规模“大”、安全“牢”、观点“正”、效果“好”、应用“广”等特征。高质量数据集的检验标准,既要看准确性、完整性、一致性、时效性、多样性、真实性和合规性等静态指标,也要看其在代表性模型训练和应用中的实际效果。也就是说,高质量数据集不是“收得多”就行,关键在于能不能理解真实任务、支撑真实应用、提升真实能力。

  随着人工智能从“数字世界”走向“物理世界”,高价值场景与高质量数据集之间的关系,显著体现为场景、数据、模型三者之间的并行演化、相互塑形、动态耦合。以高价值场景为牵引,以高质量数据集为纽带,以模型能力迭代为目标,推动需求发现、数据生成、能力形成、效果反馈,彼此贯通、循环提升。这一过程是驱动人工智能从技术研发走向能力验证和产业应用的内在机制。为此,应将高质量数据集建设放到“以场景牵引数据、以数据支撑模型、以模型反哺场景”的系统中来把握,其核心是让人工智能模型能够深度解析“这里发生了什么”“关系如何”“为什么会这样”等问题,以实现数据集合与具体场景的深度耦合。

  从功能定位看,没有高价值场景,数据就缺少任务边界,模型就缺少能力坐标,投入也难以形成产出闭环。其中,高价值场景居于牵引地位,贯穿数据建设和模型演进的全过程,回答的是问题从哪里来、价值向哪里去、任务如何界定、效果如何检验。数据集合居于支撑地位,需要把场景中的原始信息、业务知识、操作经验和反馈信号,经过汇聚、清洗、标注、合成、评测、流通和治理,沉淀为可训练、可验证、可迁移、可复用的数据资产。模型应用则居于转化地位,通过训练、调优、部署和反馈,把数据资源转化为认知能力、决策能力和执行能力,并在运行过程中反过来发现数据短板、校正任务定义、推动场景升级。因此,脱离高价值场景来谈高质量数据集,容易陷入“数据越多越好”的数量迷思;脱离高质量数据集来谈高价值场景,又容易陷入“场景很多却难以规模化落地”的应用困境。场景定义需求,数据承载知识,模型生成能力,三者共同构成闭环。

  高质量数据集建设本身是一项系统工程,需要制度、技术、标准、生态协同发力,将高价值场景对高质量数据集建设的推动作用充分发挥出来。

  首先,把准“场景选什么”。真正的高价值场景,应当是既服务于国家战略全局、现代化产业体系建设和智能向善的治理需要,又具备明确任务目标、清晰业务流程、持续数据产出和可复制推广潜力的重点场景。要紧扣“十五五”规划、“人工智能+”行动等顶层部署,围绕科技创新、产业发展、民生福祉、社会治理等重点方向,聚焦交通、医疗、金融、制造、农业、政务服务等领域的痛点堵点,形成分层分类的高价值场景清单。明确哪里是国家战略和现实需求的结合点,哪里就应成为高质量数据集建设的发力点。

  其次,把“场景语言”转化为“数据语言”。场景不能直接等同于数据集,中间必须经过任务拆解、流程映射、标签体系设计和评测规则重构。一是围绕识别、理解、推理、决策、执行、反馈等关键环节,明确需要什么数据、需要到什么粒度、怎样保证质量、如何划定合规边界。二是把行业知识和场景知识嵌入数据集合全过程,依据基础认知、场景理解、行动规划三个层次来整合数据资源,并把模型验证嵌入建设流程,使“数据需求—数据规划—数据采集—数据处理—模型验证—反馈迭代”真正形成闭环。这样建设出来的数据集,才能从“可训练”进一步走向“可解释”“可迁移”“可复用”。

  再次,着力构建协同供给体系和运营体系。高质量数据集不可能由单一主体独立完成,而是需要政府部门、链主企业、平台企业、科研机构、数据服务机构等共同参与。要推动公共数据资源开发利用,支持企业有条件开放数据,促进跨行业跨领域数据互通共享。同时依托可信数据空间、数据交易平台等数据服务基础设施,推动多源异构数据在合规前提下安全汇聚、高效检索、可靠评测、可信流通和规模化应用。更重要的是,要树立“以用促建”理念,围绕用户需求响应、成本精细管理、质量安全维护和生态协同发展,形成从建设到运营再到迭代优化的长效机制。

  最后,要落到制度规范和治理能力建设上来。当前制约高质量数据集建设的,既有场景转化不够的问题,也有数据不精、标准不一、规则不清等问题。对此,应坚持静态质量与动态质量并重,既看数据本身是否真实、完整、多样、合规,也看其对模型性能提升是否有效、对实际应用支撑是否可靠。一是规范数据供给,加强重点行业数据标注,完善质量评价规范。对数据交易流通、收益分配、产权登记等问题,要在法治轨道上持续细化规则,推动数据供得出、流得动、用得好。二是保障数据合规复用,在不干扰正常运行、不破坏有效技术措施、不损害合法权益前提下鼓励场景加工和价值增值。三是探索建立全生命周期数据质量监测和反馈纠偏机制。发挥高价值场景的“数据监测器”功能,建立模型迭代反馈链条,加快推动数据资源优势转化为人工智能发展优势。

  《光明日报》(2026年08月07日 06版)

[ 责编:丁玉冰 ]
阅读剩余全文(