广西新闻网 > 首页栏目 > 经济 · 生活 > 创新 > 正文

前沿观点|好数据才是硬道理

2026年07月28日 18:17 来源:广西云-广西日报 作者:丁建军 编辑:陶昌顺

2026世界人工智能大会暨人工智能全球治理高级别会议主席声明凝聚了十五条共识,其中第四条专门聚焦数据——把握数据高流动性、高赋能性特征,深化数据资源开发利用,切实保障数据安全。

数据质量为什么这么重要?

过去两年,行业里有一个明显的转向:AI竞争的重心,正从“把模型做大”转向“把数据做好”。业内有个形象的比喻——大模型是发动机,数据是汽油。汽油的标号不够,发动机再强劲也跑不远。国家数据局今年6月印发的《关于推进行业高质量数据集建设行动的实施方案》给出了标准定义:高质量数据集是经过采集、加工等处理,可直接用于开发和训练人工智能模型,能有效提升模型性能的行业数据集合。说白了,不是随便一堆数据都能叫高质量数据集。它要经过专业采集、清洗、标注、验证,才能喂给模型。

例如,医疗影像数据集标注精度要求极高,哪怕0.001%的错误率,都可能造成致命误判。有关研究显示,金融风控领域的高质量数据集,让银行不良贷款识别率提升了29%,风险误报率降低了55%。DeepSeek-R1的实践证明,高质量推理数据可以让模型参数量效率提升三倍,也就是说,数据够好,小模型也能干大事。

中国做了什么?坦率地讲,我们起步不算早,但动作快、力度大。

2026年6月,国家数据局部署专项行动,明确到2028年底建成一批覆盖重点领域、经过应用验证的行业高质量数据集。这距离2024年12月国家印发《关于促进数据产业高质量发展的指导意见》、首次明确提出“高质量数据集”概念,只有短短一年多时间。

再看落地。国家数据局已遴选出104个高质量数据集典型案例,覆盖芯片制造、蛋白质研究、智慧航运、应急管理、电网调度等十余个重点领域。例如,上海交通大学的VenusPod蛋白质序列数据集,汇聚了150亿条序列数据,规模全球最大,将传统2到5年的蛋白质研发周期缩短到2至6个月;芯片陶瓷封装基板表面缺陷数据集,采集样本超过11万个,帮助企业良好率提升20%以上;天然气管网运行数据集整合了上载、下载等8个子集数据,气量预测偏差不超过4%,达到国际先进水平——这些都不是实验室里的演示,是实打实的产业效能。

挑战在哪?

一是“有数据、没数据用”的尴尬。中国各行各业沉淀了海量数据,但真正经过清洗、标注、验证、可供AI模型直接训练的,少之又少。

二是成本。高质量标注离不开专家参与,医疗影像要放射科医生审核,核电诊断要工程师定义故障阈值……自动化标注工具在进步,但离好用还有距离。

三是规则。数据的权属怎么界定?版权作品怎么合规用于模型训练?收益怎么分配?这些制度层面的问题不解决,数据就流不动。

大会强调“加快构建数据产权等基础制度,确保数据可管、可控、可追溯”,正是看到了这些堵点。

人工智能的竞争,表面上看是算法和算力的比拼,底子上是数据的较量。对广西而言,这件事尤其值得上心。广西有面向东盟的区位优势、有丰富的农业和海洋数据资源、有中国—东盟信息港等基础设施——在高质量数据集建设这件事上,不必跟北上广深拼通用大模型的全栈能力,找准特色场景、做深做透行业数据集,或许是更务实的切入路径。

好数据才是硬道理。这句话放在AI时代,恰如其分。

(作者系全国宣传思想文化青年英才,吉首大学商学院教授、博士生导师)

扫一扫在手机打开当前页
>>更多精彩图集推荐