• 正文
  • 相关推荐
申请入驻 产业图谱

数据标注需求呈指数级增长

09/01 14:00
335
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

#数据标注需求呈指数级增长

2026中国国际大数据产业博览会上,“数据标注”成为热门话题。数据标注就是给文本、图像、语音等原始数据语料打上精准“标签”,让AI能理解和识别真实世界。因此,数据标注被认为是打通人类智能和机器智能的关键环节。

当下,人工智能正处于从技术突破向系统落地转变的关键阶段,而数据标注作为人工智能开发的重要基础,对其需求也呈指数级增长。

面对高质量数据要素日益增长的需求,人工智能产业集聚区都将数据标注和数据采集作为数字经济发展的新动能与重点产业,引入和培育了大量数据企业和相关从业人员。目前贵阳全省集聚数据标注企业135家,从事数据标注人员超1.6万人。

关于数据标注行业的发展,“硬科技新势力”采访了上市公司汇洲智能(002122)旗下国内头部AI数据服务商“热热数据”CTO鲁楠,聊了聊数据标注行业,从人海战术到知识闭环到数采基础设施,行业经历的三次跃迁。

这是一场关于数据标注行业变迁的对谈,当AI从"识别"走向"理解",标注这门生意从人力密集转向知识密集,人在其中的角色被重新定义。

鲁楠梳理了数据标注行业随AI范式演进的完整脉络,从CV时代的信息抽取,到大模型时代的知识抽取,再到具身智能时代的数据基础设施之争,并给出了AI替代人力的量化判断。

数据标注常被视为AI产业链上最"土"的一环——仿佛就是成百上千人在屏幕前拉框、打点、转录,因此也曾被称为人工智能行业的“血汗工厂”。

但这场对谈揭示的图景恰好相反:标注行业的每一次转身,都精准踩在AI范式的更替节点上,在对谈的一来一回之间,一个被低估的行业变迁史徐徐展开。

一、先解构:标注行业到底在干什么

理解这个行业的变迁,鲁楠认为要先回到本质:数据标注一直在做的,是帮助大模型客户获取高质量的数据语料。这些语料流向三个去处——模型训练、模型评测,以及最终落地时的模型应用。

行业的每一次形态变化,都与AI自身的演进严格绑定。

在AI的早期阶段,也就是业界常说的"CV四小龙"(商汤、旷视、依图、云从)时期,基础神经网络开始能够较好地解决一些标准层面的任务。

彼时大量标注工作集中在信息抽取(Information Extraction),从图像、文本、语音中把结构化信息提取出来。

那个阶段的关键词是"规模"与"速度",如何更快、更大规模地抽取信息。相应地,行业对人的依赖度非常高,本质是一门劳动密集型生意。

转折发生在2022年到2023年,大模型横空出世之后,鲁楠观察到三个几乎同时出现的变化:

第一,神经网络在不断收敛,模型架构趋于稳定;第二,网络收敛之后,大模型对数据的需求量在持续增大;第三,在供给充裕的基础上,算法公司对信息抽取能力的需求反而减弱了,因为模型自己就能做这件事。

需求随即向更高层次迁移,从抽取"信息",转向抽取"知识"。

二、需求三变:从拉框到知识加工

这一迁移直接改写了标注行业的作业方式,鲁楠把它拆解为三个递进的要求:

第一,如何用AI,或者说系统工程化的方式,规模化的对数据进行标准化提炼。换句话说,纯人海战术已经不成立了,工具链和流程工程成为标配。

第二,在标准化、规模化提炼的基础上,如何把数据背后隐含的深度知识加工出来。这是"信息抽取"与"知识抽取"的分野所在,前者提取的是表层事实,比如画面里有一辆车;后者沉淀的是可迁移的理解,比如什么样的驾驶行为是安全的。

第三,加工完成之后,如何对数据质量进行可量化的评判和评测。没有度量就没有管理,质量体系成为交付的一部分。

进入大模型的预训练后阶段(post-training,指预训练完成后的微调与对齐环节)、乃至后训练和评测阶段之后,整个数据需求都建立在对知识的依赖之上。

而鲁楠给出了一个关键判断,这种知识依赖,"不仅仅只依赖于人了",它需要的是一整套完整的数据链路闭环系统,再叠加领域专家,共同把数据中的知识加工出来。

人仍然是必要的,但对人的能力要求更专业,而且前提还要有一套系统能力。

三、具身智能:更贵的数据,更高的门槛

同样的,逻辑延伸到具身智能(Embodied AI)领域,问题变得更加尖锐。

大模型时代的数据多来自互联网文本图像视频,海量供给,获取成本相对低廉,而具身智能的数据必须从物理世界中采集,获取成本显著抬高。

成本一高,对平台基础设施的要求就随之拔高,鲁楠列出了一整条链路上的五道关卡:

1.多模态数据如何获取——视觉、触觉、动作等多通道数据的一次性采集;

2.用什么硬件去获取——采集设备本身成为基础设施的一部分;

3.获取之后如何标准化、批量化地剔除数据噪声——物理世界的数据远比互联网数据"脏";

4.数据里的信息如何自动化提取——不能指望人工逐帧处理;

5.最终如何验证这份数据对模型是有价值、可用的——形成从采集到验证的闭环。

这条链路自始至终都离不开基础设施,而一个明确的趋势是,它对人的要求比例在不断降低。以前那些靠手工操作的工作,很多人已经胜任不了了。这不是人变笨了,而是AI对数据要求提高了。

四、替代率:一组直观的数字

步日欣随即追问了一个投资人最关心的问题:用了工具链和基础设施之后,人的效率到底能提升多少?有没有能直观展示的数据?

鲁楠的回答没有给出单一数字,而是做了任务分层。

在传统的感知类任务上——视频类、图像类、点评类任务——AI对人的替代率已经基本达到70%-80%。

也就是说,大部分生产环节已经交给了机器,"人更多的是在于去精调这份数据,而不是在于我要去怎么去生产这份数据。"

人的角色从流水线上的生产者,退居为质量把关的精调者。

但在组合性任务和长程任务上,替代率明显回落。

鲁楠举了自动驾驶的例子,在地下车库里,把车停进一个非常复杂的车道线区域,这类需要多要素叠加判断的场景,AI的替代率大约只有40%,且会随任务复杂度上下波动。

读完这次对谈内容,结论呼之欲出:

任务越复杂越专业,人越往价值链上游走;AI越强,人越少做"生产",越多做"判断"。

步日欣,创道硬科技创始人,北京邮电大学集成电路专委会副会长,浙商证券研究院专家,兼任多家投资机构投委。电子工程本科、计算机硕士学位,具有证券从业资格、基金从业资格,拥有IT研发、咨询、投融资十五年以上经验,关注投资领域为半导体、智能制造、新能源等。“硬科技新势力”平台覆盖5w+投资人和几千家科技型创业企业,并辅导几十家科技企业完成股权融资。

相关推荐

公众号科创之道主笔,标准的EE、CS专业理工男。从事研发、咨询、投资工作15年,主要关注领域为半导体、人工智能、物联网、云计算等,目前专注于风险投资和企业服务领域,平时喜欢把一些工作上的感悟随手记下来,希望通过自己的文字,融合IT产业和投融资行业知识,为跨行业沟通搭建一座桥梁。