而这只是冰山一角——Meta花了143亿美元买下Scale AI 49%的股份,华裔创业者Edwin Chen靠数据标注成为福布斯最年轻亿万富翁……震惊吗?数据标注不就是给人打标签吗?怎么突然这么值钱了?
因为AI时代最值钱的不是算力,不是算法,是数据。

这些最精明、最有钱的科技巨头和投资人,全在往数据标注砸钱。
他们不傻。他们砸的是"AI产业链的咽喉"。
数据标注为什么这么重要?
大白话讲——数据标注就是给AI"喂教材"。
AI模型训练的过程,本质上就是"看大量例子,学会规律"。你给它看100万张猫的图片,每张都标注了"这是猫",它就学会了认猫。给它看100万段对话,每段都标注了"好的回答"和"坏的回答",它就学会了好好说话。
但问题来了——这些"标注"从哪来?
是人来标注。
这就是数据标注的工作:让真人去看数据、理解数据、给数据打标签。一张图片里有没有猫?一段文本是不是有害?一个AI回答好不好?一个自动驾驶场景里哪些是行人哪些是路灯?
全是人标的。
没有标注数据,AI就是"文盲"。很多人以为AI训练的流程是:喂数据→训练→出模型。看起来很简单。但喂进去的"数据",AI看得懂吗?一堆原始图片、一堆没整理过的文本、一堆杂乱无章的对话记录——AI看着这些,就像你看着一堆甲骨文。没有"翻译",没有"注解",没有"标注",它什么也学不会。

标注数据就是AI的"教材",标注员就是AI的"老师"。
教材质量差,AI学出来就是个差生。教材好,AI才可能成为学霸。
核心逻辑:AI能力的天花板,不取决于算法多先进,而取决于训练数据多好。再强的GPU、再大的模型参数,喂进去的是垃圾数据,出来的就是垃圾模型。这就是AI圈那句老话:"Garbage in, garbage out"——垃圾进,垃圾出。而"数据好不好",80%取决于标注质量。所以数据标注不是"苦力活",是决定AI智商上限的源头工程。
说到数据标注,就不得不提一个关键词:RLHF——基于人类反馈的强化学习。这是ChatGPT之所以"好用"的核心技术。
原理很简单:
让AI生成多个回答→让人类标注员排序哪个好哪个差→用排序结果训练一个"奖励模型"→让AI根据奖励模型的打分来优化自己。
也就是说,ChatGPT之所以不像以前那些AI一样满嘴胡话、有害、没用——是因为有大量人类标注员在背后"教"它什么是对的。
你跟ChatGPT聊天觉得它回答得还不错?那背后是成千上万个标注员,一条一条地给AI的回答打分排序的结果。
AI模型的能力上限 = 算力 × 算法 × 数据质量,算力和算法都有天花板,但数据质量——谁掌握了最好的标注数据,谁就掌握了最强的AI。
数据标注为什么值钱
(1)Mercor:3年200亿美元,英伟达亲自下场Mercor是旧金山一家数据标注公司,2023年成立——到今天满打满算3年。
3年做到200亿美元估值,什么概念?很多上市公司干了几十年都没这个数。
它干的事看起来很"简单"——聘请各领域的人类专家,针对专业任务对AI模型进行使用和评估,产出数据供模型迭代优化。
听起来就是"找人给AI打分"?没错。但关键是——它找的不是普通大学生兼职,而是科学研究、法律、金融项目领域的专家,甚至包括英伟达GPU的编程工作。
所以Mercor卖的不是"劳动力",是"专业判断力"数据化。

英伟达为什么要投它?因为英伟达正在自研开源大模型Nemotron——对标全球顶尖开源模型。而训练Nemotron,高度依赖Mercor提供的高质量数据。
英伟达不仅投了Mercor,还参与了Scale AI 2024年的融资(当时Scale估值140亿美元),另外还用了Turing的数据服务。
一家卖芯片的公司,为什么疯狂投资数据标注公司?
因为英伟达明白:算力是硬件,数据是燃料。光有引擎没有油,车跑不动。而最好的油,就是高质量标注数据。
(2)Scale AI:被Meta 143亿"买走半条命"Scale AI是数据标注行业的"老大哥"——最早做自动驾驶数据标注起家,后来成为几乎所有头部AI公司的数据供应商。
2025年6月,Meta一出手就是143亿美元,拿下Scale AI 49%的股份。Scale估值飙到290亿美元。
更猛的是——Meta直接把Scale AI的创始人Alexandr Wang挖走了,让他来领导Meta的超级智能实验室。
扎克伯格花143亿买的不是Scale的办公楼,不是Scale的员工——是Scale手里那些给OpenAI、Google、微软做标注积累下来的数据资产和方法论。
换句话说,Meta买的不是一家"外包标注公司",买的是"AI训练数据的know-how"和数据供应体系。
这就是"数据标注"的含金量——不是苦力活,是AI大厂竞相争夺的战略资源。
(3)Surge AI:华裔小伙0融资做到180亿美元身家
这个故事最传奇。
Edwin Chen,1988年出生的华裔理工男,2020年在旧金山创办了Surge AI。成立5年,零外部融资。全靠自己的营收活下来的。
2025年营收超10亿美元——超过了同期Scale AI的8.7亿美元。
到2025年启动首轮10亿美元融资时,市场给出的估值是240-300亿美元。Edwin Chen持有约75%股份,身家约180亿美元——直接成为福布斯美国400富豪榜上最年轻、最富有的新晋成员。
他靠什么?
靠的是"高端数据标注"路线——不跟Scale AI拼规模、拼廉价劳动力,而是专攻高质量、专业化、细分领域的数据标注。Google等大厂愿意为他的数据付高价。
三家数据标注公司对比:

数据标注的市场规模看完上面三家公司的故事,可能觉得这只是"美国故事"。但数据标注是一个全球性大赛道。

而中国市场,超乎想象。
国务院直接发文件支持数据标注——这在国内AI产业政策里是头一遭。

因为中国要做自己的大模型、自己的自动驾驶、自己的AI应用——没有高质量标注数据,一切都是空中楼阁。
中国数据标注产业地图
头部企业:海天瑞声(具身智能数据服务,2026年Q1营收0.97亿元,同比增长38.63%)、数据堂、云测(TESTIN)、京东众智、百度众测、龙猫数据
国际对手:Scale AI、Appen(澳洲)、Google(Fluid Annotation)
产业链:上游(数据资源+标注人员+硬件软件)→ 中游(标注厂商+数据治理平台)→ 下游(智慧政务、金融、智能制造、自动驾驶等)
新增长点:具身智能/机器人数据服务
算力决定AI能跑多快,算法决定AI跑得多优雅,数据标注决定AI能跑多远。——三个维度缺一不可,但最容易被忽视的那个,往往是最要命的那个。
说了这么多,普通人会想:这跟我有什么关系?
机会一:新职业——"数据标注工程师"持证上岗数据标注正在催生一个全新的职业类别——数据标注工程师。
不是大学生兼职框猫猫,而是:有法律背景的,去标注法律AI的训练数据;有医疗背景的,去标注医疗影像AI;有金融背景的,去标注金融文档AI。
这个职业的门槛是"领域知识+标注方法论"。你有专业知识,加上系统培训和一张证书,就能入行。
Mercor去年60%-70%的营收用于支付标注员报酬——这意味着标注成本的大部分,是发给人了。
中国数据标注师人才缺口预计超40万。缺口在哪,机会就在哪。

具有行业背景的标注专家,部分企业年薪可达30万元。Mercor和Surge AI的商业模式已经证明——律师审法律AI、医生审医疗AI、程序员审代码AI——专业背景 + 标注能力 = 高溢价。
适合谁报:
① 在校生(计算机/统计/金融/数学/电子信息等专业)——毕业即就业,简历加分
② 转行人士——传统行业(教育/医疗/金融/制造)从业者寻求数字化转型
③ IT从业者——数据分析、内容审核、数据运营岗位人员技能升级
④ 有专业知识的人——法律/医疗/金融背景 + 标注训练 = 高端标注溢价
报考材料:身份证正反面 + 蓝底证件照 + 手机号 + 邮箱(工信部路线);
学习方式:工信部路线线上考试为主;高校路线为"线下面授+线上网课+企业实战"三位一体
核心技能链:数据采集 → 数据清洗 → 数据标注 → 数据治理 → 大模型标注 → 多模态处理 → 自动化工具开发
别去做"框猫猫狗狗"的低端标注了,那个赛道正在被AI预标注消灭。要去就去做高端:系统培训、拿证入行、往中级高级冲。
低端趋于零成本,高端越来越贵、越来越稀缺。有证书、有专业背景、有标注方法论的标注工程师,是这个行业未来5年最值钱的人。
下次你用ChatGPT的时候,记住——它之所以回答得还不错,不是因为算法多牛,而是因为背后有成千上万个标注员,一条一条地"教"过它什么是对的。
AI的聪明,是标注员"教"出来的。标注员的值钱,是巨头用真金白银"砸"出来的。
这就是数据标注的故事。一个看起来最不起眼、实际上最值钱的AI产业环节。
本文基于公开信息撰写,引用数据来自新浪财经、搜狐、PitchBook、福布斯、The Information等公开报道。文中涉及公司估值和营收数据均为撰写时点的公开信息,实际数据可能已有变化。本文为科技产业分析,不构成任何投资建议。涉及AI技术的讨论仅代表撰写时点的公开信息,技术发展迅速,请以最新资料为准。
AI人工智能科技数字资产数据标注