🤖 AI 资讯

· ·
← 返回列表

BAT 集体重做「AI 预训练」,补「脏数据」的坑

雷锋网2026-09-24 01:43:00大模型,算力芯片,腾讯,教育学习,微调蒸馏,预训练,模型评测,招聘HR,榜单评测,开发者生态原文 ↗
最近大半年,国内一批 AI 模型厂商密集启动“预训练返工”,起因都指向同一件事:数据不行。它们中,有的此前花了一年死磕万亿参数模型,落地表现却被市面上 1% 规模的小模型倒挂,最终查出是被脏数据拖了后腿。有的曾因数据标注规则模糊、评测集污染、垃圾语料冗余等工程硬伤而导致模型进展迟缓。还有的因数据受限,导致模型遭遇性能瓶颈,索性推倒重来,并重建了数据团队。与此同时,借 API 中转站截留交互轨迹、做数据蒸馏等,也成了行业水面下的一场暗战。数据,正在给模型厂商上一堂教训深刻的课。这堂课远比算力消耗、架构选型和人才争夺更隐蔽。“AI 下半场的胜负手是数据”,这话听上去像常识,但直到今天,大家才真正闻到了它背后的血腥味。
01

数据上的“粗放式弯路”

预训练返工,本质上是在补数据的课。

“多就行了”的误区

一位头部基模公司的数据专家赵翔向雷峰网回忆,前些年刚开始做预训练的时候,大家的主流观点是“数据多就可以了,稍微差一点没关系,模型自己有转化能力和鲁棒性。”于是开始一味地粗放式堆数据,只求规模不讲质量。再加上,当时行业普遍缺乏成熟的大规模数据治理体系,大家为了凑齐数千亿甚至上万亿 token 的语料库,抓取了大量网页垃圾、脏语料,甚至混入了各种来源不明的清洗包。很多数据的标注和筛选也没有处理好,导致训练出来的第一版模型效果较差。然后大家才发现,不注重数据质量,会让模型卡在 60、70 分上不去,“眼看海外的模型都跑到 90 分了,就是追不上。”于是不得不回过头来重做数据优化。

脏数据的代价

“底层脏数据的危害远比想象的大。它会让你投入的卡、钱、人力都浪费掉,而且还会耽误你的时间窗口。”某模型厂商前高管、现 AI 创业者王斌告诉雷峰网。他向雷峰网描述过一个典型案例。一家中部基模公司,把爬来的技术博客整批灌进预训练语料,跑到训练中期才发现,其中相当部分是采集站的机器生成页,同一个段落被重复了几万次。模型在评测集上开始莫名其妙地复读,等团队定位到问题,几万卡时已经烧掉了,那一版只能作废重来。事实上,这样的翻车在行业里远不止一例。不少团队都是训练效果出了问题后,才回过头来补数据治理的课。

不当的数据 KPI

基元律动创始人王云鹤也曾在接受媒体采访时提到过,AI 没有什么新鲜事,数据是地基,数据不行,不要怪算力;数据不达标,什么算法都不行,因为这违背机器学习理论。而且他还特别提到一点,数据团队要对预训练团队有一定话语权,预训练团队也要反向对数据提要求。独立考核会很乱。其实,对数据团队的考核不当,是不少模型厂商都踩过的一个坑。比如,有媒体曾描述过,腾讯混元团队曾在数据治理上,出现过“标注规则定义不清,但验收线设定过高,团队为了交差,生产出大批无法使用的数据”的情况;再加上一些打榜数据、冗余数据的污染,以至于最后不得不推倒重来,专门重拉团队从头清洗数据。 最近大半年,国内一批 AI 模型厂商密集启动“预训练返工”,起因都指向同一件事:数据不行。它们中,有的此前花了一年死磕万亿参数模型,落地表现却被市面上 1% 规模的小模型倒挂,最终查出是被脏数据拖了后腿。有的曾因数据标注规则模糊、评测集污染、垃圾语料冗余等工程硬伤而导致模型进展迟缓。还有的因数据受限,导致模型遭遇性能瓶颈,索性推倒重来,并重建了数据团队。与此同时,借 API 中转站截留交互轨迹、做数据蒸馏等,也成了行业水面下的一场暗战。数据,正在给模型厂商上一堂教训深刻的课。这堂课远比算力消耗、架构选型和人才争夺更隐蔽。“AI 下半场的胜负手是数据”,这话听上去像常识,但直到今天,大家才真正闻到了它背后的血腥味。
01

数据上的“粗放式弯路”

预训练返工,本质上是在补数据的课。

“多就行了”的误区

一位头部基模公司的数据专家赵翔向雷峰网回忆,前些年刚开始做预训练的时候,大家的主流观点是“数据多就可以了,稍微差一点没关系,模型自己有转化能力和鲁棒性。”于是开始一味地粗放式堆数据,只求规模不讲质量。再加上,当时行业普遍缺乏成熟的大规模数据治理体系,大家为了凑齐数千亿甚至上万亿 token 的语料库,抓取了大量网页垃圾、脏语料,甚至混入了各种来源不明的清洗包。很多数据的标注和筛选也没有处理好,导致训练出来的第一版模型效果较差。然后大家才发现,不注重数据质量,会让模型卡在 60、70 分上不去,“眼看海外的模型都跑到 90 分了,就是追不上。”于是不得不回过头来重做数据优化。

脏数据的代价

“底层脏数据的危害远比想象的大。它会让你投入的卡、钱、人力都浪费掉,而且还会耽误你的时间窗口。”某模型厂商前高管、现 AI 创业者王斌告诉雷峰网。他向雷峰网描述过一个典型案例。一家中部基模公司,把爬来的技术博客整批灌进预训练语料,跑到训练中期才发现,其中相当部分是采集站的机器生成页,同一个段落被重复了几万次。模型在评测集上开始莫名其妙地复读,等团队定位到问题,几万卡时已经烧掉了,那一版只能作废重来。事实上,这样的翻车在行业里远不止一例。不少团队都是训练效果出了问题后,才回过头来补数据治理的课。

不当的数据 KPI

基元律动创始人王云鹤也曾在接受媒体采访时提到过,AI 没有什么新鲜事,数据是地基,数据不行,不要怪算力;数据不达标,什么算法都不行,因为这违背机器学习理论。而且他还特别提到一点,数据团队要对预训练团队有一定话语权,预训练团队也要反向对数据提要求。独立考核会很乱。其实,对数据团队的考核不当,是不少模型厂商都踩过的一个坑。比如,有媒体曾描述过,腾讯混元团队曾在数据治理上,出现过“标注规则定义不清,但验收线设定过高,团队为了交差,生产出大批无法使用的数据”的情况;再加上一些打榜数据、冗余数据的污染,以至于最后不得不推倒重来,专门重拉团队从头清洗数据。