返回前沿资讯

人才政策

BAT 集体重做「AI 预训练」,补「脏数据」的坑

最近大半年,国内一批 AI 模型厂商 密集启动“预训练返工”,起因都指向同一件事:数据不行。 它们中,有的此前花了一年死磕万亿参数模型,落地表现却被市面上 1% 规模的小模型倒挂,最终查出是被脏数据拖了后腿。 有的曾因数据标注规则模糊、评测集污染、垃圾语料冗余等工程硬伤而导致模型进展迟缓。 还有的因数据受限,导致模型遭遇性能瓶颈,索性推倒重来,并重建了数据…

FRONTIER BRIEF

最近大半年,国内一批 AI 模型厂商 密集启动“预训练返工”,起因都指向同一件事:数据不行。 它们中,有的此前花了一年死磕万亿参数模型,落地表现却被市面上 1% 规模的小模型倒挂,最终查出是被脏数据拖了后腿。 有的曾因数据标注规则模糊、评测集污染、垃圾语料冗余等工程硬伤而导致模型进展迟缓。 还有的因数据受限,导致模型遭遇性能瓶颈,索性推倒重来,并重建了数据团队。 与此同时,借 API 中转站截留交互轨迹、做数据蒸馏等,也成了行业水面下的一场暗战。 数据,正在给模型厂商上一堂教训深刻的课。这堂课远比算力消耗、架构选型和人才争夺更隐蔽。 “AI 下半场的胜负手是数据”,这话听上去像常识,但直到今天,大家才真正闻到了它背后的血腥味。 01 数据上的“粗放式弯路” 预训练返工,本质上是在补数据的课。 “多就行了”的误区 一位头部基模公司的数据专家赵翔向雷峰网回忆,前些年刚开始做预训练的时候,大家的主流观点是“数据多就可以了,稍微差一点没关系,模型自己有转化能力和鲁棒性。” 于是开始一味地粗放式堆数据,只求规模不讲质量。 再加上,当时行业普遍缺乏成熟的大规模数据治理体系,大家为了凑齐数千亿甚至…