国内模型厂商密集返工预训练,数据治理成新瓶颈
近半年,国内多家AI模型厂商密集启动预训练返工,直接原因大多是数据质量不过关。有团队耗时一年训练万亿参数模型,落地效果却被仅有其1%规模的小模型反超,最终发现问题来自脏数据;也有团队因标注规则模糊、评测集污染、垃圾语料重复或数据来源受限,不得不推倒重来并重建数据团队。围绕API中转截留交互轨迹、数据蒸馏的竞争,也逐渐成为行业暗线。
早期业内普遍相信“数据越多越好”,即使质量稍差,模型也能自行消化。为凑齐数千亿乃至上万亿Token,团队大量抓取网页垃圾内容,甚至使用来源不明的清洗包,标注和筛选体系却并不成熟,导致首版模型能力长期卡在60至70分,难以追上已达到90分左右的海外模型。数据专家赵翔认为,数据团队不能只按数量考核,否则会诱使团队用垃圾凑数,几百TB脏数据甚至可能让模型变笨或训练崩溃。
一位模型公司前高管王斌举例称,某中部基模公司将抓取的技术博客整批放入训练集,训练中期才发现大量内容其实是采集站生成页面,同一段文字重复了数万次。模型在评测时不断复读,团队定位问题时已经消耗数万张卡,只能废弃当前版本。类似问题并非个例。另有团队曾因标注规则不清、验收标准过高,生产出大量不可用数据,同时受到打榜数据和冗余数据污染,最终重新拉起团队清洗。
互联网时代积累的本地生活、社交、游戏、电商和搜索数据,也不能直接转化为通用基模优势。Google拥有丰富场景数据,却不一定领先;此前数据积累较少的Anthropic、OpenAI同样快速追赶。如今竞争关键变成算力、数据获取速度、样本质量,以及将数据稳定转化为模型能力的管线。数据优化没有简单秘方,只能按重要程度分批处理,在训练周期和优化成本之间权衡,持续小步迭代;后训练所需的专家数据和Agent长程轨迹同样昂贵。
多位从业者认为,当前数据工作的主要限制是预算和产能。业内一种粗略拆分是,AI训练每投入100元,约40元用于算力、30元用于人才、20元用于推广,数据仅占10元。专家长程任务数据需求量很大,大厂预算口径常达数亿元,但同类数据在美国HLE调研中每条起价一两万美元,国内往往只支付一两千元人民币。由于高质量数据稀缺,一些厂商通过Token转发或路由平台收集用户请求与结果,这些真实任务轨迹比公开网页语料更有价值,但能领先多久仍难判断。
数据飞轮要真正运转,还需打通用户行为回流训练的通路。目前组织调整和部门数据墙尚未解决,清洗、管道、工程和研究人才也供不应求。国内长程轨迹主要来自AI编程和AI办公,但前者相当一部分市场被Claude、Codex占据,后者产品能力尚处早期,沉淀数据有限。未来一两年,行业可能继续出现推倒重来的案例;算力和人才可以购买或招募,高质量数据却只能依靠长期治理、稳定投入和组织协同积累。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文