报道称国内大模型厂商加强数据治理,腾讯混元已重建训练基础设施
报道称,多家国内大模型厂商因训练数据质量问题加强治理,其中腾讯混元已重建预训练和强化学习基础设施,阿里、百度也升级清洗流程。
Reported facts
万亿参数也救不了脏数据,国内大模型开始返工预训练
动察 Beating AI 快讯,雷峰网称,过去大半年,多家国内大模型厂商开始重做预训练,问题都指向数据。
一家厂商曾花近一年训练万亿参数模型,实际效果却被参数量只有约 1% 的小模型反超。团队最后发现,问题出在训练数据。网页垃圾、重复语料、低质量标注混进训练集,再大的模型也吃不消。该案例来自匿名信源,具体公司尚未公开。
腾讯混元已经公开重做了一轮。今年 2 月起,团队重建预训练和强化学习基础设施。此前媒体曾披露,老混元存在打榜数据混入训练集、标注规则混乱等问题。新团队重新定数据标准,清洗原有语料,Hy3 也把数据质量和多样性列为主要改进项。
阿里和百度也在加码数据治理。Qwen3 用 Qwen2.5 系列模型清洗文档,还大量补充数学和代码合成数据。文心 4.5 则加入去重、低质量过滤、数据地图和人工复核。两家公司没有公开说自己曾因脏数据返工,但新一代模型都把更多功夫花在了数据处理上。
原文链接 https://m.theblockbeats.info/flash/368576
AI-assisted interpretation
The following is analysis, separate from reported facts. Verify important claims independently.
No additional explanation is available beyond the summary.
Why it matters to readers
腾讯混元重建训练基础设施及各厂商加强数据治理的内容具有具体项目和措施支撑,但“多家厂商返工”及万亿参数模型失败案例主要来自媒体转述和匿名信源,涉事公司未公开,不能整体视为完全证实。该变化可能影响国内AI模型研发周期和成本,但未披露明确财务影响。
关注后续官方信息,不根据单一消息做决定。
Risks and unknowns
腾讯混元是否披露重建训练基础设施的时间表、成本及模型评测结果
匿名万亿参数模型案例的涉事厂商是否公开回应
阿里Qwen与百度文心后续版本的评测、发布时间及数据治理说明
相关厂商财报中的研发费用和资本开支变化
Related Developments
Loading event timeline…