产品派
返回

七名博士生三个月训练7B模型并公开完整研发记录

AI量子位2026/9/15 10:17:34
AI 导读

北京中关村学院七名博士生用一个暑假、约三个月从零训练出7B模型ZGCM-1,并开放训练数据与配方、代码、权重、中间checkpoint和日志。模型在多项通用评测中接近Qwen3-8B,部分数学推理与搜索任务可与更大模型比较。

团队成员来自人工智能、网络、化学、生物和网络安全方向。起初他们希望亲自验证技术报告中的数据处理、故障排查和训练方法,随后借助数百个Agent分别处理数万亿token数据、实验、日志和评测,搭建任务发布、汇报与检查系统。

研究人员负责目标、约束和关键决策,Agent则编写清洗脚本、检查数据分布、调整规则,执行实验、监控日志并定位故障。团队还通过ZGent平台沉淀会议上下文、脚本、工作流和调试经验。对11类研发任务的L1至L5自主性评级显示,实验监控和部署达到L4,而模型架构与学习算法设计仍主要处于L2。

训练过程中,模型曾出现loss持续下降但能力退步的情况,排查后发现底层数据分片和shuffle导致实际数据比例波动。团队因此增加checkpoint频率,并建立ACE评测体系,将能力拆分为18类、183项,使用2503个探针进行诊断,每轮分布式评测约需两三分钟。

模型训练到一半时曾写出一首歌,团队回到最初讨论项目的火锅店庆祝。为节省算力,他们采用局部与全局注意力结合的架构,将上下文从16K扩展到64K和256K;在256K下吞吐量约提升3.94倍,KV Cache降至全注意力方案约六分之一。

结合Muon、FP8、延迟缩放和TWEO后,方案在16K预训练中达到相同loss的效率较BF16/AdamW基线提高约4.2倍。团队还将搜索和工具调用轨迹整理为状态—行动数据,训练模型学习后续决策;SFT阶段严格筛选使样本减少约44.9%,但整体评测提升,同时发现长思维链比例过高会损害指令遵循。

ZGCM-1在14项同规模推理评测中处于领先位置,部分搜索和工具调用结果也体现出小模型潜力。团队已公开GitHub代码、Hugging Face模型权重和训练数据,希望研究者追踪能力形成过程;目前他们还在尝试400B和500B规模模型,并继续验证Agent协作能承担多少研发工作。

大模型训练AI4AI智能体开源模型

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文