梁文锋署名11篇论文聚焦大模型底层技术
9月19日,DeepSeek在arXiv发布31页论文《DSec:面向大规模智能体训练的高效沙箱基础设施》,首次公开DSec(DeepSeek Elastic Compute)。该系统服务于大规模智能体强化学习和评测,可在数秒内为训练任务创建独立环境,每日自动运行300万个沙箱,单个生产单元覆盖160个CPU节点,并通过权限隔离防止作弊、复现智能体获得的每一步环境反馈。沙箱因此同时承担训练场与安全边界的作用,论文通讯作者为梁文锋。
过去三年,梁文锋较少出现在V3.2、V4、V4.1-Flash等多人旗舰模型报告的主要作者位置,却持续署名底层技术论文。11篇论文分别涉及DeepSeek LLM、DeepSeekMoE、V2、Coder-V2、V3、R1、Native Sparse Attention、V3硬件分析、mHC、DSpark和DSec,覆盖模型架构、注意力机制、推理优化及智能体基础设施。
2024年初,行业普遍依赖万卡集群和高额投入,GPT-4级模型单次训练物料成本超过6300万美元,Stability AI和Inflection AI也先后因成本压力陷入困境。DeepSeek LLM提出,在算力固定时,优化数据质量和密度比盲目扩大参数更有效,并用2万亿中英双语Token训练出7B和67B模型;67B版本在代码、数学、推理测试中超过Llama-2 70B,并在开放对话中击败GPT-3.5。
随后,DeepSeekMoE通过细粒度专家路由和共享专家隔离,将训练开销降低42.5%;MLA将KV Cache体积压缩93.3%。基于这些技术的DeepSeek-V2达到接近GPT-4的表现,并将千Token推理成本降至此前的几十分之一,推动了国内模型服务价格竞争。
2024年6月发布的DeepSeek-Coder-V2加入6万亿中英代码和数学数据,支持语言从86种增至338种,上下文扩展到128K,并在HumanEval、Codeforces和LiveCodeBench上超过GPT-4 Turbo、Claude 3 Opus。其输入和输出价格分别为每百万Token 0.14美元和0.28美元,远低于GPT-4 Turbo的10美元和30美元。
DeepSeek-V3在不足两个月内用2048张H800训练完成,参数量671B,公布的训练成本为560万美元;复盘指出,该数字未计入研发、折旧和约13亿美元硬件投入。论文采用无辅助损失的负载均衡、FP8训练,以及计算与数据传输并行等方法。2025年春节发布的DeepSeek-R1则以29.4万美元强化学习成本挑战闭源推理模型,核心方法包括组相对策略优化。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文