14.8 万亿 tokens 的阅读量DeepSeek-V3 预训练数据分布拆解【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3DeepSeek-V3 是一个 671B 总参数的MoE混合专家模型在14.8 万亿 tokens的预训练数据上完成训练全程训练成本仅 278.8 万 H800 GPU 小时。这篇文章拆解四件事数据到底多大、语言与领域怎么分布、怎么保证不翻车、你能拿它干什么。第一笔账14.8 万亿 tokens 花了多少14.8 万亿 tokens 是什么概念大约相当于1.5 亿本 300 页的书一个人每天读 2 本、全年无休要读约 20 万年。而 DeepSeek-V3 的预训练只用了266.4 万 H800 GPU 小时加上 SFT、强化学习等后训练阶段约 0.1 万小时全程合计 278.8 万小时——相当于 1000 张 H800 不停跑约 116 天4 个月。说白了读 1.5 亿本书机器账单不到一千张卡跑 4 个月。这份效率来自FP8混合精度训练框架首次在该规模验证 FP8 可行、跨节点通信与计算几乎完全重叠以及 671B 总参数中每个 token 只激活 37B——阅读成本约为同规模 dense 模型的 1/10。图1DeepSeek-V3 与 DeepSeek-V2.5、Qwen2.5-72B、Llama-3.1-405B、GPT-4o、Claude-3.5-Sonnet 在 MMLU-Pro、MATH-500、AIME 2024 等 6 项任务上的对比对应上文账本讨论用 1/10 的激活参数在数学与代码任务上打成平手语言与领域配比官方说了什么什么只是反推语言分布官方没公布从分数反推仓库里没公布各语言 token 占比论文只有一句diverse and high-quality。所以下面全部是从基准分数反推的属于合理估计不是官方数据。 反推的语言占比英语Pile-test BPB 0.548与 LLaMA-3.1-405B 的 0.542 接近、MMLU 87.1、BBH 87.5——合理估计占比50% 以上。中文C-Eval 90.1Base/86.5Chat、CMMLU 88.8、CMath 90.7、CNMO 2024 43.2几乎全在头部——合理估计20%~30%。其他语言MMMLU-non-English 79.4超过 Qwen2.5-72B74.8和 LLaMA-3.1-405B73.8MGSM 79.8——合理估计10%~20%以日语、西班牙语、法语等为主。领域覆盖基准分泄露了什么这里有个容易被忽略的细节基准分不只反映能力也泄露数据配比——分数高的地方那个领域的粮食显然喂得多。数学与科学最扎实MATH 61.6、GSM8K 89.3Chat 版 MATH-500 90.2、AIME 2024 39.2。代码HumanEval 65.2、MBPP 75.4、CRUXEval 67.3/69.8、Codeforces 51.6 百分位——代码语料是明确的主粮。通识知识TriviaQA 82.9 很强但 NaturalQuestions 40.0 低于 LLaMA-3.1-405B41.5事实问答是相对短板。长文本128K 上下文下 NIAH 测试全绿相当于一本 20 万字书里找指定句子全程稳定。怎么保证不翻车数据与训练流水线的四步14 万亿 tokens 里混进一点脏数据就足以把训练搞炸。按公开技术报告流水线大致是四步说明本仓库只含推理代码数据处理细节以论文为准输入——去重与质量评分去除重复内容用分类器给文本质量打分过滤低质内容。处理——FP8 训练与通信重叠跨节点 MoE 训练以通信为瓶颈通过算法与硬件协同设计让计算和通信几乎完全重叠直接把账单压到 266.4 万 GPU 小时。平衡——免辅助损失的负载均衡 MTP不额外加平衡损失项避免为公平牺牲性能MTP多 token 预测作为辅助训练目标顺带提升基座质量。输出——平稳的损失曲线全程没有出现过不可恢复的损失尖峰也没有任何回滚。换个角度看这种稳定本身就是数据最大的卖点14.8 万亿 tokens 跑下来一次回滚都没有说明数据分布足够平滑。你能拿它干什么场景与边界的速查表适合优先上手的场景✅ 有四组数据撑腰中英文问答与内容生成C-Eval 86.5、MMLU 87.1Chat两种语言的分数都在开源阵营第一梯队。代码辅助与算法题HumanEval 65.2、LiveCodeBench 37.6、Codeforces 51.6 百分位、SWE-Verified 42.0。数学推理MATH-500 90.2、AIME 2024 39.2蒸馏了 R1 的推理能力这是它领先同行最明显的地方。长文本处理128K 上下文、NIAH 全绿适合长文档检索、合同级长文审阅。图2DeepSeek-V3 的 128K 上下文 Needle In A Haystack 测试整片绿色意味着任意上下文长度与任意深度都能找到针对应上文长文本处理一条需要留意的边界⚠️ 有三类场景要降低预期低资源语言MMMLU-non-English 79.4 不弱但离英语的 87 还差 8 分小语种别指望与中英打平。事实问答SimpleQA 24.9低于 GPT-4o38.2和 Claude-3.5-Sonnet28.4要精确事实时建议上检索增强或校验。部署成本671B 参数加 128K 上下文至少多卡起步官方只提供 FP8 权重如果框架只支持 BF16先用inference/fp8_cast_bf16.py转一下。回到那座图书馆1.5 亿本书、1000 张卡 116 天、全程零回滚——这组数字说明数据分布和训练成本不是跷跷板。想动手可以 clone 仓库从inference/目录的 demo 开始git clone https://gitcode.com/GitHub_Trending/de/DeepSeek-V3。至于各语言的具体占比等团队放出数据明细再说在此之前本文里的数字都请当作从分数反推。【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考