
揭秘zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE训练数据5大SFT数据集如何炼成百万Token长上下文【免费下载链接】zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE项目地址: https://ai.gitcode.com/hf_mirrors/amd/zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE百万Token长上下文大模型怎么练出来答案就藏在zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE这个开源模型的训练数据里。它基于 Qwen3-1.7B 底座通过 5 大 SFT 数据集的混合配比把上下文窗口从 32K 一路拉伸到 1048576 Token约 100 万 Token并采用 7 层 MLA 21 层 GDN 的混合注意力架构完成无教师蒸馏微调。这篇文章为你完整拆解这套 SFT 数据集配方以及数据 架构如何协同炼成长上下文能力。模型档案一眼看懂 zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE先快速认识这个模型的硬核配置所有关键信息都可以在仓库根目录的 README.md 和 zebra_7MLA21GDN_noT_SFT_1M_combined_fCE.yaml 中找到配置项数值基座模型Qwen/Qwen3-1.7B上下文长度1048576 Token1MRoPE 扩展系数32 倍从 32K 原始窗口扩展注意力架构7 层 MLA 21 层 GDN 混合训练方式SFT 微调无教师蒸馏noT学习率6e-05cosine 调度训练样本约 2173 万条最终训练损失0.3477从模型命名就能看出训练路线7MLA21GDN表示 28 层中 7 层用 MLA多潜变量注意力、21 层用 GDN门控差分网络noT代表无教师蒸馏1M则点明目标是百万级上下文combined_fCE指融合了 Liger 融合交叉熵损失。百万 Token 是怎么炼成的先看两大技术支柱在介绍数据集之前有必要先理解这个模型能不能装下 100 万 Token背后的两个关键设计支柱一RoPE 位置编码的 32 倍扩展原始 Qwen3 预训练窗口是 32768 Token配置文件通过factor: 32.0的 YARN 缩放把位置编码窗口直接拉到 1048576。这相当于给模型换了一根更长的标尺详见 hybrid_config.json 中的rope_scaling配置。支柱二MLA GDN 混合注意力省内存28 层 Transformer 中7 层使用 MLA压缩 KV 缓存21 层使用 GDN 门控机制两者组合大幅降低长序列训练时的显存占用。这也是为什么能在 8 卡环境下以 batch size 2 跑 1M 长度的序列。5 大 SFT 数据集逐个数长上下文的数据配方训练数据全部通过dataset_mixer按 1:1:1:1:1 的权重混合共约 2173 万条样本。下面逐一拆解这 5 大数据集的作用1. JunxiongWang/sftdatasetv3通用指令基石这是覆盖问答、写作、代码、翻译等多任务的通用 SFT 数据集负责保住模型的基础指令跟随能力。在长上下文微调中它相当于压舱石防止模型在超长序列下丢失通用能力。2. amd/OpenMathInstruct-2_ZebraLlama_2M数学推理主力200 万条规模的数学指令数据包含大量带解题步骤的思维链样本。数学题天然适合检验长距离推理能力——解答一道复杂题往往需要跨越多段文本保持逻辑连贯。3. amd/Zebra_Llama_OpenThoughts-114k-math长思维链强化约 11.4 万条数学思维链数据专门强化模型在超长推理过程中的稳定性。这类样本的单条长度通常远超普通对话是训练 1M 上下文的加长训练剂。4. amd/OpenR1-Math-220K开源强化学习数学集源自 OpenR1 项目的 22 万条数学数据进一步丰富数学题型多样性与第 2、3 个数据集形成互补覆盖从简单计算到高难竞赛题的多层次难度。5. amd/Zebra_Llama_ChatQA2-Long-SFT_long_sft_QA长对话问答专项这是整个配方中最关键的长文本数据集包含大量超长对话和多轮 QA 样本专门用于训练模型在百万 Token 窗口内进行信息检索与定位。只有喂入真正长的数据模型才能学会在 100 万 Token 里准确找到答案而不是假装看到。数据 长度的协同策略packing 与热身配置文件中有一个容易被忽略的细节数据以 1M 长度打包后一整个 epoch 只产生约 20~160 条 packed 序列。如果沿用常规的warmup_ratio: 0.01热身步数几乎为 0。因此训练特意改用绝对热身步数warmup_steps: 200给 RoPE 扩展后的注意力一个真实的呼吸窗口避免模型一上来就被超长序列冲垮。# 摘自 zebra_7MLA21GDN_noT_SFT_1M_combined_fCE.yaml max_seq_length: 1048576 factor: 32.0 warmup_steps: 200训练结果2173 万样本的真实成本从 train_results.json 可以看到这次训练的真实账本总样本数21,729,253 条约 2173 万训练步数4978 步epoch 1最终 loss从 1.60 稳步降至0.3477训练时长约 298512 秒约 83 小时计算量约 1.04e20 FLOPs训练全程 loss 曲线平滑下降、无发散说明5 数据集混合 1M 打包 200 步热身的配方是稳定有效的。更详细的逐 step 损失曲线记录在 trainer_state.json 中。总结这套配方给长上下文训练的三点启示长文本数据是刚需5 个数据集里专门服务长上下文的 ChatQA2-Long 与长思维链数据占了半壁江山仅靠普通指令数据喂不出百万窗口能力。混合配比要稳通用指令 数学推理 长对话的组合让模型在扩展长度的同时不损失通用能力。训练策略要适配长度超长序列下样本数骤减绝对 warmup_steps 这类细节决定了训练能否稳定收敛。如果你也想复现这套5 大数据集炼成百万 Token的完整流程直接克隆仓库查看zebra_7MLA21GDN_noT_SFT_1M_combined_fCE.yaml与 hybrid_config.json 即可所有配方都开源在那里。【免费下载链接】zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE项目地址: https://ai.gitcode.com/hf_mirrors/amd/zebra_qwen3_7MLA21GDN_noT_SFT_1M_combined_fCE创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考