Smart-Yuki · ZGCM-1中关村模型

ZGCM-1 论文解读

全开放、极致高效的数学与 Agentic 搜索基础模型 · A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search

arXiv:2609.13356v1 [cs.AI] 2026-09-11 7.39B dense · 256K ctx 4.19T + 600.5B tokens 48 页 · 17 图 · 16 表 中关村学院 / 中关村人工智能研究院 本地文件: 2609.13356v1.pdf 解读生成: 2026-09-22

1. 速览:一页读懂 ZGCM-1

一句话总结:在“前沿推理只属于千亿参数模型”的行业叙事之外,ZGCM-1 用一套完全公开的训练配方,把 7.39B 的 dense 模型做到数学推理与 Agentic 搜索上可与体量大两个数量级的前沿模型掰手腕——方法是让“内部深思(deliberate thinking)”与“外部主动检索(active external tool use)”互补,而不是靠参数记忆整个开放网络。

核心论点(原文 Thesis):“Compact models are inherently bounded by static parametric capacity, but they can transcend this limitation through a dual engine of deliberate internal thinking and active external seeking.” —— 紧凑模型受限于静态参数容量,但可通过“深思 + 主动搜寻”的双引擎突破该上限。
7.39B
dense 参数,32 层,hidden 4096,从零训练
256K
最大上下文(262,144 tokens)
3.94×
256K 下相对全注意力的训练吞吐加速
6.4×
每 token KV Cache 占用下降(128→20 KiB)
≈4.2×
16K 预训练 time-to-loss 加速(vs BF16/AdamW)
4.19T
通用预训练 tokens(0.99T + 3.20T)
600.5B
中训练 tokens,16K → 64K → 256K
62.0%
Binary Function Search(50 任务,31/50)

1.1 四大技术支柱

① 架构 / 系统协同设计门控滑窗注意力(SWA)与全局注意力 5:1 交织 + 稳定的 FP8 Muon 优化器 + TWEO 离群值正则。
② 渐进课程 + MDP 中训练上下文 16K→64K→256K,把交互轨迹重构成马尔可夫决策过程的状态-动作转移做稠密监督。
③ 执行对齐 + 混合 SFT在“执行可验证”的轨迹上做 think / no-think 混合微调,兼顾深度推理与直答效率。
④ AI-Native R&D研究者指挥 Agent 集群,自主承担集群运维、数据治理与快速诊断评估。

1.2 关键成绩

解读(关键定位):ZGCM-1 的差异化不在“刷新 SOTA”,而在把一条本来只存在于闭源内部的完整链路(数据过滤→中训练课程→长上下文调度→多轮 Agent 轨迹→评测)公开化,并用 8 条可操作经验(Finding 1–8)把“怎么做”写成可复现的工程结论。它是一份“学术算力预算下的前沿复现配方”,而非单纯的模型卡。
ZGCM-1 Overview
图 2 ZGCM-1 总览。左:与 7B 级及前沿模型在推理与 Agentic 任务上的成绩对比;右:四项核心技术亮点——(1) FP8 + Muon + TWEO 带来约 4.2× time-to-loss 加速,(2) 混合滑窗/全局注意力,(3) MDP 中训练(轨迹→状态-动作监督,上下文扩展到 256K),(4) AI-Native R&D(每位研究者指挥 Agent 集群覆盖全生命周期)。 来源:本文 Figure 2(arXiv:2609.13356v1,第 2 页,整页插图)。BFS = Binary Function Search;Qwen3-8B-Distill 指 DeepSeek-R1-0528-Qwen3-8B。
Per-benchmark ranks across 14 reasoning benchmarks
图 1 14 项推理基准上的逐项排名。ZGCM-1-7B 与同量级模型(7B–8B)对比,横轴为基准、纵轴为平均排名(越低越好)。 来源:本文 Figure 1(arXiv:2609.13356v1,第 1 页)。

2. 背景与核心论点

报告开篇指出:尽管基础模型在长程推理与工具增强的 Agent 能力上推进迅猛,但学术社区被两堵墙挡在外面——

两道进入壁垒(原文 Introduction)
壁垒含义
规模壁垒
The Scale Barrier
前沿推理与深度 Agentic 搜索被视为“千亿参数系统的专属领地”,令算力受限的研究者无法参与训练与探索前沿智能。
不透明壁垒
The Opacity Barrier
多数有竞争力的模型只开放权重(open-weight)而非完全开源;上游过滤配方、中训练课程、长上下文调度、多轮 Agent 轨迹全部是黑箱,无法系统研究训练动力学与容量上限。

ZGCM-1 的应对方式:一个从零训练、透明开源的 7.39B dense 基础模型。它不追求“用参数记住开放网络”,而是把能力建立在两种机制的耦合上:

解读(为什么这个论点重要):它把“参数容量”与“可得信息”解耦。对 7B 模型而言,闭卷(closed-book)事实召回必然吃亏;但只要把检索与工具使用训练成稳定的策略,就能用“每 token 计算量”换取“有效知识覆盖”。这解释了后文为什么在数学(可验证、推理密集)与 Agentic(外部信息密集)两个方向投入最重,而在纯闭卷知识类基准(MMLU、GPQA)上明显落后——这是一个有意的能力取舍,而非缺陷。

3. 模型架构:混合注意力骨干

3.1 规格

ZGCM-1 模型规格(原文 §2.1)
项目取值
架构Decoder-only dense Transformer + GQA
参数规模7.39B
层数 / 隐层维度32 层 / 4,096
SwiGLU 中间维度11,008
注意力头32 query heads / 8 KV heads(head dim 128)
注意力排布27 层门控滑窗注意力(窗口 128 tokens)+ 5 层全局注意力(5:1)
全局层位置第 6、12、18、24、30 层(1 起计);即“5 局部 + 1 全局”重复 5 次,再跟 2 个尾部局部层
归一化 / 位置编码RMSNorm;QK 归一化(用 RMSNorm 实现);Partial RoPE(旋转比例 0.33)
激活函数SwiGLU
最大上下文262,144 tokens(256K)

3.2 门控滑窗注意力(Gated SWA)

对归一化后的隐状态 h,门控 SWA 模块并行生成 query / key / value / gate 四路投影;query 与 key 分支施加 RMS 归一化与 Partial RoPE。设 A_SWA(q,k,v) 为 128-token 滑窗 GQA 输出,则:

GatedSWA(h) = oproj( A_SWA(q, k, v) ⊙ σ( gproj(h) ) )

其中 σ 为 sigmoid,学习到的门控对局部注意力输出做逐元素调制后再送入输出投影。全局注意力层不加门控,直接在完整上下文上做注意,负责跨窗口的信息流动。

解读(局部 + 全局的取舍):5:1 的比例与 Gemma 3 在生产规模上采用的 local:global 配比一致——说明这是一个“已被大规模验证过”的成熟选择。放在第 6/12/18/24/30 层的规律排布,使每 6 层出现一次“全局信息汇聚点”,既控制 KV Cache,又避免长程依赖在纯局部层中被逐层稀释。
Hybrid attention architecture
图 3 ZGCM-1 的混合注意力架构。右侧为骨干:门控滑窗层与全局层交织;左侧为门控滑窗注意力模块细节及其两种注意力掩码(全因果掩码 / 128-token 滑窗掩码)。 来源:本文 Figure 3(arXiv:2609.13356v1,第 4 页)。最后一个全局层是第 29 层(0 起计),其后跟随两个 SWA 层。

4. 架构实验与 KV Cache 分析

4.1 注意力方案的选型实验

为选出生产用注意力方案,作者对比了全注意力Flash-GQAMLA,以及 SWA 1:1 / 3:1 / 5:1 三种滑窗比例。所有配置均在 8×H100 上以相同预算训练 10B tokens、序列长度 4,096。质量指标为最后 50 步的平均 loss,效率指标为 tokens/s/GPU。

注意力配置对比(原文 §2.2 与 Figure 4a;非参数对齐的 7B 配置)
配置吞吐 (tokens/s/GPU)Tail-50 loss结论
Full Attention≈8,9001.93基线
Flash-GQA≈9,0001.955
SWA 1:1≈9,1001.945
SWA 3:1≈9,3001.92loss 最低
SWA 5:1(选中)9,5661.93吞吐最高,loss 与全注意力持平
MLA7,6451.94吞吐代价大,无对应 loss 收益

注:表中 Full/Flash-GQA/SWA 1:1/3:1 的吞吐数值由原文 Figure 4a 的散点位置近似读取,仅 SWA 5:1 = 9,566 与 MLA = 7,645 为原文明确给出的数值

随着上下文从 4K 增长到 256K,SWA 5:1 相对全注意力的吞吐优势持续扩大:4K 时 1.13× → 16K 1.40× → 32K 1.63× → 64K 2.13× → 128K 2.79× → 256K 3.94×;SWA 3:1 位于两者之间。这一“差值随上下文拉大”的特性,使门控 SWA 特别适合长上下文训练与推理——因为此时全注意力成为主导性的计算瓶颈。

4.2 KV Cache 分析

由于 27 个 SWA 层在 KV Cache 中只保留固定的 128-token 窗口,而仅 5 个全局层存储完整序列,每 token 的 KV 占用从 128 KiB(全注意力)降到 20 KiB。在 256K 上下文、batch=1、bf16 下:

三种等参数量架构的 KV Cache 对比(原文 Figure 4c)
架构层构成参数量256K KV Cache
Full Attention32 全局层7.39B32.0 GiB
Linear Attn (GDN 3:1)7 全局 + 21 线性(L=28)7.47B7.0 GiB
Hybrid SWA 5:1(本文)5 全局 + 27 SWA7.39B5.0 GiB(↓6.4×)

作者强调:自回归解码是内存带宽受限的,因此更小的 KV 占用可直接转化为更高的解码吞吐——这正是长推理与 Agentic 搜索这类“天然长上下文”负载最需要的特性。

Architecture experiments
图 4 架构实验。(a) 非参数对齐的 7B 注意力配置在 10B tokens 下的质量-吞吐权衡(越靠左下越好);(b) SWA 调度相对全注意力的吞吐加速随上下文长度增长(4K 的 1.13× → 256K 的 3.94×);(c) 三种等参数量架构在 batch=1、bf16 下的 KV Cache 内存占用。 来源:本文 Figure 4(arXiv:2609.13356v1,第 5 页)。

5. 预训练:数据处理、课程与效率配方

预训练分两段:通用预训练(General Pre-Training,2 个数据阶段) + 中训练(Mid-Training,3 个上下文阶段)。通用预训练建立语言、知识、数学、代码的广谱能力;中训练保持全序列因果语言建模目标,但引入更稠密的推理/指令/Agentic 数据,并把上下文逐步拉长到 256K。

通用预训练 Stage 1 0.99T tokens @ 16K 通用预训练 Stage 2 3.20T tokens @ 16K ── 中训练 16K 180B → 64K 240B → 256K 180.51B ──

5.1 数据混合

先用一个 0.3B 参数代理模型在约 30B tokens 上搜索数据配比(通过知识、代码、数学的训练 loss 与评测信号迭代调整),以较低成本替代目标规模上的配比探索。最终语料来源包括:

所有文档统一 schema、按版本化 shard 落盘并登记 manifest,用 GLM-5.1 tokenizer 分词与索引;跨阶段去重确保 Stage-1 内容不会再次进入 Stage-2 采样。

两个通用预训练阶段的数据构成(原文 Figure 6;Stage 1 = 0.99T,Stage 2 = 3.20T)
来源Stage 1Stage 2变化
Web54.6%54.0%两阶段最大来源,基本持平
Code21.0%23.6%↑ 提升代码占比
Academic OCR13.7%10.8%
Math8.0%9.0%
LaTeX papers1.7%2.0%
Encyclopedic text1.0%Stage 2 移除
Specialized reasoning0.6%Stage 2 新增

5.2 课程式预训练(Curriculum Pretraining)

用 Stage 1 的 0.99T 作为课程阶段:通用语言文档按词法复杂度从低到高呈现,代码与数学则各自独立交织。7B 探针实验结果显示,该调度使 coding BPB 从 1.99 降到 0.81、mathematics BPB 从 0.97 降到 0.94,而通用基准 BPB 上升 0.03–0.09。课程只作用于 Stage 1;后续阶段在完整混合上训练,不做复杂度排序。

Finding 1 · 课程预训练Curriculum Pre-training

词法复杂度对通用语言文本是廉价且可扩展到语料级的排序信号,但对代码与数学是糟糕的难度代理——表层统计反映的是样板代码/模板化表述,而非算法或推理深度。

因此只对“非代码、非数学”数据排序,并独立交织代码与数学;同时剔除极端高复杂度的离群文档(通常是损坏/乱码文本)。该调度在技术域上改善 BPB,代价是通用域拟合损失 0.03–0.09 BPB。

5.3 超参与数值精度

预训练优化配置(原文 §3.1.3)
维度配置
训练框架 / 硬件NVIDIA Megatron Core,H100 GPU
矩阵参数优化器Muon:momentum 0.9,spectral scaling,5 步 Newton–Schulz,常数学习率 2×10⁻⁴,weight decay 0.1,梯度裁剪 1.0
标量参数优化器Adam
数值精度矩阵乘用 Transformer Engine hybrid FP8(前向 E4M3 / 反向 E5M2)delayed scaling,缩放因子取自 1,024 步历史的最大绝对值;其余算子保持 BF16 / FP32
离群值正则TWEO 作为激活正则项,抑制极端中间值,与 delayed scaling 互补
效率16K 生产运行约 585 model TFLOP/s/GPU,即约 60% BF16 等效 MFU(H100 BF16 dense 峰值 989 TFLOP/s)
Finding 2 · TWEO 使 FP8 预训练可行TWEO enables FP8 Pretraining

抑制中间激活的离群值对 FP8 训练稳定性至关重要;delayed scaling 结合 TWEO 正则,能在规模上防止数值发散的同时维持 60% BF16 等效 MFU。

5.4 ≈4.2× 效率增益的构成

作者以“OLMo 3 风格的 7B BF16/AdamW 基线”为参照估算 16K 预训练的 time-to-loss,四个因子相乘:

SWA 5:1 1.4× × FP8 精度/系统 1.5× × Muon 优化器 1.8× × Pre-LN 1.1× ≈ 4.2×

其中 Muon 的 1.8× 是step-to-loss 效率(相对 AdamW),Pre-LN 的 1.1× 来自探索性 7B 证据的数据效率。

Finding 3 · 预训练效率增益Pretraining Efficiency Gain

混合 SWA(1.4×)、FP8 混合精度系统(1.5×)、Muon 优化器(1.8×)与 Pre-LN(1.1×)的协同设计,相对标准 BF16/AdamW 基线在 16K 预训练 time-to-loss 上累计带来约 4.2× 加速

解读:把加速拆成“架构 × 精度 × 优化器 × 归一化”四个正交来源很有价值——它说明 4.2× 不是靠单点奇技,而是四类改进的乘性叠加。对资源受限团队最可迁移的两项是 SWA 与 FP8:前者不改变模型语义、只改注意力掩码;后者有成熟工程路径(Transformer Engine delayed scaling)。Muon 的 1.8× 收益最大,但需要与 FP8/TWEO 一起调稳。

6. 中训练:600B tokens 与 MDP 状态-动作监督

中训练是以能力为导向的持续预训练。作者先做池级去重以提升 token 效率、控制重复内容,得到约 2.86T tokens 的候选池,再采样出 600.51B tokens 的调度,组织为 16K / 64K / 256K 三个上下文阶段。

6.1 顶层能力混合

中训练三个阶段的能力混合(原文 Figure 6 下半部分)
类别16K(180B)64K(240B)256K(180.51B)趋势
Code20.0%20.0%19.9%全程≈20%,保持编程能力
Math20.0%20.0%19.9%全程≈20%,保持推理能力
Web17.0%15.9%15.9%略降
Knowledge10.5%12.5%14.2%↑ 提升长文档密度
QA10.0%10.0%9.9%稳定
Reasoning6.0%6.0%5.9%稳定
Instruction2.0%2.0%2.0%稳定
Agentic1.5%1.5%3.3%↑ 提升工具交互/多步任务密度
Pretraining replay13.0%12.1%9.0%↓ 但仍保留,维持广谱覆盖

关键设计:各阶段累加而非替换更短序列——64K 阶段 = 180.89B(≤16K)+ 59.11B(16K–64K);256K 阶段 = 127.81B(≤16K)+ 21.72B(16K–64K)+ 30.98B(>64K)。这样在拉长上下文的同时持续 replay 短上下文数据,避免常规上下文任务的能力退化。

Data mixture donut charts
图 6 数据混合构成(环形图)。上排:通用预训练 Stage 1(0.99T)与 Stage 2(3.20T);下排:中训练 16K(180B)、64K(240B)、256K(180.51B)。扇区面积表示该类别在对应阶段总 token 中的占比。 来源:本文 Figure 6(arXiv:2609.13356v1,第 8 页)。

6.2 数据加工链路

数据源Code / Web / Web-QA / Instruction / Agentic / Math / Reasoning
清洗Common Cleaning + Type-Specific Cleaning
分词与长度分桶B16(≤16K)/ B64(16K–64K)/ B256(64K–256K)
前缀采样Mix16K / Mix64K / Mix256K(后两者包含更短桶的 replay)

推理数据

推理源被规范化到统一 schema,并按“自包含性、答案证据、推理价值”路由为 accepted / rewrite / pending / holdout / rejected 五类视图。“题目本身有价值但原始轨迹不适合训练”的样本会被抽成独立问题、由教师模型重构或改进,并在通过解析有效性、完整性、模板/来源泄漏风险、重复度、可训练性检查后才准入——从而把“题目价值”与“上游轨迹质量”解耦

指令数据

收集包含 Tulu 与 FLAN 派生数据的大规模指令语料,转换为预训练兼容的原始上下文(raw context);保留合法的短标签任务,把翻译风险子集路由到模型复核,并将部分单轮样本改写成多轮讨论,以增加对话状态与顺序推理的覆盖——同时仍保持全序列训练目标。

Agentic 数据(MDP 重构)

这是报告最具方法论特色的部分:遵循 agentic continual pre-training 的思路,把通用交互轨迹重构为马尔可夫决策过程(MDP)风格的状态条件式“下一动作预测”样本

对软件工程轨迹,则按是否有真实执行环境采取不同过滤:无执行环境的轨迹用结构、补丁、shell/edit、日志与行为证据筛选(而非自报的运行时结果);有执行环境的轨迹按实际执行结果、最终交互轮反馈、交互轮数联合打分过滤。

6.3 超参与 256K 路线选择

中训练超参(原文 §3.2.5)
项目取值
训练目标全序列因果语言建模(raw context),区别于 SFT 的仅 assistant 计损
每优化步 tokens三阶段统一约 12.6M
全局 batch size768(16K)/ 192(64K)/ 48(256K)
学习率1×10⁻⁴
256K 阶段RoPE base 10M完整激活重计算(full activation recomputation)
256K 路线对比直接路线 30B tokens vs 分阶段路线(10B@64K → 20B@256K);分阶段最终 loss 略低(1.16 vs 1.19),吞吐相当
Mid-training loss and LR schedule
图 9 分阶段中训练的损失轨迹与学习率调度。蓝色(左轴)= token 级交叉熵 loss,浅蓝为原始值、深蓝为 200 点滑动平均;赭色(右轴)= 学习率。虚线标记 16K / 64K / 256K 阶段切换:每次切换 loss 出现台阶式下降,256K 阶段学习率进入余弦衰减。 来源:本文 Figure 9(arXiv:2609.13356v1,第 11 页)。

6.4 训练期监控(一个可复用的工程细节)

作者在通用预训练与中训练全程持续监控训练动力学、数值稳定性、硬件/系统状态、训练效率与资源利用率。其中记录了一个很有代表性的吞吐衰减排查

现象与修复:恢复训练任务后,匹配窗口内吞吐在约 80 步中从 585 逐步降到 554 model TFLOP/s/GPU;释放 overlap buffer 缓解但未根除;加入周期性 CUDA allocator cache 清理 + 每 100 迭代垃圾回收后,吞吐稳定回到 585。该修复已进入生产训练循环。

7. 后训练:SFT 与混合 RL

后训练 = SFT(建立响应模式)混合 RL(在数学/代码等单域任务上增益)。SFT 语料共 4,921,933 条样本,其中通用数据 96.46%、Agentic 数据 3.54%。

SFT 语料构成(原文 Table 1)
组件占比主要作用
General data96.46%指令跟随、知识、数学、科学、代码、对话、推理
Agentic data3.54%深度研究、软件工程、通过结构化工具进行的终端交互
合计100.00%全部 SFT 数据

7.1 数据质量分级与去污染

两段式筛选:确定性启发式规则先行(剔除缺失对话轮、非法角色、重复生成、prompt 模板泄漏、畸形推理轨迹等结构缺陷),再由经人工标注校准的模型评估器按教育价值、逻辑严谨性、逐步推理连贯性、事实一致性、安全合规等多轴打分,将样本离散分级(而非刚性二值阈值):高分优先、临界样本转入辅助验证管线、噪声/高风险样本严格丢弃;拒答样本单独隔离过滤以消除过度拒答。

去污染:全部候选 SFT 语料与所有下游评测/验证集用 8-gram 滑窗比对,任何与评测 prompt 或参考答案 8-gram 重叠 > 50% 的训练样本被永久剔除。

Finding 4 · 后训练中数据质量胜过数据量Data Quality Trumps Volume

受控对比中,砍掉约一半候选池使六基准均值从 67.78 提升到 68.83;增益集中在推理(BBH +10.10),损失局限于部分任务。因此优先保留可靠、高价值的监督信号,而非最大化样本数。

7.2 长 CoT 的非单调性

在数学、代码生成、多轮对话与复杂指令跟随上做配比消融后发现:过度放大长链式思维(long CoT)轨迹会引入啰嗦偏置(verbosity bias)并损害指令遵循。作者通过迭代式网格校准,调和“长程推理 / 直答 QA / 严格格式指令”三者的比例,最终到达一个平衡的 Pareto 最优混合。

Finding 5 · 长 CoT 的权衡与校准Long-CoT Trade-offs and Calibration

长 CoT 监督的效用是非单调的:在训练混合中过度饱和长推理轨迹会降低通用指令跟随性能。动态校准数据配比可缓解该退化,在保持强指令遵循的同时不牺牲长 CoT 推理增益。

7.3 统一的 think / no-think 监督

SFT 语料刻意把 think 样本(含结构化推理标签包裹的端到端推理链)与 no-think 样本(简洁即时回答)交织。这一双模式设计让同一套权重可以依系统指令或运行时预算,在“完整深思”与“高效零样本直答”之间动态切换。

更重要的是:中间 checkpoint 评测确认联合训练带来正向的跨模态迁移——暴露于结构化推理轨迹,会直接提升 no-think 模式在代码、数学与逻辑推理上的准确率(详见附录 B.4)。

7.4 Agentic 数据:三条支线

Deep Research20,217 条多步研究轨迹;统一到 search / visit 工具的共享交互环境;每条轨迹提供对齐的 think 与 no-think 形式。
Software Engineering30,014 条“执行接地(execution-grounded)” + 30,000 条“无执行(execution-free)”轨迹,投影到 GLM-5.1 结构化工具格式。
Terminal隔离 Docker + 持久 shell + 结构化 bash 工具;环境侧 verifier 独立判定(test.sh);消融视图含 22,309 条轨迹 / 15,748 条 verifier 成功子集。

关键工程约束:每条任务族的训练 schema 必须与下游推理环境对齐(系统指令、消息角色、工具定义、结构化调用、观测放置、最终答案约定)。实验表明 schema 不匹配会显著损害下游 Agent 性能

Finding 6 · 通用数据对 Agent 训练不可或缺The Necessity of General Data for Agent Training

只做 Agent 微调会降低交互保真度,因为 Agent 能力本质上依赖广谱通用能力。与通用指令数据联合训练提供了逐步推理与精确约束遵循的必要基础,带来显著更优的 Agentic 性能。(作者对比了“先通用后 Agentic 的顺序调度”与“全程交织的联合调度”,后者胜出并用于最终训练。)

7.5 训练目标与超参

所有样本渲染为统一的 GLM-5.1 会话格式,采用仅 assistant 计损:assistant 的推理、回答与结构化工具调用计入 loss;system/user 消息与 tool 观测作为被掩码的上下文。该混合 think/no-think 目标同时训练“推理、回答生成、动作选择”,而不教模型复现环境反馈

SFT 训练配置(原文 §4.1.3)
项目取值
长度变体最大序列长度 65,536262,144 两种
轮数 / 数据量64K 变体 8 epochs;256K 变体 10 epochs,含 19.46B packed tokens(发布版)
全局 batch size48(两变体一致)
优化器矩阵参数用 layer-wise Muon,标量参数用 Adam
学习率cosine 衰减 1×10⁻⁴ → 1×10⁻⁶,无 warmup,weight decay 0.01,梯度裁剪 1.0
Finding 7 · 长 Agentic 中训练可绕过超长 SFTLong Agentic Mid-Training Bypasses Ultra-Long SFT

中训练阶段建立的长上下文基础,使模型仅用中等长度 SFT 数据就能在 256K 规模上可靠地激发推理与 Agentic 行为。这实际上绕过了后训练阶段昂贵的 256K 长推理轨迹——说明短序列监督足以激活并外推在中训练中已建立的长序列能力。

7.6 混合强化学习(Mixed RL)

8. 评测结果:7B 对标与 Agentic 能力

评测设置:think 模式,使用发布的 256K SFT checkpoint;非 Agentic 与 web 深度研究均用 temperature 1.0、top-p 1.0;总上下文预算 262,144 tokens(最多 4,096 prompt + 258,048 生成);非 Agentic 基准报告 32 次运行的 mean pass@1

8.1 7B–8B 量级对比(20 项基准)

think 模式基准结果(%,原文 Table 2 节选)。深蓝粗体为最优,浅蓝为次优;本表列出 ZGCM-1 与主要对比模型。
基准 ZGCM-1 7B R1-0528-Qwen3-8B MiniCPM4.1-8B Qwen3-8B Olmo3-7B-Think
推理与通用
MATH-50097.1396.3295.6096.2095.10
AIME 202480.6283.3383.3380.0071.60
AIME 202573.3375.2173.3363.3364.60
AIME 202675.0069.1771.6766.6766.16
HMMT 202570.4261.5052.5043.3343.89
HMMT 202659.4851.5246.2145.4543.94
AGIEval SAT Math99.0991.1498.9899.0990.45
AQuA-RAT90.5790.8891.3992.6290.98
HARDMath-mini56.3461.9251.8963.3158.90
IMO-AnswerBench53.0055.0054.2545.0045.25
MATH-P-Hard79.2182.5384.4182.0877.42
OlympiadBench76.0674.7582.7582.4769.55
ARC-AGI-13.501.692.583.003.25
miniF2F2.875.120.002.873.28
代码
HumanEval+90.2488.8789.6380.2089.90
MBPP+63.2365.5463.9669.1064.70
LiveCodeBench v646.8653.5752.1452.2049.26
知识
MMLU73.8882.0983.5185.4077.80
GPQA-Diamond47.8760.1047.9859.0949.94
指令跟随
IFEval75.4272.3773.2487.4088.20

原表还包含 MiMo-7B-RL 与 Open Thinker3-7B 两列;上表为便于对照列出主要 5 列。粗体/浅蓝标记沿用原文着色规则。

解读(成绩结构):ZGCM-1 的强项集中在“高难数学竞赛题 + 抽象推理”(AIME 2026、HMMT 2025/2026、MATH-500、AGIEval SAT Math、ARC-AGI-1 均最优或并列最优),而知识类(MMLU、GPQA-Diamond)明显落后,指令跟随(IFEval)居中。这与它的核心论点完全自洽:7.39B 的静态参数容量决定了闭卷知识下限,而“深思 + 工具”路线把收益集中在推理与外部信息任务上。使用时应据此选型——它是数学/Agent 方向的专用高效模型,不是通用知识问答的首选

8.2 Web 环境深度研究

Web 环境深度研究结果(%,原文 Table 3)。破折号表示无公开结果。
模型 / 系统WebWalkerQABrowseCompGAIA (text-only)
ZGCM-1-7B(本文)63.0919.4342.52
开源研究 Agent
WebDancer-32B38.402.5040.70
带工具的开放权重模型
Qwen3-235B-A22B59.602.3045.60
Kimi-K263.0014.1057.30
DeepSeek-R110.002.0031.10
QwQ-32B4.300.5022.30
带工具的闭源模型
GPT-4o33.801.9034.60
GPT-554.9076.40
Claude 4 Sonnet61.7012.2068.30

Web 深度研究使用thinking-enabled ReAct 策略,最多 64 个“搜索-阅读”步骤。值得注意:在 BrowseComp 上 ZGCM-1(19.43%)超过了 Claude 4 Sonnet(12.20%)与 Kimi-K2(14.10%),仅次于 GPT-5。

8.3 Binary Function Search(二进制函数定位)

该基准考察 Agent 能否仅凭行为描述,在被 strip 的 ELF 二进制中定位目标函数。数据来自数千个开源 C/C++ 项目构建的“strip / 未 strip”配对;已校验数据池含 529 个项目、11,767 个任务。评测用 50 任务子集(10 个代表项目各随机 5 个,全部为训练集未见的 held-out 项目:tmux、tree、GNU Wget2、XZ Utils、YAJL、zlib、libuv、libgit2、nm、Lua)。

Binary Function Search 结果(50 任务;原文 Table 4)
模型 / 系统有效提交正确准确率 (%)
更大规模前沿模型
DeepSeek-V4 Flash50/5038/5076.00
Qwen3.5-397B-A17B50/5038/5076.00
GLM-5.150/5033/5066.00
ZGCM-1-7B50/5031/5062.00
Kimi-K250/5031/5062.00
DeepSeek-R146/5018/5036.00
GPT-4o50/509/5018.00
同量级模型
ZGCM-1-7B50/5031/5062.00
Qwen3-8B50/506/5012.00

评测协议要点:只接受精确匹配函数入口的 ELF 虚拟地址;文件偏移、运行时地址、函数内部指令均判错。判分对照由对应未 strip 二进制构建的 hidden oracle。ZGCM-1-7B 达 62%,远高于同量级基线(Qwen3-8B 12%,其余 0%),逼近 GLM-5.1(66%),并超过 DeepSeek-R1 与 GPT-4o。

Binary Function Search workflow
图 12 Binary Function Search 工作流与 Ghidra 命令接口。Agent 在“候选探索”与“证据精化”之间迭代(证据不足则回退),最后提交精确的函数入口地址,由 hidden oracle 验证。下方为 gcmd 的六个动作:functions / function / decompile / search / refs / listing。 来源:本文 Figure 12(arXiv:2609.13356v1,第 17 页)。

8.4 内部诊断:SWE-bench 与 Terminal-Bench(作者主动披露的短板)

作者在附录中如实给出了两个“通用软件/终端 Agent”诊断结果:

诚实性亮点:报告没有回避这两个偏低的数字,而是把它们写进 limitations(“尚处萌芽的通用软件与终端 Agent 能力”)。这使整份报告的可信度显著高于只报喜的材料。

9. 八条经验性发现(Findings 1–8)

报告的核心可复用产出是八条跨生命周期的可操作经验。前七条散布于各章节,第八条来自 AI-Native R&D 的自主度评估。汇总如下:

Finding 1 · 课程预训练§3.1.2

词法复杂度是通用语言的廉价排序信号,却是代码/数学的糟糕难度代理(表层统计反映样板而非算法深度)。只对通用语言排序、代码数学独立交织,可改善技术域 BPB,代价是通用域 0.03–0.09 BPB。

Finding 2 · TWEO 使 FP8 预训练可行§3.1.3

抑制中间激活离群值对 FP8 稳定至关重要;delayed scaling + TWEO 正则防发散,同时维持 60% BF16 等效 MFU。

Finding 3 · 预训练效率增益§3.1.3

SWA(1.4×) × FP8(1.5×) × Muon(1.8×) × Pre-LN(1.1×) ≈ 4.2× 的 16K time-to-loss 加速。

Finding 4 · 数据质量胜过数量§4.1.1

砍掉约一半候选池,六基准均值 67.78 → 68.83,BBH +10.10;损失局限于部分任务。优先保留可靠高价值监督。

Finding 5 · 长 CoT 的权衡与校准§4.1.1

长 CoT 效用非单调:过度饱和会引入啰嗦偏置、损害指令遵循。动态校准配比可缓解退化。

Finding 6 · 通用数据对 Agent 训练不可或缺§4.1.2

只用 Agent 数据会降低交互保真度;与通用指令数据联合训练提供推理与约束遵循基础,Agent 性能显著更优。

Finding 7 · 长 Agentic 中训练绕过超长 SFT§4.1.3

中训练建立的长上下文基础,使中等长度 SFT 即可在 256K 上激发推理与 Agent 行为,省去昂贵的超长推理轨迹。

Finding 8 · AI 自主度依任务而异§6.2

共享上下文、可复用技能与集成工具让 Agent 能在有限人工干预下迭代,但自主度不均匀:实验监控与部署工程达 L4,而模型架构与学习算法设计停留在 L2、从未超过 L3。

10. AI-Native R&D 与 AI4AI 自主度

ZGCM-1 的另一条主线是把 AI Agent 深度嵌入模型研发全生命周期。每位研究者指挥若干 LLM Agent,覆盖数据工程、架构设计、学习算法、实验与监控、基础设施、评测、部署七个环节。

10.1 两条信息流:Human Context 与 Experience

两股流汇入共享的 Agent Harness,为每个 Agent 装备 context、skills、tools、memory、orchestration、verification 能力。

10.2 四个落地场景

10.3 Atomic Capability Evaluation(ACE)

ACE 是一个细粒度诊断基准:18 个类别、183 个原子能力、2,503 个可执行探针(835 L1 / 835 L2 / 833 L3);完整一轮约 2–3 分钟,可快速刻画强弱项。其四条设计原则:

  1. 原子性:每个能力语义边界狭窄,失败能定位到具体行为而非整个领域。
  2. 探针多样性:每个能力用多种表层形式、三个难度级测试,降低对单一措辞的敏感性。
  3. 意图感知评分:仅当格式本身是目标行为时才严格整串匹配;否则抽取实质答案并归一化非语义差异。
  4. 可追溯性:每个判定都链到探针、参考答案、评分策略、抽取答案与失败记录。

评分路径:2,503 个探针中 2,155(86.1%)用确定性评分(数值/字符串/选择题/AST/单元测试/JSON Schema),其余 348(13.9%) 因正确性无法可靠表达为可执行判据,调用独立模型按预定义二值 rubric 评判。

ACE category-level performance
图 17 各模型的 ACE 类别级表现(通过率 %)。行=模型,列=18 个评测类别。ZGCM-7B 在数学(98.18)、规划(97.78)、逻辑(96.08)、因果推理(96.00)、阅读(95.04)上最强;最弱为指令跟随(49.74)、真实性(68.91)、代码(72.24)、语言(79.75)。相对同量级 Qwen3-8B-256K 的优势集中在长上下文(+31.11)、算术(+20.74)、规划(+14.45)、世界建模(+10.00)。 来源:本文 Figure 17(arXiv:2609.13356v1,第 43 页)。
解读(ACE 的局限作者也已写明):作者主动指出 ACE 的构建并非完全自主——纯模型驱动迭代不足,仍需人类专家裁定分歧、验证能力边界、检查系统性失败模式并批准实质性改动;且 rubric 式 LLM 评判可能残留偏置。因此 ACE 被定位为诊断补充,而非模型质量的唯一综合度量。这种“工具自我设限”的表述值得借鉴。

10.4 AI4AI 自主度评估

AI4AI(AI for AI)指用 AI 系统构建、评估、改进其他 AI 系统。为评估 Agent 能承担多少责任,9 位核心贡献者对 11 个任务类别按五级 rubric 打分,共 99 条评分

AI 在 R&D 工作流中的自主度分级(原文 Table 5)
级别名称定义判据
L1Basic Assistance人类主导并执行工作流;AI 协助单个步骤。
L2Partial AutomationAI 执行预定义工作流;人类指定流程并处理异常。
L3Conditional AutonomyAI 适应并管理常规工作流;重大决策需人类批准
L4High AutonomyAI 在人类设定的目标与约束内独立规划、执行、迭代。
L5Full AutonomyAI 还能自行确立研究目标并跨 R&D 阶段协调持续改进,无需常规人工指导。

L4/L5 的分界是“是否自主形成目标”:L4 在人类定义的目标内独立执行;L5 还能识别研究目标并跨阶段协调工作。

AI4AI autonomy across R&D tasks
图 14 各 R&D 任务的 AI4AI 自主度(基于核心贡献者评估)。条形=平均评分,误差棒=±1 样本标准差(9 位贡献者),点=个人评分(垂直偏移仅为分离重合点,无量化含义)。右侧列为团队为该任务共识指派的自主度级别。 来源:本文 Figure 14(arXiv:2609.13356v1,第 20 页)。
共识指派的自主度级别(原文 §6.2 与附录 E.3)
任务类别指派级别说明
Experimentation & MonitoringL4自主度最高(99 条评分中唯一一条 L5 也在此项)
Deployment EngineeringL4高自主度
Model Architecture DesignL2最低;从未收到高于 L3 的评分
Learning Algorithm DesignL2最低;从未收到高于 L3 的评分
Data Cleaning / Data Acquisition / Synthetic Data GenerationL3数据工程三项
Operator DesignL3
Training & Inference Framework DesignL3
Resource Platform ManagementL3
Model EvaluationL3

核心结论:运维类任务(实验监控、部署)可达 L4,而设计类任务(模型架构、学习算法)停在 L2。作者强调这些是贡献者判断而非标准化测量,且级别刻画的是自主度而非生产力或产出质量——更高自主度不一定意味着更好结果。

AI-native R&D workflow
图 13 AI-Native R&D 工作流。每位研究者指挥 Agents 覆盖七个核心开发阶段;完成的 Agent 工作产出可复用经验(已验证脚本、工作流、检查清单、调试历史),研究者讨论产出人类上下文;两者共同汇入共享 Agent Harness,为所有 Agent 装备上下文、技能、工具、记忆、编排与验证能力。 来源:本文 Figure 13(arXiv:2609.13356v1,第 19 页)。

11. 局限与未来方向

11.1 四条明确局限

  1. 参数知识边界:尽管深思与外部搜索补偿了许多事实缺失,静态记忆容量仍受 7.39B dense 规模根本约束;在无检索支持的纯闭卷、召回密集型任务上,自然落后于大规模前沿系统。
  2. 指令遵循 vs 推理啰嗦:细粒度 ACE 与数据配比消融显示,重度推理监督会引入啰嗦、并略微损害严格非推理的指令跟随(如 IFEval 与复杂表层约束),若不持续校准就会退化。
  3. 通用软件与终端 Agent 尚处萌芽:模型在结构化 Agent 环境(web 深度研究、二进制分析)表现优异,但更广泛的仓库级长程工程(SWE-bench Verified)与非结构化 Linux 终端导航(Terminal-Bench 2.0)完成率仍然偏低(分别为 4.0%、2.25%)。
  4. 环境与协议脆弱性:Agentic 执行高度依赖严格 schema 对齐与稳定的环境反馈;极端观测噪声、工具调用格式偏差、外部搜索 API 延迟仍会破坏多步 rollout。

11.2 四个未来方向

  1. 扩展到稀疏 MoE 架构:把混合 SWA、Muon、MDP 中训练配方迁移到稀疏 MoE 骨干,在保持低推理 FLOPs 的同时扩大参数容量与领域专精。
  2. 端到端交互式 Agentic RL:从 token 级 SFT 与 outcome 奖励,走向在真实执行沙箱(终端、web、编译器)内直接进行多轮交互式 RL。
  3. 自主动态知识检索:进一步统一预训练表示与即时自主检索,使模型在检测到参数不确定性时动态触发检索子程序
  4. 自演化 AI4AI 研发生态:把 AI-Native Agent Harness 从集群遥测、数据治理、原子评估,扩展到自主假设形成、自动 kernel 优化与闭环合成环境设计。

12. 附录速查:训练配置与关键消融

12.1 分布式训练配置

H100 上的分布式训练配置(原文 Table 6)。TP/PP/CP/DP = 张量/流水线/上下文/数据并行;MBS/GBS = 微/全局 batch size。
阶段上下文TP/PP/CP/DPMBS/GBS重计算LRRoPE base备注
通用预训练16K2/1/1/961/768None2×10⁻⁴5M≈60% BF16-eq. MFU(≈585 TFLOP/s/GPU)
分阶段(step 1)64K2/1/4/241/192Selective1×10⁻⁴5M10B tokens
直接 256K256K2/2/4/121/48Full1×10⁻⁴10M30B tokens;203 TFLOP/s/GPU
分阶段(step 2)256K2/2/4/121/48Full1×10⁻⁴10M20B tokens;204 TFLOP/s/GPU

12.2 通用预训练的能力演化(54 个 checkpoint)

直接评测 54 个已保存 base checkpoint(累计 0.04T → 4.19T tokens),不做任何 SFT / 指令微调。下表为四个五点窗口平均。

通用预训练期间的五 checkpoint 窗口均值(%,原文 Table 7;越高越好)
基准能力早期 (0.04–0.07T)≈1.0T≈2.5T最终 (3.67–4.18T)
MMLU知识26.3748.3256.9459.52
OpenBookQAQA24.8060.8072.4078.80
CSQAQA19.0257.7064.2667.87
HumanEval代码13.6628.2936.4643.54
GSM8K数学11.5238.6457.1259.09
Minerva Math数学6.8020.4032.8038.40
GSM-Symbolic数学1.2025.6049.2064.00
ARC-Challenge推理24.9656.0769.7475.90
HellaSwag推理24.5642.7552.6957.15
PIQA推理53.8064.7869.7874.89
WinoGrande推理50.7165.9866.1468.98

关键观察:多数增益在 2.5T 之前完成(MMLU 覆盖其总提升的 92%、ARC 88%、WinoGrande 84%),但代码与更难数学基准在最后 1.7T 仍持续上升(HumanEval +7.08、GSM-Symbolic +14.80)。这种分化式边际收益正是后续引入“能力导向中训练”的动机。

12.3 短 SFT 探针(中训练的能力跃迁)

用同一套精选 SFT 语料快速适配每一里程碑 checkpoint 后再评测(区别于上面的直接 base 评测)。从通用预训练结束到中训练结束:MATH-500 35.83% → 74.12%HumanEval+ 43.29% → 73.78%IFEval Strict 29.57% → 72.64%MMLU 44.17% → 72.63%。作者注明:最终探针用 3 个 SFT epoch、之前用 2 个,因此这是“下游潜力提升”的诊断证据,而非严格匹配的因果消融。

12.4 课程 vs 随机(BPB,越低越好)

10B tokens 后的 BPB(原文 Table 8)
基准RandomCurriculum方向
Coding1.990.81大幅改善
Math0.970.94改善
MMLU1.031.12+0.09
ARC1.051.09+0.04
HellaSwag1.051.08+0.03

附录还给出定性例子说明为何词法复杂度不能代理“算法/推理难度”:一个含大量程序结构的 WFC 网格构建程序落在代码 shard 的最低 0.01%,而一个两行 NumPy 文件加载片段落在最高 0.01%;数学侧,需在障碍下构造不相交最短路径的“Manhattan Wiring”落在最低 0.11%,而一句加法结合律陈述落在最高 0.01%。

12.5 SFT 数据过滤消融

SFT 数据过滤消融(原文 Table 10;同一 base checkpoint 与快速 SFT 流程,末列为六基准均值)
数据处理样本数IFEvalMATH-500BBHMMLUHumanEval+MBPP+Mean(6)
Minimal processing≈2.08M72.6474.1258.4972.6373.7855.0367.78
Broader filtering≈1.833M71.2077.6365.0870.6065.0058.3667.98
Quality-focused filtering≈1.145M71.9475.4368.5971.5067.5657.9468.83

严格质量过滤版比最小处理版少 44.9% 样本、比广泛过滤版少 37.5%,但六基准均值反而最高(68.83)。单项任务并非全部同向移动,但总体结论明确:高质量数据比单纯增加数据量更有用

12.6 think → direct 迁移(no-think 模式)

混合 think/no-think SFT 前后的 no-think 表现(%,原文 Table 12;两列使用匹配的基准版本与指标)
基准混合 SFT 前混合 SFT 后变化
AIME 202510.0043.33+33.33
AIME 20246.6733.33+26.66
MBPP+55.0375.93+20.90
BBH58.4969.48+10.99
LiveCodeBench v328.0034.31+6.31
IFEval72.6478.00+5.36
MMLU72.6370.03−2.60
HumanEval+73.7866.46−7.32

最大增益出现在数学推理与代码生成(AIME 2025 从 3/30 → 13/30)。作者诚实标注:这是观测性的 checkpoint 对比,两轮可能在总训练 tokens、数据构成、checkpoint 历史与优化调度上都不同,不是受控消融;迁移也是任务相关而非普遍的。

12.7 no-think 模式对外结果

选定 no-think 结果(%,原文 Table 16;确定性解码 temperature 0、top-p 1.0、单次运行)
基准ZGCM-1-7BOlmo 3 7B InstructQwen3-8B (non-thinking)Qwen2.5-7B
MATH-50089.4087.3082.3071.00
AIME 202433.3344.3026.2011.30
AIME 202543.3332.5021.706.30
BBH69.4871.2073.7068.80
HumanEval+66.4677.2079.8074.90
MBPP+75.9360.2064.4062.60
LiveCodeBench v334.3129.5053.2034.50
MMLU70.0369.1080.4077.20
GPQA-Diamond42.4240.4044.6035.60
IFEval78.0085.6086.3073.40
IFBench31.6732.3029.3028.40

附录 F 强调可复现性需要把数值结果绑定到四层:模型产物、评测数据、调用契约、评分实现;每条评测记录应保留模型 hash、官方数据集 URL 与不可变 revision、split、prompt wrapper、few-shot、system prompt、chat template、模式控制、答案抽取、指标实现、随机种子、超时、推理引擎与版本、硬件、原始输出位置。

13. 解读与工程启示

① 这是一份“算力受限下的前沿复现配方”,而非单纯的模型发布。 报告把 4.2× time-to-loss 明确分解为四个正交因子(架构 / 精度 / 优化器 / 归一化),把 600B 中训练拆成可审计的长度桶与 replay 结构,把 Agent 数据写成 MDP 状态-动作可监督形式——每一层都可被复现、而非“神秘调参”。这是它相对普通技术报告的最大增量。
② “深思 + 工具”路线的能力边界已被说清。 强项在可验证推理(数学竞赛题)与外部信息任务(web 研究、二进制定位);弱项在闭卷知识(MMLU 73.88 / GPQA 47.87)与严格指令跟随(IFEval 75.42)。使用时应按任务选型,而不是期待它全面替代通用模型。
③ 三条可迁移的工程经验:
④ 关于 AI-Native R&D 的冷静结论值得注意。 9 位核心贡献者的 99 条评分显示:运维/实验类任务可达 L4,而模型架构与学习算法设计停在 L2。这说明当前 Agent 的可靠自主性集中在“可验证、有稳定反馈回路”的工程环节,而需要提出新假设与目标设定的设计环节仍是人类主场。同时作者也承认 ACE 基准的构建“并非完全自主”,仍需人类裁定分歧——这是对“AI 自主研发”叙事的一个重要的自我设限。
⑤ 最值得学的一点是诚实性。 报告主动报告了 SWE-bench Verified 4.0%、Terminal-Bench 2.0 的 2.25%,把能力短板写进 limitations;也标注了短 SFT 探针“epoch 数不匹配”、think→direct 迁移“非受控消融”、ACE“rubric 判分可能有偏”。这类限定语让关键数字更可信,应作为技术报告写作的模板。

14. 引用与资产

论文与开放资产
项目内容
标题ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
作者ZGCM Team(Zhongguancun Academy · Zhongguancun Institute of Artificial Intelligence)。Project Lead: Jiyan He;核心贡献者:Guang Liang, Hao Liu, Haoxiang Guan, Jinbo Sun, Junyi Guo, Wenjun Feng, Yantai Xie, Yifei Shen 等
arXivarXiv:2609.13356v1 [cs.AI],2026-09-11,48 页
代码github.com/zgcagi/ZGCM-1
模型权重huggingface.co/zgcagi/ZGCM-1-7B
数据集huggingface.co/datasets/zgcagi/ZGCM-1-Data
开放内容预训练 / 中训练 / 后训练各阶段权重与中间 checkpoint、训练代码与配置、分阶段数据与数据配方、W&B 日志、评测 harness

BibTeX

@misc{zgcm1,
  title  = {ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search},
  author = {ZGCM Team},
  year   = {2026},
  eprint = {2609.13356},
  archivePrefix = {arXiv},
  primaryClass  = {cs.AI},
  url    = {https://arxiv.org/abs/2609.13356}
}

本解读的素材来源与边界

← 返回上一级