知识卡片:苹果新研究:纯中文推理训练,和用英文几乎没有差距
英文标题:待核实(报道未给出论文英文标题;论文链接为 arXiv:2608.13698)
英文关键词:Apple; Hasso Plattner Institute; GRPO; reasoning training; multilingual; Chinese; cross-lingual transfer; performance collapse
原始来源:新智元(AIERA),https://aiera.com.cn/2026/08/30/other/admin/111361/%e8%8b%b9%e6%9e%9c%e6%96%b0%e7%a0%94%e7%a9%b6%ef%bc%9a%e7%ba%af%e4%b8%ad%e6%96%87%e6%8e%a8%e7%90%86%e8%ae%ad%e7%bb%83%ef%bc%8c%e5%92%8c%e7%94%a8%e8%8b%b1%e6%96%87%e5%87%a0%e4%b9%8e%e6%b2%a1%e6%9c%89
论文预印本:https://arxiv.org/pdf/2608.13698
一句话结论
Apple 联合 Hasso Plattner 研究所的 200 多组 GRPO 推理训练实验显示,用中文做推理训练与用英语训练的性能差距约为 1.1 个百分点,远低于此前同类研究 10 个百分点以上的差距。中文推理模型有条件从训练阶段就跳过英语,但跨语言迁移中仍存在特定“模型—语言”组合下的性能崩塌风险。
事件概述或研究问题
研究问题:推理必须用英语吗?
此前多项研究报告,强制模型用非英语语言做推理,准确率会下降 10 个百分点甚至更多,“推理必须用英语”几乎成了多语言 AI 领域的默认共识。这篇论文用大规模对照实验检验该共识:在 9 个基座模型、11 种训练语言、14 种评估语言上,进行了超过 200 组 GRPO 强化学习推理训练实验。
方法/产品要点
- 模型覆盖:Qwen3、Gemma 3、SmolLM3 三个模型家族,参数规模 1B 到 8B。
- 关键设计选择:奖励模型用英语推理,还是用提问者的母语推理。
- 选英语:模型收到中文问题也会切到英语思考;
- 选母语:模型全程用中文。
- 训练方案:每种语言分别用英语推理奖励和母语推理奖励两套方案训练 500 步,再交叉评估。
- 评估任务:程序化生成的数学和逻辑题;文中出现 PolyMath、MGSM,完整任务清单以论文原文为准。
- 跨语言迁移矩阵:11 种语言分别做单语训练,再在 14 种语言上评估,形成 11×14 性能表。
主要结果或产业意义
- 中文训练的英语优势只有 1.1 个百分点;法语 1.4、德语 1.7、日语 1.6。高资源语言普遍在 2 个百分点以内。
- 低资源语言差距更大:孟加拉语 5.7、泰卢固语 4.6、斯瓦希里语 4.5 个百分点。语言在预训练阶段积累的资源厚度,直接影响母语推理训练的性价比。
- 跨语言迁移广泛有效:西班牙语单语训练后,法语恢复了目标语言直接训练增益的 96%;中文与日语之间迁移明显,可能和 CJK 语系预训练共享有关。
- 英语并不总是最好的迁移源:在 Qwen3-4B-Base 和 Qwen3-8B 上,孟加拉语训练对中文的迁移效果反而最好。论文作者推测,低资源语言训练可能迫使模型更深层地重组推理能力,泛化有时强于高资源语言训练。
- 多语言混合训练务实:Qwen3-Base 系列在多语言训练下,与“为每种评估语言分别挑选最优迁移源”的理想方案平均只差 0.3 个百分点,且只需训练一个模型。
- 产业意义:中文推理模型有可能从训练源头就走独立路线,跳过英语推理模型的翻译适配层;对非英语生态来说,“差距可控”从猜测变成了有数据支撑的判断。
为什么重要
这项研究把“推理必须用英语”的默认共识,拉回到“差距可控但需要评估覆盖度”的工程问题。此前非英语团队只能默认走英语推理路线;如今对中文等高资源语言,母语推理的代价只有 1–2 个百分点,从 RLVR 训练阶段就用目标语言跑,成为一个合理的工程选择。
与既有脉络的关系:已有相关卡片(NIST AI RMF、Epoch AI、OpenRouter)均未涉及苹果或推理训练路线;本条属于新增主题,增量信息在于“母语推理性能损失的量化”和“跨语言迁移的失败模式”。
局限与不确定性
- 论文测的是 8B 以下开源模型,任务为程序化生成的数学和逻辑题;结论不一定外推到更大模型或真实部署场景。
- 实验为单种子实验,未做逐配置超参调优。
- 原报道未给出论文英文标题、完整任务列表和详细模型配置;这些需以 arXiv:2608.13698 原文为准。
- 跨语言迁移存在性能崩塌:例如 Qwen3-4B 用斯瓦希里语训练后,在含英语内容的未见任务上性能下降 19.2 个百分点;部分非英语单语训练后,PolyMath 高难度题平均分下滑超过 30 个百分点。
- 推理奖励语言本身也可能触发崩塌,而且回退无法从模型或语言中单独预测,只有在特定组合下才会暴露。
- 低资源语言差距仍较大,中文结论不能直接推广到所有非英语语言。
可用于图书/PPT/简报的角度
- 从“推理必须用英语”到“中文差距 1.1 个百分点”:一个默认共识如何被大规模实验修正。
- 独立中文推理模型是否可行:母语奖励训练 + 跨语言迁移数据。
- 反直觉发现:低资源语言训练有时比英语迁移效果更好。
- 平均分陷阱:只看目标语言平均分,性能崩塌可能藏在暗处;逐语言、逐任务、逐模型排查不可省略。
- 资源有限团队可以考虑多语言混合训练:一个模型逼近“逐语言挑选最优迁移源”的理想方案。
原始材料
- 新智元(AIERA)报道:《苹果新研究:纯中文推理训练,和用英文几乎没有差距》,2026-08-30,URL:https://aiera.com.cn/2026/08/30/other/admin/111361/%e8%8b%b9%e6%9e%9c%e6%96%b0%e7%a0%94%e7%a9%b6%ef%bc%9a%e7%ba%af%e4%b8%ad%e6%96%87%e6%8e%a8%e7%90%86%e8%ae%ad%e7%bb%83%ef%bc%8c%e5%92%8c%e7%94%a8%e8%8b%b1%e6%96%87%e5%87%a0%e4%b9%8e%e6%b2%a1%e6%9c%89
- 报道所附论文预印本:https://arxiv.org/pdf/2608.13698 (正式标题、作者名单、完整实验数据需核对原文)