知识卡片:什么、哪里、如何:代码模型表征中任务、语言与模型的角色分离
英文标题: What, Where, and How: Disentangling the Roles of Task, Language, and Model in Code Model Representations
英文关键词: foundation-model, concept circuits, universality, code models, Qwen2.5-Coder, DeepSeek-Coder
一句话结论
独立训练的代码模型在“哪些概念获得专用电路”上高度一致(由任务决定),但在“电路位于哪一层”和“电路如何逐层增长”上完全由模型个体决定——通用性属于表征内容,而非计算组织。
事件概述 / 研究问题
该论文旨在回答:独立训练的语言模型是否以相同方式表示相同事物?作者聚焦代码领域,设计了一个 2×2 实验(Python 与 Rust 两种语言 × Qwen2.5-Coder-7B 与 DeepSeek-Coder-V1-6.7B 两个模型),对四种组合分别提取完整的语法概念电路(Python 58 个,Rust 57 个),从而分离任务(语言)、语言本身和模型架构的影响。
方法 / 产品要点
- 实验设计:2×2 交叉设计,是最小可分离任务、语言和模型各因素影响的设置。
- 概念电路提取:扩展了近期提出的概念电路提取方法,对每个语法概念计算专用的电路(circuit)。
- 测量指标:概念电路的“是什么(what)”(哪些概念有专用电路)、“在哪里(where)”(电路出现的层数)、“如何(how)”(电路随层数的增长模式)。
- 验证手段:消融实验(ablation)和线性探针(linear probes)确认电路具有功能性。
主要结果
- What(哪些概念获得电路)由任务(语言)决定:两个模型在 Python 上概念电路的一致性 Spearman ρ = 0.638,在 Rust 上 ρ = 0.673,p < 10⁻⁷,表明模型对哪些概念需要专用电路高度共识。
- Where(电路位置)由模型决定:Qwen 将概念集中在约第 17-19 层处理,DeepSeek 则集中在第 6-7 层,且该位置差异对两种语言一致。
- How(电路增长模式)也由模型决定:Qwen 对原子概念在早期层有一个激增,DeepSeek 没有。
- 非预期发现:
- Rust 构造获得的概念专用电路是 Python 等效构造的 2-3 倍(两模型均如此)。
- 两个模型在两种语言之间共享神经元(6/7 与 7/7 配对构造),DeepSeek 的共享程度是 Qwen 的 1.94 倍。
- Qwen 将 Rust 类型-特质机制的九个关键词绑定为一个紧密的神经元簇(Jaccard 0.535 vs 零假设 0.112,p < 0.001),这种语义维度在表面句法上不可见。
- 总体结论:“电路是通用的吗?”没有单一答案:对于 What 是通用的,对于 Where 和 How 不是——通用性是表征内容的属性,而非计算组织的属性。
为什么重要
- 首次在代码模型上系统分离了任务、语言和模型个体对神经表示的影响,为“模型内部表示是否通用”这一核心问题提供了细粒度答案。
- 发现 Rust 比 Python 需要更多概念专用电路,暗示不同语言的计算复杂度在学习表示上有显著差异。
- 观察到模型间跨语言共享神经元的非对称性(DeepSeek 远高于 Qwen),该方向无先验预测,可能揭示模型架构或训练细节对跨语言泛化的影响。
- 对可解释性研究有直接意义:未来分析电路时不能默认“位置”或“增长模式”具有跨模型一致性。
局限与不确定性
- 所有结论仅限于 2×2 设计(两种语言、两个模型),是否外推至第三个模型(如 Llama 或 GPT 系列)是设计的下一步测试。
- 概念电路提取方法本身可能存在偏差,且仅覆盖语法概念,未涉及语义或高阶任务概念。
- 模型间的差异可能由训练数据、超参数、随机种子等非架构因素导致,论文未排除这些混淆。
- Rust 的 2-3 倍专用电路是否源于语言特性(如所有权系统)还是数据量差异,待核实。
与既有脉络的关系
本卡片不重复已有卡片内容(VLA 忠实性、超级权重、视觉语言模型错误演变)。它与“大语言模型内部表示”这一脉络相关,增量信息是:提供了代码领域中任务、语言和模型三因素分离的实证,将“电路通用性”问题分解为三个不同维度,并揭示模型间共享神经元的非对称性。
可用于图书 / PPT / 简报的角度
- 角度一:从“电路通用性”切入,展示 AI 可解释性研究的最新进展——不同模型“想什么”可以一致,但“在哪儿想”和“怎么想”各不相同。
- 角度二:对比 Python 和 Rust 的差异,说明编程语言的语法复杂度如何影响神经表示的资源分配。
- 角度三:作为“语言模型内部机制”案例,向非专业观众解释概念电路、神经元簇等概念。
原始材料
- 论文标题:What, Where, and How: Disentangling the Roles of Task, Language, and Model in Code Model Representations
- arXiv ID:2607.21491v1(2026-07-23)
- 作者:Piotr Wilam
- 类别:cs.CL, cs.LG
- 摘要来源:https://arxiv.org/abs/2607.21491v1
- PDF 链接:https://arxiv.org/pdf/2607.21491v1