知识卡片:第一个Token是线索:从J-lens中读出多Token概念
英文标题: The First Token Is a Clue: Verbalizing Multi-Token Concepts from the J-lens
英文关键词: Jacobian Lens; interpretability; multi-token concepts; first-token clue; language model interpretability
一句话结论
J-lens 的“第一个 token 线索”可以从冻结的大语言模型中恢复多 token 概念的向量,并在概念读出和因果干预上显著优于 Template Lens。
事件概述或研究问题
Jacobian Lens(J-lens)是一种新近的大模型可解释性工具,它将隐藏状态读取为词汇表 token 的排序列表,但多 token 概念没有属于自己的向量表示。原始 J-lens 工作通过 Template Lens(预计算固定短语的向量)和 Oracle Lens(微调组件来提出短语并重建短语向量)来缓解这一问题。本文研究的是:能否直接从 J-lens 和冻结模型中恢复多 token 概念及其向量,而不需要额外微调或预定义短语表?
方法/产品要点
- 使用 J-lens 提出第一个 token,然后让冻结模型自动补全候选概念。
- 在单次前向传播中,从后续隐藏状态恢复完整概念的向量。
- 将每个候选概念向量与完整词汇表一起打分。
- 实验模型:Gemma-3-12B-IT、Llama-3.1-8B、Qwen3-14B;测试集:496 个多跳完型(multi-hop cloze)任务。
- 在给定正确第一个 token 和源提示时,模型在两 token 概念中恢复第二个 token 的成功率为 88.3%。
主要结果或产业意义
- 所提方法在 496 个多跳完型上的平均 Rank@10 为 43.1%,而 Template Lens 为 27.6%。
- 如果没有 J-lens 提供的首 token 线索,Rank@10 降至 21.6%,说明该线索对读出效果提升显著。
- 使用恢复向量进行因果概念交换时,平均 succ@10 为 61.4%,而 Template Lens 在同一干预下为 26.2%。
- 这为多 token 概念的可读性和干预提供了一条无需微调的路径,或可推广到更多模型解释和编辑场景。
为什么重要
这项工作是 J-lens 能力的直接延续:它把原本只处理单个 token 的透镜扩展到多 token 概念,而且不需要修改模型权重,也不必预先枚举短语。相比 Template Lens 需要固定短语词汇表,本文方法用 J-lens 的首 token 建议+冻结模型补全,以更灵活的方式恢复概念向量,也补充了“第一个 token 可以作为线索”这一可解释性发现。
局限与不确定性
- 摘要中未报告在超过两个 token 的概念上的表现,因此更长概念的恢复效果待核实。
- 未披露三个模型各自的结果、方差或失败案例,跨模型差异待核实。
- 因果概念交换的具体操作方式(如替换哪个隐藏状态、如何评估 succ@10)在摘要中未展开,待核实。
- 该方法是否适用于其他架构或更大规模模型,待核实。
可用于图书/PPT/简报的角度
- 用“第一个词是钥匙”比喻:大模型内部概念并非无法解析,只差一个线索。
- 可以做成一张对比图:Template Lens 的固定短语表 vs 本文的动态“首 token + 模型补全”流程。
- 适合放入“AI 可解释性”专题,展示无需微调即可干预模型内部概念的思路。
原始材料
- 英文标题:The First Token Is a Clue: Verbalizing Multi-Token Concepts from the J-lens
- 作者:Xijie Gong, Tonghan Wang
- 发布于:2026-08-31(arXiv id:2608.31084v1)
- 来源:https://arxiv.org/abs/2608.31084v1