知识卡片:CARE:基于置信度自适应的混合专家低秩适配路由
一句话结论:CARE 是一种无需额外参数的前向传播规则,它利用 MoE 路由器自身输出的分布熵作为不确定度信号,自适应地为每个 token 激活不同数量的专家,在匹配计算量下提升多任务性能,同时附带 OOD 检测能力。
事件概述或研究问题:Mixture-of-Experts (MoE) 风格的 LoRA 通常为每个 token 固定路由到 k 个专家,但不同 token 的模型不确定度差异很大——简单 token 被过度服务,困难 token 则专家不足。现有方法未利用路由器输出分布中蕴含的置信度信息。本文提出问题:能否根据每个 token 的不确定度动态调整活跃专家数,从而更高效地分配计算资源?
方法/产品要点:
- CARE(Confidence-Adaptive Routing of Experts):采用核采样(nucleus)方式激活专家——按路由器权重降序依次激活,直到累计概率质量超过阈值;当已激活专家之间出现分歧(disagreement)时,额外扩展专家数。
- 预算恒温器(Budget Thermostat):自动校准阈值,使平均激活专家数匹配任意目标计算预算。
- 无额外参数:是即插即用的单次前向规则,不增加训练参数。
- OOD 检测应用:同一置信度与分歧信号可用于改进分布外检测,优于 MSP、熵及多轮代理方法。
主要结果或产业意义:
- 在 LLaMA-3.1-8B 和 Qwen2.5-7B 上的 8 个常识推理基准、数学、代码和知识任务中,CARE 在匹配计算量下优于固定 top-k MoE-LoRA,且在激活更少专家的条件下匹配 k=4 的基线。
- 提供了核保真度、预算最优性以及分歧可认知解释的理论支撑,并开源代码(待核实具体仓库地址)。
为什么重要:
- 首次将路由器输出分布作为 token 级不确定度信号用于动态专家路由,避免了传统方法需要额外分类器或多次前向的代价。
- 计算效率与任务精度的权衡更加灵活,尤其适合资源受限或需要动态控制的场景。
- 与已有 MoE-LoRA 卡片(如 LingBot-Video、TRACE-ROUTER)不同,本工作聚焦于细粒度 token 级路由自适应,而非任务级或视频领域;且完全基于单次前向,无需在线学习。
局限与不确定性:
- 实验仅在 7B/8B 规模 LLaMA 和 Qwen 上验证,更大模型或不同架构(如 Mixtral)上的效果待核实。
- 预算恒温器需要在验证集上调节目标平均活跃专家数,实际部署中可能存在开销(待核实是否需要微调)。
- “分歧”信号的定义(待核实具体计算方法)以及阈值选取的敏感性未详细讨论。
可用于图书/PPT/简报的角度:
- MoE 路由效率优化:从固定 top-k 到动态激活的演进。
- 不确定性感知的深度学习:利用已有路由头的置信度信号,无需额外训练。
- 计算预算感知的模型压缩:如何在精度与 FLOPs 之间自动权衡。
- OOD 检测新思路:单一前向即可同时获得路由与不确定性估计。
原始材料:
- URL: https://arxiv.org/abs/2607.26052v1
- 英文标题: Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA
- 英文关键词: foundation-model, mixture-of-experts, LoRA, confidence-adaptive routing, uncertainty estimation
- Track: academic
- Candidate summary 中提供了上述信息,正文未能抓取,部分细节(如确切数据集结果、开源许可证等)待核实。