生成-测试-修订循环本身不提供可靠性保证;在修复过程中,维持当前验证状态比重复循环更重要,陈旧痕迹会显著损害正确修复,而证据绑定的类型化契约机制可在不提升修复能力的前提下确保可审计的可靠提交。
本文研究编码智能体在生成-测试-修订循环中“找到正确补丁”与“保留、验证、提交正确补丁”之间的差距。具体问题是:仅仅增加循环次数能否带来可靠性?重复过程中,旧版本验证痕迹(stale traces)对最终提交正确性的影响有多大?如何从契约层面确保修复过程的可靠性?
生成-测试-修订循环本身不提供可靠性保证;在修复过程中,维持当前验证状态比重复循环更重要,陈旧痕迹会显著损害正确修复,而证据绑定的类型化契约机制可在不提升修复能力的前提下确保可审计的可靠提交。
本文研究编码智能体在生成-测试-修订循环中“找到正确补丁”与“保留、验证、提交正确补丁”之间的差距。具体问题是:仅仅增加循环次数能否带来可靠性?重复过程中,旧版本验证痕迹(stale traces)对最终提交正确性的影响有多大?如何从契约层面确保修复过程的可靠性?
本文证明了从多个异构且可能有重叠的数据提供者学习分布时,可学习性完全由提供者对应的“共现图”结构决定:点态一致性要求共现图在目标支撑集上连通,而PAC可学习要求共现图完全;样本复杂度可从近线性($\widetilde Θ(n/ε^2)$)到二次($\widetilde Θ(n^2/ε^2)$)连续调节。
研究受多源数据融合(如不同机构提供的异构、交叠数据集)的启发,建立了一个理论模型:学习一个有限域 $[n]$ 上的未知分布 $p$。学习者拥有一个固定的可查询集合族 $\mathscr{S} \subseteq 2^{[n]}$,每次查询 $S \in \mathscr{S}$ 返回一个来自条件分布 $p(\cdot \mid S)$ 的独立样本。模型的核…
Kimi K3 是一个拥有 2.8T 总参数(104B 激活参数)的 MoE 大语言模型,在长时编码、智能体、知识、推理和视觉任务上达到前沿水平,但整体性能仍落后于最强闭源模型(Claude Fable 5、GPT-5.6 Sol);其权重已开源。
Kimi K3 是 Moonshot AI 发布的新一代基础模型,采用混合专家架构(Mixture-of-Experts),包含 2.8T 总参数,每 token 激活约 104B 参数。模型原生支持视觉,上下文窗口达 100 万 token。核心创新包括 Kimi Delta Attention 和 Attention Residuals(改善序列长度和…
KANEx是首个利用KAN(Kolmogorov-Arnold Network)的符号化可解释性来支撑视觉-语言模型(VLM)推理的框架,结合其直接导出的热力图方法KAN-Map,在MIMIC-CXR数据集上使视觉定位与下游推理质量提升约10%,同时生成更忠实的显著性图。
医学影像分类模型(如胸部X光片分类器)虽高效,但其黑盒特性削弱了临床医生的信任。工业界尝试将分类器与视觉-语言模型(VLM)配对以生成自然语言解释,但这种做法仅增加语言流畅性,并未解决底层视觉模型的不透明性。KAN因其基于样条(spline)的组件具有内在可解释的函数单元,本研究探索能否利用这种架构透明度产生更可信的文本解释。
本文综述提出,将宽光谱红外成像与深度学习跨模态翻译耦合,可从非电离数据生成合成X线片重建,为儿科骨骼创伤分诊提供无辐射替代方案;但该方向仍处于框架论证阶段,还需多中心配对数据集、外部验证模型及红外源安全认证才能迈向临床。
儿科骨骼肌肉创伤占儿科急诊就诊量的18%,当前诊断依赖电离X线摄影。儿童早期累积低剂量辐射会增加终身白血病和脑恶性肿瘤风险,因此需要无辐射分诊替代方案。本文目标是综合证据,构建混合框架:利用宽光谱红外成像(650 nm–1 mm)结合深度学习跨模态翻译,从非电离数据生成临床可解释的合成X线片重建。
该研究严格证明,对一类半线性偏微分方程(在解及其一阶导数上非线性),使用梯度下降最小化PDE残差目标函数训练的神经网络将收敛到PDE的真实解,而非仅收敛至局部极小值。
Deep Galerkin Method (DGM) 和 Physics Informed Neural Networks (PINNs) 是科学机器学习中求解偏微分方程的流行方法。其核心是用(随机)梯度下降训练神经网络,通过最小化PDE残差来逼近解。然而,由于残差目标函数的非凸性,理论上训练可能仅收敛到局部极小值(此时不是PDE的解)。因此,长期存在一个…
本文提出一种基于物理感知特征与“噪声专家轨迹”数据生成的策略蒸馏框架,将连续控制深度强化学习(TD3)策略蒸馏为浅层决策树,在保持倾倒摆基准任务性能等价的同时,实现全局与局部可解释性,但代价是引入了高频Bang-Bang控制与稳定的双峰极限环。
Explainable Reinforcement Learning via Physics-Aware Policy Distillation
该研究提出在视觉文档理解中,用自然语言引用(quote)代替坐标框输出可大幅提升证据召回并降低归因幻觉,且通过无需区域标签的GRPO训练方法进一步提升了严格归因准确率。
可靠的视觉文档理解要求模型将每个答案归因到支持它的证据区域。现有基准和系统通过坐标接口(输出边界框坐标)来表示证据,但视觉语言模型(VLM)在此接口下即使答案正确也常识别错误区域——即“归因幻觉”(Attribution Hallucination)。本研究探究:该失败是否部分受限于模型通过坐标表达证据的能力。
本文将从有界工作记忆中驱逐哪些标记(token)的问题重新建模为一个对隐藏信号(该标记是否会被重用)的估计问题,并提出一种训练自由的策略RMM,它通过测量模型未来短时间内的实际注意力(demonstrated utility)来决定驱逐,但实验表明,在标准自然语言基准上,该方法并未显著优于现有方法(H2O、SnapKV),优势仅出现在具有尖锐内生重用模式的…
语言模型的测试时记忆(如KV缓存)受有界工作记忆限制,必须反复决定保留哪些已存储的标记。现有方法(如StreamingLLM、H2O、SnapKV)都在标记到达的瞬间做出决定——要么根据过去(如累积注意力),要么根据对未来的猜测(如SnapKV)。本文将其重新定义为对“某个标记在未来是否会被重用”这一隐藏信号的估计问题,指出不同方法对应不同的“提交延迟”(…
首个大规模结构化ER图理解基准ERUnderstand揭示:当前视觉-语言模型(VLM)能可靠识别常见ER图元素(F1>0.74),但在弱实体(低至0.28 F1)、多值属性(0.14 F1)和N元关系(0.07 F1)上性能骤降;推理增强模型整体提升15-25%,但仍受语言先验和图复杂度影响。
实体-关系图(ERD)是概念数据库设计的核心,但通常以渲染图像形式存在,缺乏机器可读结构,限制了AI辅助数据库工程。研究者提出ERUnderstand,首个用于评估VLM对ER图结构化理解的基准,包含2960张图(来自教材、真实模式、合成数据),覆盖多种领域、表示法、复杂度及扩展ER(EER)构造。每张图配有标准化机器可读表示,支持细粒度要素评价。
Efficient LLM-Generated Shuttling Compilers for Complex Trapped-Ion Architectures
自主研究(AR)系统的性能不仅应看最终结果质量,还应重视搜索过程效率;新提出的自适应方法“流体搜索”(fluid search)在12项系统优化任务上取得了最高的整体搜索效率,接近事先知道最优搜索结构的理想性能。
论文指出当前AI驱动的自主研究系统主要依据最终结果质量来评估性能,忽视了达到该结果所需的搜索预算(如评估次数、物理实验成本)。随着AR从数学、代码等低成本验证领域扩展到需要昂贵物理实验的真实科学场景,搜索效率将变得至关重要。作者提出使用帕累托前沿的曲线下面积(AUC)与最终结果质量共同评估AR系统,并比较了爬山法、束搜索、树搜索、进化搜索等多种搜索算法在1…
DreamStyle3D能够在10秒内生成高保真、几何一致的3D风格化资产,通过解耦双交叉注意力机制显式分离几何与风格特征,实现了效率与质量的兼顾。
DreamStyle3D: Efficient 3D Stylized Asset Generation via Dual-Attention Disentanglement
分布式推理架构中的协调层(路由器和合并器)易受波形工作负载攻击(如 Yo‑Yo 突发请求),攻击者通过资源竞争使正常用户的慢路径预测延迟超过截止期限,导致预测被丢弃,从而引发准确度崩塌——无需获取模型权重或受害者数据,即可显著降低推理质量。
现代推理系统常采用“快路径+慢路径”方案:快路径在延迟截止期内返回预测,慢路径在更强的远程硬件上运行高计算量方法以获得更高精度,并通过协调层(路由器调用慢路径、合并器决定是否采纳慢路径返回的预测)整合结果。本文发现,该协调层暴露出新的攻击面——**形状工作负载攻击**可人为制造资源竞争,将慢路径预测推出延迟截止期,使合并器丢弃这些预测,从而损失慢路径精度优…
DataOrchestra 是一个为每个预训练数据样本(chunk)自适应编排处理流程的框架,在 0.5B 到 7B 模型的从头预训练中,相比单个固定处理策略在 11 项基准上取得稳定平均提升,并能在数学继续预训练场景下超越更强的基线,同时通过跳过不必要操作降低处理计算量。
大型语言模型(LLM)的预训练数据质量对下游性能至关重要。现有方法大多在语料库或领域层面定义固定的处理策略(如统一清洗或过滤),对所有样本采用相同操作,缺乏对每个样本具体需求的适应性。因此,如何根据每个样本的特点动态选择是否丢弃、保留或清洗,并进一步编排多个清洗操作,是一个待解决的问题。
本文系统地将具身操作的数据源组织为一个五层“金字塔”,围绕可扩展性与机器人对齐之间的张力,分析了不同数据源的质量、多样性、可重用性与物理保真度,并探讨了近期具身基础模型在预训练中如何选择、对齐与混合这些数据源,最后提出了六个开放的挑战。
多模态基础模型通过互联网数据轻松学会了看和说,但具身智能体无法走这条捷径——它们需要耦合观察、物理状态与动作的数据。这些信号可以从多种数据源中以不同程度获取。本文旨在系统化整理具身数据生态系统,回答:不同数据源在可扩展性与机器人对齐之间存在怎样的权衡?当前具身基础模型的数据配比如何影响其能力?
该研究提出了两种共学习策略(特征级与决策级),使多模态分类模型在训练与推理时模态不匹配(任意子集缺失)的场景下仍能保持鲁棒性能,实验发现特征级方法在单模态缺失时更优,而决策级方法在仅剩单一模态的极端缺失条件下表现更好。
Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification
ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding
TemporalSinkhorn通过并行时间执行和可认证的审计机制,在保证输出无容差违规的前提下,将动态熵最优运输中重复Sinkhorn计算的执行速度提升1.42 倍至3.632 倍(针对Flow Matching小批量流),且零边际容差违规。
动态应用(如最优运输流匹配Flow Matching)需要反复求解一系列相互关联的熵最优运输问题。传统分布式Sinkhorn算法顺序处理每个时间帧,并在每次迭代后全局同步,导致大量等待和冗余计算。本文提出TemporalSinkhorn,一个并行时间执行器,同时批处理未来候选帧及其修正计算,并通过中心化的、行分片的认证器确保只有确定性安全的前缀被接受,预测…
Causal‑TS 是一个面向高维、非平稳多元时间序列的因果发现开源 Python 库,内置四种专用算法和多种经典包装器,通过统一的 GPU 加速条件独立性检验层和结构变化发现流程,提供从原始时序到因果效应估计的端到端工具链。
因果发现对于理解复杂系统的动态机制至关重要,但现有库在处理高维、非平稳时间序列时往往缺乏对结构突变的适应性,且算法扩展性有限。Causal‑TS 旨在填补这一空白,将因果发现的适用场景从平稳、低维数据推广至非平稳、高维情景。