本文证明奇异值软阈值(singular value soft-thresholding)可通过归约到矩阵极分解来计算,从而利用GPU友好的极分解算法,在GPU上相比标准SVD方法实现显著加速;但鲁棒性未经探究,且因符号函数的不连续性只适用于低精度应用。
奇异值软阈值是矩阵补全、低秩表示等算法中的基本操作,通常通过奇异值分解(SVD)实现,而SVD在GPU上的并行效率不高。本文提出将软阈值计算转化为矩阵极分解问题,以利用更适于GPU的极分解算法(如迭代法或加速方法)。
本文证明奇异值软阈值(singular value soft-thresholding)可通过归约到矩阵极分解来计算,从而利用GPU友好的极分解算法,在GPU上相比标准SVD方法实现显著加速;但鲁棒性未经探究,且因符号函数的不连续性只适用于低精度应用。
奇异值软阈值是矩阵补全、低秩表示等算法中的基本操作,通常通过奇异值分解(SVD)实现,而SVD在GPU上的并行效率不高。本文提出将软阈值计算转化为矩阵极分解问题,以利用更适于GPU的极分解算法(如迭代法或加速方法)。
人类常通过身体抽象(如影子、剪影、反射)进行沟通,但机器人目前主要依赖物理形态表达。本研究旨在让机器人学会操控自身投影的视觉抽象(特别是阴影)来与观察者交流。核心挑战在于:机器人不仅需要推理自身运动,还需理解运动如何被转化为外部投影并被人感知。
本文提出机器人分解世界模型,将动作执行过程拆解为机器人自身控制器/运动学渲染的标称轨迹,再通过 URDF 显式渲染机器人几何体,从而让视频世界模型专注于学习物体如何响应机器人运动,在未见过的机器人形态上也能泛化,并可从人类演示视频重定向生成机器人操作视频。
现有动作条件视频世界模型直接以动作指令为输入,需要模型自行学习“动作→机器人运动→场景变化”的完整过程,导致学习负担大且难以迁移到不同机器人。 若以未来状态作为条件会泄露预测目标的交互结果,不适用于规划。 本文提出将机器人特有的两个因素(动作实现、机器人渲染)从世界模型中分离出来,构建一个视觉共享的接口。
量子谱模型(QSM)通过将输入矩阵直接编码进哈密顿量生成器,使量子模型的归纳偏置显式地匹配输入数据的谱结构,从而在多个基准任务上优于坐标式旋转门编码的传统量子模型。
现代机器学习的设计原则之一是让模型的归纳偏置与输入数据的结构对齐。对于矩阵值输入,关键的矩阵级关系可通过谱值和谱子空间刻画。然而,大多数量子机器学习模型使用逐坐标旋转门数据编码酉变换,并未显式构建这种矩阵级表示。本研究提出量子谱模型(QSMs),将每个输入矩阵直接构造数据编码酉变换的生成器,从而在量子模型中引入输入条件化的谱表示。
PRIMS 通过将流体力学物理关系显式嵌入 Transformer 架构(三个专用模块),在仅 0.46M 参数下对五种流体分类达到 98.92% 平均 F1 分数,相比当前最优 Transformer 方法参数减少 14 倍,并在未见过的温度/流速分布偏移下保持鲁棒性,为片上微流控设备中的可靠流体识别提供了可解释、数据高效且抗环境变化的方案。
精准的片上流体识别对微流控应用至关重要,但实际运行中流速、压力和温度变化剧烈,现有基于学习的方法往往将传感器信号视为领域无关特征,忽略了控制流体行为的物理关系,导致泛化能力差且缺乏可解释性。本文提出 PRIMS(Physics-guided Representation for Multimodal Sensing),一种物理感知的多模态 Transfor…
工业级搜索与推荐系统中,新内容(冷启动)因缺乏历史交互信号而难以获得曝光,同时系统对已有内容的偏向会扭曲模型预测。现有方案多局限于单阶段或单场景,缺乏跨漏斗的统一解法。本文提出 PinEqualizer,旨在解决以下问题: 如何在整个多阶段漏斗(召回、粗排、精排等)中协同处理冷启动与去偏? 如何在不引入短期探索损失的前提下,提升模型对各类内容的预测准确性?…
通用音频基础模型(AST、CLAP)从物种发声嵌入中自动恢复了系统发育距离,相关性高达 r≈0.82,而手工设计的 MFCC 特征完全不相关;出人意料的是,针对鸟类训练的专用模型(BirdNET)和生物声学模型(BEATs-bio)的表现反而弱于通用模型,领域特定预训练并未带来优势。
该研究提出一个核心问题:深度音频嵌入是否在没有人显式要求的情况下,自动编码了物种之间的进化关系?具体来说,研究者用四个预训练音频模型(AST、CLAP、BEATs-bio、BirdNET)对海洋哺乳动物和鸟类的发声进行嵌入,然后测试这些嵌入空间的几何结构能否恢复物种间的系统发育距离——这是所有模型在训练时都未曾见过的下游任务。
本文提出将最优输运(OT)成像技术与深度协方差对齐(Deep CORAL)相结合,为工业控制阀粘滞检测提供了一种能够有效缓解模拟-真实域偏移、在基准测试中达到90%准确率与100%召回率的无监督域适应方法。
控制阀粘滞(stiction)是工业过程中引起不必要振荡和回路性能下降的常见原因。数据驱动方法可自动检测粘滞,但仅基于模拟数据训练的模型由于域偏移(domain shift),往往难以泛化到真实工业控制回路。本文旨在弥补这一差距,提出一种新的粘滞检测框架。
商业大语言模型对争议性科学主张的立场并非模型本身的稳定属性,而是部署配置(系统提示、安全层、接口路由、无声更新)的偶然产物;在测试的四个模型家族中,Grok 的 Fast 版本给出的伪科学可信度评分是其他模型的 2–5 倍,且该行为在无声补丁后发生逆转,同一模型标识符在不同接口上产生截然不同的输出。
Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science
该论文证明了在谱分离与非退化条件动作变异两个条件下,联合嵌入预测架构(JEPA)的全局最优解能够唯一(至多相差正交变换)识别高斯潜状态的受控世界模型,并揭示了有限动作覆盖带来的反事实预测代价。
学习能够从高维观测推断环境动态并预测备选动作结果的世界模型是规划与控制的核心。联合嵌入预测架构(JEPA)在表示空间学习这类模型,但其动作条件扩展在视觉控制和潜空间规划中表现良好的同时,留下一个根本问题:受控潜预测何时能同时识别底层状态和受控动力学?非线性观测和条件动作变化有限的行为策略会导致状态演化与动作效应统计混淆,挑战可辨识性。
MineValiCoder通过“测试用例质量挖掘+并行TDD优化+二部图互验证”的闭环框架,在无需人工测试用例的情况下,在HumanEval上实现Pass@1达96.34%,显著缓解LLM随机性导致的代码生成不可靠问题。
现有基于LLM的测试驱动开发(TDD)严重依赖人工编写的测试用例,当仅有自然语言需求时无法有效工作。尽管已有自动测试用例生成研究,但忽略了LLM内在的随机性,导致两大缺陷:错误测试用例产生误导性反馈扭曲代码优化,混合质量测试用例产生冲突评估信号阻碍可靠代码选择。MineValiCoder旨在解决这些问题。
Learning to Prepare Molecular Ground States with Transformer Models
本文发现LoRA矩阵的条件数(最大与最小奇异值之比)与微调贡献正相关:条件数大的矩阵包含更丰富的方向信息,是性能提升的主要来源。基于此提出κ-LoRA,仅更新条件数排名前50%的矩阵,可在匹配标准LoRA准确率的前提下,将可训练参数减半,平均节省16.2%的微调时间并降低4.5%内存开销。
LoRA(低秩适配)被广泛用于神经网络高效微调,但其对所有矩阵进行统一更新的方式仍存在计算成本高的问题,尤其在大模型(数十亿参数)和资源受限场景(边缘部署、设备端微调)中更为突出。本文首次系统探究:是否所有LoRA矩阵都值得同等更新?哪些矩阵对适配的贡献更大?
Bag-of-waves 是一种基于无监督学习的小型可解释脑电波形字典方法,在仅有少量数据(如16只小鼠)或大规模临床数据集上均能达到与深度模型及基础模型相当的分类性能,同时保持完全的可解释性。
Interpretable EEG biomarkers with bag-of-waves: Spatial and temporal waveform dictionaries for low-data regimes
超球风格优化器(如MuonH)在大规模训练中的优势并非来自其固有更优的更新方向,而主要源于有效步长的演化差异;恒定的角速度并不能消除学习率调度的难题,精心设计的调度仍是发挥其潜力的关键。
针对尺度不变深度网络中广泛使用的超球(Hyperball)风格优化器(如MuonH、MuonWD)——它们通过固定矩阵参数范数并归一化更新来提升大规模训练性能——研究者试图解释其优势的根源。具体而言,MuonH在训练早期收敛慢于MuonWD但后期反超的现象尚未得到理论解释。
grapheme-kit 是一个开源 Python 库,它将词法距离、相似度和评估指标从 Unicode 码点层面提升至字素簇(grapheme cluster)层面,从而更忠实地评估泰米尔语、僧伽罗语等复杂书写系统的 OCR 与 NLP 任务。
现有词法距离、相似度和评估指标均基于 Unicode 码点(code point)计算。但在许多书写系统中,一个单一字素(grapheme)由多个 Unicode 码点组合而成(如泰米尔语、僧伽罗语的元音附标字符)。此时码点级度量会错误地将合成字符拆解为多个单元,导致对错误类型和位置的误判。本文提出并开源了 **grapheme-kit**,将所有度量迁移…
Graph-Based Correlation Matrix Generation: A Convex Optimization Approach
本文探索将可解释性技术应用于强化学习(RL)算法,以辅助空中交通管制(ATC)决策,并初步使用显著性图(saliency map)分析影响智能体决策的关键输入特征(待核实具体实验结果)。
在高风险、高安全性的领域(如医疗、自动驾驶、航空)中,AI 系统的可解释性对于建立人机信任至关重要。该研究聚焦于安全关键的空中交通管制场景,训练一个强化学习智能体在简化 ATC 环境中为航班选择避开禁飞区的替代航线,并探讨如何通过可解释性技术揭示智能体的决策依据。
本研究提出一个无需视频荧光成像、仅凭患者报告结局(PRO)和结构化临床变量即可预测头颈癌(HNC)幸存者吞咽障碍风险的两阶段堆叠模型,并证明单个MDADI条目比总分或综合评分包含更多预测信息。
Dysphagia Risk Stratification in Head and Neck Cancer via Two-Stage PRO-Clinical Stacking
本文主张企业 AI 智能体的权限应遵循动态最小权限原则(作为预防机制而非检测机制),设计了一个包含角色上限、任务上下文分类器和策略组合禁止的三源权限架构,并贡献了一个 600 条合成任务提示数据集用于评估该架构。
Dynamic Capability Scoping for Enterprise AI Agents: A Synthetic Dataset and Three-Source Permission Architecture