本文提出将向量搜索视为因果推断中的最近邻匹配,利用检索增强生成(RAG)框架进行策略学习,通过两步法分解策略遗憾并利用最近邻估计器和Transformer的预测误差界进行理论分析。
Vector Search As Nearest Neighbor Matching: RAG-based Policy Learning in Causal Inference
本文提出将向量搜索视为因果推断中的最近邻匹配,利用检索增强生成(RAG)框架进行策略学习,通过两步法分解策略遗憾并利用最近邻估计器和Transformer的预测误差界进行理论分析。
Vector Search As Nearest Neighbor Matching: RAG-based Policy Learning in Causal Inference
ATLAS 通过分离不变因子与异质因子,并利用辅助标签从异质因子中提取可迁移因子,使下游潜在因子回归性能接近最优,在辅助标签可用时实现跨环境迁移预测,否则退化为鲁棒的不变因子预测。
本文研究多环境因子模型:高维协变量从异构环境收集,环境间联合分布可能不同,但潜在结构可分解为**不变因子**(共享载荷)和**异质因子**(环境特定载荷)。该模型源于迁移学习与潜在因子回归,目标是为响应变量 Y 获得稳定低维表示以支持解释和鲁棒外推预测。
TPIPS 是一种基于文本提示的视觉相似性度量,能够根据用户指定的语义方面(如形状、颜色)动态评估图像对之间的相似性,在多个基准上比现有单一标量度量更接近人类判断,并解锁了文本引导检索、组合搜索和生成模型细粒度评估等新功能。
人类对图像相似性的判断是上下文相关的——例如两幅图像可能在形状上相似但在颜色上不同。现有的感知相似性度量(如 LPIPS、SSIM 等)只能输出一个单一标量值,无法根据具体语义方面进行条件化。本文旨在填补这一空白,提出一种支持文本提示的、多语义的感知相似性度量。
SWE-Pruner Pro 利用编码器LLM自身的内部表示来逐行判断工具输出是否保留,无需额外分类器,在节省最多39% token的同时还能轻微提升任务准确率。
SWE-Pruner Pro: The Coder LLM Already Knows What to Prune
提出一个包含平衡小批量采样和晚期注入策略的简单域泛化训练框架,在跨模型(GPT-Images-2.0、Gemini-3.1、FLUX.2、Seedream 4.5)像素级篡改定位任务上,平均gIoU和cIoU相对先前SOTA(PIXAR)分别提升26.1%和26.8%。
现代视觉语言模型(VLM,如ChatGPT、Gemini、Qwen-Image)大幅提升了图像生成与编辑能力,导致像素级图像篡改检测在跨模型和分布外(OOD)场景下变得日益重要且挑战性增强。本文研究的是:如何学习一个对多种VLM生成的不同篡改分布均保持鲁棒的篡改定位模型,即域泛化问题。
PPL-Factory 通过结合任务感知的困惑度评分与预算感知的选择标准,在仅使用 1% 训练数据时即超越现有数据选择方法;使用 10% 数据时在 GSM8K 和 MATH 上分别超全数据微调精度 0.9 和 4.8。
大语言模型微调中,不同训练样本对下游性能的贡献不均。高效数据选择可降低计算成本,但现有方法多依赖间接启发式(如质量、多样性、推理链长度),这些固定标准难以泛化到不同任务。基于困惑度的选择虽简单且模型感知,但现有工作对整个序列统一评分,忽略了语言建模与推理任务在学习目标上的差异。本文提出的 PPL-Factory 旨在解决任务相关性与预算约束下的样本选择问题。
Patch Policy 是一种轻量级架构扩展,使基于 Transformer 的机器人策略能直接利用预训练的密集补丁令牌(patch tokens),在不引入完整视觉语言模型(VLM)巨大计算开销的前提下,显著提升控制性能——在多个模拟与真实环境套件中相比全局池化表示提升40%,相比微调后的 OpenVLA-OFT 提升18%,而参数量仅为后者的约0.7…
现有机器人策略要么将每个观测压缩为单个全局令牌(丢失精细空间细节),要么使用从头训练的视觉骨干(无法利用大规模视觉预训练的优势)。虽然大型视觉-语言-动作模型(VLA)能操作密集补丁特征,但它们继承了十亿参数 VLM 的全部计算成本,导致体量大、速度慢。本文旨在填补这一空白:在保持策略训练效率和推理速度的前提下,让 Transformer 策略高效吸收并利…
通过在预训练语言模型前面插入学习到的连续向量(软前缀),可以系统性覆盖模型原本正确的三段论推理答案,且该效果在不同逻辑形式与接口变体间保持良好的泛化性,揭示了模型逻辑稳定性的显著模型间差异。
研究问题:大语言模型在面对通过软前缀学习的上下文压力时,其原本正确的逻辑判断(三段论推理)会被多大程度地覆盖?这种覆盖效应在不同模型、不同逻辑形式和接口设置中如何泛化?软前缀的主要作用机制是对特定答案语义的偏向还是固定符号的强制?
该工作提出一种上下文条件化的安全批评器(safety critic),通过学习自适应间隙偏好对扩散规划器生成的轨迹候选进行排序,在Habitat-Matterport 3D(HM3D)和MP3D上的PointGoal导航任务中取得了最高的成功率和成功率加权的路径长度,并且零微调地从模拟迁移到了Unitree G1人形机器人实物平台。
机器人在杂乱室内环境中失败的原因常不是无法生成无碰撞路径,而是固定的安全边际校准不当:保守的边际导致绕路和超时,宽松的边际则在感知偏差下导致近边界捷径。基于扩散的规划器可以从第一人称RGB-D图像生成多样化的轨迹候选,但可靠的候选选择仍是瓶颈。本文提出一套上下文条件化的安全批评器(context-conditioned safety critic),用于学…
It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief
HOMIE 提出统一处理主体间(inter-subject)和主体内(intra-subject)输入设置的人类-物体中心视频个性化框架,通过更好的多模态大语言模型(MLLM)集成策略,在保持文本编码器可控性的同时提取引用级关系知识,在多种 HOCVP 任务上达到当前最优性能。
人类-物体中心视频个性化(HOCVP)是主体驱动视频生成的核心任务。现有方法存在两个关键局限: 1. **主体间个性化**:在追求高主体保真度与准确交互模式之间难以平衡,尤其是当物体为抽象概念(如Logo)时; 2. **主体内引用**:虽然主体内参考(如OCR图、多视角输入)预期能增强保真度,但现有工作缺乏理解这种潜在对应关系的机制。
GigaPath-Flash在保持GigaPath平均切片级性能97%的前提下将计算量降低50倍;GigaTIME-Flash预测肿瘤免疫微环境的质量超越原CNN版GigaTIME,同时速度提升6倍、GPU内存减少8倍,两者均为Apache-2.0开源模型。
计算病理学领域的基础模型通过大规模组织病理学数据学习可迁移表征,有望变革癌症诊断、预后和治疗选择。然而,现有大多数预训练模型仅能在图像块(tile)级别工作,许可证限制严格,且计算成本高昂,阻碍了大规模全切片级别的临床和研究应用。
FlowMimic 提出一种像素对时间扭曲流场,可从图像编辑样本实时生成对应的视频编辑训练数据,并利用模态模仿损失使单一模型同时支持图像与视频的生成与编辑,无需人工掩码或外部辅助模型。
当前视频编辑数据的收集依赖人工掩码标注、基于 I2V 模型和 ControlNet 的配对合成、VLM 质量过滤等耗时流程,导致编辑任务多样性远不如图像编辑模型。该工作旨在将生成与编辑能力统一到单个模型中,并让模型内化语言指令的定位能力,而非依赖外部 MLLM 或推理时显式提供掩码序列。
本研究将经典因果发现方法 PCMCI+ 扩展至不规则采样的时间序列,通过聚合预定义时间窗口内的因果影响替代固定滞后依赖,在合成数据上显著优于原版方法。
现有因果发现方法(如 PCMCI+)假定时间序列为规则采样且因果依赖具有离散、固定的滞后结构,这限制了它们在传感器流、医疗保健数据和金融交易等不规则事件序列上的应用。本文旨在提出一种能处理不规则时间序列的因果发现扩展方法。
现有的自主发现系统(如OpenEvolve和TTT-Discover)不存在在所有模型-问题对上普遍优越的固定harness;应将其视为超参数,并根据任务进行在线自适应选择。
自主发现系统(automated discovery systems)常被当作通用harness(如OpenEvolve和TTT-Discover),但它们实际上是组合了存档策略、父代选择、探索方式和预算分配等多个设计选择的复合系统。由于发现实验成本高且随机性强,现有比较往往使用过少的独立重复试验,难以区分方法改进与运行间方差。本研究系统性地分解了这些ha…
本文表明,为优化自由回忆任务而训练的循环神经网络能够自发发现多种类人记忆策略,其中最优模型学到的是一种基于项目位置索引的“记忆宫殿”式机制,而非经典的时间上下文模型所假设的机制。
人类自由回忆表现出规律性的模式(如近因效应、顺序效应),经典理论认为这是因为记忆编码了随时间平滑整合的“时间上下文”。然而,是否单个统一机制就能解释所有人类记忆策略?特别是,记忆专家广泛使用的“记忆宫殿”策略在实证上优于时间上下文模型,却未被后者捕获。研究问题:最优的回忆策略究竟是什么?循环神经网络在自由回忆任务中能否发展出超越经典时间上下文模型的策略?
一项基于最优觅食理论的建模研究预测:在现有“重数量轻质量”的科研激励体系下,科学家使用大语言模型(LLM)后,会更快产出更多论文,但花在打磨、润色上的时间减少,导致论文整体精细化程度下降——即“do more, less well”。
本研究试图回答:LLM 的普及将如何改变科学家的科研生产力与论文质量? 研究由 Duede、Gross、Crockett 和 Bergstrom 合作,预印本于 2026 年 7 月 19 日发布在 arXiv 上(待核实最终期刊发表状态)。 Nature 新闻于 2026 年 7 月 31 日报道了这项研究。
“世界模型元年”定了!昆仑万维WAIC发布全矩阵升级:让AI懂世界、能行动
Anthropic在遭遇OpenAI价格战和月之暗面Kimi K3性能压制后,紧急逆转此前下架计划,宣布Claude Fable 5永久纳入订阅方案,并给予用户额度补偿。
2026年7月19日,Anthropic官方宣布原本计划下架或限流的旗舰模型Claude Fable 5改为永久可用。从7月20日起,Fable 5直接包含在Max和Team Premium订阅方案中(额度限制为50%),Pro和Team标准版用户将获得一次性100美元额度补偿。此前Anthropic曾因高昂定价和稀缺访问维持Fable 5的“不可替代”地…
大晓机器人在2026年世界人工智能大会上发布了融合理解、生成与预测一体化的开悟世界模型3.1、以人为中心的环境式数据采集方案2.0以及面向零售、酒店和开放场景的三套标准化行业解决方案,并联合多方推出全球首个具身物理智能统一评测基准平台“PHYSICAL IQ物智”,标志着物理AI从技术突破迈向规模化产业落地。
2026年7月19日,世界人工智能大会期间,大晓机器人承办“世界模型‘六小龙’巅峰论坛”,围绕“驱动物理AI从理解到执行”主题,发布了三大核心成果:开悟世界模型3.1(Kairos 3.1)、环境式数据采集方案2.0、覆盖即时零售、酒店服务与开放场景自主作业的成套解决方案。同时,由上海人工智能行业协会、河套学院、中国信通院华东分院联合发起的“PHYSICA…