An Experimental Design Approach to Evaluating Agentic AI's Autonomous Model Discovery
Align4D 框架通过三种对齐技术(物体距离对齐、运动-几何联合对齐、异步优化)将任意模态输入(文本、图像、视频、3D)转化为连贯的视频-3D 对,实现了高质量、一致性的 X-to-4D 生成,且无需昂贵的大规模多样化数据集。
当前生成式扩散模型在图像、视频、3D 内容多模态控制方面表现优异,但任意用户定义的模态到 4D(X-to-4D)生成仍然面临挑战:构建多样化数据集成本高昂,现有方法可扩展性有限。本文提出 Align4D,旨在将任意模态输入转化为连贯的视频-3D 对,利用视频指导 4D 运动、3D 数据塑造 4D 几何,从而解决这一难题。
AirflowAttack 是首个针对红外(IR)遥感视觉语言模型(VLM)的对抗攻击,通过将热气流湍流制作为物理可行的通用扰动,在多个模型上实现了平均 48.5% 的场景分类攻击成功率,暴露了该领域严重的安全漏洞。
视觉语言模型越来越多地被部署于安全关键场景中的红外遥感图像分析,但它们的对抗鲁棒性此前未被系统研究。本文提出了 AirflowAttack,旨在检验并揭示红外遥感 VLMs 在面对物理可实现的对抗扰动时的脆弱性。
该研究提出了一种融合白天视觉性能与夜间逆反射评估的VLM(视觉语言模型)增强框架,能够低成本、自动化地对交通标志进行综合状态评估,并在462个验证标志中识别出68个需要立即更换的隐患标志。
交通标志是全天候道路安全的关键视觉工具。美国《统一交通控制设施手册》(MUTCD)规定了白天可读性、色彩对比度等视觉要素以及夜间逆反射性能要求。传统评估依赖人工巡检,联邦公路管理局(FHWA)指出该方法主观性强、劳动密集且存在安全隐患;而逆反射仪价格昂贵,小型机构难以承担。现有研究多只关注白天或夜间单一维度,缺乏综合评估手段。本研究旨在开发一种集成昼夜评估…
本研究提出了一种基于物理信息神经网络(PINN)的框架,用于模拟双材料系统中的瞬态弹性动力波传播,能够准确预测波在界面的透射和反射,并在不依赖额外有限元模拟的情况下预测新时刻和修改材料属性后的波响应,为高速固体力学和冲击工程提供高效代理模型。
传统的弹性动力波动模拟通常依赖有限元方法(如ANSYS Workbench Explicit Dynamics),但计算成本高、缺乏连续解析形式。该研究旨在利用物理信息神经网络(PINN),将控制方程(轴对称线性弹性动力学方程)、初始条件、边界条件和界面条件嵌入损失函数,直接学习波传播过程,从而提供一个连续且计算高效的替代模型。
本文提出**SpectraReward**,一种无需训练的奖励函数,直接将预训练多模态大语言模型(MLLM)作为文本到图像生成强化学习的奖励模型;进一步引入**Self-SpectraReward**,使统一多模态模型的理解分支同时充当生成分支的奖励模型,形成闭环自改进框架,在多项基准上显著优于此前基于MLLM的奖励训练方法。
在文本到图像生成中,使用强化学习(RL)优化生成模型需要可靠的奖励函数。现有方法通常需要人工标注偏好数据或微调奖励模型,成本高且泛化性有限。本文研究是否可以利用预训练MLLM已有的图像-文本对齐能力,无需额外训练或标注,直接作为零样本奖励模型来评估生成图像与提示词的一致性。
**私有化评估(Private Eval)与可持续进化能力(Sustainable Evolution)才是企业在AI时代的真正护城河**——底层模型可以被替换,但企业自己沉淀的专家判断、业务规则、评测体系和自主进化能力不会流失。
文章从企业CEO的普遍困惑切入:“模型每个月都在变强,但我的企业没有一起变强?”指出当前企业使用AI的路径高度相似(开通账号→Copilot→知识库→Agent),但使用痕迹并未沉淀为企业能力。核心研究问题包括: 专家经验能否变成组织资产? 如果底层模型换掉,企业积累的判断是否还在? 所有公司把知识喂给少数大模型后,价值到底留在谁手里?
AI支出正从实验性试点转变为重大经常性运营开支(2025年全球达1.5万亿美元),但多数组织无法将投资与盈利影响直接挂钩;Cursor成立CFO委员会,旨在帮助财务领导者建立可衡量、可预测的AI投资回报框架。
AI支出快速增长,但投资与影响之间存在巨大鸿沟:88%的组织已在至少一个业务职能中部署AI,但仅39%能追溯该投资到企业层面的EBIT(息税前利润)影响。 当前缺乏成熟的学科来使这些投资可衡量、可预测且高效。Cursor因此发起CFO委员会,聚焦一个核心问题:**如何让AI支出始终与价值挂钩?**
Park 和 Walsh 提出了一个强化学习框架(Chemeleon2),通过组相对策略优化(GRPO)和多目标奖励机制引导潜在扩散模型生成热力学稳定、化学新颖且结构多样的晶体材料,有效解决了生成模型在材料发现中“似然采样”与“探索未开发区域”之间的目标错配问题。
晶体材料的设计空间极其庞大且组合复杂,现有生成式 AI 模型(如变分自编码器、扩散模型)通常基于最大似然训练,倾向于重现训练数据中的统计模式,而材料发现的目标是系统性地探索训练数据稀疏覆盖的“未开发区域”。这种目标错配限制了模型发现新颖但稳定化合物的能力。本研究旨在通过强化学习为生成模型提供明确的设计目标,引导其探索化学空间中真正具有科学价值的区域。
待核实。该论文标题暗示对齐语言模型存在“先错后对”的后期补救机制与接口失败现象,但具体结论需查阅全文。
待核实。论文题目提到“Wrong Before Right: Late Rescue and Interface Failure in Aligned Language Models”,可能研究对齐语言模型在生成过程中先输出错误答案、随后才纠正(或无法纠正)的行为模式,以及模型接口(如输入/输出处理)的缺陷。
WildSplat 是首个能够从无位姿、光照多变的野外图像中,通过单次前馈推理实现外观条件化新视角合成和外观编辑的3D高斯泼溅框架,性能优于现有优化基与前馈方法。
现有前馈3D重建方法在光照一致场景下高效,但在野外光照变化场景下表现不佳。WildSplat 旨在解决从不一致光照、无相机位姿的稀疏野外图像中进行新视角合成和外观编辑的问题。
离散扩散模型在学习一个反向跳转率的条件期望,而该条件期望可通过去噪器(denoiser)、分数比(score ratio)或桥插件预测器(bridge plug-in predictor)三种等价坐标表示;负ELBO精确等于数据熵加上真实反向过程与学习到的反向过程之间的路径KL散度,而不仅仅是下界。
论文旨在回答“离散扩散模型到底在学习什么”这一基础问题:是在学一个去噪器、一个分数比,还是一个桥插件预测器?在跳转率层面,这些实际上是同一对象在不同坐标下的表示,用错误坐标读取神经网络会改变被训练和采样的过程。作者从连续时间马尔可夫链(CTMC)的ELBO严格推导出发(包含边界项),提出了**Oracle距离定理**。
本研究提出 Direct On-Policy Distillation (Direct-OPD) 方法,通过在弱模型上运行强化学习(RL),然后将其 RL 引发的策略偏移(而非最终策略)作为隐式奖励信号转移到强学生模型,从而高效地实现从弱到强的泛化。
使用可验证奖励的强化学习(RLVR)是改进语言模型推理能力的有效策略,但将其应用于每个新的大模型成本高昂,因为目标模型在训练中需要生成大量轨迹。随着模型规模扩大,后训练本身成为计算瓶颈。本研究探索一种弱到强的替代方案:在计算成本较低的小模型上运行 RL,然后复用该 RL 运行的学习成果来改进更强的目标模型。直接蒸馏 RL 后的弱教师模型效果不足,因为其最终…
待核实(无法从元数据中提取结论,需查阅原文正文)。
待核实。根据标题推测,该论文提出视频生成模型(如基于扩散模型的视频生成器)内部隐式具备光照估计能力,但具体研究问题与假设需确认。
URSA是一个针对实用逆合成评估的化学感知基准,旨在更全面地衡量逆合成模型在真实化学场景中的表现。具体结论待核实。
本文提出了URSA(Chemistry-Aware Benchmark for Utilitarian Retrosynthesis Assessment),用于评估逆合成预测模型的实用性和化学可感知性。研究问题待核实。
待核实(本文提出一种轻量级多目标时空动作检测方法,旨在平衡精度与计算开销)。
待核实(论文可能聚焦于如何在视频中同时检测多个人的动作,并降低模型参数量和推理延迟)。
TREK 通过蒸馏(而非模仿)来扩展学生模型的探索支持,有效克服了 GRPO 在困难提示上的停滞问题,在数学推理和智能体任务上均取得了显著提升,且可兼容白盒、黑盒或自上下文教师。
GRPO 在策略能够采样有用推理轨迹时表现良好,但当正确解模式位于学生策略支持范围之外时,GRPO 会在困难提示上停滞。TREK 提出一种简单分阶段流程,利用前向 KL 散度将验证过的候选解拉入学生策略支持,随后回归标准在线 GRPO 精炼。
本工作提出了一个用于诊断LLM智能体在工具使用中失败情况的基准,但具体结论因无法获取原文而待核实。
研究问题:大型语言模型(LLM)智能体在执行工具调用时会出现多种失败模式,现有基准缺乏系统性的诊断能力。 待核实:具体失败类型分类、基准构建方法、实验设置等细节。
在表格数据的深度学习中,基于多层感知机(MLP)的高效集成近期成为有效且实用的架构。现有同类方法对所有底层 MLP 使用相同的超参数,因此需要额外的超参数调优才能获得最佳性能。本研究提出 TabPack,一种具有强“开箱即用”性能、对传统调优依赖更低的高效 MLP 集成方法。