本文是一篇系统性的综述与诊断评估,针对多模态大语言模型(MLLM)在遥感图像场景理解(RSISU)中的应用。作者回顾了RS-MLLM的技术演进(模型设计、多模态学习、训练数据、下游能力),并首次将RS-MLLM与通用CV-MLLM在多种RSISU任务和基准上进行对比,以厘清现有MLLM的能力边界、跨任务泛化能力与任务特定局限。
该研究提出一种多模态深度学习架构,联合处理原始时间序列、小波图像和静态特征向量,在42肽基准上超越现有方法超10个百分点,并能以近完美精度迁移至20氨基酸数据集,展示了机器学习在纳米孔传感器分子识别中的潜力。
纳米孔器件通过检测分析物进入纳米孔时离子电流的变化来实现单分子传感,有望用于快速、便携的诊断。然而,这类信号极其复杂,可靠地将信号分配至特定分子是主要挑战。本文引入一种多模态深度学习架构来解决此问题。
多模态大语言模型(MLLM)在视觉-语言任务中表现优异,但高推理成本(源于大量视觉输入 token 和 LLM 的繁重计算)阻碍了实际部署。现有方法通常独立优化单个维度(如裁剪冗余视觉 token、跳过 LLM 层或注意力头),忽略了计算资源必须在各维度间根据输入内容动态分配的根本耦合问题。
LKValues 是首个基于调查的斯里兰卡价值观对齐资源套件,包含 40 个多数人认可的社会价值观、15 万条僧伽罗语-英语指令数据和 1000 条评估基准;微调 Qwen 系列模型后显著减少了无效输出和跨语言差异,但效果依赖模型家族。
大语言模型(LLM)的价值观对齐普遍偏向西方文化规范,导致对多语言社会(如斯里兰卡)的本地价值观处理不当。现有基准缺乏斯里兰卡语境下的价值观(特别是其官方语言僧伽罗语),阻碍了文化敏感性的评估与微调。
本文证明了局部 Lipschitz 函数在 Lipschitz 伪度量下的强大数定律,并识别出一类函数集,使得此前发现的“失败现象”不再出现。
作者 Lai Tian 与 Johannes O. Royset 在 arXiv 预印本 (2607.20411v1) 中,针对随机函数序列,建立了基于 Lipschitz 伪度量的强大数定律。该工作提供了两种充分条件(拓扑条件与模型论条件),后者覆盖 o-minimal 结构中的联合可定义函数并超越该类。作为应用,作者证明了极限次微分与 Clarke 次…
本文提出一种无需任何标注数据、仅通过最小化有限体积法(FVM)残差来训练注意力图神经网络的方法,在稳态三维热流体场预测中达到全场归一化均方根误差(nRMSE)2.3–2.8%,在参数化瞬态案例中精度甚至优于有监督基线,同时完全省去了传统数值模拟生成训练数据的计算与存储成本。
神经代理模型(neural surrogates)在科学机器学习中被广泛用于快速预测三维热流体场,但传统训练方式依赖大量由CFD求解器生成的标签数据,数据生成本身耗费大量计算与存储资源。本研究试图回答:能否直接利用控制方程的有限体积法残差作为训练信号,从而彻底抛弃标注数据?
本文提出区间物理增强神经网络(iPANN)和模糊物理增强神经网络(fPANN),通过学习自由能密度的上下界及模糊集表示,实现对含噪声超弹性应力-变形数据的无分布偶然不确定性量化,并在有限元模拟中传播不确定性。
当应力-变形数据稀疏、噪声大或异质时,传统本构建模难以可靠量化不确定性。本文旨在为超弹性本构建模提供一种紧凑、物理一致的路径,以量化并传播偶然不确定性,而无需假设数据的具体概率分布。
该工作为 Ex‑Fuzzy 库添加了基于 Mamdani 推理的可解释回归模块,利用 Fuzzy C‑Means 聚类进行目标感知分区,在 10 个 KEEL 数据集上取得约 0.86 的决定系数(R²),同时保持 10–15 条人类可读规则,为黑箱回归模型提供了透明且性能有竞争力的替代方案。
机器学习回归模型在安全关键和受监管领域部署时面临解释性不足的问题。模糊规则系统虽能提供透明、语言可解释的模型,但 Mamdani 型模糊回归在现代机器学习软件库中仍少有支持。本文旨在解决该空白,为 Ex‑Fuzzy 库开发一套可解释的回归扩展。
人工智能(AI)工具能让没有平面设计经验的研究者快速制作清晰、吸引人的图形摘要,前提是必须负责任地使用——用户需确保科学准确性和不侵权。
2026年7月22日,《自然》职业专栏发表了赫尔辛基大学博士生Ananya Thakur的实操指南,系统介绍了如何利用AI工具(如ChatGPT、Claude)辅助制作论文图形摘要。她分享了从前期构思到设计落地的五步流程,并强调了AI辅助下的伦理与责任。
Generative AI floods and dilutes the market for books
FMRP-LEAN: A HIPAA-Compliant AI-Augmented LIMS Architecture for End-to-End Clinical Assay Workflow Optimization
EVO 是一种无需重训练的加速框架,通过进化搜索为扩散策略的迭代去噪过程全局优化缓存刷新调度,在保持近完整性能的同时最高实现 8.05 倍动作生成加速,并将 FLOPs 从 15.77G 降至 1.96G。
扩散策略通过迭代去噪动作块实现强视觉运动控制,但重复去噪导致实时部署计算开销巨大。现有基于缓存的加速方法通常均匀分配计算到各 Transformer 块,忽略了不同块之间冗余程度的异质性,导致性能与效率的次优权衡。本文提出 EVO,旨在通过无训练的全局缓存调度搜索解决该问题。
AI供应链中许可证义务在流转过程中严重失效:62.3%的链条至少经过一个无声明许可证的工件,所有负担义务的许可证类别端到端存活率低于7%,而宽松许可证(Permissive)存活率高达95.1%。
AI制品(数据集、模型、应用)在多平台供应链中流转(Hugging Face上的数据集和模型,GitHub上的应用)。每个制品携带许可证,其义务应在再分发时传播。但尚无研究衡量这些义务是否在供应链下游被剥离或替换。本文首次量化两种许可证洗白形式: 无声明许可证的工件在下游获得明确标签(可能错误); 一个已声明许可证类别在再分发时被另一类别替换。
本文提出 DIM-Fashion 基准和 FashionAM 框架,直接对齐多模态对话查询与时尚图库嵌入空间,避免中间文本化带来的信息损失,从而解决多轮时尚图像检索中意图多样化的实际问题。
真实世界的时尚搜索通常是多轮交互过程,但现有多轮检索方法均基于一个限制性假设:每轮交互都遵循相同的属性编辑范式(attribute-editing paradigm),忽视了异构意图转换(heterogeneous intent transitions)。此外,已有方法常依赖文本化(textification)来桥接多模态查询与视觉检索,这可能会丢失细粒度…
本文首次在去中心化黎曼优化中针对强测地凸损失实现了 \(O(\log T)\) 的静态遗憾界,匹配欧几里得强凸在线优化的极小化最优速率,并通过新颖的次凸性论证将这一结果扩展到了两点赌博机反馈设定。
研究在具有有界截面曲率(包括正曲率)的黎曼流形上如何进行去中心化在线优化,其中损失函数为 **强测地凸 (strongly geodesically convex, strongly g-convex)**。 现有集中式黎曼优化中,强测地凸性可将最优遗憾从 \(O(\sqrt{T})\) 收紧至 \(O(\log T)\);但在去中心化设定下,已有方法仅能…
在多机器人共享持久环境中,采用“礼貌性预判规划”(Courteous Anticipatory Planning)可显著降低长任务序列的总成本:在双机器人家庭场景中相比短视规划降低10.43%,在三机器人餐厅场景中降低17.41%。
研究针对一个场景:多个机器人共享同一持久环境,任务按序列逐个分配。标准规划器(短视)只解决当前任务,忽略未来任务及其他机器人的约束,导致终端状态积累副作用,增加后续所有机器人的成本。目标是设计一种规划方法,使机器人预判当前动作对未来所有共享环境机器人任务性能的影响,从而降低序列总成本。
本文提出DEED(数据高效后训练与经验驱动学习)系统级框架,在超市薯片补货任务上验证:通过精心设计的数据后训练(仅需单张GPU)即可将原失败策略转变为有效的真实世界系统,表明弥合实验室-商店差距主要是系统集成挑战而非架构问题。
视觉-语言-动作(VLA)人形机器人在从基准测试迁移至真实零售场景时面临执行错误、分布偏移和环境变化等挑战。现有方法往往在实验室表现良好,却无法在真实商店中可靠运行。本文以Unitree G1-Edu人形机器人搭载GR00T N1.6基础模型为平台,在超市薯片补货任务上系统性地研究该问题。
变分量子自编码器模型在实时异常检测触发任务中能达到与经典方法相当的性能,且经FPGA合成后资源与时序满足未来对撞机触发系统的约束,这项工作是首批将QML模型部署到FPGA用于高能物理触发的实现之一。
Classical Hardware Acceleration of Quantum Autoencoders for Real-Time Anomaly Detection in Collider Experiments
ATSplat 通过引入自适应 3D 令牌(Adaptive 3D Tokens)和令牌级不确定性驱动的扩展机制,在保持前馈式 3D 高斯泼溅(3DGS)实时渲染速度的同时,将高斯数量减少 5.7 倍以上,达到与优化式方法相媲美的渲染质量。
现有前馈式 3DGS 方法大多将高斯回归在输入像素上并沿相机射线提升,导致图元数量与图像分辨率和输入视角数量强相关,而非场景复杂度。这造成了大量冗余高斯,浪费计算和存储资源。ATSplat 旨在恢复 3DGS 优化中场景自适应容量分配的能力,使前馈方法也能将高斯集中在重建困难区域。
利用AI模型ProteinMPNN重新设计实验室进化后的酶,可恢复其稳定性,作为定向进化的起始点能持续获得比野生型起始点活性更高、特异性更强的酶。
2026年7月22日《Nature》发表研究,提出一种将AI蛋白质序列设计与实验室连续进化(PACE)整合的工作流。作者用ProteinMPNN重新设计三种肉毒杆菌神经毒素(BoNT)蛋白酶,得到稳定性改善且催化效率与野生型相当的变体。以这些AI重设计酶为起始点进行并行的PACE定向进化,相比从野生型起始,进化出的蛋白酶活性更高、适应性更快,且能解锁野生型…