AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1821-1840 条,共 2269 条
第 92 / 114 页
事件日期 2026-07-15

Lighthouse RL 提出一种基于“灯塔”(lighthouses)的策略性重置策略,能够大幅提升模拟电路尺寸优化中强化学习的样本效率与泛化能力,在多个基准测试中实现 100% 成功率与最高 1.72 倍加速。

模拟电路尺寸优化(analog circuit sizing)是一类计算昂贵的黑箱优化问题。传统方法难以在不同性能目标间泛化,标准强化学习则因在无前途区域无效探索而浪费资源。本文旨在通过一种轻量级、即插即用的重置策略解决这两种不足。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

本文提出一种名为 CSFS(Cluster‑based Sequential Feature Selection)的聚类包装式特征选择方法,能在不牺牲预测精度的前提下,将风能/太阳能功率预测的特征选择计算成本平均降低 21%。所有结论均基于摘要,因无法获取全文而需待核实。

可再生能源发电受环境条件影响,出力不稳定,因此准确预测至关重要。然而现有预测流程中,面对大量监测和环境变量,特征选择方法要么有限、要么不成体系。本文通过两项结构化文献综述(自做风电功率曲线建模综述,以及基于已有综述的光伏功率预测综述)确认了这一缺口,并为此设计了 CSFS 方法。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

Hindcast通过冻结Reddit历史快照并设置每个市场的时间截止点,消除了LLM预测评估中因训练数据泄漏和检索结果泄漏导致的“事后知识”偏差,从而更真实地衡量模型的预测能力。

标准回测(backtesting)用已解决的历史问题来评估预测系统:系统在结果公布前给出的概率会被评分。但对LLM,存在两条泄漏渠道:一是检索增强的模型可能获取事件发生后的报告,使预测变成查询;二是新模型训练数据包含更接近事件发生时间的数据,使得去年模型眼中的“未来问题”出现在今年模型的训练数据中。结果是测试声称评估“预见力”,实际却在评估“记忆力”。该研…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

利用10米分辨率卫星影像和机器学习绘制的欧洲湿地地图显示,湿地高度碎片化(27–33%面积位于<25公顷的斑块中),人类活动影响约20%的湿地面积,且各国对欧盟自然恢复法(NRL)的恢复承诺存在显著不均。

欧洲湿地储存大量碳,但数世纪的土地利用已侵蚀碳储量和生物多样性。欧盟自然恢复法(NRL)要求到2030年恢复至少30%未处于“良好状态”的湿地生态系统,但缺乏空间一致性的湿地类型和状态信息。本研究旨在提供高分辨率、标准化、可重复的湿地制图基线,以量化人为干扰并评估各国恢复目标的匹配程度。

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-07-15

本文以传统游戏引擎的“动作‑状态‑观测”循环为组织视角,系统分析了交互世界模型在玩家动作控制、游戏状态动态、状态‑观测持久性和实时交互生成四个维度的研究现状,并发布了超过90小时的《黑神话:悟空》游戏数据集,推动状态感知的游戏世界建模。

交互式游戏世界需要响应玩家动作、遵循演化游戏规则、保持长期一致性并实时运行。尽管视频生成模型被视为潜在下一代游戏引擎,但现有模型在这些方面仍有不足。本文重新审视该领域,将传统游戏引擎的循环作为分析透镜。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

Earthquaker-AI 将基于 Lego WeDo2 的机器人模拟与基于检索增强生成(RAG)的对话助手相结合,通过分年级的量规评估实现小学生地震安全知识的渐进式学习,实验显示高准确率与低幻觉率。

本文提出Earthquaker-AI混合教育框架,旨在增强小学生的地震准备意识和应急行动能力。该框架在获奖STEM项目Earthquaker(使用Lego WeDo2模拟地震响应)的基础上,引入基于RAG的对话AI助手,将学习从机械模拟扩展到认知与元认知加工。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

大多数GitHub项目对智能体编码工具的采纳仍处于早期,中位数项目在三个月内仅生成1–2个智能体PR;密集采纳集中在少数项目,且人机协作以单人监督模式为主。

本研究旨在填补现有知识的空白——以往研究多关注智能体生成PR(pull request)的产出质量,但缺乏项目级别的采纳与管理模式分析。论文通过分析25,264个智能体PR(来自2,361个热门GitHub仓库),回答三个问题:① 智能体编码工具在项目中的采纳情况;② 项目级别的智能体PR生产力;③ 人机协作模式。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

在持续学习场景下,只有内置回归控制(regression control)的智能体优化方法才能使优化增益在新任务上持续累积;否则,要么负迁移,要么无法在新一轮优化中继续提升。

目前大多数智能体优化方法的报告收益是一次性的(one-shot):智能体针对固定基准优化后,改进结果被当作方法的稳定属性。这并未测试部署型智能体面临的真实场景——随着时间推移,新失败和新任务出现,优化会被递归应用。核心问题是:优化器驱动的增益能否**复合**(compound)?即,智能体在第一轮优化后,是否能在新任务上再次优化而不侵蚀第一轮获得的增益?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

DeltaMerge-LowRes 提出将语言适应和任务适应解耦学习,然后在权重空间中用四种规则组合;其中新提出的跨轴 TIES(cross-axis TIES)规则在低资源摘要和问答任务上显著优于仅使用任务增量,稀疏感知合并可降低分类校准误差 36% 而保持宏 F1 持平。

低资源 NLP 中常见场景是同时适应新语言和新任务,但传统方法需要昂贵的语言–任务联合微调。本文研究能否将语言增量(Δ_L,从无标注单语文本学习)和任务增量(Δ_T,从英文标注数据学习)分别训练,推理时在权重空间组合,从而避免联合微调。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

本文提出 Deep Interaction 方法,允许用户直接编辑语言模型的多步推理回复中的错误部分,并将编辑后的思维链提炼为提示,从而引导模型沿正确路径推理。相比基线方法,在 STEM 推理任务上纠正成功率提升超 25%,token 用量减少约 40%。

大语言模型通过思维链(CoT)推理能解决复杂多步任务,但一旦中间步骤出错,现有交互方式要么要求模型重新生成整个回答(可能重复犯错),要么让用户逐轮指出错误(模型常回应“你说得对,我错了”后仍出现类似错误)。研究问题:如何让用户高效、精准地纠正推理模型中的错误,同时保留正确的推理步骤。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

CF-Net 通过显式建模跨模态不一致性并引入说话人归一化与确定性加权,在 ABAW 2026 挑战赛的 BAH 数据集上实现了矛盾/犹豫识别的领先性能,Macro F1 达 0.7364(AP=0.7492)。

检测非受限视频中的矛盾与犹豫(Ambivalence/Hesitancy, AH)极具挑战性,因为目标信号本身模糊,且通过细微的跨模态不一致而非典型情感表达来体现。该任务属于第三届 AH 视频识别挑战赛(ABAW 11th,与 ECCV 2026 同期),目标数据集为 BAH。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

本文提出RAG系统**PAT(Pragmatic Auto-Translator)**,通过整篇文档和可比语料库上下文引导LLM进行语用重述翻译,初步验证LLM可以逐渐脱离句子级翻译范式,但重述效果尚不稳定,需要进一步改进。

自动翻译系统(从CAT工具到机器翻译)绝大多数仍按逐句处理。本文核心问题:能否让LLM通过**整篇文档、语料库信息**的翻译方式超越逐句范式?作者构建了PAT系统,采用RAG(检索增强生成)架构,将用户配置的规范与来自可比语料库(美国英语与拉丁美洲西班牙语的真实长篇文本)的上下文相结合,向LLM传递检索到的段落级、章节级和文档级示例,进行整篇文档生成。目标…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

本研究证明,使用缩放后的 Lee–Sidford 度量的 Dikin 行走,在热启动下从多面体中进行指数采样的混合时间为 $d^{2.25}$ 次迭代,将此前 $d^{2.5}$ 的上界改进为更接近 $d^2$ 猜想。

Dikin 行走受内点法启发,是一种仿射不变的马尔可夫链,用于从多面体中均匀或指数采样。其混合时间由局域提议所依赖的障碍度量决定:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

该论文围绕多机器人协调中的异中心(环境中心)遥操作展开,关注可变视角下的操作方式;因仅有元数据,具体结论、方法与实验结果待核实。

多机器人系统在搜救、物流、建筑等场景中需要操作者同时监控和指挥多个机器人。传统以单机器人自我中心视角为主的遥操作可能让操作者难以把握全局空间关系,增加认知负担。该论文标题表明其探索“异中心”(allocentric,即以环境为参照)的遥操作,并强调“可变视角”,试图改善多机器人协调任务中的人机交互效率。具体研究问题与动机待核实。

学术前沿 · 原始来源:science.org · foundation-model
事件日期 2026-07-15

本文提出的端到端框架在知识获取、内容开发、内容审查、教学和评估五个阶段全面引入AI加速,已获得美国国家会计委员会(NASBA)认可,并在NVIDIA Agentic AI认证考试中验证其高效性。

到2030年,每100名工人中有59人需要重新培训或技能提升,但企业填补技能差距的平均时间从2014年的约3天增长到2018年的36天。现有框架大多只加速技能提升项目的单个阶段,且普遍缺乏行业验证。为此,研究人员提出一个端到端框架,将AI加速应用于全部五个阶段,并注重生产效率和学习效率。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

根据论文标题与发表元数据,本研究面向野外四足机器人,探索将感知能力与敏捷、多技能运动相结合;具体研究结论与性能结果待核实。

标题显示研究对象为四足机器人(quadrupedal robots),应用场景为“野外”(in the wild),核心能力关键词为“敏捷”(agile)、“感知”(perceptive)和“多技能运动”(multiskill locomotion)。 研究可能试图解决在非结构化真实环境中,机器人如何依靠感知完成多种敏捷运动技能的问题。具体问题定义、方法设…

学术前沿 · 原始来源:science.org · foundation-model
事件日期 2026-07-15

HealthClaw 是一种开源智能体架构,通过分离共享安全规则与隐私纵向记忆,能够在多次交互中自动更新用户画像、流程和经验记录,将单次查询的答案准确率从 0.2% 提升至 45.7%,同时将提示端上下文暴露量降低 71.7%,并在隐私探针中产生更少的不安全披露。

个人健康管理涉及反复多次的交互,但现有健康 AI 系统大多将每次请求孤立处理。研究团队开发了 HealthClaw,一种能够随着用户日常习惯、偏好、测量数据和风险变化而持续更新支持的自进化智能体。该架构将共享安全规则与医学知识从包含画像事实、可复用流程和事件痕迹的私密纵向记忆中分离出来,并在每次交互后通过归纳机制决定哪些信息应该更新画像、修订流程、保留为事…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条