AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1361-1380 条,共 2269 条
第 69 / 114 页
事件日期 2026-07-28

指令微调后的 Llama 和 Gemma 模型在与人类对话的相邻轮次中,对上下文无关语法(CFG)规则的复用程度超过了被替换的人类回应,且指令微调增强了这种句法趋同,但同时也带来了对无关句法线索的更高敏感度。

句法趋同(syntactic convergence)是人类对话中普遍存在的无意识语言适应现象。本研究探究大语言模型(LLM)在与人类用户交互时是否表现出类似的行为,以及指令微调如何改变这一倾向。研究者使用替换范式,将模型生成的回复插入真实人类对话中,测量相邻轮次间 CFG 规则的复用程度。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

在理想化AI竞赛实验中,不安全开发行为主要源于落后于对手的竞争压力以及对手的行为动态,而非个体风险偏好;政策应侧重降低竞争压力与促进合作,而非仅关注个人风险。

Falling Behind Drives Unsafe Development in an Idealised AI Race Experiment

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

现有多模态大语言模型在真实临床诊断中的多轮推理能力仍然有限,即使最优模型也仅有极少数案例能完全正确诊断;ClinMM-Bench 是目前规模最大的多轮多模态临床诊断评估基准,揭示了五种典型失败模式。

临床诊断过程涉及多模态信息的逐步披露、诊断假设的动态更新和推理的持续修正,但现有评估通常基于单轮或孤立任务,无法反映真实临床复杂性。为弥合这一差距,研究团队开发了 ClinMM-Bench,用于系统评估多模态大语言模型在多轮、多模态临床诊断中的表现。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

所有评估的九种表格基础模型(TFM)在标签偏移、社会经济偏移和地理偏移三种真实分布偏移下均出现系统性性能下降,无论预训练策略如何,偏移差距在 0.003–0.060 之间;高性能模型还存在显著的可扩展性瓶颈。

表格基础模型(Tabular Foundation Models, TFMs)是表格预测任务的新方法,其预测性能可媲美集成树模型。然而,现有研究大多假设训练和测试数据独立同分布(i.i.d.),真实场景中的分布偏移会破坏模型鲁棒性,且目前缺乏对TFMs在分布偏移下的系统评估。本研究首次对九种TFMs(TabPFNv2、TabPFNv2.5、TabPFNv2…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

向 LLM 提供实时集群服务调用图与工作负载绑定信息(拓扑上下文),可将拓扑依赖型安全补丁的正确率从 11.1% 提升至 78.0%,而拓扑无关补丁不受影响,证明该提升来源于上下文而非通用提示丰富。

现有基于 LLM 的 Kubernetes 安全修复系统孤立处理每个 KSPM 发现,假设通用加固知识足以生成补丁。然而,当补丁需保留运行时服务依赖(如调用边、权限绑定)时,此类系统会生成破坏下游服务的补丁。本文提出 KuTIE(Kubernetes Topology Intelligence Engine),从 Istio 调用边、Trivy KSPM…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

本文提出了一种跨模态不一致检测方法(Kontrast),能够自动识别并分类维基百科文本/表格与Wikidata知识图谱之间的知识冲突、粒度差异、时间变化及知识图谱不完整性,揭示了多模态知识间的互补与校正潜力。

维基百科和Wikidata的知识分散在文本、表格和知识图谱三种模态中,当这些模态对同一事实的表述不一致时,如何自动检测并解释冲突成为关键问题。本文将之定义为“模态级不一致检测”(modality-level inconsistency detection),并构建了相应的分类体系和自动化框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

Desktop-Delta Bench(DDB)是一个针对计算机使用智能体(CUA)的离线步骤级基准测试,旨在评估模型对 GUI 状态转换中因果关系的理解能力。初步实验表明,现有模型在该基准上表现不佳,最优非干扰项和干扰项精确匹配率仅约 65%,且存在系统性错误复制给定顺序的问题。

计算机使用智能体通常通过桌面 GUI 执行长周期任务,但现有基准主要衡量最终任务成功率或单帧定位能力,无法单独评估模型能否重建动作产生后的因果、任务相关状态转换。由于推理、远程输入、应用渲染和截图捕获异步,下一个观测可能延迟、遮挡、短暂或无关,易被误读为进展并带入后续规划中。因此,研究者提出了 Desktop-Delta Bench(DDB),构建了一个包…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

本文提出了一种联邦纵向-生存建模框架,通过客户端可分离的离散时间风险目标,使多个机构在不共享原始传感器数据或个体失效记录的情况下协同训练故障预测模型,并在C-MAPSS涡扇发动机退化数据集上验证其性能接近集中式训练。

传统的故障预测模型(如Cox比例风险模型)依赖于全局风险集的非可分离偏似然,难以在标准联邦学习协议下直接优化。而分布式场景中,传感器轨迹和失效时间记录因隐私或专有限制无法集中存储。本文旨在解决:如何在保护数据隐私的前提下,利用分布在不同组织或站点的纵向监测数据协作训练系统故障预测模型。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

CHARM 是一种多模态图基础模型,通过引入层次上下文建模,将节点替换为层次化图上下文,从而在零样本迁移场景下跨图域和跨模态任务上取得一致改进,无需目标域微调。

现实世界的图往往包含文本、图像等多模态信息,且为新图域标注或适应模型成本高昂。现有的图神经网络(GNN)基础模型通常需要下游微调,而基于大语言模型(LLM)的图方法主要处理单模态图或域内任务。因此,**多模态图上的零样本迁移**(zero-shot transfer)仍未被充分探索,面临两个关键挑战:1)模型需要泛化来自单个模态的知识并捕获可迁移的跨模态关…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

深度生成模型(DGM)广泛用于高维复杂数据,并越来越多地被应用于空间和时空建模。然而,在真实世界中,由于真实底层过程未知,评估模型是否学到了正确的数据分布十分困难,往往只能依赖观测数据本身。本文在**已知的非平稳高斯随机场**上评估四种代表性 DGM(flow matching、DDPM、score‑SDE、VAE),并给出综合指标来检验模型对真实均值和协…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

GeoLens 通过多工具视觉推理(结合工具注意力强化学习),在超高分辨率遥感 VQA 任务上显著优于直接推理和单工具缩放基线,实现了更强的准确率、证据定位和更高效的工具使用轨迹。

超高分辨率(UHR)遥感图像提供了城市级场景的细粒度观测证据,但任务相关证据通常稀疏、局部且分散在极大的视觉上下文中,对多模态大语言模型(MLLM)构成根本挑战。传统自然方案是让 MLLM 具备“放大”工具用于主动局部检查,但研究发现放大仅对简单和中等难度任务有效,在需要全局搜索、多区域比较、路径规划或分散证据推理的高难度任务上表现饱和。为此,研究者提出超…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-28

ClinPRISM 在拥有 40 亿参数的大语言模型(LLM)骨干上,仅需 16 个时间序列令牌和平均每条问题 0.15 秒的推理延迟,即在保留测试集上取得了最先进的问答性能,同时大幅降低了计算成本。

临床上广泛存在不规则采样的时序数据(如患者生命体征监测值),其稀疏性、异步性和不均匀采样模式给多模态 LLM 的时序问答带来了挑战。现有通用时序 LLM 难以有效建模这些不规则性。本文提出 ClinPRISM,一种经济高效的多模态 LLM 推理框架,专门用于不规则临床时间序列(ICTS)上的问答任务。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-27

英伟达CEO黄仁勋首次在社交媒体X发帖,公开25家科技公司联署的《开放权重与美国AI领导力》公开信,主张开源对美国AI生态、竞争与安全至关重要;闭源巨头OpenAI、Anthropic、谷歌缺席,信中对“蒸馏”技术正名触及闭源阵营核心利益。

黄仁勋首次在X平台发帖,公开25家公司联署的公开信《开放权重与美国AI领导力》(Open Weights and American AI Leadership)。 公开信主张:开源对美国AI生态系统、竞争格局以及国家安全至关重要。 签署方包括英伟达、微软、Meta、IBM、a16z、YC等,但OpenAI、Anthropic、谷歌三家闭源巨头缺席。 信中为…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-27

Microsoft 于 2026 年 7 月 27 日发布 Project Perception,一个专为 AI 时代设计的代理式安全系统,通过“红、蓝、绿”三色智能体团队和全新 Cyber Stack 架构,实现持续感知、推理和自主防御,预计 2026 年 8 月 3 日进入公开预览。

Microsoft Security 执行副总裁 Hayete Gallot 在官方博客宣布,传统以人类行动者为基础的安全方法无法应对 AI 驱动的攻击(攻击者生成漏洞更快、规模化更高效)。Microsoft 因此推出 Project Perception,这是一个基于“新 Cyber Stack”(新网络安全堆栈)的持续学习安全系统,旨在让防御者以机器速…

产业观察 · 原始来源:Microsoft AI 博客 · ai-industry
事件日期 2026-07-27

NVIDIA Ising Calibration 1.5 是一款开源的 31B 参数视觉语言模型,通过增强的上下文学习能力实现量子处理器诊断输出的全自动校准,在零样本和上下文学习设置下均超越所有开源模型,并与领先闭源模型(如 Fable 5、GPT 5.6 Sol)竞争。

2026 年 7 月 27 日,NVIDIA 发布 Ising Calibration 1.5,这是其面向量子处理器校准的开源视觉语言模型(VLM)的最新版本。该模型旨在解释量子处理器的诊断输出并自动决定如何调优,支持实验室本地部署,首次推出 NVFP4 量化版本以便在单 GPU 或 NVIDIA DGX Spark 上运行。模型权重、数据集、基准和部署蓝…

产业观察 · 原始来源:NVIDIA 博客 · ai-industry
事件日期 2026-07-27

陶哲轩在2026年国际数学家大会(ICM)上提出“AI能力猜想”,认为AI可能以可接受成本承担研究级数学任务,但现有评价体系将面临冲击;他主张将数学问题“真正解决”分为五层,警示AI加速前端可能导致“证明过剩”与“证明消化不良”,未来稀缺的是提出问题、理解问题与组织知识的能力。

2026年ICM上,陶哲轩发表题为《人工智能时代的数学》的演讲。 提出“AI能力猜想”:AI或将以可接受成本承担研究级数学任务,冲击现有研究文化与评价体系。 核心关注:AI在数学研究中的角色边界,以及如何调整数学界的评价标准以适应AI时代。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-27

2026 年 7 月 27 日,Anthropic CEO Dario Amodei 发布公开声明,回应近期围绕中国开放权重模型以及部分美国官员考虑禁止美国企业使用中国开放权重模型的讨论。声明澄清 Anthropic 的立场,并解释其核心关切与应对措施。

产业观察 · 原始来源:Anthropic 博客 · ai-industry
每页 20 条