AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 2101-2120 条,共 2269 条
第 106 / 114 页
事件日期 2026-07-07

人工智能在印度次大陆是一把“双刃剑”,既能促进语言包容,也可能导致文化同质化;本文通过纵向梳理印度自然语言处理(Indic NLP)的发展历程,并提出“文化感知”(Culture Sensing)研究方向,旨在构建更具文化意义和包容性的印度基础模型。

论文研究AI如何影响印度次大陆的语言和文化基础。印度语言的丰富形态、复杂文字与语法规则、双言现象及巨大方言差异等结构和社会语言学特征,给构建AI基础模型带来了独特挑战。作者试图刻画这一问题的全貌,指出AI在促进大规模访问和包容的同时,也可能使世界观同质化、排斥未被充分代表的语言和世界观。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

Publisher Correction: A 98-qubit trapped-ion quantum computer with all-to-all connectivity

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-07-07

ProxyPose 通过将单目视频中的 6-DoF 姿态追踪问题转化为视频到视频的转换任务,仅需输入视频和首帧一个标记像素,利用微调的视频扩散模型生成代理视频,即可使用经典方法恢复 6-DoF 轨迹,在无需额外输入(如 3D 模型、深度图)的情况下达到最先进精度。

从单目视频中追踪物体或表面的六自由度(6-DoF)姿态是计算机视觉中的长期难题。现存方法通常需要输入 3D 模型、深度图、物体掩码或任务特定特征,并且在无纹理、透明、反光或可变形表面上表现不佳。ProxyPose 提出将其重构为视频到视频转换问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

量子计算机天然适合模拟量子多体系统,但能否设计出物理上合理的量子机器学习(QML)任务,并展示量子相对于经典的学习优势(学习分离)?本文从PAC学习理论出发,研究量子多体动力学的可学习性。核心问题:是否存在一个基于哈密顿量演化的自然机器学习任务,使得量子学习器高效可行,而经典学习器在多项式时间内无法完成?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

PACR-Video 通过冻结文本到视频扩散 Transformer,仅添加低秩时间适配器与递归提示库,在不进行全模型微调的前提下,实现了多镜头长视频外推中实体、场景、语义和因果关系的连贯保持,并在六个基准上超越多种现有方法。

多镜头长视频外推需要保持重复出现的实体、场景结构、视觉风格和因果进程的长期一致性。现有方法通常需要对生成器进行全参数微调,参数效率低且容易丢失之前镜头的关键信息。PACR-Video 提出一种参数高效框架,在不改动底层扩散 Transformer 的前提下,通过轻量适配模块和上下文路由机制解决这一挑战。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

PAW 将自然语言描述的模糊函数编译为轻量级本地可执行神经工件,使用 0.6B 参数的解释器即可达到 32B 参数直接提示的性能,推理内存仅为后者约 1/50,并在 MacBook M3 上以 30 tokens/s 运行。

许多日常编程任务(如日志告警、修复格式错误的 JSON、按意图排序搜索结果)难以用严格的规则实现,当前越来越依赖大语言模型 API,但这带来了成本、可复现性和本地化问题。论文提出模糊函数编程(fuzzy-function programming)范式,将自然语言规格说明编译为紧凑的本地可执行神经工件,从而减少对外部 API 的依赖。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

Point as Skeleton 是一个生成式传感器仿真框架,通过引入点云骨架条件和 Reset-and-Roll 机制,在闭环驾驶仿真中实现了更稳定的自回归视频生成,兼顾了闭环交互性与视觉保真度,并在 nuScenes 和 nuPlan 数据集上验证了其有效性。

端到端自动驾驶(E2E-AD)的评估仍然困难,现有驾驶仿真方法往往需要在闭环交互性(如 CARLA)和真实世界视觉保真度(如 nuScenes)之间权衡。作者提出 Point as Skeleton 框架,旨在实现既支持闭环 rollout 又保持高视觉真实感的传感器仿真,以解决自回归生成长序列时误差累积的问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

Pitwall 是一个在实时一级方程式(F1)比赛中生成多语言策略简报的生产系统,通过将每个句子分解为可验证的事实声明并借助校准的蒙特卡洛概率引擎进行验证,将忠实性作为架构属性而非事后补救,实现了高保真度的实时生成。

实时体育评论是“有截止时间的地面化生成”:评论涉及真实、具名的运动员,基础状态每几秒变化,且在生成时没有参考文本。传统方法难以同时满足时效性和事实准确性,容易产生幻觉。Pitwall 旨在解决这一矛盾,为 F1 策略提供忠实、可验证的实时自然语言简报。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

PIPBench 是首个将用户画像(profile)纳入评估的个性化图像生成基准,揭示了现有方法在捕捉用户审美偏好方面的关键局限。

当前的文本到图像模型(如 DALL·E 3)虽能遵循多样化的提示词,但无法感知用户的个体审美偏好。研究聚焦于**个性化图像生成**:模型需要根据用户历史偏好的少量图像和简短提示,生成符合其隐式视觉偏好的输出。为此,作者引入了 PIPBench——第一个包含用户画像的评估基准。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

由于非人类灵长类动物发声或手势序列的长度分布快速衰减,无监督依存句法分析器所检索到的正确边的比例必然很高,因此无需金标准即可评估其性能;而人类语言序列缺乏该性质,导致评估困难。

依存句法分析旨在为序列寻找树表示。无监督依存句法分析在模型训练时不依赖金标准。人类语言中,通常存在或可创建金标准来评估无监督解析器;但对于其他物种,金标准未知。那是否意味着无法判断解析器准确率,进而导致依存句法分析在其他物种中不可行?本论文对此提出挑战。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

该研究提出的双层控制框架(上层动态定价 + 下层基于多智能体深度强化学习的电池管理)在奶牛场场景中,相比基于规则的模型可将能源套利利润提升最高 18%,同时增加分布式发电利用率且不显著增加成本,并符合爱尔兰电网电压规范。

Multi-Agent Deep Reinforcement Learning for Multi Objective Battery Management in Dairy Farms

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

红外遥感图像能捕捉强度结构、目标-背景对比度及不受光照影响的线索,而这些在RGB图像中常不可见。然而,现有的遥感视觉-语言资源与模型大多聚焦于可见光波段,红外遥感视觉-语言理解仍未被充分探索。MonoIR-RS旨在填补这一空白,提供一个受控、可复现的测试平台,将红外模态与语言对齐。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

该研究首次系统评估了条件式户型图生成模型对域偏移的敏感性,发现跨域转移时性能可下降一个数量级;并提出通过合成数据预训练来缓解该问题,在零样本和低数据微调场景下均显著优于现有基线,低数据量下微调性能提升高达40%。

Mitigating Domain Shift in Conditioned Floor Plan Generation: Synthetic Pre-training for Data-Efficient Adaptation

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

本研究提出了一种仅依赖公开卫星影像和建筑形态数据的可扩展网格化框架,能够以高空间分辨率划分印度城市内部的富裕与贫困区域,并通过Google街景和贷款违约数据验证其有效性。

在印度等发展中国家,快速城市化地区缺乏精细尺度的社会经济数据,限制了识别城市内部富裕与匮乏空间差异的能力。本研究旨在利用开源地理空间数据,构建一种低成本、可解释且可推广的城市富裕程度划分方法。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

LACUNA 是首个提供参数级定位真相的大模型遗忘测试平台,发现现有最先进遗忘方法在参数层面高度不精确且易受重新浮现攻击,而一旦实现精确定位,即使是简单的基于梯度的遗忘方法也能达到强擦除效果。

大语言模型会记忆训练数据中的敏感个人信息(PII),需要可靠的遗忘(unlearning)方法。当前最先进的遗忘方法遵循“先定位再遗忘”范式,但现有基准仅从输出层面评估遗忘效果,无法判断知识是否真正从模型参数中被擦除,还是仅仅被掩盖。重新浮现攻击的成功进一步放大了这一担忧。为此,该研究提出了 LACUNA,首个具有参数级定位真相的遗忘测试平台。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

本文构建了一个高质量、人工验证的GitHub仓库行业分类数据集NAICS-GH(6,588个仓库,标记为NAICS两位数行业),并设计了一套检索-验证流水线,在人工验证样本上达到96.98%的精确率,为产业创新地理、开源软件产业构成等实证研究提供了基础资源。

GitHub拥有数亿公共仓库,但平台本身并未提供仓库到标准化行业分类的映射。这种缺失限制了关于创新地理分布、开源生产的产业构成以及新技术在经济部门间扩散的实证研究。本文试图填补这一空白,通过构建一个基于北美行业分类系统(NAICS 2022)的标注数据集来解决该问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

HoloCount 是一个分级诊断性视觉计数基准,揭示了当前多模态大语言模型在从感知性计数过渡到复杂逻辑推理与对抗场景时性能显著下降,定量的精确性仍是重大瓶颈。

多模态大语言模型在定性场景理解上取得了显著成功,但在定量精度上存在持续的数字幻觉。现有计数基准多集中于简化语境下的基础感知,未能捕捉逻辑约束或对抗条件下出现的复杂失效模式。为此,本文提出了 HoloCount——一个基于三级层次分类法的整体性、诊断丰富的基准。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-07

本文首次揭示了全双工口语语言模型(SLM)中模态干扰的根本原因——声学与语义建模在共享深层参数空间时产生梯度冲突,并提出了Lychee-FD框架,通过层次化参数分离策略有效解耦冲突模态,同时利用专用语义对齐通道保持跨模态连贯性。实验表明,该方法在Spoken QA上提升7.4%,在FullDuplexBench 1.5上提升28.5%,且不牺牲推理效率。

开发无缝、高性能、原生智能的全双工口语语言模型(SLM)是语音和自然语言处理领域长期追求的目标。然而,现有方法受限于严重的模态干扰(modality interference),导致知识退化、语义完整性受损,使得交互不自然、不智能。本研究通过细粒度的模型优化动态分析,发现模态干扰源于声学建模与语义建模在被迫共享深度参数空间时产生的梯度冲突。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条