WALL-SS 是自变量机器人发布的“下一尺度自回归世界模型”,核心改进是让未来画面生成受动作控制,配合长时记忆可连续虚拟推演约 60 秒;在动作跟随得分与虚实相关性上明显优于材料中的对比模型,但暂不支持力矩与多指灵巧手。
按腾讯研究院AI速递 2026-08-28 报道,自变量机器人发布了世界模型 WALL-SS。该模型面向机器人操作与虚拟推演场景,试图解决世界模型中的“动作可控性”问题:模型不仅要生成未来画面,还要让不同动作对应不同结果,才能在虚拟环境中为真机策略提供可靠预测。
WALL-SS 是自变量机器人发布的“下一尺度自回归世界模型”,核心改进是让未来画面生成受动作控制,配合长时记忆可连续虚拟推演约 60 秒;在动作跟随得分与虚实相关性上明显优于材料中的对比模型,但暂不支持力矩与多指灵巧手。
按腾讯研究院AI速递 2026-08-28 报道,自变量机器人发布了世界模型 WALL-SS。该模型面向机器人操作与虚拟推演场景,试图解决世界模型中的“动作可控性”问题:模型不仅要生成未来画面,还要让不同动作对应不同结果,才能在虚拟环境中为真机策略提供可靠预测。
OpenAI与泰国高等教育科研与创新部(MHESI)合作,推出一个为期八周的加速器项目,帮助10家来自健康、福祉和教育领域的AI初创企业将原型转化为可信赖的产品(具体细节待核实)。
根据已知元数据,OpenAI与泰国MHESI联合发起了一个面向AI初创企业的加速器项目,重点支持健康、福祉和教育方向,共覆盖10家初创企业,项目周期为八周。由于原始网页未能抓取正文,事件的具体启动时间、申请条件、合作形式等信息待核实。
SemiAnalysis预测2028年两家实验室控制全球算力
OpenAI宣布,在Cursor被SpaceX收购后,将逐步终止(wind down)向Cursor提供OpenAI模型的合同。具体安排与影响尚待核实。
根据OpenAI官网页面标题及摘要信息,OpenAI就Cursor被SpaceX收购一事作出决定:不再继续向Cursor提供OpenAI模型。该决定涉及双方原有供应合同的终止流程。
在 DeepSWE 基准上,GLM-5.3 Flash 以约 1/17 的 rollout 成本,实现了 pass@1 只比完整版 GLM-5.3 低 5.6 个百分点、pass@4 只低 2.6 个百分点的成绩;若采用“Flash 先跑、失败后升级到完整 GLM-5.3”的级联路由,可以每任务 1.70 美元解决 80.9% 的任务,超过完整版单独使用的…
Together AI 于 2026-08-28 发布对比测试,评估 GLM-5.3 与其蒸馏版本 GLM-5.3 Flash 在 DeepSWE 上的表现。 实验覆盖 113 个 DeepSWE 任务,每个配置 4 次试验,两个模型均设为 max effort,共 900 次 rollout,其中完整版 452 次、Flash 448 次。 核心研究问题…
Claude宣布Cowork内置浏览器正式上线,付费用户可通过侧边栏让AI代理直接操作网页,但官方提示存在提示注入风险。
Claude推出Cowork内置浏览器。当任务涉及网站操作时,系统可直接调起侧边栏浏览器,完成导航、读取、点击、输入与表单填写等操作。
法拉第未来在EAI机器人“Built in USA”大会上半场公布三阶段路线图:目标年内工厂投运、2027年2月首款机器人本体下线;计划未来十年在美投资不少于50亿美元,每年推出3至5款机器人产品,首批纳入全尺寸人形机器人Next Futurist与四足机器人Next Aegis。
法拉第未来举办EAI机器人“Built in USA”大会上半场,公布三阶段路线图。 已知时间节点:年内工厂投运;2027年2月首款机器人本体下线。 投资计划:未来十年在美投资不少于50亿美元。 当前进展:机器人出货量已超400台,保持单品正毛利;教育生态覆盖约22所K-12学校;共享平台RoboShare启动全北美招商。
根据现有材料,Mark DiLeo是波士顿动力Atlas维修团队的“机器人外科医生”,他在“Ask a Roboticist: Meet Mark”访谈中回答了关于修复“此前不存在的东西”的操作指南、他见过的最严重的机器人损坏,以及人们看到机器人摔倒时的感受;具体访谈内容细节待核实。
波士顿动力博客发布“Ask a Roboticist: Meet Mark”专访,邀请Atlas维修团队成员Mark DiLeo分享机器人维修与部署经验。材料显示,访谈还配有一段关于“什么造就了一名好的机器人外科医生”的对话视频。
百度搭子通过“专业套件 + 企业知识库 + VPC安全版本”和自研Harness引擎,提出“交付即惊艳”的AI办公新标准;在量子位实测中,它能在20分钟内将一套发布会资料自动产出17份跨平台自媒体成品,但能否真正实现稳定可靠的企业级交付,仍需更多独立验证。
2026年8月28日,量子位报道了百度搭子的产品发布会。发布会现场演示了长程任务:从资料检索、信息分析到生成最终成果,新闻稿、产品长图、嘉宾金句海报、现场高光视频等实时产出。同期发布了百度搭子企业版,提出“专业办公新定义,交付即惊艳”。文章还记录了记者对自媒体套件和金融套件的实际测试。
据The Information报道,英伟达已同意以129亿美元收购Hugging Face,价格约合其1.5亿美元年化收入的八十多倍;交易若完成,将引发对Hugging Face中立性的广泛质疑。
英伟达已同意收购开源模型生态平台Hugging Face,交易价格约为129亿美元,对应其约1.5亿美元年化收入的八十多倍。英伟达此前已扩张Nemotron家族、组建Nemotron联盟并拿下Poolside技术授权,此次收购被视作其加强开放模型生态布局、制衡大客户自研芯片的战略举措。Hugging Face曾拒绝英伟达5亿美元投资,理由是担心单一投资者过…
云知声2026年中期财报显示,其智能体(Agent)业务上半年营收4.78亿元,同比增长35.7%,占总营收85.1%;Token业务收入近3000万元,Q2环比增长超500%。这说明Agent不仅能落地,还能通过解决方案、订阅和Token调用变成可复购的亿元级生意。
2026年8月28日,被称为“港股AGI第一股”的云知声发布2026年中期财报。文章以“OpenClaw遇冷”为对照,分析云知声如何将Agent业务做成核心增长引擎,并提炼出其“强基模+深应用”战略和具有Palantir色彩的产业AI商业化路径。
高通提出以“连接、感知、计算”为三大支柱的AI原生6G方向,目标频谱效率提升约50%,并展示13GHz与7GHz的Giga-MIMO原型机;预计AI-to-AI流量几年内增长约8倍,智能体应用可使单用户月流量超过50GB,同时动态QoS可将AI问答耗时从约48秒压缩至约13秒。
腾讯研究院AI速递(2026-08-28)报道了高通6G技术日展示的AI原生用例。该活动的具体举办日期、地点未在材料中说明。核心问题是:面向AI与智能体普及,6G网络应如何设计?高通给出的方向是6G不再只是连接管道,而是围绕连接、感知、计算三大支柱构建,并通过Giga-MIMO原型机、分布式计算、协同通信等方式验证。
自动语音识别(ASR)错误可能使具身AI(EAI)模型接受并执行有害指令,从而显著降低其安全性;自动纠错能在部分情况下降低风险,但并非总是有效。
研究问题:用户语音输入中的ASR错误,是否会导致具身AI模型产生不安全输出?
将预训练视频生成模型改造为几何估计器(GeoNeXt),把单目深度估计与表面法线估计创新性地表述为“下一帧预测”任务,以显著更少的标注数据实现零样本几何估计,并在多个基准上媲美训练数据多 100 倍以上的判别式方法。
现有的生成式几何估计方法大多基于预训练图像扩散模型,将任务视为图像条件生成。这类方法通常有两种路线:
CE-MoE 通过将专家层集中到少数路由 MoE 层、同时增加额外 token-mixing 层与稠密 FFN 层来保持深度,在匹配总参数和激活参数的条件下,相比常规 full-MoE 模型降低了训练成本;在 31.5B 规模下,GPU 小时使用减少 33.3%,并提高了平均下游得分和推理吞吐量。
研究问题:使用专家并行(expert parallelism)训练混合专家(Mixture-of-Experts, MoE)语言模型时,all-to-all 的 token 分发与合并集合通信可能占用端到端训练时间的很大一部分。 该工作提出通信高效的 MoE 模型(CE-MoE),采用异构层模式,将 token-mixing 的深度与 channel-mi…
Texture Image Classification Using DWT AlexNet Feature Fusion and Deep Neural Networks
在基于人设的对话生成中,训练阶段的传记可见性比推理阶段更能决定模型是表达人设特质还是退而复制传记文本;非对称披露下(只有对话者能看到目标说话者传记),目标内容更容易泄漏到对话者话轮中,且这类痕迹可被大语言模型评判者识别。
基于人设的对话系统通常以说话者传记为条件,但对话至少涉及两个参与者,谁能看到谁的传记在训练、推理和评估阶段可能各不相同。以往研究往往忽略这些阶段差异,很大程度上把传记可见性当作单一因素,遮蔽了只有在训练、推理、评估三阶段分别切换可见性时才会显现的机制。本文针对这一三阶段分解进行系统性研究,使用与说话者传记配对的对话数据集,改变目标说话者和对话者在训练与推理…
SignRR 提出“检索-精炼”(retrieve-and-refine)的新范式:先从真实手语片段库中检索动作来初始化姿态序列,再用部位感知的残差 VQ-VAE 对整段序列进行精炼,从而在保留真实手部细节的同时获得全局连贯的手语动作;实验在 PHOENIX14T 和 CSL-Daily 上取得领先的反向翻译性能。
手语生成(Sign Language Production, SLP)旨在从口语/文本生成连续的手语动作,常见路线是 gloss-to-pose(从注释到姿态)生成。既有工作主要有两条范式: **生成式模型**:从学习到的先验或噪声中合成动作,不参考真实手语实例,导致罕见手型与特定手语者的动作风格难以保持。 **检索式方法**:复用真实且动作良好的片段,但…
Real-time virtual circuits for plasma shape control via neural network emulators: experimental demonstration on MAST Upgrade