国内首部上星AI长剧《后西游记》由芒果灵创制作,100%由Seedance 2.0与2.5提供技术支持,从备案到播出仅4个月,成为“广电21条”后首部“边制作、边审核、边播出”的剧集,并带动芒果超媒涨停。
《后西游记》在芒果TV上线并登陆湖南卫视黄金档。全剧共30集,首季播出5集、每集40分钟。上线不到1小时,播放量达206.4万次。该剧被行业速递称为“国内首部上星AI长剧”。
国内首部上星AI长剧《后西游记》由芒果灵创制作,100%由Seedance 2.0与2.5提供技术支持,从备案到播出仅4个月,成为“广电21条”后首部“边制作、边审核、边播出”的剧集,并带动芒果超媒涨停。
《后西游记》在芒果TV上线并登陆湖南卫视黄金档。全剧共30集,首季播出5集、每集40分钟。上线不到1小时,播放量达206.4万次。该剧被行业速递称为“国内首部上星AI长剧”。
事件:a16z宣布成立11亿美元“机器时代基金”,投向芯片、内存、网络、存储、数据中心、机器人与家用AI设备等物理层基础设施。 投资命题:AI需求是否已超出当前供应链承载能力?数据中心算力密度和功耗快速上升后,硬件投资是否必须从平缓增长切换为翻倍级增长? 背景数据:Rubin机架算力密度为H100的28倍,单机架功耗升至100至250千瓦;软件端估值拥挤且…
MiniMax与fal联合推出的H3 Max模型,生成一段5秒768p视频耗时不到3秒,速度快于视频播放时间;该能力催生了全程AI实时生成直播间、“AI版抖音”等新应用,为AI视频从“生成后等待”走向“实时生成”提供了一条商业化路径案例。
2026年9月1日,量子位报道称,MiniMax上线了视频生成模型H3 Max。该模型基于MiniMax在7月底开源的H3模型,由MiniMax与AI推理基础设施公司fal联合开发,核心方向是针对实时生成场景进行后训练和推理优化,从而大幅提升生成速度。报道提到,已有开发者在直播平台和网页上基于H3 Max搭建出实时生成视频的直播间和短视频应用。
OpenAI为训练可自主操作电脑的智能体,已采购数万台Mac mini与Mac Studio用于强化学习;苹果上季度Mac营收达103亿美元、同比增长近29%,高配机型已断货数月。
据腾讯研究院AI速递(2026年9月1日)报道,OpenAI已购入数以万计Mac mini与Mac Studio,专用于强化学习,目标是训练可自主操作电脑的智能体。Anthropic也通过AWS租用Mac。报道还提到,高配机型已断货数月,英伟达DGX Spark构成正面竞争;苹果缺少面向企业的工程与开发者关系团队,只能借助Mount Thor等合作伙伴切入。
吴恩达认为,AI能承担程序员岗位中30%至40%的任务,人类负责的另外60%反而更有价值;开发者需要从“能写代码”转向“判断做什么”,并把隐性业务上下文转化为对Agent的约束,否则按旧方式写代码将处于危险之中。
该内容来自“腾讯研究院AI速递 20260901”中的报告观点。吴恩达提出,AI可承担岗位中30%-40%的任务,优秀工程师并未变闲,代码评审、联调与事故处理等压力更早地压到团队;AI帮助前后端边界变薄,开发者向全栈扩展。
Lovart 发布灵感采集 Chrome 插件,并上线 100 多个专业 Skill,由 Agent 自动拆解设计任务,覆盖情绪板生成到品牌套件与海报;新版已面向所有用户开放,且国内可直接访问。
根据腾讯研究院AI速递 20260901 的报道,Lovart 完成一次重要产品升级:推出灵感采集 Chrome 插件,同时上线 100 多个专业 Skill,将设计工作流规则与交付标准封装为可复用能力。新版还支持动态海报、一键位图转 SVG 矢量与网页生成,PPT 可封装成在线 HTML,面向所有用户开放,国内可直接访问。
OpenAI 发布文章,提出 AI 原生公司通过 AI 代理(agents)将工作流转化为可复用的运营能力,并以 Basis、Clay 和 Exa Labs 为例,展示其在入职、客户管理和开发者集成等场景中的应用。由于正文未能抓取,具体论述和结论细节待核实。
该文章主题为“agent”,讨论 AI 原生企业如何围绕工作流构建运营能力。根据候选摘要,文中重点介绍了几家公司的实践,但完整的研究问题、论述框架和具体案例细节待核实。
DeepSeek正式开源其V4系列首个实验性多模态模型DeepSeek-V4-Flash-Vision-Exp;该模型在真实软件工程测试DeepSWE上以59.3%反超Opus-4.8登顶第一,但在部分其他基准上仍落后约10%。
腾讯研究院AI速递(2026-09-01)报道,DeepSeek开源了V4系列首个实验性多模态模型DeepSeek-V4-Flash-Vision-Exp。该模型基于V4-Flash架构,集成视觉模块后持续训练而成;V4系列一个月内更新6次,Harness开发者预览版同步开源迭代。
通过逐层轻量探测发现,自监督视频基础模型 V-JEPA 2 与 VideoMAE-v2 在约 60–70% 网络深度处能高精度地解码“相机运动”(ROC AUC > 90),异常检测达到中等水平(ROC AUC > 60),但对直观物理任务接近随机水平;同时,单个视频的时间特征在表征空间中形成平滑的低维轨迹,基于该几何结构可用样条引导生成比线性插值更平滑、…
自监督视频基础模型能够学习丰富的时空表征,但学界仍不清楚: 这些表征究竟编码了哪些视觉概念(what); 它们出现在 Transformer 的哪些层(where); 它们在表征空间中如何被几何组织(how)。
本文研究在“最多只能使用指定数量特征”的硬性约束下,如何为特征型报童问题挑选协变量,以在库存决策中平衡持有成本与缺货成本。作者提出带 ℓ2 正则化的 ℓ0 约束报童经验风险模型,并配套精确求解、随机化近似算法与统计误差分析;实验表明,该框架能用明显更少的协变量取得有竞争力的样本外运营成本。
Variable Selection for Feature-Based Newsvendor
统一多模态模型(UMM)把视觉理解与生成放进同一个模型,并不等于两者会自动产生学习协同;只有在表示、任务和系统层面做好适当专门化、共享任务知识与端到端优化,才能把“功能共存”真正转化为“协同增益”。
论文研究的是:在同一个多模态模型中,视觉理解与视觉生成两类目标之间的关系究竟是相互促进、相互竞争容量,还是只是“井水不犯河水”地共存?作者在没有预训练视觉先验的受控原生统一设置下,从表示、任务、系统三个层面系统探究这一问题。
UI-VISA 将 U-Net 的血管前景预测作为种子点,交给 CNN 引导的区域生长算法迭代细化分割,从而在 DSA 血管分割中取得比单独 U-Net 和既有区域生长方法 VISA 更高的平均 Dice 与 clDice;其中连通性指标 clDice 的提升具有统计学显著性(p=0.023),而 Dice 的提升未达显著(p=0.104)。具体数值待核实。
本文针对数字减影血管造影(DSA)图像中血管结构分割的难点:血管细长、弯曲且分支复杂。像素级深度学习模型(如 U-Net)虽然通用分割性能强,但往往在细小血管区域产生碎片化或不连续的预测,因为没有显式建模结构连通性;区域生长算法能保持空间上下文与拓扑连续性,却又高度依赖种子点初始化,且可能计算开销高。论文据此提出混合架构 UI-VISA。
在给定的额外精度预算下,把预算“全局”用于更细的量化粒度,普遍优于“局部”修复最可恢复的层;量化损伤的位置无法由任务电路、计算位置或权重统计等廉价信号可靠预测,必须用因果干预来检验。
论文研究大语言模型(LLM)在后训练量化(PTQ)中精度损失的位置,以及当只有少量额外精度预算时,应该如何分配这些预算:是集中修复某些关键层,还是均匀地提高全局量化粒度?
自然语言正成为改进语言智能体的主要反馈通道;作者将这一范式称为“Verbal Reinforcement Learning (VRL)”,并主张按“语言反馈在智能体生命周期中何时生效、修改什么”来统一理解已有工作。
这篇 arXiv 论文声称提供 VRL 的“第一个统一描述”。研究问题是:如何将各种利用自然语言反馈改进语言智能体的方法放进同一个分类框架?作者给出的答案是:以反馈的生效时机与修改对象为统一分类轴,并由此提炼出三大支柱。
StudentSim 提出了一种把每个学生稀疏的真实作答数据转化为个性化“学生模拟器”的训练框架;模拟器既能复现学生的水平,也能在得到教师指导后像该学生一样更新作答,在象棋、二语英语写作和数学三个领域中均优于 GPT-5.4。
个性化 AI 教师需要根据学生的优势、弱点和偏好的指导方式调整教学,但关于“哪种指导对哪个学生有效”的证据很难从真实学习者身上大规模、低成本地获取。作者认为,学生模拟器可以作为这种证据的代理信号。已有方法存在两类不足:
2026年9月1日,《自然·机器智能》(Nature Machine Intelligence)在线发表 Changde Du 与 Huiguang He 撰写的“新闻与观点”(News & Views)评论文章。该文认为,表征对齐(representational alignment)不仅能揭示人脑活动与语言模型之间的相似性,最新工作还表明它可以进一步“…
本条是一篇期刊评论文章(News & Views),不是原始研究报告;主题标签为 Machine learning 与 Neural encoding,页面同时标注 “NeuroAI”。 评论所聚焦的问题:表征对齐能否从一种“被动”的比较工具,发展为一种“主动”的学习引导信号? 文章英文标题为 *Steering machine reasoning wit…
SpatialGuard 提出一种以“可编辑3D布局”为中心的文本到图像生成框架,把复杂3D空间关系的保持从隐式提示跟随变成“规划→生成→校验→修复”的可验证闭环,并在复杂3D空间布局生成上达到 state-of-the-art。
复杂3D空间文本到图像生成要求模型把自然语言转换为稳定的视觉几何关系,而不只是语义外观。现有提示驱动或布局条件方法虽然改善了可控性,但在视觉采样前缺少一个可优化、可验证的空间中间表示,因此多轮生成中物体关系、遮挡、可见性和相机约束可能退化或漂移。
本文提出一种用于持久图(persistence diagrams)的快速距离——谢尔宾斯基-克诺普 Wasserstein 距离(\(d_{\mathrm{SK}}\)),通过 Sierpiński-Knopp 空间填充曲线将二维匹配转化为一维最优分配,以 \(O(N\log N)\) 复杂度逼近经典 2-Wasserstein 距离,并支持 Hilber…
持久同调产生的持久图是比较拓扑特征的重要工具,但经典 Wasserstein 距离的计算成本较高,限制了在大规模数据与机器学习流程中的使用。本文针对 2-Wasserstein 距离提出更快的替代度量 \(d_{\mathrm{SK}}\),并研究其与精确 \(W_2\) 的理论关系及下游聚类、分割等应用表现。本卡片依据 arXiv 元数据及摘要生成;原始…
Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers
SDARE-Bench 是论文作者所称的首个基于场景的、同时评估大语言模型在对话中进行“污名检测”和“开放式回应生成”的基准。基于 8 个大语言模型的实验结果显示,模型在群体对话中对污名成分的识别普遍较差;在构造的群体压力情境中,污名表达率平均达到 97.5%,提示污名回应是大语言模型安全性中反复出现的一个漏洞。
大语言模型越来越多地被用于建议寻求和决策场景,可能影响社会判断与偏见传播。 污名对个人和社区有深远影响,但针对污名的基准仍然稀缺。 已有通用评估多依赖静态提示和固定格式任务,忽略了真实对话中的上下文和“受众效应”。 本基准的研究问题是:在双人对话与群体对话中,大语言模型能否识别污名成分?模型生成的开放式回应是会抵制污名,还是可能强化污名?群体压力和社交复杂…