知识卡片:ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion
一句话结论
ATSplat 通过引入自适应 3D 令牌(Adaptive 3D Tokens)和令牌级不确定性驱动的扩展机制,在保持前馈式 3D 高斯泼溅(3DGS)实时渲染速度的同时,将高斯数量减少 5.7 倍以上,达到与优化式方法相媲美的渲染质量。
事件概述或研究问题
现有前馈式 3DGS 方法大多将高斯回归在输入像素上并沿相机射线提升,导致图元数量与图像分辨率和输入视角数量强相关,而非场景复杂度。这造成了大量冗余高斯,浪费计算和存储资源。ATSplat 旨在恢复 3DGS 优化中场景自适应容量分配的能力,使前馈方法也能将高斯集中在重建困难区域。
方法/产品要点
- 稀疏骨架构建:从输入图像中提取粗略的块级深度和相机线索,提升为稀疏的 3D 锚点令牌(anchor tokens),形成场景的紧凑骨架。
- 可学习偏移解耦:每个锚点令牌通过可学习的 3D 偏移回归出局部高斯,使图元放置不再依赖输入图像网格。
- 自适应令牌扩展:一个预测模块输出每个令牌的不确定性分数,由渲染误差图监督,对高不确定性令牌通过可学习扩展层选择性增密,形成稀疏到自适应的流程。
- 任意分辨率输入:图元数量不再被图像尺寸或视角数量锁定,而是根据场景需求动态分配。
主要结果或产业意义
- 在 RealEstate10K 和 DL3DV 数据集上达到当前最佳的渲染质量(PSNR/SSIM/LPIPS)。
- 与密集像素对齐的前馈 3DGS 方法相比,高斯数量减少 5.7 倍以上。
- 输入 12 张 512×960 图像时,单张商用 GPU 上重建耗时 <1 秒,渲染速度达 1136 FPS(512×960 分辨率),仅使用 311K 个高斯。
- 极低的显存占用和高帧率使其适合移动端或实时交互应用。
为什么重要
- 首次在前馈式 3DGS 中实现了与优化式方法类似的场景自适应容量分配,解决了像素对齐范式固有的冗余问题。
- 与已有的 WildSplat(面向无位姿野外图像)不同,ATSplat 聚焦于有标定输入下的高效紧凑表示,在渲染速度和模型大小上显著优于同类前馈方法。
- 为将 3DGS 部署到资源受限设备(如手机、AR/VR 头显)提供了可行的紧凑方案。
局限与不确定性
- 方法依赖于粗略的深度和相机线索输入,对于无位姿或深度不可靠的场景,性能有待验证(待核实)。
- 当前实验仅在两个合成/标定较完备的数据集上进行,在真实复杂光照或遮挡场景下的泛化能力未在摘要中说明(待核实)。
- 自适应扩展模块的额外推理开销未与基线方法进行端到端延迟对比(待核实)。
可用于图书/PPT/简报的角度
- 从“自适应的稀疏性”入手,类比于注意力机制中的稀疏注意力,展示如何用极少图元表达精细场景。
- 对比传统像素对齐前馈 3DGS 与 ATSplat 的图元分布图(想象中应显示后者在纹理丰富边缘集中更多高斯)。
- 在“实时 3D 重建与渲染”专题中作为紧凑高效的典型案例。
原始材料
- 英文标题:ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion
- 英文关键词:Feed-forward 3D Gaussian Splatting, Adaptive Token Expansion, Novel-view Synthesis, Compact Representation.
- 来源:arXiv:2607.20417v1,https://arxiv.org/abs/2607.20417v1