文章转自“京东零售技术”公众号
Oxygen XR产品研发团队联合清华大学一起提出了 DirectFisheye-GS 框架,创新性地将鱼眼模型原生嵌入到3D高斯泼溅管线中,实现了对鱼眼图像的直接、无损处理。此外,该框架引入了跨视角联合优化策略,有效解决了单视角随机优化引起的高斯形状畸变及视角间几何/光度不一致问题。实验表明,该方法在多个公开数据集上达到或超越了现有最优性能(SOTA),并能无缝兼容现有3DGS工具链,实现了渲染效率与重建质量的深度兼顾。
Oxygen是京东零售产研对外发布的电商创新AI架构体系:以Joy AI大模型为底座,构建系统能力与多元智能体,赋能购物、供应链等电商场景,呈现AI技术在京东零售业务中的整体应用布局。
基于本工作的论文已被 CVPR 26 接收,欢迎阅读交流。
· 链接:https://arxiv.org/abs/2604.00648
· 论文:DirectFisheye-GS: Enabling Native Fisheye Input in Gaussian Splatting with Cross-View Joint Optimization
序言
在电影《星际穿越》的末尾,男主角库珀进入了一个由未来人类构建的超立方体(Tesseract)。在这个奇点空间内,时间不再是流逝的箭头,而是一个可观测、可触碰的几何维度。库珀可以像翻阅书架一样,在女儿墨菲房间的每一个时间节点间自由穿梭,从不同视角观察那些被遗忘的瞬间。
这种对“时空完整留存”的极致想象,正是人类信息记录技术的终极目标。我们已经经历了从平面照片(2D)到动态视频(2.5D)的跨越,现在正站在三维场景采集(3D)向全时空数字重构(4D)进化的奇点上。面对人类留住更多信息的本能渴望,那有没有一种方案,能够让我们记录完整的时间和空间,轻松获得像游戏一样自由探索的体验并且保留真实世界的真实感,答案就在今天将要介绍的文章中。
技术背景
在AI技术飞速发展的今天,高斯泼溅(Gaussian Splatting)技术的出现,使得《星际穿越》中“超立方体”所描绘的、能够完整记录并回溯时空片段的愿景,正从科幻走向现实。这项技术通过将三维场景分解为成千上万个可定向、可缩放的3D高斯椭球,实现了对复杂场景的高效、高保真重建。从静态的3D场景到动态的4D时空序列,其重建效果在视觉真实感与细节丰富度上取得了突破性进展。具体来说,高斯泼溅的技术架构与算法流程如下所示,

• 初始化阶段(Initialization):这个过程通常从稀疏的输入数据开始,例如多视角图像。系统会为每个点创建一个初始的3D高斯椭球,每个椭球由七个核心参数定义:三维空间中的中心位置、三维协方差矩阵(决定椭球的形状、大小和方向)、以及一个代表颜色的RGB值。这些初始参数为后续的优化提供了起点。
• 渲染与可微分计算 (Differentiable Tile Rasterizer):在训练过程中,这些高斯椭球会被“泼溅”到屏幕上,通过一个可微分的渲染管线生成2D图像。这个渲染过程模拟了光线与高斯椭球的交互,最终输出一幅与真实照片类似的图像。关键在于,这个渲染过程是完全可微的,这意味着我们可以计算渲染结果与Ground Truth之间的差异Loss。
• 参数优化(Optimization):通过反向传播算法,将渲染图像的损失值反向传递回网络,从而更新每一个高斯椭球的七个参数。这个过程会不断迭代,使得渲染出的图像越来越接近真实输入,从而让3D高斯模型精确地拟合原始场景的几何结构与外观。
• 自适应密度控制(Adaptive Density Control):在训练的中后期,系统会引入一个关键的自适应机制。每隔一定次数的迭代,算法会评估每个高斯椭球的“重要性”。对于在训练中贡献显著、信息量丰富的高斯,系统会通过增加其数量(分裂)来提升局部细节的密度;而对于贡献微弱、冗余的高斯,则会被剪枝移除。这一步骤确保了模型在保持高效的同时,能够动态地聚焦于场景中重要的区域,最终得到一个既精确又紧凑的3D高斯表示。

论文解读
传统的高斯泼溅算法多依赖针孔相机模型采集的多视角图片作为输入,这导致重建过程面临视场局限,需要大量图像才能完整覆盖场景。相比之下,鱼眼相机凭借其超宽视场优势,能有效减少重建所需的图像数量,但现有方案通常依赖于去畸变预处理,易导致信息丢失、细节模糊及漂浮伪影。
为此我们Oxygen XR产品研发团队联合清华大学一起提出了DirectFisheye-GS框架,它创新性地将鱼眼模型原生嵌入到3D高斯泼溅管线中,实现了对鱼眼图像的直接、无损处理。此外,该框架引入了跨视角联合优化策略,有效解决了单视角随机优化引起的高斯形状畸变及视角间几何/光度不一致问题。实验表明,该方法在多个公开数据集上达到或超越了现有最优性能(SOTA),并能无缝兼容现有3DGS工具链,实现了渲染效率与重建质量的深度兼顾。

论文的创新点主要包括可微鱼眼投影模型与跨视角联合优化:传统鱼眼相机模型(如等距投影)因采用单一数学公式,难以准确表征现代复合光学系统的复杂非线性畸变,通用性差且建模精度受限。为此,研究团队将基于泰勒展开的多项式扩展方法嵌入3DGS渲染框架,通过四个畸变参数构建了通用化投影模型。该模型通过多项式系数灵活适配不同镜头的畸变特性,相比传统模型具有更高的参数自由度,显著提升了复杂光学系统的建模精度。同时,团队推导了该模型下的投影雅可比矩阵,实现了3D高斯到鱼眼图像的可微投影,保证了端到端的可微性。这一设计无需对鱼眼图像进行去畸变预处理,从根本上避免了信息损失与细节模糊问题。此外,跨视角联合优化策略通过同步优化所有视角下的高斯参数,有效抑制了单视角优化可能引发的形状畸变,并确保了多视角间几何与光度的一致性,从而在保持高重建质量的同时,进一步提升了算法的鲁棒性与效率。

为全面验证方法有效性,我们在单张 NVIDIA A100 80GB 显卡上完成所有实验,选取 FisheyeNeRF、ScanNet++、Den-SOFT 三类涵盖小尺度物体、中尺度室内、大尺度实景的公开数据集,以原始 3DGS、Fisheye-GS、3DGUT、Self-Cali-GS 为对比基线,采用新视角合成领域通用的 PSNR、SSIM、LPIPS 三项指标开展定量评估。实验结果表明,DirectFisheye-GS 在所有数据集的训练视角与测试视角上,均达到或超越当前最优性能,在鱼眼图像边缘畸变超过 60° 视场的区域,PSNR 指标相较 3DGUT 提升更为显著;定性结果显示,该方法有效消除了边缘马赛克伪影、纹理模糊、漂浮高斯等问题,细节保留度与跨视角光照一致性大幅优于现有方案。

技术应用
在高斯泼溅技术快速发展的背景下,我们Oxygen XR产品研发团队联合清华大学、华为等机构,持续推进3D与4D高斯重建的技术创新与业务应用探索。具体而言,我们通过3D高斯重建技术实现商品、空间场景的数字化,并尝试虚实结合的3D直播应用;同时,将传统2D直播带货短视频升级为4D体积视频,为C端用户提供更具交互性与沉浸感的体验。
总结展望
高斯溅射技术的崛起正引领一场从“记录影像”到“封存时空”的感官革命,它以近乎极致的真实感精准复刻流转的时间与凝固的空间。在电商及商业零售场景下,3D静态重建技术正深度重塑交互与决策逻辑,通过毫米级的商品细节复刻与数字化展示,显著提升购物真实感并驱动沉浸式消费升级;而在内容与短视频场景下,依托于日益强大的端侧NPU性能与AI算法优化,智能手机将进化为捕捉生命底色的记忆容器,使家庭团聚、孩子成长、旅途盛景、热恋瞬间等悲欢离合不再随现实褪色,而是被完整留存在可重入、可交互的4D数字空间中,让我们在未来的光影重逢中,能以全新视角再次凝视那些定格的、确定的瞬间,赋予岁月跨越时空的生命意义。
然而,当前技术仍面临拍摄过程复杂(需多角度采集、布光要求高)与重建耗时较长(从采集到生成完整模型需数十分钟至数小时)等核心瓶颈,这在一定程度上制约了其大规模普及与实时应用。我们将持续探索与创新,随着端侧AI算力提升、算法效率优化以及硬件集成创新,有望实现一键式采集与秒级重建,最终让高保真时空重建技术真正融入更广阔的业务场景。
版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。