只需训练一次,即可生成3D新场景!谷歌「光场神经渲染」进化史

视图合成(view synthesis)是计算机视觉和计算机图形学交叉领域的一个重点难题,指的是从一个场景的多张图片中创建该场景的新视图。

要准确地合成一个场景的新视图,一个模型需要从一小部分参考图片中捕捉多种类型的信息,比如详细的三维结构、材料和光照等。

自2020年研究人员提出神经辐射场(NeRF)模型以来,这个问题也受到了越来越多的关注,大大推动了新视图合成的性能。

图片

其中一个超级大玩家就是Google,在NeRF领域也发表了诸多论文,本文将为大家介绍两篇Google发表在CVPR 2022和ECCV 2022上的论文,讲述光场神经渲染模型的进化。

第一篇论文提出一个基于Transformer的两阶段模型来学习组合参考像素颜色,首先获得沿对极线(epipolar lines)的特征,然后获得沿参考视图的特征以产生目标射线的颜色,极大提升了视图重现的准确率。

图片

论文链接:​https://arxiv.org/pdf/2112.09687.pdf​

经典光场渲染(Light Field Rendering)可以准确地再现与视图有关的效应,如反射、折射和半透明,但需要对场景进行密集的视图采样。基于几何重建的方法只需要稀疏的视图,但不能准确地模拟non-Lambertian效应,即非理想散射。

图片

文中提出的新模型结合了这两个方向的优势并缓解了其局限性,通过对光场的四维表示进行操作,模型可以学会准确地表示与视图有关的效应。通过在训练和推理过程中强制执行几何约束,场景几何被隐含地从一组稀疏的视图中学习。

图片

该模型在多个正向和360°数据集上的表现优于最先进的模型,并且在具有严重的视线依赖性变化的场景上有较大的余地。

另一篇论文通过使用具有规范化(canonicalized)位置编码的Transformer序列来解决合成未见过的场景的泛化性问题。模型在一组场景上训练后就可以用来合成新场景的视图。

图片

论文链接:​https://arxiv.org/pdf/2207.10662.pdf​

文中提出了一个不同的范式,不需要深度特征和类似NeRF的体积渲染,该方法只需从场景中取样patch集合就能直接预测新场景中目标射线的颜色。

首先利用对极几何学,沿着每个参考视图的对极线提取patch,并将每个patch都线性地投射到一个一维特征向量中,然后由一系列的Transformer处理这个集合。

对于位置编码,研究人员采用和光场表示方法类似的方式对射线进行参数化,区别在于坐标是相对于目标射线的规范化,也使得该方法独立于参考框架并提高了通用性。

图片

模型的创新点在于,它是进行基于图像的渲染,结合参考图像的颜色和特征来渲染新的视图,而且纯粹是基于Transformer的,在图像patch集上操作。并且它们利用4D光场表示来进行位置编码,有助于模拟与视图相关的效果。

最后实验结果表明,该方法在未见过的场景的新视图合成方面优于其他方法,即使在用比少得多的数据进行训练时也是如此。

光场神经渲染

模型的输入包括一组参考图像、相应的相机参数(焦距、位置和空间方向),以及用户想要确定其颜色的目标射线的坐标。

为了生成一个新的图像,我们需要从输入图像的相机参数开始,先获得目标射线的坐标(每一个都对应一个像素),并为每一个坐标进行模型查询。

研究人员的解决方法是,不完全处理每张参考图像,而只看可能影响目标像素的区域。这些区域可以通过对极几何学确定,将每个目标像素映射到每个参考框架上的一条线。

为了稳妥起见,需要在对极线上的一些点周围选取小区域,从而形成将被模型实际处理的patch集合,然后将Transformer作用于这组patch上以获得目标像素的颜色。

图片

Transformer在这种情况下特别有用,因为其中的自注意力机制可以自然地将patch集合作为输入,注意力权重本身就可以用来结合参考视图颜色和特征来预测输出像素的颜色。

在光场神经渲染(LFNR)中,研究人员使用两个Transformer序列将patch集合映射到目标像素颜色。

第一个Transformer沿着每条对极线聚合信息,第二个Transformer沿着每张参考图像聚合信息。

这种方法可以把第一个Transformer解释为在每个参考帧上寻找目标像素的潜在对应关系,而第二个Transformer则是对遮挡和视线依赖效应的推理,这也是基于图像的渲染的常见难题。

图片

LFNR在最流行的视图合成基准(NeRF的Blender和Real Forward-Facing场景以及NeX的Shiny)上相比sota模型在峰值信噪比(PSNR)的提升幅度高达5dB,相当于将像素级的误差减少了1.8倍。

LFNR可以重现一些NeX/Shiny数据集中比较难的视线依赖性效果,比如CD上的彩虹和反射,瓶子上的反射、折射和半透明。

图片

与之前的方法如NeX和NeRF相比,它们就没办法重现与视线相关的效果,如NeX/Shiny数据集中的实验室场景中的试管的半透明性和折射率。

图片

一次训练,泛化新场景

但LFNR也有局限性。

第一个Transformer对每个参考图像独立地沿每条对极线折叠信息,这也意味着模型只能根据每个参考图像的输出射线坐标和patch来决定要保留哪些信息,这在单一场景的训练中效果很好(和大多数神经渲染方法一样),但它无法泛化到不同场景中。

可通用的模型很重要,因为可以直接应用于新的场景而不需要重新训练。

研究人员提出可通用的基于patch的神经渲染(GPNR)模型解决了LFNR的这个缺陷。

图片

通过在模型中增加一个Transfomre,使其在其他两个Transformer之前运行,并在所有参考图像的相同深度的点之间交换信息。

图片

GPNR由三个Transformer序列组成,这些Transformer将沿对极线提取的一组patch映射为像素颜色。图像patch通过线性投影层被映射到初始特征,然后这些特征被模型连续细化和聚合,最终形成特征和颜色。

举个例子,第一个Transformer从「公园长椅」上提取出patch序列后,新模型可以使用在两个视图中出现在相应深度的「花」这样的线索,表明存在潜在的匹配。

图片

这项工作的另一个关键idea就是根据目标射线将位置编码规范化,因为想要在不同的场景中进行泛化,就必须以相对而非绝对的参照系来表示quantities

为了评估模型的泛化性能,研究人员在一组场景上训练GPNR,并在新场景上进行测试。

GPNR在几个基准(遵照IBRNet和MVSNeRF协议)上平均提高了0.5-1.0 dB,尤其是在IBRNet基准上,GPNR 在只使用11%的训练场景的情况下,就超过了基线模型。

图片

GPNR在NeX/Shiny和LLFF的保持场景上生成的视图细节,没有进行任何微调。与IBRNet相比,GPNR可以更准确地再现叶片上的细节和通过镜头的折射。

图片

以上就是只需训练一次,即可生成3D新场景!谷歌「光场神经渲染」进化史的详细内容,更多请关注【创想鸟】其它相关文章!

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至253000106@qq.com举报,一经查实,本站将立刻删除。

发布者:PHP中文网,转转请注明出处:https://www.chuangxiangniao.com/p/1660760.html

(0)
上一篇 2025年2月18日 20:47:50
下一篇 2025年2月18日 20:48:12

AD推荐 黄金广告位招租... 更多推荐

相关推荐

  • Photoshop利用图层样式绘制电影中逼真的3D机器人EVA

    本文小编姜维大家带来如何使用Photoshop绘制电影中的3D机器人EVA,教程有些复杂,喜欢的朋友可以一起来学习实现目标的方法有很多种,但掌握原理什么的最重要了。因为只要掌握了原理,我们甚至就可以画出更为复杂的效果。最终效果 EVA的故事…

    2025年3月12日 编程技术
    200
  • 用PS制作CC 3D立体图的方法教程

    本文教大家如何用ps制作出3d立体图 张帅PHOTOSHOP CC 3D教程-第一部分

    2025年3月12日 编程技术
    200
  • PS制作旋转的3D立方体gif动画教程

    本教程是向【创想鸟】介绍利用ps制作旋转的3d立方体gif动画方法,教程最终制作出来的效果真的非常漂亮,难度不是很大,但很实用,推荐过来【创想鸟】,喜欢的朋友一起跟着教程来学习吧 这篇教程是向大家介绍利用PS制作旋转的3D立方体gif动画方…

    2025年3月12日 编程技术
    200
  • PhotoShop打造超具想象力的3D生态系统海报

    国外牛人超具想象力的3d生态系统海报制作过程。作者没有写任何详细的文字步骤,只上传了每个阶段的图片。  然后真要论详细的话还得自己去慢慢琢磨!  先看最终效果:   演变过程:   这2张的步骤有点太快,原作者怎么就不慢点呢!!!   最终…

    2025年3月12日 编程技术
    200
  • Photoshop创建3D立体效果的无缝拼贴图案

    本教程是向大家介绍如何利用photoshop创建3d立体效果的无缝拼贴图案,创建方法很简单,只要大家学会这种方法,掌握创建思路,灵活运用并加以创新,就可以根据自己的想法,创建一些简单的、有趣的图案 本教程是向大家介绍如何利用photosho…

    2025年3月12日 编程技术
    200
  • PS中的3D字体实现(超简易)

    由于工作原因,最近小编一直在找图的路上很是疲惫,一直想学ps自己做图,可又是懒癌晚期,这不,让我遇见了ps cs6,很好用,推荐给大家。下文就是小编用ps做的立体字的过程,赶紧学习一下吧! 第一步:我先找了一张美丽的风景图片,用Photos…

    2025年3月12日 编程技术
    200
  • ps3d模式怎么退出

    想了解更多关于ps的教程,可以点击:PS教程 ps退出3d模式步骤如下: 1、在当前的3D模式窗口中,点击窗口上方的【视图】。 2、在视图的下拉菜单中,点击【显示额外内容】,将其前面的√去掉即可退出ps的3d模式。 3、我们也可以点击当前3…

    2025年3月12日 编程技术
    200
  • 教你一招实现3D图片演示

    本篇文章给大家详细介绍一下制作3d图片的方法。有一定的参考价值,有需要的朋友可以参考一下,希望对大家有所帮助。 1、创建一个父容器,将所有照片叠放在一起 代码如下(html): <!– –> 3D Tiktok Carous…

    2025年3月11日 编程技术
    200
  • 多视角3D逼真HTML5水波动画 _html5教程技巧

    这是一款基于html5的3d水波动画特效,它的效果非常逼真,我们可以按“g”键来让水池中的石头上下浮动,按“l”键添加灯光效果,设计相当完美。同时说明一下,这款3d水波动画是基于webgl渲染技术的,大家可以了解一下webgl。 在线预览 …

    2025年3月11日
    200
  • HTML5 3D衣服摇摆动画特效_html5教程技巧

    这又是一款基于html5 canvas的3d动画杰作,它是一个可以随风飘动的3d衣服摇摆动画特效,非常逼真。当我们将鼠标滑过衣服时,衣服将会出现摇摆的动画,点击鼠标时,衣服将会更加剧烈地摆动。 在线演示  源码下载 HTML代码 XML/H…

    2025年3月11日
    200

发表回复

登录后才能评论