港科大联手华为诺亚方舟实验室:让3D场景重建计算量减少一半

发布时间:2026/7/29 1:23:12
港科大联手华为诺亚方舟实验室:让3D场景重建计算量减少一半 这项由香港科技大学与华为诺亚方舟实验室、香港城市大学联合开展的研究以预印本形式于2026年7月13日发布在arXiv平台论文编号为arXiv:2607.10995。研究成果命名为AsySplat聚焦于如何让计算机更高效地从一组照片中脑补出完整的三维场景。设想你手头有32张从不同角度拍摄的同一个房间的照片现在你希望让计算机根据这些照片生成出你站在任意其他角度时应该看到的画面——这就是所谓的新视角合成。这项技术在虚拟现实、数字孪生、影视制作、自动驾驶地图构建等领域都有广泛应用可以说是让计算机真正理解三维世界的一把关键钥匙。然而要让计算机做到这件事并不容易。主流的做法是把照片切成一小块一小块的图像碎片然后让神经网络反复处理这些碎片之间的关系推断出每一处场景的三维结构和外观。问题在于照片越清晰、数量越多这些碎片就越多计算量就会爆炸式增长。一张960P的高清照片已经包含大量细节32张叠加在一起计算机需要处理的信息量让很多现有方法望而却步。研究团队发现现有方法在这件事上存在严重的资源浪费——他们把有限的计算力平等地分配给了本不需要同等精力的两件事导致整个系统臃肿而低效。AsySplat的核心贡献就是找到了这种浪费的根源并提出了一套因材施教的解决方案。一、为什么现有方法在大材小用要理解AsySplat的创新先得明白它要解决的具体问题出在哪里。现有的主流方法包括AsySplat主要对标的LongLRM采用的是一种一刀切的处理方式把所有照片切成尽可能细小的图像碎片然后让网络层层叠加地处理所有碎片之间的关系。为了保留足够的画面细节碎片必须切得很小碎片越小数量就越多碎片越多处理它们之间关系的计算量就越大——这是个近乎无解的死循环。更关键的问题在于这套方法把所有的计算资源同等地投入到了两件性质截然不同的任务上一是弄清楚场景的三维结构也就是这里是墙、那里是桌子、东西离我多远这类几何信息二是决定每个位置的外观细节也就是这块墙是什么颜色、这张桌子的纹理是什么样的这类外观信息。把资源平等分配给这两件事听起来很公平但实际上是一种巨大的浪费因为这两件事的难度根本不在同一个水平线上。研究团队通过仔细观察发现了两个关键事实。第一个事实是三维重建要做得很精确并不是高质量渲染的必要条件。3D高斯泼溅技术的工作原理有点像用无数个彩色气泡填满空间最终的画面效果来自这些气泡叠加融合的结果而不是要求每个气泡都精确地贴在真实的物体表面上。就像一幅印象派画作近看是零散的色块远看却栩栩如生——只要气泡的位置和颜色大致对了渲染出来的新视角就足够逼真。这意味着在三维重建这一步我们不需要追求极致的精度够用就好。第二个事实是外观信息其实比几何信息容易处理得多。一旦我们大致知道了场景的三维结构要给每个位置涂上正确的颜色本质上只是一个对号入座的工作——把原始照片中对应位置的颜色信息搬过来就行不需要在不同视角的照片之间做复杂的比对和匹配。这就好比你已经拼出了一幅拼图的大致轮廓那么往上面涂颜色就是相对简单的工序了。正是这两个观察催生了AsySplat的核心设计理念既然两件事的难度不同、精度需求不同为什么要用同样的资源去处理它们二、不对称的智慧把对的钱花在对的地方AsySplat的解决方案可以用一个厨房的比喻来理解。假设你要准备一顿大餐厨房里有两位厨师一位负责处理食材切菜、备料、控制火候另一位负责最后的摆盘装饰。处理食材的工作复杂、费时需要有经验的主厨而摆盘虽然需要精细但有了好食材一个熟练的帮厨就能胜任。AsySplat做的事情就是把厨房资源合理分配给这两位厨师而不是让两个同等级别的大厨都去做同样繁重的工作。具体来说AsySplat将整个处理流程拆分成两条并行的流水线。第一条叫做几何分支专门负责推断三维结构。这条流水线使用较大的图像碎片——碎片大意味着每张照片被切成的块数少总碎片数量就少处理起来计算量大大降低。由于前面提到的第一个观察几何不需要极致精确用这种粗粒度的碎片来重建三维结构完全够用。但是由于多视角三维重建本身是件很难的事——需要在不同角度的照片之间找到对应关系就像把来自不同方向拍的照片中的同一个点对应起来——这个任务本身就需要强大的网络能力。因此AsySplat把模型中90%的参数都集中到了几何分支让这条流水线拥有最强的大脑来解决这个难题。第二条叫做外观分支专门负责推断颜色和纹理等外观信息。这条流水线使用较小的图像碎片——碎片小意味着能保留更多细节而高质量渲染确实需要这些细节。但正因为前面提到的第二个观察外观信息的推断只需要处理单张照片内部的信息不需要在不同视角之间做复杂匹配这条流水线不需要处理所有视角碎片之间的关系只在每张照片内部处理就够了。这让外观分支的计算量不会随着照片数量增加而爆炸。同时由于任务本身相对简单外观分支只需要全部参数的10%使用的网络也更轻量。两条流水线并非各自为政它们之间有三次双向交流的机会研究团队称之为双边连接模块。在每个处理阶段结束时几何分支会把当前推断出的深度信息传给外观分支告诉它这里的东西离我们有多远而外观分支则把细节信息传给几何分支帮助它更好地理解场景。这种双向信息交流的设计让两条流水线各取所长、互相补充。从整体结构来看几何分支经历三个层次递进的处理阶段网络的宽度也就是处理信息的通道数量在三个阶段中分别设置为192、512和896逐级增加以便在后期进行更精细的几何推断。外观分支同样经历三个阶段但通道数始终保持在256设计更为简洁均匀。最终两条流水线的输出通过一个简单的融合操作合并然后预测出每个位置的三维高斯参数完成整个场景的重建。三、一个让训练不那么痛苦的小发明即便有了不对称架构的帮助几何分支内部依然面临一个棘手的问题要做好跨视角的三维匹配就需要大量的注意力层一种能让每个图像碎片看到所有其他碎片的网络机制而注意力层的计算量随着碎片数量呈平方增长——碎片数翻倍计算量就要变成原来的四倍。研究团队最初的设计是在几何分支中混合使用两种机制一种叫做Mamba的高效序列处理工具计算量随碎片数量线性增长比注意力层友好得多以及前面提到的注意力层。但他们发现过度依赖Mamba会损害三维重建的质量。这并不奇怪——Mamba擅长处理有顺序关系的信息比如文字序列但三维匹配需要在空间上任意两点之间直接建立联系Mamba在这方面的能力不如注意力层直接。因此研究团队决定在几何分支中保留更多的注意力层。但这样做的代价是训练时间大幅增加。为了解决这个矛盾他们设计了一个稀疏注意力模块。这个模块的工作原理有点像一种聪明的抽样检查策略。假设你要检查一幅巨大的地图上所有地点之间的关联如果逐一检查每两个地点的关系工作量会大到无法完成。稀疏注意力模块的做法是先把地图划分成一个均匀的网格然后从每个网格中抽取一个代表点只检查这些代表点之间的关系。但在此之前先用卷积操作一种能汇聚局部信息的工具让每个代表点充分了解它周围邻居的情况这样每个代表点就不只是代表自己而是代表了它所在区域的综合信息。这个设计让需要进行注意力计算的序列长度大幅缩短训练时间因此显著减少。以最高分辨率的训练阶段为例这一模块让每次迭代的时间从10.5秒降到了6秒缩短了将近40%。同时由于卷积步骤确保了每个代表点携带了足够丰富的上下文信息这种精简并没有明显牺牲模型性能。四、实验结果数字背后的故事研究团队在多个数据集上对AsySplat进行了全面测试结果从多个维度展示了这套不对称架构的实际效果。在与传统优化方法也就是针对每个新场景从头花时间优化的方法的对比上AsySplat展现出了惊人的速度优势。传统的3D高斯泼溅方法需要对每个场景优化30000次迭代大约耗时13分钟才能得到PSNR图像质量指标数值越高越好约为23.6的结果。AsySplat只需不到1秒就能得到PSNR为24.0的结果——在速度上快了将近800倍质量上还略胜一筹。如果再给AsySplat10次快速的后优化整个过程只需18秒PSNR可以进一步提升到25.2超过了另一个精心设计的优化方法Scaffold-GS的24.8。与它最直接的竞争对手LongLRM相比AsySplat的表现更加全面而均衡。在训练效率上AsySplat的参数量从142M降到了98M减少了约30%在最高分辨率阶段的每次迭代时间从8.5秒缩短到6秒减少了约30%GPU内存占用从52G降到48G。累计整个训练过程AsySplat大约需要54小时而LongLRM需要76小时。在推理也就是实际使用时的效率上AsySplat的计算量从20.2万亿次浮点运算TFLOPs降到16.2万亿次GPU内存从26G降到22G预测出的高斯数量从800万个减少到400万个。高斯数量减少的意义在于后续的快速优化阶段变得更快——从LongLRM的50秒缩短到AsySplat的18秒快了将近两倍。在零样本泛化能力也就是在训练时从未见过的场景类型上的表现方面AsySplat表现出了明显的优势。在TanksTemples数据集上AsySplat在不做任何优化的情况下就全面优于LongLRM。在MipNeRF-360数据集上AsySplat的PSNR比LongLRM高出约0.7。在深度混合Deep Blending数据集上AsySplat在各项条件下均优于LongLRM其中在给定相同时间预算的条件下AsySplat的PSNR比LongLRM高出将近1.0。最为显著的差异出现在合成场景数据集Replica上在不做任何优化的情况下AsySplat的PSNR27.46就已经超过LongLRM做了10次优化后的结果28.37接近但要注意LongLRM优化了10次而AsySplat是0次而当两者都做10次优化时AsySplat30.83比LongLRM28.37高出了超过2.5个PSNR——这是一个相当显著的差距。研究团队还额外测试了AsySplat在稀疏视角场景下的表现——也就是只给两张照片来重建场景的极端情况。在RealEstate10K数据集的这项测试中AsySplat的PSNR28.27超过了参数量比它大三倍多的DepthSplat27.47354M参数和GS-LRM28.10300M参数再次印证了不对称架构带来的参数效率提升。五、拆解设计每个决策都有它的道理研究团队并没有满足于展示整体结果他们还做了大量细致的拆解实验逐一验证每个设计决策的必要性。这些实验在256×256的低分辨率下进行以节省时间但已经足以说明问题。关于最终如何把几何分支和外观分支的信息合并来预测三维高斯参数团队验证了两者都需要的结论。如果只用几何分支的粗粒度信息来预测PSNR会下降约0.7如果只用外观分支的细粒度信息由于缺乏来自几何分支的深度信息指导效果同样不理想。只有把两者融合才能达到最好的效果。关于双边连接模块中的双向信息交流实验表明两个方向的交叉注意力都不可或缺。单独去掉任何一个方向无论是几何到外观的方向还是外观到几何的方向都会导致性能下降。关于不对称设计本身的合理性研究团队设计了一个三方对比实验。第一种是单分支设计使用细粒度碎片处理所有信息包括几何和外观计算量最大6104 GFLOPs第二种是双分支设计但两个分支都使用相同的细粒度碎片pcpf8计算量依然较大5892 GFLOPs第三种是AsySplat的不对称双分支设计几何分支用粗粒度碎片pc16外观分支用细粒度碎片pf8计算量大幅降低2033 GFLOPs。从渲染质量来看三种设计的PSNR相同19.24、19.24、19.24但从几何精度来看双分支设计确实比不对称设计更精确AbsRel分别为0.44和0.55——这直接验证了研究的第一个核心观察更高的几何精度并不带来更好的渲染质量。不对称设计用大约三分之一的计算量实现了相同的渲染质量印证了整个方法的核心逻辑。关于几何分支中Mamba和注意力层的比例团队通过系统实验发现存在一个甜蜜点。当每个阶段8层网络中有6层是注意力层、2层是Mamba时2m6a模型在渲染质量和几何精度上均表现最佳随着Mamba层比例增加性能单调下降纯Mamba的配置8m0a表现最差。这些实验同时报告了深度估计精度数据显示Mamba比例越高深度估计越不准确这说明Mamba在多视角匹配任务上确实存在天然的局限性。关于参数在几何分支和外观分支之间的分配比例团队测试了从90%/10%到50%/50%的多种方案。结果表明90%的参数给几何分支、10%给外观分支时性能最好随着外观分支比例增加即几何分支比例降低模型性能特别是在零样本场景上的泛化能力明显下降。这背后的逻辑是几何重建是一件本质上困难的任务即便不需要极致精度网络也需要足够的容量来隐式地完成跨视角匹配——这一点容不得吝啬。关于稀疏注意力模块中的卷积步骤实验证明这一步骤至关重要。去掉卷积块后模型性能下降超过1.0 PSNR说明在进行稀疏注意力计算之前必须先让每个代表点充分汇聚周围的局部信息否则抽样检查的代表性就会严重不足。为了进一步证明紧凑的AsySplat之所以有效不是因为参数少的模型本来就够用团队还与几个参数量相近的LongLRM变体进行了对比。无论是把LongLRM削减到18层103M参数还是减小特征维度99M参数还是引入与AsySplat相同的层次化参数设计102M参数这些变体的性能都明显低于AsySplat98M参数。这说明紧凑模型取得好性能并非偶然而是不对称架构带来的参数效率提升在发挥作用。归根结底AsySplat证明的是一件听起来简单但在实践中需要大量工程智慧才能落地的事情当你真正理解不同任务的难度和需求把资源精准地投放到最需要的地方你就能用更少的资源做到同样甚至更好的事情。这个道理说起来人人都懂但在复杂的神经网络设计中真正实现它需要的不只是直觉更需要大量严谨的实验验证和设计迭代。研究团队也坦诚地指出了这项工作目前的局限性。AsySplat在感知质量指标LPIPS上仍然落后于传统优化方法——这是大多数前馈式通用三维重建模型的通病因为它们无法像传统方法那样根据渲染误差动态增加高斯数量来修补细节薄弱的区域。研究团队认为将AsySplat节省下来的参数预算用于引入这种动态致密化机制是一个值得探索的未来方向。从更大的视角来看AsySplat所代表的按任务难度和需求分配计算资源的设计哲学或许会为整个计算机视觉领域的模型设计提供一种新的思路——与其追求更大、更深、更均匀的网络不如先想清楚每个子任务真正需要什么然后有的放矢地设计。QAQ1AsySplat比传统3D高斯泼溅方法快多少AAsySplat处理一个场景只需不到1秒而传统3D高斯泼溅方法需要大约13分钟速度差距将近800倍。更重要的是AsySplat不做任何优化时的画质PSNR 24.0已经略好于传统方法优化30000次后的结果PSNR 23.6。Q2AsySplat的两条处理流水线分别负责什么为什么不能合成一条A几何分支负责推断场景的三维结构物体的位置和深度使用粗粒度图像碎片和大量网络参数外观分支负责推断颜色纹理等细节使用细粒度碎片但参数量只有前者的约十分之一。之所以要分开是因为这两项任务的难度和精度需求差异悬殊——合在一条流水线里处理要么浪费了大量计算资源要么无法兼顾两者的不同需求。Q3AsySplat为什么在从未见过的场景上表现反而更好A这很可能与不对称架构带来的参数效率提升有关。由于每组参数都专注于特定任务几何推断或外观建模而不是笼统地处理所有信息模型学到的特征更具泛化性而不是过拟合到训练数据的特定外观上。在合成场景Replica数据集上经过10次优化后AsySplat的PSNR比LongLRM高出超过2.5进一步说明其内部表征质量更高。