用一句话来概括就是
由于地面数据训练出的模型不能很好地适用于无人机从下往上拍摄的情况,因此本文提出了 AerialMetric 数据集和评价标准,并用低秩适配的方法对 MoGe2 进行微调得到 MoGe2-Aerial,在没有真实的相机内部参数的城市场景里,MoGe2-Aerial 可以将 由原来的 5.1% 提高到现在的 89.3%。

2. 论文信息
-
题目: AerialMetric: Benchmarking and Adapting UAV Monocular Metric Depth Estimation in the Real World | 真实世界无人机单目度量深度估计的基准评测与适配
-
发表: ECCV 2026
-
作者: Zhongqiang Song、Guanying Chen*、Yuqi Zhang、Yin Zou、Chuanyu Fu、Zhiyuan Yuan、Chuan Huang、Shuguang Cui、Xiaochun Cao
-
作者单位:
-
中山大学深圳校区
-
香港中文大学(深圳)未来智联网络研究院、理工学院
-
电子科技大学深圳高等研究院
-
代码:
-
https://kuieless.github.io/AerialMetric-ECCV2026-page/
-
论文:
-
https://arxiv.org/abs/2606.29716
3. 论文摘要
目前的单目度量深度模型主要是从街道和室内的数据中学习到的,在遇到无人机的高度、俯仰角以及视场发生变化的时候很容易出现尺度漂移的问题。AerialMetric 采用真实的摄影测量、可控采集、合成渲染以及互联网视频补全的方式来获得空中的数据,并且建立了变量解耦评价的方法;经过这样的处理之后再用 LoRA 进行适配之后,模型对于各种航拍场景下的表现都有所提升,但是仍然保持了对地面场景泛化的功能。
核心创新点
创新一:四组互补集合
AerialMetric 提供大约 52k 的真实世界的图片以及 16k 的合成图片-深度对,其中包含 Oblique、Decoupled、Synthetic 和 Wild 四种类型,涵盖了真实的摄影测量、受控飞行、合成长尾视图和开放区域视频等。
创新二:变量解耦测试
Decoupled 子集用四个俯仰角、两个相对高度以及两个视角来组成 16 个正交配置,并且可以单独研究俯仰角、高度和视角对于度量深度估计所产生的影响。
创新三:空域的适应性
论文把 LoRA 加入到 MoGe2 的注意层以及前馈层里,并且加入了空中、合成和少量地面的数据来得到 MoGe2-Aerial;补充实验说明了 AerialMetric 对于 UniDepthV2 也是适用的。
5. 方法详解
5.1 整个结构
输入的是一个单个的无人机 RGB 图像 ,用米做单位得到一个深度图 。整个过程分为四个部分的数据创建、统一分析以及模型调整。

Fig.2: AerialMetric 数据采集过程说明了来自各种源头的数据是如何产生出测量值或者假测量值的。
第五部分数据建立
Oblique 收集了六个公开的摄影测量数据来源,并用 LiDAR 投影或者网格光栅化的方法得到深度信息;Decoupled 利用 DJI Matrice 300 RTK 在四类场景下获取大约四万六千对的数据;Synthetic 利用 Google Earth Studio、Unreal Engine、AirSim 和 Cesium 来创建可控制的角度和 Z-缓冲区深度;Wild 从网络上的视频中构建出一个开放区域的人工度量标签。

Table.1: 现有数据集与 AerialMetric 的对比,涵盖数据类型、深度真值、三维资产、数据规模及解耦飞行参数。

Table.2: AerialMetric-Decoupled 的无人机采集参数,包括 RTK 平台、传感器与视场、飞行高度、俯仰角、图像分辨率和场景类别。

Fig.3: AerialMetric 四个子集的代表性可视化,用于直观展示真实、受控、合成及开放域航拍场景。
5.3 Wild 的规模恢复
首先用 COLMAP 恢复出姿态和内参之后再用 Depth Anything 3(DA3)做稠密推断,在此过程中标注人会去量取一些参照物体的实际尺寸,并且得到一个统一的标准尺度:
其中:
-
为了便于比较;
-
和 分别表示第 个真实的物体和不确定尺寸重绘后的物体之间的差别;
-
对于没有明确标准和深度的情况;
-
序列级别的尺度因子。
公式解读: 对于各种真实的长度和重构长度的比例求出平均值之后再用同一个尺度因子拉伸整个视频的深度,并且没有逐帧做尺度拟合。
5.4 LoRA 的适配以及损失
MoGe2-Aerial 用的是 ViT,在 、、 和 使用 LoRA 进行层次化注入,采用 、,使用的是 0.1 的 dropout,在训练的时候取值为 Oblique 80%,Synthetic 15%,Ground Truth 5%。
其中, 调整整个几何结构, 约束绝对尺度,两个权重分别是 1 和 1.5。
公式解读: 模型保持了预训练时获得的部分边缘先验,并且主要针对的是从空中看去的整体几何结构和米制尺寸。
❝
用一句话来概括这个方法就是: 利用航拍数据来补充空域,并且用 LoRA 对模型的空间以及距离先验进行校正。
6. 实验结果
实验条件
训练数据有 AerialMetric-Oblique、AerialMetric-Synthetic、Hypersim、MVS-Synth、TartanAir 等五种,输入被缩小到 1K 像素大小上,每一批次包含 32 个样本进行训练 1800 步;编码器的学习速率是解码器学习速率的两倍, 与 。评价标准是 AbsRel、 和 。该文没有说明所用的硬件条件。
6.2 定性和定量的结果
没有真实的参照物的情况下,MoGe2-Aerial 在 Oblique-City 上把 AbsRel 由 48.4 降到 10.3, 由原来的 5.1% 提高到现在的 89.3%,在 Decoupled 的 Building、Factory 和 Lawn 上, 分别是 87.6%、90.2% 和 94.0%,都是最好的;Farm 上 UniDepthV2 为 57.9%,次好的是 MoGe2-Aerial 的 54.2%。

表 3. : 对于有无真实的相机内参的情况下的各种方法,在航拍数据集中所得到的结果进行比较。
对于 Wild 的 0-400m 范围内,MoGe2-Aerial 把 AbsRel 由原来的 55.26 降到现在的 21.34, 由原来的 9.50% 提高到现在的 53.7%,而且边界更加清晰,局部反向程度小一些,远处的道路以及植被的整体尺寸也更为一致。

Fig.4: 代表性的航拍场景的 RGB、真值以及各种方法所做出的预测结果进行比较。

Table.4: AerialMetric-Wild 上的度量深度结果,分别给出 0–400 m 与 0–800 m 深度范围内的 AbsRel、δ₁ 和 δ₂。

Table.5: 七个地面数据集上的度量深度定量评测,用于检验空中域适配后的跨域泛化能力。

Fig.5: AerialMetric-Decoupled 上的参数鲁棒性雷达图,半径越大表示对应设置下的性能越好。

Fig.6: 不同视场与飞行高度下的深度估计鲁棒性,结果为 AerialMetric-Decoupled 上的平均 δ₁。

Fig.7: 不同飞行高度与相机俯仰角组合下的度量精度热力图。
消融实验
完整的微调在空中数据中最好,但是地面平均 降低到 56.70%,使用 的 LoRA 之后,Oblique、Decoupled 以及地面上的数据上, 为 84.40%、83.90%、79.59%,跨域表现更加均匀一些,在添加了 5% 的地表数据之后,ETH3D 的 从只有在合成数据的时候才有的 71.54%,提高到了现在的 86.67%。

Fig.8: 不同微调策略的定性对比,展示完整微调、冻结 ViT、仅调整尺度头和 LoRA 适配的预测差异。


表 6. 和表 7. : 各种各样的微调方法和不同的训练数据所得到的结果进行消融分析。
7、总结和展望
AerialMetric 将真实的摄影测量、可控变量、合成渲染以及开放式视频都放在一个共同的基础之上,并且表明专门的空中数据可以很好地纠正现有的模型在尺寸和形状上的错误。接下来的工作将会把多视角来衡量深度并且加入极端天气的数据。
❝
一句话总结: 除了给航拍数据加上一层外衣之外,AerialMetric 还使无人机深度模型的不同领域之间的差异可以被训练、诊断和量化的程度提高。
往期推荐
转载自 CSDN-专业IT技术社区
原文链接:https://blog.csdn.net/weixin_43312117/article/details/165364261








