Can VGGT (v1 + Ω) Replace Drone VIO? (VGGT 和 VGGT-Ω 能否取代无人机 VIO?)
发布时间: 2026-05-20(v1.1 backfill 2026-05-21;翻译为简体中文 2026-05-21;v1.2 加入 VGGT-Ω 对比 2026-05-22) 论文 / 模型: VGGT(Wang et al., CVPR 2025, arXiv 2503.11651)+ VGGT-Ω(Wang et al., 2026-05, arXiv 2605.15195)vs VINS-Fusion / OpenVINS / DROID-SLAM 核心定位: feed-forward 3D foundation model 能否在 aerial 平台取代紧耦合 VIO —— 以及为什么答案因 embodiment 而异。Ω 出来之后答案变了吗?没变。Status: v1.2 — VGGT-Ω 加入对比 2026-05-22。
UNVERIFIED 数字需 rig-side 验证。
Wedge tier: W1 · Handbook flagship
TL;DR: 仍然不行,2026 年内不行。VGGT-Ω 改了 training efficiency × data scale × dynamic scene 三件事 —— 但没改 streaming / 没解 metric scale / 没改 inference latency budget。差距仍是 延迟、米制、IMU 耦合。出货架构仍是混合(VGGT-Ω 当低速率几何锚 + 经典 VIO 跑高速率状态),不是替换。
X-Ray. 无人机要在桨叶振动 IMU 的同时,给出 200 Hz、米制、sub-10 ms 的状态估计 —— 经典 VIO 就是为此手工调出来的。VGGT v1 (2025) 单次前向就能从 N 帧 RGB 吐出位姿 + 稠密 3D;VGGT-Ω (2026-05) 把它做得更高效(30% GPU 内存 + 15× 训练数据)并首次支持动态场景(Sintel 提升 77%)—— 但 推理 envelope 与 v1 同构:仍 batch、仍 un-metric、仍 100ms+ latency。教训:feed-forward 3D 谱系正在 efficiency × scale 两条轴上演进,但 streaming + metric + IMU 耦合 这三件架构性事它们没碰 —— 也就是 aerial 真正的墙。
📍 研究全景时间线
1 · 为什么这是最干净的跨 embodiment 测试
manipulation 研究员被问 “VGGT 能替代经典 SfM 吗?” → 耸肩,能。drone 工程师在 15 m/s 风切被问 → 一口回绝。两个答案都对;它们的分歧告诉你 “spatial intelligence” 在每个 embodiment 上到底要什么。 这条迁移故事(manipulation → ground → aerial → marine)正是单 embodiment 综述永远不写的维度 —— 也是这篇文章为什么住在crossing/。
1.2 ⚡ Eureka Moment
VGGT 给出正确的几何,但永远给不到 aerial 控制器要的米制尺度和延迟 —— 差距是 operational,不是 accuracy。任何从”更好的 depth!更好的 tracking!更多视图!“角度切入这个问题的视角都是干扰。墙是 rate × latency × metric,benchmark accuracy 不是失败点。
2 · 数学核心:rate-latency-cost 乘积
📌 Napkin Formula
左边是预算;右边是账单。Ω 把账单做小一些(register attention linear-in-N + 移除 high-res conv),但没改变量级 —— 仍是桌面 GPU 账单 vs autopilot 预算。两者 2026 不会相遇。
VGGT-Ω 的影响: 30% 训练 GPU 内存提示推理可能也轻一点(UNVERIFIED ——论文未直接给 inference benchmark)。乐观估计 distilled Ω 在 Orin Nano 上跑到 ~10 Hz(vs v1 的 ~5 Hz)。但 5 ms latency 的 aerial 控制环要求 200 Hz 视觉前端 —— 一个数量级的差距,Ω 没动。
3 · 玩具例子:30 Hz 控制器、两个前端
慢速巡检无人机,30 Hz 控制器,每帧 50 ms latency 预算。
算账:
- VINS:
30 × 0.050 = 1.5 vs 30 × 0.005 = 0.15→ 10× 余量 → 出货。 - VGGT v1:
30 × 0.050 = 1.5 vs 10 × 0.100 = 1.0→ 临界;桨叶抖动让它跌穿预算。 - VGGT-Ω:register attention linear-in-N + 训练 memory 30% 提示推理也可能~30-50% 提升。乐观估计:
1.5 vs 12 × 0.080 ≈ 0.96→ 仍在临界以内但更稳。悲观估计: Ω 的 inference latency 论文没披露,预期 v1 几乎不变 → 仍不行。
4 · Aerial VIO 基线(VGGT 要对照的标杆)
四条不可妥协的约束:
参考栈:VINS-Mono / Fusion(Qin 2018, HKUST)紧耦合 opt-VIO;OpenVINS(Geneva 2020, UDel)MSCKF,Skydio 系;DROID-SLAM(Teed 2021)学习式稠密 BA,Orin 上 ~5 Hz
UNVERIFIED,没 first-class IMU。这是 VGGT 要清的栏。
5 · VGGT 谱系实际给什么(v1 + Ω 对比)
关键观察:
- ✅ Ω 在 效率 × 训练数据 × 动态场景 上是真升级 —— Sintel 77% 提升 + dynamic scene 是质变
- ❌ Ω 完全没碰 aerial 真正卡住的 4 条:streaming / metric / IMU coupling / 振动抗扰
- ⚠️ inference latency 期待 Ω 比 v1 略快(register attn linear-in-N),但量级不变(仍是 50-200 ms 而非 < 20 ms)
6 · Gap matrix + 隐含假设
纵看:VGGT 强在 良性条件下的几何正确;弱在 aerial 把基线都拉到极端的任何东西。横看:“VGGT 能替代 VIO 吗?” 有五个不同答案 —— 这就是
crossing/ 存在的全部意义。
6.1 Hidden Assumptions(VGGT 在哪里悄悄崩)
VGGT 在 manipulation / ground 的成功,建立在 drone 一出实验室就违反的几个假设上:- 静态场景 —— 训练分布偏拟静态;旋翼下洗扬尘、巡检工地工人、编队飞行 都破坏 rigid-world prior。
- 足够视图重叠 —— N-view 假设帧间内容共享;快速偏航或无特征墙面会让几何坍塌。
- 单目非米制 —— 前向 pass 里没尺度;米制控制器要外部 scale(stereo / RTK / 已知物体)。
- 板载 GPU —— VGGT-large ~6 GB
UNVERIFIED;小型无人机带的是 Orin Nano(8 GB 共享)或更少;持续推理功耗没有预算。 - 没有 native IMU 耦合 —— 没地方接 200 Hz IMU pre-integration;hybrid pose-graph 融合是外挂,会吃几十 ms。
7 · Hybrid 甜蜜点在哪
2026 真正能出货的是 “VGGT 和 VIO,各司其职”:7.1 Comparison & Interview Tip
Ω 对 hybrid 架构的真正贡献:因为 Ω 原生支持动态场景,hybrid VGGT-Ω + VIO 现在能在 行人 / 工地 / 仓库 这种动态环境工作(v1 hybrid 在动态环境下静默漂移)。这是 巡检 drone 的真实改进。
🎤 Interview Tip. “VGGT-Ω 出来了,无人机要不要换?” —— 正确答:“Ω 改的是训练效率 + 数据规模 + 动态场景支持,aerial inference envelope 一点没动 —— 仍是混合架构题,不是替换题。但如果你的无人机巡检场景动态环境多(工地、仓库、行人),hybrid Ω + VIO 比 hybrid v1 + VIO 更稳,因为 v1 在动态环境下静默退化。” 错答:“Ω 更高效所以替换 VIO” —— Ω 改的层和 VIO 不在一个轴。
8 · 为什么 marine 根本不参加这场辩论
水下:视觉描述子失效(吸收 + 散射毁纹理),单目尺度没主动测距完全没救,GPS 没了。VGGT 通过单目 RGB 把这些全部继承下来。 marine SLAM 用 sonar + DVL + IMU;相机是辅助。“VGGT vs VIO” 无论怎么打都输给声学 —— 这个 contrasting case 定义了视觉-only feed-forward 3D 的上限。9 · 2 年展望(什么会翻转 aerial 答案?)
四件事都落地才会翻转:- VGGT-Ω 后代蒸馏到 Orin <20 ms latency —— 现在 Ω 训练 memory 是 v1 的 30%,提示推理也可能更轻;但实际 distilled 数字论文未披露,预期 50-100 ms 量级。还需 ~5× 进一步压缩到 < 20 ms。2027 内可能。
- Metric-aware feed-forward 变体 —— 把 stereo / IMU / known scale anchor 融进前向 pass。Ω 没做这件事 —— 这是下一篇论文的押注。盯 π³ streaming / 任何”VGGT-Σ / VGGT-Metric”风格的后续。
- Streaming feed-forward 3D —— Ω 仍 batch-only。Register attention 天然适配 streaming(register 当 state cache),所以这是 Ω 架构留给后续的 hint。Streaming Visual Geometry Transformer 这条路在走,但未到生产级。
- 抗振动前端 —— ViT 类(含 v1 / Ω)还没在高频运动模糊下专项调过;Ω 的 self-supervised on unlabeled video 可能间接帮(视频里有自然抖动)。UZH RPG event camera 仍是最强对冲。
- 能容忍 20–40 ms 级联 latency 的控制器 —— RL policy (UZH 赛车) 已经能;PID 不行。
- 2027-06 前:会出现 VGGT-Ω 衍生 streaming variant(可能叫 VGGT-Σ 或类似),把 batch 改成 increment-per-frame。Register attention 是 streaming 的天然 cache。
- 2027-12 前:会有一篇公开的无人机自主 stack 论文,用 VGGT 谱系模型当 主视觉前端 —— 但飞 <5 m/s 室内 / 巡检,不是 racing。
- 2027-12 前不会发生:VGGT 谱系(含 Ω 后代)成为 Skydio-class 户外 racing aerial 主前端 —— operational envelope 限制不在 Ω 改的层。
10 · For the reader
- Manipulation 工程师 —— 这些原语在你身上 port 得很干净;VGGT 就是你的新 SfM。别把这边的时序假设带进 aerial。
- Aerial 工程师 —— 别因此就 dismiss VGGT。它不适合控制环,但是你这辈子能见过的最便宜的 relocalizer / loop-closer。
- AD 工程师 —— driving = ground-mobile + GNSS。VGGT 类模型在你这里最闪光是 离线 4D 场景重建(看 Cosmos),不是在线估计器。
- Marine 工程师 —— VGGT 不适用;老老实实 sonar + DVL + IMU。视觉-only FF 是思考实验,不是 stack。
- 研究者 —— §9 四条都是开放问题。Metric-aware feed-forward 是最大的解锁,谁先发出来谁赢两个 CVPR。
References
- VGGT v1 — Wang et al. CVPR 2025 best paper arXiv:2503.11651
- VGGT-Ω — Wang et al. 2026-05 arXiv:2605.15195 · 中文导读 Alan Hou
- VINS-Mono — Qin et al. T-RO 2018 https://arxiv.org/abs/1708.03852
- OpenVINS — Geneva et al. ICRA 2020 https://arxiv.org/abs/1910.00298
- DROID-SLAM — Teed & Deng NeurIPS 2021 https://arxiv.org/abs/2108.10869
- UZH RPG champion racing — Kaufmann et al. Nature 2023 https://www.nature.com/articles/s41586-023-06419-4
- Streaming Visual Geometry Transformer — arXiv:2507.11539(streaming 路线)
- Skydio autonomy blog — https://www.skydio.com/blog
- VGGT v1 完整解构 →
foundations/feed-forward-3d/vggt_cvpr2025_dissection.md - VGGT-Ω 完整解构 →
foundations/feed-forward-3d/vggt_omega_dissection.md(v0.5 verified)
Boundary
本文比较的是跨 embodiment 的方法类。Per-method dissection 在foundations/feed-forward-3d/vggt_cvpr2025_dissection.md(VGGT)和 embodiments/aerial/vio/(VINS-Mono)。从那两边引用本文,是因为只有这边有跨 embodiment 视角。
Last opinion update: 2026-05-20. §9 预测 2027-12 打分。