🏗️ Foundations — Explorer’s Map
Foundations 是跨 embodiment 共享的底层 — 3DGS / VGGT / Depth Foundation / 经典 SLAM 这些”工具箱”原语,无论你做 manipulation、aerial 还是 marine,最终都会回到这里。 目前收录 123 篇深度解析 + 13 区导读,是华语世界对空间智能底层最系统的拆解。 2026-05 重要更新(多轮叠加):不知道从哪开始?先选你的角色 ↓
- 🔮 Feed-Forward 3D:+ VGGT-Ω + MapAnything ★ (metric solved) + 即将 Depth Anything 3
- 📡 Sensor Physics ★:5 → 23 篇(+ RGB / GNSS / barometer / magnetometer / opt-flow / range finder + UWB / WiFi / 水下声呐 / 热红外 / 24GHz Doppler / mic array
pending agent)- 🧮 Spatial Math:+ 前置教学(rotation_intuition_primer)+ 跨领域数学灵感(cross_domain_math_inspirations)+ IMU §6 production 优化 10 项
- 📏 Depth Foundation:4 篇 v1.2 深化 + 新 depth_models_comparison.md ★(4 模型横向对比)
🎭 你是谁?
🔍 一眼看清 13 区特性
分 3 张窄表 — GitHub 渲染友好。先看你想要的”上游 → 输出 → 下游”链;再查特性;最后看决策。
表 1 · 上游 → 输出 → 下游消费
表 2 · 运行特性(4 正交轴:推理 / 训练 / 硬件 / 米制)
v2 重设计 — 之前 1 列混了”训练时间”和”推理时间”,现在分清。每个轴独立。
读表秘诀:常见误用警告:
- 🏃 推理速率 = 你的应用控制环 / 任务每帧能给的预算
- 🎓 训练模式 = 上线前是不是要训(“每场景训” = production blocker;“已训好” = 直接用)
- 🖥️ 最低部署硬件 = 能不能跑在 Orin Nano (edge) / consumer GPU (workstation) / A100 (cloud)
- 📐 米制输出 = 下游能不能拿到米(manipulation grasp / drone control 需要;rendering / visualization 不需要)
- 把 3DGS 当 “real-time 3D”(render 是实时,训练每场景 5-30 min 不是)
- 把 Depth Anything v2 当 “可以拿来 grasp”(它是相对深度,Metric3D 才给米)
- 把 SpatialVLM 当 “高精度 spatial”(它给语言答案,不给度量)
- 把 mono Classical SLAM 当 “完整 6DoF”(mono scale drift;需要 stereo/RGBD/IMU)
表 3 · 决定性因素(关键限制 / 何时选)
🎯 快速决策树 (5 秒选区)
🚦 实时 vs 离线 × 米制 vs 非米制 (二维定位)
读图秘诀:你的应用控制环带宽(200 Hz aerial / 30 Hz manipulation / 几 Hz 离线)决定纵向位置;你能不能拿到 stereo / IMU / RTK 决定米制能不能给。两轴交叉的那一象限 = 你该用的工具区。
🌍 世界地图
读图方式:实线 = 建议学习顺序(从 feed-forward 3D 出发是最快理解全局的路径)。虚线 = Sensor Physics 是物理底层,遇到 “为什么 850nm?"" 为什么 RGBD 在户外失效?” 这种问题随时回来。
🏛️ 十三大区域
⚡ Speed Runs
没时间读 14 篇?选一条最短路线。
🏃 “我就想搞清楚 2024-2026 spatial 范式怎么变了”(3 篇)
🎓 “我要为无人机选 perception stack”(4 篇)
🤖 “我要做 manipulation 的 3D-aware policy”(3 篇)
🧬 “我是 VLA 研究者,想跨过来看 spatial”(3 篇)
🏗️ “我是 sensor hardware 团队”(2 篇 + 1 crossing)
🏆 Achievements
读完一篇就算解锁。看看你能拿几个?← Back to Handbook root · → Crossing (★ USP) · → Embodiments · → Bridge to VLA-Handbook