> ## Documentation Index
> Fetch the complete documentation index at: https://kensou.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# Whole body spatial perception

# Humanoid + Legged 机器人的全身空间感知

**状态：** v1——观点稿。所有商用规格数字标 `UNVERIFIED`，除非来自带 URL 的厂商数据手册。
**Wedge 档：** W2 · Humanoid-legged 子树锚文。
**TL;DR：** 人形感知是两个感知问题伪装成一个。头装相机服务**远凝视**（前方 \~3 m、地形分类、导航）和**近落脚**（下一步落点、\<1 m、30–100 Hz）——两个不同传感器的活，被打包成一个。带体装 LiDAR 的四足（Spot、ANYmal）通过完全放弃凝视来绕开这一点，用拟人换传感器姿态稳定。这两条路之间的架构选择，是任何一个人形项目最重要的单一规格决策。

***

## 1 · 背景——两份感知工作

走路的双足在任意瞬间都有两份感知工作，需求在每一根轴上都岔开：

| 轴       | 远凝视           | 近落脚                       |
| ------- | ------------- | ------------------------- |
| 距离      | 1.5–10 m      | 0.2–1.0 m                 |
| 更新率     | 5–10 Hz 够用，语义 | 30–100 Hz，几何              |
| 分辨率优先级  | 语义（是什么？）      | 公制（确切在哪？）                 |
| 传感器姿态稳定 | 容忍俯仰晃         | **不容忍**——需要 body-frame 锚定 |
| 失效模式    | 路线错           | **摔倒**                    |
| 延迟预算    | 100–300 ms    | 10–30 ms `UNVERIFIED`     |

单一头装相机同时服务两者，每一帧都被迫妥协。这就是为什么人类进化出周边视觉 + 中央视觉——两份工作两套传感器机制。机器人学还没收敛到对应的拆分，但快了。

```
                    Head-mounted RGB-D
              ┌───────────────────────────┐
              │                           │
              ▼                           ▼
       ┌────────────┐              ┌─────────────┐
       │ Far gaze   │              │ Near footfall│
       │ 5–10 Hz    │              │ 30–100 Hz    │
       │ semantic   │              │ metric+IMU   │
       │ planning   │              │ control      │
       └────────────┘              └─────────────┘
              │                           │
              ▼                           ▼
        Navigation MPC               Footfall MPC /
        (1–3 s horizon)              RL policy
                                     (<200 ms horizon)
```

注意时间视野差了 10×。不拆开两者的感知栈会被迫两个都跑在慢速率上——导航没事，落脚迟到，地面变了就摔。

***

## 2 · "远眺" 问题

人在平地走路自然注视前方 \~3 m——约 1 秒的预览，正常步速。上楼梯或粗糙地面时，凝视前推到 \~5 m 并向下聚焦到具体台阶规划。这不是审美：这是在脚抬起前规划落脚点的*唯一*办法。

把这翻译到机器人：

| 机器人策略                          | 给什么        | 代价                             |
| ------------------------------ | ---------- | ------------------------------ |
| **静脖子，宽 FOV**（早期人形大多数，Spot）    | 机械简单       | 远近永久折中；不能定睛                    |
| **带凝视控制的可动头**（Atlas 一类、未来人形）   | 拟人的动态凝视    | 加延迟 + 控制问题；凝视稳定对抗 ego-motion 难 |
| **多相机阵列，不做动**（Tesla、Figure 趋势） | 软件控制的 "凝视" | 算力高；标定难                        |
| **体装 LiDAR**（Spot、ANYmal）      | 姿态稳定、360°  | 放弃凝视 → 没有语义中央化 → 靠密集 LiDAR 处理  |

Spot 方案（体装、无头）是最清晰的*交易*：完全放弃凝视，免费换来传感器姿态稳定 + 360° 覆盖。Unitree / Figure / Atlas 的路线押反方向——拟人的头装相机会赢，因为策略训练数据（人类视频、teleop）就是拟人的。两个押注都自洽。

到 2026 还看不出长期谁赢。维护者的读法：**体装赢工业 / 室外；头装赢人类环境 / 从人类视频采数据**。不同产品，不同答案。

***

## 3 · 三路必须融合的传感器流（头相机 + IMU + 足触发）

一个人形空间栈有三路流*必须*融合才能做全身感知。哪一路都不是可选。

**3.1 · 头装相机（RGB-D 或立体）。**

* 提供远近几何 + 语义。
* **问题：** 相机帧运动包含整个步态的俯仰/偏航振荡。在无人机振动谱（高频、小幅）上调好的朴素 VIO 处理不了步态诱导的运动（1–3 Hz、大幅）——滤波器设计不同，时间常数不同。

**3.2 · 体 IMU。**

* 锚定重力（roll/pitch 绝对值），提供快速姿态估计。
* 常常在体 IMU 之外还配一个*头装 IMU*——头 IMU 直接稳定相机帧；体 IMU 锚定运动控制。
* 双 IMU 系统需要在脖子动时做在线外参标定。

**3.3 · 足触发 + 关节运动学。**

* 从躯干经腿做前向运动学，给出每只脚在体帧的位置。
* 足触发（力传感器或接触事件检测）是一个**零速度更新（ZUPT）**——脚踩地的瞬间，该脚的世界速度为零。这是人形状态估计里最强的约束，相当于 aerial 的 GNSS。一定要用。
* 谱系：Bloesch et al. *Two-State Implicit Filter for Legged Robot State Estimation*——足触发 + IMU 融合的经典论文。

**能用的融合模式**（公开的 Spot / ANYmal / 学术论文的合成体，精确对应 `UNVERIFIED`）：

```
   Visual front-end (head cam)
        │  ~30 Hz pose + features
        ▼
   ┌─────────────────────┐
   │   EKF / Factor      │ ← IMU (body) @ 1 kHz
   │   graph state est.  │ ← IMU (head) @ 1 kHz
   │                     │ ← Foot contact ZUPT @ event
   │                     │ ← Leg FK @ 100 Hz
   └─────────────────────┘
        │  200 Hz state
        ▼
   Whole-body controller / RL policy
```

因子图变体（TSIF、OpenVINS 衍生的腿足扩展）目前在 legged case 上被认为比 EKF 更鲁棒 `UNVERIFIED`，主要因为足触发事件用离散时间因子表达，比作为连续时间过程噪声表达要容易。

***

## 4 · Humanoid vs Quadruped——细节里是不同的问题

| 维度        | 人形（Unitree H1、Figure 02） | 四足（Spot、ANYmal、Go2） |
| --------- | ------------------------ | ------------------- |
| 静平衡       | 没有——需要持续平衡               | 高——能无限久站立           |
| 传感器姿态稳定   | 差（头会动）                   | 好（体平移多，旋转少）         |
| 远眺        | 关键（1 m/s 时 1 秒预览）        | 不那么关键（四腿几何宽容）       |
| 失效代价      | 灾难（摔 + 损坏）               | 较低（摔得相对安全）          |
| LiDAR 安放  | 难（头太小/太重）                | 易（体上有空间 + 预算）       |
| 2026 公开部署 | 试点 / 演示                  | 工业量产（Spot 规模化）      |

四足路在 2026 是*工程完结*的，人形不是。Spot 已经在建筑工地、核检测、工厂地面部署了多年。人形公开部署仍是演示级。

维护者观点的读法：**人形构型当下在为人环境兼容性（用既有工具、过门、上楼梯）优化，代价是感知栈难度**。这个交易长期可能正确——但预期还有 2–3 年的 "人形 VIO 论文" 在不同振动谱上重新发明 aerial VIO 早已学过的东西。

***

## 5 · 哪里会崩（失效模式清单）

按弄死一次人形试验的频率粗略排序：

1. **俯仰诱导的视流 + 尺度漂移。** 每一步把头转 2–5°。视流多出大块俯仰分量，需要 IMU 抵消。抵消不完美 → 尺度漂 → 落脚距离回归差 2–5 cm → 终究漏一步。
2. **冲击阻尼下漏的足触发事件。** 软地毯 / 草地可能让接触检测失败。ZUPT 没应用。状态估计漂。结果：落脚偏 3–8 cm，可恢复但难看。
3. **眩光 / 纹理差的地板。** 和 ground-mobile 一样——反光大厅地、漆木、玻璃都让深度失败。
4. **楼梯检测滞后。** 远感知 5 Hz 更新，但楼梯边缘进入近感知区是 30 Hz。错位意味着策略看到 "楼梯" 是脚需要知道它的 200 ms 后。
5. **动态障碍（一个人走进画面）。** 远感知需要标出近未来碰撞；近感知看不见上半身。协同失败。

大多数失效都有 aerial-VIO 上的直接类比，文献可迁移、需要重调。aerial 那边对应清单见 `crossing/slam-vio-migration/vggt_vs_drone_vio.md` §4。

***

## 6 · 2 年展望 + 可证伪预测

**展望：** "头相机人形" 和 "体 LiDAR 四足" 的分叉会持续，并冒出第三条路：**头相机人形再加一个胸装深度/LiDAR** 来做稳定的近场感知。胸装传感器*物理上*把远眺/落脚拆开，解决拆分问题。Tesla Optimus 近期演示透露了这个方向；Figure / 1X 很可能跟。

**可证伪预测：** 到 2027 年底，前 5 大人形项目（按估值 / 公关声量）里 ≥2 家会在栈里加一个**非头装的深度或 LiDAR 传感器**来处理近落脚感知，把它和头相机的凝视解耦。这条预测对标某些项目目前坚持的 "纯视觉" 路线。

***

## 7 · 给读者

* **人形项目创始人**——§1 的感知拆分是真的。给*两*个感知子系统预算，不是一个。"我们用一个头装 RealSense 全搞定" 是最常见的架构错误。
* **四足研究者**——Spot 的传感器布置不是遗留思维；它是体旋转问题的连贯答案。换头装设计前先重新推导这个交易。
* **跨过来的 aerial 工程师**——IMU 耦合的直觉几乎可以原样迁移。重调一下：1–3 Hz 步态谱 vs 你的 100–400 Hz 螺旋桨谱。
* **VLA / 策略研究者**——感知的活到把 200 Hz 的体帧和世界帧状态送出去就结束了。策略 / 控制器住在 [VLA-Handbook](https://github.com/sou350121/VLA-Handbook)。别糊掉接缝。

***

## References（入门集）

* TSIF (Two-State Implicit Filter) — Bloesch et al. *RSS 2017*. [https://arxiv.org/abs/1611.01717](https://arxiv.org/abs/1611.01717)
* OpenVINS legged extensions — Geneva et al., various follow-ups. [https://github.com/rpng/open\_vins](https://github.com/rpng/open_vins)
* Atlas / new Atlas — Boston Dynamics 公关材料（无规范论文）
* Unitree H1 / G1 — 厂商产品页，`UNVERIFIED` 规格表
* ANYmal（感知 + 控制）— Hutter et al.，ETH Zurich 系列发表
* Spot autonomy — Boston Dynamics 白皮书
* 冠军级无人机竞速（类比高速率栈）— Kaufmann et al. *Nature 2023*. [https://www.nature.com/articles/s41586-023-06419-4](https://www.nature.com/articles/s41586-023-06419-4)
* 基于学习的腿足运动 — Lee et al. *Science Robotics 2020*. [https://www.science.org/doi/10.1126/scirobotics.abc5986](https://www.science.org/doi/10.1126/scirobotics.abc5986)

## 边界

本文覆盖**人形 + 腿足机器人的空间感知与状态估计**。不覆盖：

* 全身控制器、MPC、RL 运动策略 → [VLA-Handbook](https://github.com/sou350121/VLA-Handbook)
* 人形上半身做的 manipulation → `embodiments/manipulation/`
* Aerial VIO 基线（仅作类比引用）→ `embodiments/aerial/vio/`
* SLAM/VIO 方法的跨 embodiment 迁移 → `crossing/slam-vio-migration/`
* 腿足用的 IMU / 深度 / LiDAR 传感器物理 → `foundations/sensor-physics/`

*最近一次观点更新：2026-05-21。§6 预测于 2027-12 计分。*
