跳转到内容

控制动作的 Token 化

类型 笔记 · 更新 2026-07-20

标签 embodied-ai · vision-language-model · end-to-end-learning

所属 VLA 模型

VLA 把动作序列编成离散 token(或分位数/VQ 码本),与文本共享自回归接口,从而复用大模型的预训练与指令跟随能力。

  • 分辨率:token 过粗则控制抖;过细则序列过长、难训。
  • 时间块:一次预测一段动作 chunk,降低逐步误差。
  • 语义对齐:语言指令如何条件化同一套动作词表。
  • 离散化引入量化误差,精细力控场景可能不够。
  • 开源权重与真实机器人本体差异导致 sim/real 或 cross-embodiment 失败。
  • Topic:vla-models