控制动作的 Token 化
控制动作的 Token 化
Section titled “控制动作的 Token 化”类型 笔记 · 更新 2026-07-20
标签 embodied-ai · vision-language-model · end-to-end-learning
所属 VLA 模型
VLA 把动作序列编成离散 token(或分位数/VQ 码本),与文本共享自回归接口,从而复用大模型的预训练与指令跟随能力。
- 分辨率:token 过粗则控制抖;过细则序列过长、难训。
- 时间块:一次预测一段动作 chunk,降低逐步误差。
- 语义对齐:语言指令如何条件化同一套动作词表。
- 离散化引入量化误差,精细力控场景可能不够。
- 开源权重与真实机器人本体差异导致 sim/real 或 cross-embodiment 失败。
- Topic:
vla-models