跳转到内容

LLM 与语言推理

大语言模型驱动的推理、任务分解与指令理解。

类型 Topics · 更新 2026-07-19

本Topic聚焦如何利用大语言模型(LLM)的语言理解与生成能力,实现具身智能与自动驾驶场景中的复杂推理、规划与决策。传统模块化或端到端系统在开放环境、指令遵循与长时程任务中面临泛化差、接口刚性与可解释性不足的问题。通过自然语言作为中间表示,LLM可支持链式思考(Chain-of-Thought)、内在独白式规划、行为树启发式生成及多模态条件推理,将高层语义指令转化为可执行轨迹、动作序列或子目标。CONTEXT中相关工作涵盖LLM自主代理综述、机器人集成、具身规划(如Inner Monologue)、端到端驾驶开源框架(OpenEMMA结合CoT)及安全风险(如BadRobot越狱),目标是建立从语言推理到具身执行的桥梁,服务于代理与驾驶任务中的可解释、可扩展规划。

  • 不覆盖纯视觉感知或VLM底层架构细节
  • 不深入传统非语言规划算法的完整推导
  • 不提供具体实现代码或未给出实验数值的对比
  • 不讨论化学或非具身科学发现代理的专属应用
  • foundations — 需掌握语言模型基础、预训练与缩放定律,以理解LLM涌现推理能力来源
  • vlm-understanding — 相邻主题提供多模态输入基础,便于语言推理与视觉条件结合
  • decision-task-planning — 需熟悉任务规划与决策框架,才能将语言推理输出映射到动作/轨迹
术语 含义 常见混淆
Chain-of-Thought (CoT) 通过显式中间推理步骤提示LLM逐步分解复杂问题,提升规划与决策准确性 易与简单少样本提示混淆,CoT强调可观测的思考链而非直接答案
LLM Agent 以LLM为核心、结合工具调用、记忆与规划模块的自主代理系统,可执行多步具身任务 不同于纯聊天模型,强调闭环感知-推理-行动循环
Planning Language 用自然语言作为规划中间表示,实现高层指令到子目标或行为序列的转换 非形式化规划语言(如PDDL),而是灵活但可能模糊的自然语言接口
Inner Monologue 具身推理中LLM通过持续语言自我对话与反馈进行规划与纠错的方法 不同于外部提示,是内部闭环的语言思考过程
Embodied Reasoning 将语言推理与物理世界感知/动作结合,使代理能在真实或仿真环境中遵循指令完成任务 易与纯文本推理混淆,必须考虑物理约束与多模态反馈
Jailbreaking Embodied Agents 通过提示攻击使具身LLM代理在物理世界执行有害或越权行为的安全风险 不仅是文本越狱,还涉及动作执行后果

早期语言模型侧重统计预测与文本生成;预训练LLM时代涌现上下文学习与推理能力;当前范式转向语言作为通用规划接口,结合CoT与工具实现具身代理闭环。从刚性模块化驾驶/机器人系统转向可解释的语言条件端到端框架(如OpenEMMA式CoT规划)。安全与可靠性从后处理转向设计阶段关注(BadRobot类风险)。

  1. A survey on large language model based autonomous agents(精读)— foundational 综述系统梳理LLM自主代理架构、记忆、规划与应用,直接支撑本Topic核心,适合建立整体框架
  2. Inner Monologue: Embodied Reasoning through Planning with Language Models(精读)— 经典具身语言规划方法,展示自然语言内在独白如何支持反馈式推理与任务完成,与驾驶/代理紧密相关
  3. OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving(中文笔记)— 结合预训练MLLM与CoT推理的开源端到端驾驶框架,提供语言推理在自动驾驶中的具体落地示例,有中文笔记可参考
  1. 先读LLM自主代理综述,建立代理架构与语言规划整体图景
  2. 再读Towards Reasoning in Large Language Models: A Survey 与Inner Monologue,掌握推理机制与具身实现
  3. 然后结合OpenEMMA与VLM-in-AD survey理解驾驶场景应用
  4. 最后浏览机器人集成survey、RoboGPT及BadRobot,覆盖工程集成与安全风险
  5. 补充Learning to Plan with Natural Language等watch论文拓展规划语言视角
Paper 输入 输出 表示 训练目标
Inner Monologue: Embodied Reasoning through Planning with Language Models 语言指令+环境反馈 规划步骤与动作序列 自然语言内在独白 具身任务完成与纠错
OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving 多模态感知+语言推理提示 速度/曲率预测积分轨迹 CoT增强的MLLM表示 端到端自动驾驶规划
A survey on large language model based autonomous agents 代理组件综述(记忆/规划/工具) 系统化LLM代理设计空间
RoboGPT: An LLM-Based Long-Term Decision-Making Embodied Agent for Instruction Following Tasks 长期指令与环境状态 决策序列 LLM长期决策框架 指令跟随具身任务
  • 自然语言规划歧义导致动作错误或安全隐患
  • 具身代理越狱(BadRobot类)在物理世界产生真实危害
  • CoT推理延迟与计算开销影响实时驾驶决策
  • 多模态对齐不足时语言推理与感知脱节
  • 开源vs闭源模型可复现性与部署依赖问题
  • 长时程任务中记忆与一致性崩溃
  • 如何系统评估语言推理在真实驾驶闭环中的可靠性与安全性?
  • Planning Language的形式化程度与灵活性如何最优权衡?
  • LLM代理在开放世界中的长期自主性与灾难性遗忘如何解决?
  • CoT等推理技术对具身约束(物理可行性)的内建程度待提升
  • 多代理协作中的语言协商协议标准化问题
  1. Chain-of-Thought如何提升LLM在具身规划任务中的表现?请结合OpenEMMA或Inner Monologue说明其作用机制。
  2. 什么是LLM Agent的核心组件?与纯语言模型的主要区别是什么?
  3. Inner Monologue方法中自然语言如何实现具身反馈闭环?潜在失败场景有哪些?
  4. BadRobot论文揭示的具身LLM代理安全风险是什么?对自动驾驶应用有何启示?
  5. 比较传统模块化自动驾驶与基于LLM/CoT的端到端语言推理框架(如OpenEMMA)在可扩展性与可解释性上的差异。

本 Topic registry 入选 19 篇(foundational/recent/watch 见 papers.yml)。

Tier Paper Year Reason
watch Learning to Plan with Natural Language 2023 auto score=47
needs-review BadRobot: Jailbreaking Embodied LLM Agents in the Physical World 2024 auto refresh 2026-07-19 sources=arxiv
needs-review OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving 2024 auto refresh 2026-07-19 sources=arxiv
recent A survey on integration of large language models with intelligent robots 2024 Survey on integrating LLMs with intelligent robots
foundational A survey on large language model based autonomous agents 2024 Survey on large language model based autonomous agents
recent A Survey of Large Language Models 2026 auto refresh 2026-07-19 sources=openalex
needs-review Planning and control of autonomous mobile robots for intralogistics: Literature review and research agenda 2021 auto refresh 2026-07-19 sources=openalex
watch Autonomous chemical research with large language models 2023 auto refresh 2026-07-19 sources=openalex
watch Use large language model to enhance reasoning of another large language model through reward updated GRPO 2026 auto score=40
recent Augmenting large language models with chemistry tools 2024 auto refresh 2026-07-19 sources=openalex
foundational A review of large language models and autonomous agents in chemistry 2024 auto refresh 2026-07-19 sources=openalex
recent Large language models empowered agent-based modeling and simulation: a survey and perspectives 2024 auto refresh 2026-07-19 sources=openalex
watch HBTP: Heuristic Behavior Tree Planning with Large Language Model Reasoning 2025 auto score=40
foundational RoboGPT: An LLM-Based Long-Term Decision-Making Embodied Agent for Instruction Following Tasks 2025 auto refresh 2026-07-19 sources=openalex
recent Vision Language Models in Autonomous Driving: A Survey and Outlook 2024 VLM-in-AD survey covers language-conditioned driving reasoni
watch Towards Reasoning in Large Language Models: A Survey 2023 auto refresh 2026-07-19 sources=openalex
watch Evaluating Large Language Models Trained on Code 2021 auto refresh 2026-07-19 sources=openalex
watch Inner Monologue: Embodied Reasoning through Planning with Language Models 2022 auto refresh 2026-07-19 sources=openalex
watch PaLM-E: An Embodied Multimodal Language Model 2023 auto refresh 2026-07-19 sources=openalex

来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。

基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)

Section titled “基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)”

近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)

Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”

观察清单(选题 8 · 可学习 3 · 待获取 PDF 5)

Section titled “观察清单(选题 8 · 可学习 3 · 待获取 PDF 5)”

成熟度 seed · 内容数 19 · 论文池 16