LLM 与语言推理
LLM 与语言推理
Section titled “LLM 与语言推理”大语言模型驱动的推理、任务分解与指令理解。
类型 Topics · 更新 2026-07-19
本 Topic 要解决什么
Section titled “本 Topic 要解决什么”本Topic聚焦如何利用大语言模型(LLM)的语言理解与生成能力,实现具身智能与自动驾驶场景中的复杂推理、规划与决策。传统模块化或端到端系统在开放环境、指令遵循与长时程任务中面临泛化差、接口刚性与可解释性不足的问题。通过自然语言作为中间表示,LLM可支持链式思考(Chain-of-Thought)、内在独白式规划、行为树启发式生成及多模态条件推理,将高层语义指令转化为可执行轨迹、动作序列或子目标。CONTEXT中相关工作涵盖LLM自主代理综述、机器人集成、具身规划(如Inner Monologue)、端到端驾驶开源框架(OpenEMMA结合CoT)及安全风险(如BadRobot越狱),目标是建立从语言推理到具身执行的桥梁,服务于代理与驾驶任务中的可解释、可扩展规划。
非目标 / 边界
Section titled “非目标 / 边界”- 不覆盖纯视觉感知或VLM底层架构细节
- 不深入传统非语言规划算法的完整推导
- 不提供具体实现代码或未给出实验数值的对比
- 不讨论化学或非具身科学发现代理的专属应用
foundations— 需掌握语言模型基础、预训练与缩放定律,以理解LLM涌现推理能力来源vlm-understanding— 相邻主题提供多模态输入基础,便于语言推理与视觉条件结合decision-task-planning— 需熟悉任务规划与决策框架,才能将语言推理输出映射到动作/轨迹
| 术语 | 含义 | 常见混淆 |
|---|---|---|
| Chain-of-Thought (CoT) | 通过显式中间推理步骤提示LLM逐步分解复杂问题,提升规划与决策准确性 | 易与简单少样本提示混淆,CoT强调可观测的思考链而非直接答案 |
| LLM Agent | 以LLM为核心、结合工具调用、记忆与规划模块的自主代理系统,可执行多步具身任务 | 不同于纯聊天模型,强调闭环感知-推理-行动循环 |
| Planning Language | 用自然语言作为规划中间表示,实现高层指令到子目标或行为序列的转换 | 非形式化规划语言(如PDDL),而是灵活但可能模糊的自然语言接口 |
| Inner Monologue | 具身推理中LLM通过持续语言自我对话与反馈进行规划与纠错的方法 | 不同于外部提示,是内部闭环的语言思考过程 |
| Embodied Reasoning | 将语言推理与物理世界感知/动作结合,使代理能在真实或仿真环境中遵循指令完成任务 | 易与纯文本推理混淆,必须考虑物理约束与多模态反馈 |
| Jailbreaking Embodied Agents | 通过提示攻击使具身LLM代理在物理世界执行有害或越权行为的安全风险 | 不仅是文本越狱,还涉及动作执行后果 |
方法谱系与时间线
Section titled “方法谱系与时间线”早期语言模型侧重统计预测与文本生成;预训练LLM时代涌现上下文学习与推理能力;当前范式转向语言作为通用规划接口,结合CoT与工具实现具身代理闭环。从刚性模块化驾驶/机器人系统转向可解释的语言条件端到端框架(如OpenEMMA式CoT规划)。安全与可靠性从后处理转向设计阶段关注(BadRobot类风险)。
- (2021) needs-review — Planning and control of autonomous mobile robots for intralogistics: Literature review and research agenda
- (2021) watch — Evaluating Large Language Models Trained on Code
- (2022) watch — Inner Monologue: Embodied Reasoning through Planning with Language Models
- (2023) watch — Learning to Plan with Natural Language
- (2023) watch — Autonomous chemical research with large language models
- (2023) watch — Towards Reasoning in Large Language Models: A Survey
- (2023) watch — PaLM-E: An Embodied Multimodal Language Model
- (2024) foundational — A survey on large language model based autonomous agents
- (2024) foundational — A review of large language models and autonomous agents in chemistry
- (2024) needs-review — BadRobot: Jailbreaking Embodied LLM Agents in the Physical World
- (2024) needs-review — OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving
- (2024) recent — A survey on integration of large language models with intelligent robots
- (2024) recent — Augmenting large language models with chemistry tools
- (2024) recent — Large language models empowered agent-based modeling and simulation: a survey and perspectives
- (2024) recent — Vision Language Models in Autonomous Driving: A Survey and Outlook
- (2025) foundational — RoboGPT: An LLM-Based Long-Term Decision-Making Embodied Agent for Instruction Following Tasks
- (2025) watch — HBTP: Heuristic Behavior Tree Planning with Large Language Model Reasoning
- (2026) recent — A Survey of Large Language Models
- (2026) watch — Use large language model to enhance reasoning of another large language model through reward updated GRPO
- A survey on large language model based autonomous agents(精读)— foundational 综述系统梳理LLM自主代理架构、记忆、规划与应用,直接支撑本Topic核心,适合建立整体框架
- Inner Monologue: Embodied Reasoning through Planning with Language Models(精读)— 经典具身语言规划方法,展示自然语言内在独白如何支持反馈式推理与任务完成,与驾驶/代理紧密相关
- OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving(中文笔记)— 结合预训练MLLM与CoT推理的开源端到端驾驶框架,提供语言推理在自动驾驶中的具体落地示例,有中文笔记可参考
推荐阅读路径
Section titled “推荐阅读路径”- 先读LLM自主代理综述,建立代理架构与语言规划整体图景
- 再读Towards Reasoning in Large Language Models: A Survey 与Inner Monologue,掌握推理机制与具身实现
- 然后结合OpenEMMA与VLM-in-AD survey理解驾驶场景应用
- 最后浏览机器人集成survey、RoboGPT及BadRobot,覆盖工程集成与安全风险
- 补充Learning to Plan with Natural Language等watch论文拓展规划语言视角
| Paper | 输入 | 输出 | 表示 | 训练目标 |
|---|---|---|---|---|
| Inner Monologue: Embodied Reasoning through Planning with Language Models | 语言指令+环境反馈 | 规划步骤与动作序列 | 自然语言内在独白 | 具身任务完成与纠错 |
| OpenEMMA: Open-Source Multimodal Model for End-to-End Autonomous Driving | 多模态感知+语言推理提示 | 速度/曲率预测积分轨迹 | CoT增强的MLLM表示 | 端到端自动驾驶规划 |
| A survey on large language model based autonomous agents | — | — | 代理组件综述(记忆/规划/工具) | 系统化LLM代理设计空间 |
| RoboGPT: An LLM-Based Long-Term Decision-Making Embodied Agent for Instruction Following Tasks | 长期指令与环境状态 | 决策序列 | LLM长期决策框架 | 指令跟随具身任务 |
工程实现与复现风险
Section titled “工程实现与复现风险”- 自然语言规划歧义导致动作错误或安全隐患
- 具身代理越狱(BadRobot类)在物理世界产生真实危害
- CoT推理延迟与计算开销影响实时驾驶决策
- 多模态对齐不足时语言推理与感知脱节
- 开源vs闭源模型可复现性与部署依赖问题
- 长时程任务中记忆与一致性崩溃
- 如何系统评估语言推理在真实驾驶闭环中的可靠性与安全性?
- Planning Language的形式化程度与灵活性如何最优权衡?
- LLM代理在开放世界中的长期自主性与灾难性遗忘如何解决?
- CoT等推理技术对具身约束(物理可行性)的内建程度待提升
- 多代理协作中的语言协商协议标准化问题
Topic 自测清单
Section titled “Topic 自测清单”- Chain-of-Thought如何提升LLM在具身规划任务中的表现?请结合OpenEMMA或Inner Monologue说明其作用机制。
- 什么是LLM Agent的核心组件?与纯语言模型的主要区别是什么?
- Inner Monologue方法中自然语言如何实现具身反馈闭环?潜在失败场景有哪些?
- BadRobot论文揭示的具身LLM代理安全风险是什么?对自动驾驶应用有何启示?
- 比较传统模块化自动驾驶与基于LLM/CoT的端到端语言推理框架(如OpenEMMA)在可扩展性与可解释性上的差异。
选篇附录(registry)
Section titled “选篇附录(registry)”本 Topic registry 入选 19 篇(foundational/recent/watch 见 papers.yml)。
论文池(FRW)
Section titled “论文池(FRW)”来自 research/papers.yml 的正式选题配额:基础必读 3 · 近期重要 5 · 观察 5。
可学习条目需本地 PDF 或已有精读/中文笔记;无正文资产的选题标为 待获取 PDF,不作为学习路径必读链接。
基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)
Section titled “基础必读(选题 3 · 可学习 2 · 待获取 PDF 1)”- A survey on large language model based autonomous agents (2024) · 固定 · 中文笔记
- A review of large language models and autonomous agents in chemistry (2024) · 中文笔记
- RoboGPT: An LLM-Based Long-Term Decision-Making Embodied Agent for Instruction Following Tasks (2025) · 待获取 PDF
近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)
Section titled “近期重要(选题 5 · 可学习 4 · 待获取 PDF 1)”- A survey on integration of large language models with intelligent robots (2024) · 固定 · 中文笔记
- Large language models empowered agent-based modeling and simulation: a survey and perspectives (2024) · 中文笔记
- Augmenting large language models with chemistry tools (2024) · 中文笔记
- A Survey of Large Language Models (2026) · 中文笔记
- Vision Language Models in Autonomous Driving: A Survey and Outlook (2024) · 待获取 PDF
观察清单(选题 8 · 可学习 3 · 待获取 PDF 5)
Section titled “观察清单(选题 8 · 可学习 3 · 待获取 PDF 5)”- Learning to Plan with Natural Language (2023) · 中文笔记
- HBTP: Heuristic Behavior Tree Planning with Large Language Model Reasoning (2025) · 中文笔记
- Use large language model to enhance reasoning of another large language model through reward updated GRPO (2026) · 中文笔记
- Autonomous chemical research with large language models (2023) · 待获取 PDF
- PaLM-E: An Embodied Multimodal Language Model (2023) · 待获取 PDF
- Evaluating Large Language Models Trained on Code (2021) · 待获取 PDF
- …另有 2 篇待获取 PDF
成熟度 seed · 内容数 19 · 论文池 16