操作形态学:自修改 LLM 智能体的具身认知
Part I · 基础:LLM 智能体
第 1 章 · LLM 智能体时代
- 学习目标
- 先修知识
- 章节地图
- 1.1 从语言模型到行动者
- 1.2 工具调用作为通用接口
- 1.3 反思与短期记忆
- 1.4 自进化 Agent 的边界
- 1.5 本书路线图
- 本章小结
- 推荐阅读
- 练习题
- 常见误区
- 参考文献(本章内)
第 2 章 · 智能体基础:感知、决策、行动、反馈
- 学习目标
- 先修知识
- 章节地图
- 2.1 Agent 的四元组结构
- 2.2 控制论视角:开环与闭环
- 2.3 POMDP:部分可观察的世界
- 2.4 强化学习与 LLM Agent 的范式对比
- 2.5 本章小结与第 3 章预告
- 本章小结
- 推荐阅读
- 练习题
- 参考文献(本章内)
第 3 章 · 工具与函数调用
- 学习目标
- 先修知识
- 章节地图
- 3.1 工具的本质:从 API 调用到结构化动作
- 3.2 JSON Schema:工具签名的形式语言
- 3.3 错误恢复:重试、降级、切换
- 3.4 三大协议对比:OpenAI / Anthropic / Google
- 3.5 工具描述工程:把工具变成 LLM 的“第一公民“
- 3.6 本章小结与第 4 章预告
- 本章小结
- 推荐阅读
- 练习题
- 参考文献(本章内)
第 4 章 · 提示词工程:从静态到动态
- 学习目标
- 先修知识
- 章节地图
- 4.1 静态 prompt 的工程局限
- 4.2 OPRO:让 LLM 自身作为优化器
- 4.3 DSPy:把 prompt 编译为可签名
- 4.4 PromptAgent:用 MCTS 策略性搜索
- 4.5 自修改 prompt 的安全边界
- 4.6 本章小结与第 5 章预告
- 本章小结
- 推荐阅读
- 练习题
- 参考文献(本章内)
第 5 章 · 上下文工程与短期记忆
- 学习目标
- 先修知识
- 章节地图
- 5.1 上下文窗口:LLM 的“工作记忆“
- 5.2 Token 预算与计费
- 5.3 Lost in the Middle:长上下文的陷阱
- 5.4 上下文压缩:LongLLMLingua 等方法
- 5.5 短期记忆的三种实现
- 5.6 本章小结与第 6 章预告
- 本章小结
- 推荐阅读
- 练习题
- 参考文献(本章内)
第 6 章 · 长期记忆与检索增强
- 学习目标
- 先修知识
- 章节地图
- 6.1 长期记忆的三大类
- 6.2 MemGPT:把 LLM 当作操作系统
- 6.3 A-MEM:Zettelkasten 风格的动态记忆网络
- 6.4 检索增强生成(RAG):长期记忆的核心技术
- 6.5 O-Mem 与 Mem0:长期记忆的工程化方案
- 6.6 长期记忆的评测
- 6.7 本章小结
- 本章小结
- 推荐阅读
- 练习题
- 参考文献(本章内)
Part II · 具身认知与计算形态学
第 7 章 · 4E Cognition 简史
- 学习目标
- 先修知识
- 章节地图
- 7.1 经典认知科学的反例
- 7.2 Gibson:affordance 与生态心理学
- 7.3 Embodied:身体对认知的塑造
- 7.4 Embedded:环境作为认知系统的一部分
- 7.5 Enacted:行动产生认知
- 7.6 Extended:延展心智假说
- 7.7 4E Cognition 阵营内的分歧
- 7.8 4E 与 LLM Agent 的映射
- 7.9 本章小结与第 8 章预告
- 本章小结
- 推荐阅读
- 练习题
- 参考文献(本章内)
第 8 章 · Enactivism 与自创生
- 学习目标
- 先修知识
- 章节地图
- 8.1 生命-心灵连续性论题
- 8.2 Autopoiesis:生命的最小组织
- 8.3 Enaction:认知即行动
- 8.4 感觉运动理论:知觉是技能
- 8.5 Radical Enactivism:基本心 智无内容
- 8.6 Enactivism 对 LLM Agent 的边界
- 8.7 本章小结与第 9 章预告
- 本章小结
- 推荐阅读
- 练习题
- 参考文献(本章内)
第 9 章 · Extended Mind 与延展心智
- 学习目标
- 先修知识
- 章节地图
- 9.1 Otto 与 Inga:延展心智的思想实验
- 9.2 Parity Principle 的形式化
- 9.3 Active Externalism 三大论据
- 9.4 Adams & Aizawa 的反驳:non-derived content
- 9.5 Rupert 的“耦合-构成混淆“
- 9.6 第三波延展认知
- 9.7 延展心智与 LLM Agent:操作形态延展
- 9.8 本章小结与第 10 章预告
- 本章小结
- 推荐阅读
- 练习题
- 参考文献(本章内)
第 10 章 · 具身 AI 与机器人认知
- 学习目标
- 先修知识
- 章节地图
- 10.1 经典 AI 的身体缺失
- 10.2 Brooks:subsumption 架构与“无表征智能“
- 10.3 Pfeifer:形态学与智能
- 10.4 Embodied Foundation Models:PaLM-E、RT-2、Octo
- 10.5 Embodied AI 与 LLM Agent 的关系
- 10.6 本章小结与第 11 章预告
- 本章小结
- 推荐阅读
- 练习题
- 参考文献(本章内)
第 11 章 · 当工具成为身体:操作形态假说
- 学习目标
- 先修知识
- 章节地图
- 11.1 4E Cognition 的“身体“还差什么
- 11.2 操作形态的形式化
- 11.3 元控制器 U:谁修改 B
- 11.4 操作形态 vs enactivism vs extended mind
- 11.5 五个可证伪假设
- 11.6 实验验证设计
- 11.7 操作形态的可塑性边界
- 11.8 本章小结与第 12 章预告
- 本章小结
- 推荐阅读
- 练习题
- 参考文献(本章内)
Part III · 自进化系统
第 12 章 · 自修改提示词:从 OPRO 到 PE2
- 学习目标
- 先修知识
- 章节地图
- 12.1 操作形态学的第一个应用:修改 P
- 12.2 OPRO:LLM 作为优化器
- 12.3 DSPy:把 prompt 编译为可签名
- 12.4 PromptAgent:用 MCTS 全局搜索
- 12.5 PE2:反射式进化
- 12.6 Prompt 自修改的 4 类安全风险
- 12.7 H1 的第一个验证案例
- 12.8 本章小结与第 13 章预告
- 本章小结
- 推荐阅读
- 练习题
- 参考文献(本章内)
第 13 章 · 自动工具创建与重构
- 学习目标
- 先修知识
- 章节地图
- 13.1 操作形态学的第二个应用:修改 T
- 13.2 LATM:让 LLM 自己造工具
- 13.3 Voyager:无限增长的技能库
- 13.4 AFlow:工作流自动进化
- 13.5 EvoAgent:多 Agent 系统自动生成
- 13.6 AlphaEvolve:整个代码库作为进化对象
- 13.7 工具生命周期治理
- 13.8 H1 的第二个验证案例
- 13.9 本章小结与第 14 章预告
- 本章小结
- 推荐阅读
- 练习题
- 参考文献(本章内)
第 14 章 · 自适应记忆结构
- 学习目标
- 先修知识
- 章节地图
- 14.1 操作形态学的第三个应用:修改 M
- 14.2 MemGPT:把 LLM 当作操作系统
- 14.3 A-MEM:Zettelkasten 风格的动态记忆网络
- 14.4 O-Mem:主动用户画像与层级检索
- 14.5 Mem0:工业级记忆层抽象
- 14.6 记忆一致性与冲突解决
- 14.7 记忆衰减与遗忘机制
- 14.8 H1 的第三个验证案例
- 14.9 本章小结与第 15 章预告
- 本章小结
