华为天才少年的开源AI Agent全书:6700星、十章、可跑实验代码

图0-1:Agent = LLM + 上下文 + 工具

GitHub 上最近冲上 Trending 榜首的 bojieli/ai-agent-book,两天内收获超过 1700 颗星,总星标突破 6700。这不是又一个 Demo 项目或 API 封装库——它是一本完整的技术书:李博杰所著《深入理解 AI Agent:设计原理与工程实践》,全书正文、配图、编译版 PDF 和按章配套的实验代码全部开源。

作者的身份本身就是这本书信誉的背书。李博杰是华为"天才少年"计划首批入选者,曾任华为计算机网络与协议实验室副首席专家,目前是 Pine AI 的联合创始人和首席科学家。Pine AI 的核心业务,是让 AI 替用户打客服电话、协商账单、取消订阅、处理退款——动辄几十轮交涉、涉及真金白银的长程任务。这本书的每一条架构原则,都是从这种"出错就赔钱"的高风险场景中倒逼出来的。

核心公式:Agent = LLM + 上下文 + 工具

全书围绕一个公式展开:Agent = LLM + 上下文 + 工具

组成直觉类比学术映射(强化学习)作用
LLM大脑Policy(策略)理解意图、规划决策、判断下一步行动
上下文眼睛Observation Space(观察空间)Agent 在每个决策点能看到的全部信息——环境状态、对话历史、记忆、工具定义
工具手脚Action Space(动作空间)Agent 能执行的所有操作——搜索、代码执行、API 调用、文件操作

这个公式看起来简单,但每个词的含义远比字面丰富。以"上下文"为例:它不只是一段输入文本,而是 Agent 在当前决策点能看到的一切——环境信息、用户记忆、领域知识、自身状态和任务进展。工具也不只是几个 API 函数,而是从预定义的工具调用到按需加载的专业技能(Skills),从动态生成代码创造新能力到委托子 Agent 协作的完整能力体系。

十章结构:从基础到协作

全书分为三个部分,十章内容,每一章都配有可独立运行的实验代码:

主题核心内容
1Agent 基础知识"模型即 Agent"新范式,Harness 工程,ReAct 循环
2上下文工程KV Cache 友好设计,提示工程,Agent Skills,上下文压缩
3用户记忆和知识库用户记忆系统,RAG 管道,知识图谱,Agentic RAG
4工具MCP 协议,五类工具设计原则,事件驱动异步 Agent
5Coding Agent 与代码生成OpenClaw 架构,代码作为"创造新工具的工具"
6Agent 的评估评估环境,数据集设计,LLM-as-a-Judge,仿真环境
7模型后训练SFT vs RL,奖励信号设计,样本效率优化
8Agent 的自我进化从经验中学习,工具发现与创造,不改权重也能成长
9多模态与实时交互语音三范式,Computer Use,VLA 机器人操作
10多 Agent 协作协作分类框架,失败模式,Agent 社会与 Agent 经济

上下文工程:全书最关键的一章

第二章被作者定位为"全书最关键的一章"。原因在于:上下文决定 Agent 的能力上限。

这一章从大模型 API 的消息结构出发,讲清楚"上下文就是消息列表"这个地基,然后深入 KV Cache 的底层原理——一个在大多数 Agent 教程中被忽略但对生产级系统至关重要的主题。KV Cache 是大模型推理中复用历史计算结果的机制:如果上下文的管理方式让每轮对话都破坏缓存命中,延迟和成本会急剧上升。书中通过实验展示了常见的错误模式如何破坏缓存效率,以及正确的上下文设计如何显著降低延迟。

该章还覆盖了提示注入攻防。配套实验 prompt-injection 构造了 3 种攻击场景(直接注入、间接注入、记忆注入)× 4 种防御配置(无防御、提示词加固、来源标记、组合防御)的对照实验,用确定性规则统计攻击成功率。这种"逐层叠加防御后注入成功率显著下降"的定量分析,在 Agent 安全讨论中并不多见。

Harness 工程:模型之外的一切

书中提出了一个贯穿全书的概念——Harness。

Harness 原指马具:套在马身上的缰绳与挽具,不限制马的奔跑能力,而是把力量引导到正确方向。映射到 Agent 语境,模型是那匹强大但不可预测的马,Harness 是把模型能力引导成可靠任务执行的工程外壳。具体包括上下文管理、工具接口、安全约束、验证与纠正等基础设施。

作者在引言中给出了一个关键的实践判断:

模型越强大,围绕模型构建的 Harness 就越关键。模型自主决策的空间越大,出错时的影响面也越大,因此需要更精细的约束、验证和纠正机制来确保可靠性。模型厂商的真正优势在于对模型与外围 Harness 的协同优化和持续迭代,而非简单地"让框架变薄"。

这意味着 Agent 的核心竞争力不在模型本身(模型会持续升级),而在"模型之外的一切工程能力"——也就是 Harness。头部公司早已把 Harness 做深做透,只是在后来才给这些实践起了 Skill、harness、loop engineering 这样的名字。作者称之为"实践在前,命名在后"。

评估驱动:没有评估就没有进步

第六章构建了一套科学的评估方法论。核心理念只有一句话:没有评估,就没有进步。评估让你分辨一次改动究竟是真的变好了还是运气使然,让 Agent 的迭代方向不再依赖直觉。

这一章覆盖了评估环境(工具调用型和人机交互型两种核心范式)、数据集的设计原则、LLM-as-a-Judge 自动化评判方法,以及评估驱动的模型选型。书末还专门讨论了仿真环境——让 Agent 在模拟世界中完成大量试验来积累经验。

配套实验引入了 SWE-bench、GAIA、OSWorld、Tau-Bench、Terminal-Bench 等主流评测基准,让读者能在真实评测集上跑通评估闭环。

配套代码:可跑的实验

仓库中每个章节目录下都有完整的实验项目,按"可独立运行"、"复现指南"、"设计文档"三类标注。第 1-4 章的实验大多可以配置好 API Key 后直接运行,涵盖:

  • 强化学习 vs LLM 对比:通过寻宝游戏展示 LLM 以 250-400 倍的样本效率超越传统 RL
  • 上下文消融研究:系统消融 Agent 上下文各组件,支持 SiliconFlow Qwen、字节 Doubao、月之暗面 Kimi 等多种模型
  • KV Cache 实验:演示常见错误模式如何破坏缓存效率
  • 提示注入攻防:3×4 攻防对照实验,定量统计攻击成功率
  • 混合检索流水线:结合稠密检索、稀疏检索和神经重排序

第 5、8、9、10 章的多数实验也提供了对接真实 LLM API 验证跑通的 demo。训练类实验(第 7 章)依赖外部框架(MiniMind、verl、AdaptThink 等),仓库提供了克隆命令和验证过的 commit 版本。

"Whisper Coding":用 Agent 写关于 Agent 的书

作者在引言中透露了这本书的写作方式——"whisper coding"(口述式协作)。他使用 Pine 自己的语音 Agent 来完成口述调研和初稿整理,每次准备讲稿时先向 Agent 口述提纲,让它调研、整理初稿;讲完课后结合学员反馈与 Agent 反复讨论打磨。

整个过程多数时候不打字,而是口述。正常说话的速度约为打字的四倍,"口述—调研—讨论—修改"的循环因此转得很快。作者将其描述为"既是在讲 Agent,也是一件由 Agent 参与做成的作品"。

谁应该读

这本书的定位是面向有一定技术背景的读者:需要 Python 编程能力、LLM 基本使用经验、软件工程常识,建议熟悉至少一款 AI 辅助编程工具(Claude Code、Codex、Cursor 等)。不要求机器学习专家背景,第七章后训练以外对数学和 ML 的要求很低。

全书采用 Apache 2.0 开源许可,中英双语 PDF 均可从仓库直接下载。如果只读两章,作者建议优先读第一章(建立全局认知)和第二章(掌握上下文工程)。第五章关于 Coding Agent 的讨论也值得关注——书中论证了"Coding Agent + 文件系统"是所有通用 Agent 最核心的技术基础,代码是"能创造新工具的工具"。

仓库地址:https://github.com/bojieli/ai-agent-book

推荐阅读