华为天才少年的开源AI Agent全书:6700星、十章、可跑实验代码

GitHub 上最近冲上 Trending 榜首的 bojieli/ai-agent-book,两天内收获超过 1700 颗星,总星标突破 6700。这不是又一个 Demo 项目或 API 封装库——它是一本完整的技术书:李博杰所著《深入理解 AI Agent:设计原理与工程实践》,全书正文、配图、编译版 PDF 和按章配套的实验代码全部开源。
作者的身份本身就是这本书信誉的背书。李博杰是华为"天才少年"计划首批入选者,曾任华为计算机网络与协议实验室副首席专家,目前是 Pine AI 的联合创始人和首席科学家。Pine AI 的核心业务,是让 AI 替用户打客服电话、协商账单、取消订阅、处理退款——动辄几十轮交涉、涉及真金白银的长程任务。这本书的每一条架构原则,都是从这种"出错就赔钱"的高风险场景中倒逼出来的。
核心公式:Agent = LLM + 上下文 + 工具
全书围绕一个公式展开:Agent = LLM + 上下文 + 工具。
| 组成 | 直觉类比 | 学术映射(强化学习) | 作用 |
|---|---|---|---|
| LLM | 大脑 | Policy(策略) | 理解意图、规划决策、判断下一步行动 |
| 上下文 | 眼睛 | Observation Space(观察空间) | Agent 在每个决策点能看到的全部信息——环境状态、对话历史、记忆、工具定义 |
| 工具 | 手脚 | Action Space(动作空间) | Agent 能执行的所有操作——搜索、代码执行、API 调用、文件操作 |
这个公式看起来简单,但每个词的含义远比字面丰富。以"上下文"为例:它不只是一段输入文本,而是 Agent 在当前决策点能看到的一切——环境信息、用户记忆、领域知识、自身状态和任务进展。工具也不只是几个 API 函数,而是从预定义的工具调用到按需加载的专业技能(Skills),从动态生成代码创造新能力到委托子 Agent 协作的完整能力体系。
十章结构:从基础到协作
全书分为三个部分,十章内容,每一章都配有可独立运行的实验代码:
| 章 | 主题 | 核心内容 |
|---|---|---|
| 1 | Agent 基础知识 | "模型即 Agent"新范式,Harness 工程,ReAct 循环 |
| 2 | 上下文工程 | KV Cache 友好设计,提示工程,Agent Skills,上下文压缩 |
| 3 | 用户记忆和知识库 | 用户记忆系统,RAG 管道,知识图谱,Agentic RAG |
| 4 | 工具 | MCP 协议,五类工具设计原则,事件驱动异步 Agent |
| 5 | Coding Agent 与代码生成 | OpenClaw 架构,代码作为"创造新工具的工具" |
| 6 | Agent 的评估 | 评估环境,数据集设计,LLM-as-a-Judge,仿真环境 |
| 7 | 模型后训练 | SFT vs RL,奖励信号设计,样本效率优化 |
| 8 | Agent 的自我进化 | 从经验中学习,工具发现与创造,不改权重也能成长 |
| 9 | 多模态与实时交互 | 语音三范式,Computer Use,VLA 机器人操作 |
| 10 | 多 Agent 协作 | 协作分类框架,失败模式,Agent 社会与 Agent 经济 |
上下文工程:全书最关键的一章
第二章被作者定位为"全书最关键的一章"。原因在于:上下文决定 Agent 的能力上限。
这一章从大模型 API 的消息结构出发,讲清楚"上下文就是消息列表"这个地基,然后深入 KV Cache 的底层原理——一个在大多数 Agent 教程中被忽略但对生产级系统至关重要的主题。KV Cache 是大模型推理中复用历史计算结果的机制:如果上下文的管理方式让每轮对话都破坏缓存命中,延迟和成本会急剧上升。书中通过实验展示了常见的错误模式如何破坏缓存效率,以及正确的上下文设计如何显著降低延迟。
该章还覆盖了提示注入攻防。配套实验 prompt-injection 构造了 3 种攻击场景(直接注入、间接注入、记忆注入)× 4 种防御配置(无防御、提示词加固、来源标记、组合防御)的对照实验,用确定性规则统计攻击成功率。这种"逐层叠加防御后注入成功率显著下降"的定量分析,在 Agent 安全讨论中并不多见。
Harness 工程:模型之外的一切
书中提出了一个贯穿全书的概念——Harness。
Harness 原指马具:套在马身上的缰绳与挽具,不限制马的奔跑能力,而是把力量引导到正确方向。映射到 Agent 语境,模型是那匹强大但不可预测的马,Harness 是把模型能力引导成可靠任务执行的工程外壳。具体包括上下文管理、工具接口、安全约束、验证与纠正等基础设施。
作者在引言中给出了一个关键的实践判断:
模型越强大,围绕模型构建的 Harness 就越关键。模型自主决策的空间越大,出错时的影响面也越大,因此需要更精细的约束、验证和纠正机制来确保可靠性。模型厂商的真正优势在于对模型与外围 Harness 的协同优化和持续迭代,而非简单地"让框架变薄"。
这意味着 Agent 的核心竞争力不在模型本身(模型会持续升级),而在"模型之外的一切工程能力"——也就是 Harness。头部公司早已把 Harness 做深做透,只是在后来才给这些实践起了 Skill、harness、loop engineering 这样的名字。作者称之为"实践在前,命名在后"。
评估驱动:没有评估就没有进步
第六章构建了一套科学的评估方法论。核心理念只有一句话:没有评估,就没有进步。评估让你分辨一次改动究竟是真的变好了还是运气使然,让 Agent 的迭代方向不再依赖直觉。
这一章覆盖了评估环境(工具调用型和人机交互型两种核心范式)、数据集的设计原则、LLM-as-a-Judge 自动化评判方法,以及评估驱动的模型选型。书末还专门讨论了仿真环境——让 Agent 在模拟世界中完成大量试验来积累经验。
配套实验引入了 SWE-bench、GAIA、OSWorld、Tau-Bench、Terminal-Bench 等主流评测基准,让读者能在真实评测集上跑通评估闭环。
配套代码:可跑的实验
仓库中每个章节目录下都有完整的实验项目,按"可独立运行"、"复现指南"、"设计文档"三类标注。第 1-4 章的实验大多可以配置好 API Key 后直接运行,涵盖:
- 强化学习 vs LLM 对比:通过寻宝游戏展示 LLM 以 250-400 倍的样本效率超越传统 RL
- 上下文消融研究:系统消融 Agent 上下文各组件,支持 SiliconFlow Qwen、字节 Doubao、月之暗面 Kimi 等多种模型
- KV Cache 实验:演示常见错误模式如何破坏缓存效率
- 提示注入攻防:3×4 攻防对照实验,定量统计攻击成功率
- 混合检索流水线:结合稠密检索、稀疏检索和神经重排序
第 5、8、9、10 章的多数实验也提供了对接真实 LLM API 验证跑通的 demo。训练类实验(第 7 章)依赖外部框架(MiniMind、verl、AdaptThink 等),仓库提供了克隆命令和验证过的 commit 版本。
"Whisper Coding":用 Agent 写关于 Agent 的书
作者在引言中透露了这本书的写作方式——"whisper coding"(口述式协作)。他使用 Pine 自己的语音 Agent 来完成口述调研和初稿整理,每次准备讲稿时先向 Agent 口述提纲,让它调研、整理初稿;讲完课后结合学员反馈与 Agent 反复讨论打磨。
整个过程多数时候不打字,而是口述。正常说话的速度约为打字的四倍,"口述—调研—讨论—修改"的循环因此转得很快。作者将其描述为"既是在讲 Agent,也是一件由 Agent 参与做成的作品"。
谁应该读
这本书的定位是面向有一定技术背景的读者:需要 Python 编程能力、LLM 基本使用经验、软件工程常识,建议熟悉至少一款 AI 辅助编程工具(Claude Code、Codex、Cursor 等)。不要求机器学习专家背景,第七章后训练以外对数学和 ML 的要求很低。
全书采用 Apache 2.0 开源许可,中英双语 PDF 均可从仓库直接下载。如果只读两章,作者建议优先读第一章(建立全局认知)和第二章(掌握上下文工程)。第五章关于 Coding Agent 的讨论也值得关注——书中论证了"Coding Agent + 文件系统"是所有通用 Agent 最核心的技术基础,代码是"能创造新工具的工具"。
仓库地址:https://github.com/bojieli/ai-agent-book
- 美国政府要求 OpenAI 分阶段发布 GPT-5.66/26/2026
- Anthropic 获美国政府批准,恢复 Mythos 5 模型对关键基础设施组织的部署6/27/2026
- 华为开源 920 亿参数 openPangu-2.0-Flash 模型6/30/2026
- xAI 开源 Grok Build:Rust 编写的终端编程代理7/15/2026
- 腾讯玄武阿图因AI在CyberGym测试中超越Mythos7/3/2026
- Gemini Omni Flash 登顶 Video Arena 盲测榜,领先第二名 101 分7/3/2026
- DeepSeek 联合北大开源 DSpark:半自回归推测解码,推理速度提升 57% 至 85%6/27/2026
- Cursor 研究:越强的 AI 模型越会"作弊"应对编程基准测试6/26/2026
- Claude Code 被指通过 system prompt 隐蔽传递代理与时区信息6/30/2026
- 苹果首款触屏 MacBook 确认搭载 M5 Pro/Max,M7 版计划 2027 年跟进6/27/2026
- AI 代码审查的 token 困境:code-review-graph 如何用代码图谱砍掉 98% 的上下文7/20/2026
- OmniRoute:日增 1300+ Star 的开源 AI 网关,一个端点接通 250 个模型提供商7/20/2026
- Voicebox:43K Stars 的开源 AI 语音工作室,7 引擎 TTS + MCP Agent 集成7/19/2026
- Hallmark:一份写给AI编码助手的反AI味设计手册7/17/2026
- OpenSEO:5800 Star 的开源 SEO 工具,10 美元/月挑战 Semrush 与 Ahrefs7/20/2026
- B站在WAIC展出开源AI猫娘:能看懂屏幕、主动搭话的桌面伙伴7/18/2026
- Kimi K3 首登 DeepSWE v1.1:开源权重模型挤进前三7/18/2026
- 27B 模型塞进手机:PrismML Bonsai 27B 把权重压到 1-bit7/18/2026
- Qwen3.8 发布:2.4T 参数、原生多模态、开放权重承诺7/19/2026
- GPT-5.6用一段十页提示词,关闭凸优化30年的复杂性缺口7/19/2026
- Moonshine Micro:80美分芯片跑完整语音流水线,500KB内存装下VAD+STT+TTS7/18/2026
- LingBot-Map:用前馈3D基础模型做流式重建,20FPS跑完一万帧7/18/2026
- 马斯克:AI 和机器人将让工作变为可选,实现全民高收入7/3/2026
- Kimi K3:2.8万亿参数开源模型,前端编程Arena登顶7/17/2026
- 香港处理中国过半芯片进口创历史新高:AI贸易重塑亚洲供应链7/5/2026
- Linux登顶2026 CVE漏洞榜:内核维护者称这是好事7/4/2026
- 2026 年 AI 都学会了记忆,但你的记忆不属于你7/19/2026
- transcribe.cpp:一个 ggml 运行时跑完 16 个语音转文字模型家族7/19/2026
- 从老鼠视皮层还原10秒视频:大脑视觉编码研究的里程碑7/13/2026
- Meta大脑读心术:非侵入式脑机接口解码句子准确率创新高7/11/2026