Book Library
书库
/ The Hitchhiker's Guide to Agentic AI: From Foundations to Systems
The Hitchhiker's Guide to Agentic AI: From Foundations to Systems
作者:Haggai Roitman · 年份:2026 · 页数:603 · 语言:zh-CN
2026
阅读中文版
中英双语阅读
目录
封面
目录
免责声明
关于作者
前言
引言
基础
1 LLM Architecture and Optimization Methods
1.1 LLM的工作原理:直观概述
1.2 分词
1.3 Transformer架构
1.4 预测头:Transformer 输出什么
1.5 大语言模型训练的优化理论
1.6 Flash Attention——算法与硬件感知
1.7 预训练:最佳实践
1.8 监督微调(SFT)
1.9 LoRA与参数高效微调
1.10 混合专家模型(MoE)
1.11 LLM训练中的多样性
1.12 文本生成:解码方法
1.13 提示工程
1.14 模型压缩方法
1.15 推测解码方法
1.16 幻觉检测
1.17 LLM安全与负责任的人工智能
2 Systems Foundations for LLMs
2.1 GPU架构——从硅片到LLM训练
2.2 vLLM – PagedAttention 与高吞吐量推理
3 Introduction to Reinforcement Learning
3.1 马尔可夫决策过程(MDP)
3.2 核心概念与定义
3.3 强化学习方法的分类
3.4 时序差分学习
3.5 Q学习
3.6 策略梯度方法——REINFORCE
3.7 Actor-Critic 方法
3.8 广义优势估计(GAE)
3.9 同策略 vs 异策略——详细对比
3.10 基于模型 vs 无模型
3.11 奖励塑形
面向LLM的强化学习方法
4 RL Foundations for Language Models
4.1 LLM中RL的两种范式
4.2 将文本生成视为MDP
4.3 RLHF 流水线
4.4 本部分路线图
5 PPO — Proximal Policy Optimization
5.1 动机与历史
5.2 裁剪目标
5.3 完整PPO损失
5.4 PPO梯度与更新规则的推导
5.5 Rollout 缓冲区与 Rollout
5.6 用于RLHF的PPO:完整循环
5.7 详细机制:Logits与策略更新
5.8 TRL 实现
5.9 关键超参数
6 DPO — Direct Preference Optimization
6.1 动机
6.2 数学推导
6.3 梯度分析
6.4 TRL 实现
6.5 DPO 的工作原理:完整机制
6.6 DPO变体及其各自失效的情况
6.7 β 选择指南
6.8 DPO 批次大小配置与扩展
6.9 DPO 扩展与变体
7 GRPO — Group Relative Policy Optimization
7.1 动机
7.2 算法
7.3 TRL 实现
7.4 分组规模分析
7.5 GRPO 变体与扩展
8 Preference Optimization Variants
8.1 在线DPO
8.2 KTO——卡尼曼-特沃斯基优化
8.3 IPO——身份偏好优化
8.4 ORPO——优势比偏好优化
8.5 最佳N采样(拒绝采样)
8.6 总结:选择对齐方法
9 Reward Model Training
9.1 Bradley-Terry模型——完整推导
9.2 奖励模型架构
9.3 奖励模型训练技巧
9.4 过程奖励模型与结果奖励模型
9.5 基于规则的RLVR奖励
9.6 多目标奖励——组合策略
9.7 基于列表排序的奖励
10 SFT Best Practices and Techniques
10.1 序列打包以提高效率
10.2 聊天模板与格式化
10.3 仅完成掩码
10.4 多任务SFT的数据混合策略
10.5 当SFT造成伤害——灾难性遗忘与对齐税
10.6 与RL的关联——SFT质量决定RL上限
11 System Architecture & Infrastructure at Scale
11.1 四模型内存挑战
11.2 并行策略详解
11.3 生成瓶颈:定量分析
11.4 解耦架构:生产设计
11.5 权重同步策略
11.6 内存优化技术
11.7 大规模容错
11.8 端到端延迟分解
11.9 监控与可观测性
11.10 网络拓扑与通信模式
11.11 训练吞吐量与模型FLOPs利用率
11.12 成本分析与云部署
11.13 分布式检查点
11.14 硬件选择指南
11.15 RL训练优化器配置
12 LLM Agentic Training
12.1 动机:从聊天机器人到自主智能体
12.2 LLM智能体的轨迹缓冲区
12.3 操作范式
12.4 范式比较
12.5 智能体强化学习的主要技术
12.6 用例:面向生产力副驾驶的智能体强化学习
12.7 用例:从零构建研究智能体
12.8 面向LLM智能体的最先进强化学习
推理
13 RL for Large Reasoning Models
13.1 动机与背景
13.2 测试时扩展方法
13.3 DeepSeek-R1
13.4 OpenAI o1/o3 系列
13.5 QwQ与Qwen推理模型
13.6 具有数学基础的关键方法
13.7 推理的缩放定律
13.8 推理模型比较
13.9 总结与开放问题
评估
14 LLM Evaluation
14.1 评估方案设计
14.2 评估数据收集
14.3 用于评估的合成数据生成
14.4 排序任务的指标
14.5 生成任务的指标
14.6 智能体任务的评估指标
14.7 LLM作为评判者
14.8 评估陷阱
智能体AI
15 智能体AI简介
16 Retrieval-Augmented Generation (RAG)
16.1 动机与问题陈述
16.2 核心 RAG 架构
16.3 检索方法
16.4 分块策略
16.5 高级RAG模式
16.6 高效RAG解码:REFRAG
16.7 智能体RAG
16.8 评估
16.9 生产考虑
16.10 RAG与微调的协同
16.11 综合RAG方法比较
17 Agentic Memory Systems
17.1 动机:为什么智能体需要记忆
17.2 记忆类型的分类
17.3 内存架构
17.4 记忆操作
17.5 多轮对话的记忆
17.6 多智能体系统的记忆
17.7 使用强化学习训练记忆系统
17.8 记忆方法比较
17.9 评估记忆系统
17.10 实现模式
17.11 智能体记忆的最新进展
17.12 总结
18 Agent Harness – Context Management
18.1 什么是智能体框架?
18.2 上下文窗口管理
18.3 提示架构
18.4 工具集成与执行
18.5 编排模式
18.6 状态管理
18.7 错误处理与恢复
18.8 扩展与生产关注点
18.9 框架比较
18.10 实现:生产级代理框架
19 Agent Design Patterns
19.1 工作流模式
19.2 自主智能体模式
19.3 设计原则
19.4 模式选择指南
20 Agentic Environments and Benchmarks
20.1 动机:为什么智能体需要环境
20.2 环境设计原则
20.3 智能体环境的类型
20.4 OpenEnv:标准化的智能体环境接口
20.5 构建自定义环境
20.6 环境-智能体接口模式
20.7 评估框架设计
20.8 代码示例:最小自定义LLM智能体环境
20.9 主要智能体环境比较
20.10 总结
21 Model Context Protocol (MCP)
21.1 动机:工具集成问题
21.2 架构概述
21.3 核心原语
21.4 协议规范
21.5 工具定义与发现
21.6 安全模型
21.7 实现模式
21.8 MCP 生态系统
21.9 MCP 与替代方案
21.10 用于智能体训练的 MCP
21.11 总结
22 Agent Skills
22.1 什么是技能?
22.2 技能架构模式
22.3 案例研究:Anthropic 的智能体设计
22.4 技能生命周期
22.5 技能注册表与市场
22.6 技能 vs. 微调
23 Agent-to-Agent Communication (A2A)
23.1 动机:为什么智能体必须通信
23.2 Google A2A 协议
23.3 通信模式
23.4 智能体发现与路由
23.5 消息格式与模式
23.6 协调协议
23.7 A2A 与 MCP:互补协议
23.8 多智能体系统中的安全与信任
23.9 实现示例:多智能体研究工作流
23.10 总结
24 Multi-Agent Systems
24.1 动机:为什么需要多个智能体?
24.2 多智能体架构
24.3 协调机制
24.4 通信协议
24.5 角色设计与专业化
24.6 面向大语言模型的多智能体模式
24.7 使用强化学习训练多智能体系统
24.8 挑战与解决方案
24.9 现实世界中的多智能体应用
24.10 架构比较
24.11 总结
25 Agent Development Frameworks
25.1 动机:工程差距
25.2 智能体开发生命周期
25.3 主要框架:深入探讨
25.4 开源智能体工具
25.5 智能体测试与评估
25.6 可观测性与调试
25.7 生产部署模式
25.8 框架比较
25.9 完整实现示例:生产研究 代理
25.10 总结
26 Agentic UI Frameworks
26.1 动机:超越聊天框
26.2 代理的UI范式
26.3 代理的关键UI组件
26.4 框架和库
26.5 生成式UI
26.6 流式与实时模式
26.7 人在环中的UI设计
26.8 可访问性与信任
26.9 实现示例:全栈代理UI
26.10 总结
评估与参考
27 Quiz Questions & Detailed Answers
27.1 基础问题
27.2 核心算法问题
27.3 系统设计问题
27.4 实践与调试问题
27.5 GRPO变体与高级强化学习问题
27.6 DPO扩展问题
27.7 GPU架构与硬件问题
27.8 优化与训练问题
27.9 奖励模型与SFT问题
27.10 系统架构扩展问题
27.11 Transformer架构问题
27.12 Flash Attention问题
27.13 LoRA与PEFT问题
27.14 模型压缩问题
27.15 混合专家模型问题
27.16 训练多样性问题
27.17 推测解码问题
27.18 智能体强化学习问题
27.19 列表级奖励与高级奖励模型问题
27.20 大型推理模型的强化学习问题
27.21 大语言模型评估问题
27.22 智能体记忆问题
27.23 智能体编排问题
27.24 MCP协议问题
27.25 智能体通信(A2A)问题
27.26 多智能体系统问题
27.27 智能体开发框架问题
27.28 智能体环境问题
27.29 智能体UI框架问题
27.30 RAG与智能体RAG问题
28 Quick Reference
28.1 核心强化学习与对齐方程
28.2 Transformer与架构公式
28.3 解码方法
28.4 系统与并行化
28.5 GPU硬件规格
28.6 超参数范围
28.7 TRL API 快速参考
28.8 RAG 流水线公式
28.9 智能体设计模式
28.10 智能体通信协议
28.11 上下文窗口预算
28.12 常见故障模式与修复
28.13 方法选择决策树
28.14 评估指标
28.15 推理与测试时扩展
28.16 记忆系统类型
28.17 MCP 快速参考
28.18 A2A 协议快速参考
28.19 智能体框架比较
28.20 智能体强化学习公式
28.21 智能体安全清单
28.22 智能体评估指标
28.23 关键智能体基准
29 Conclusion and Future Directions
29.1 总结
29.2 未来展望:开放挑战
29.3 延伸阅读
参考文献