# 智能体 AI 漫游指南：从基础到系统

> 金屋电子书图书详情的 Markdown 版本。

- 规范页面：https://pdfs.top/book/6yucl
- Markdown 版本：https://pdfs.top/book/6yucl.md
- 作者：Haggai Roitman
- 译者：祝健聪
- 出版社：无
- 出版日期：2026-01-01
- 语言：中文
- 分类：计算机、人工智能(AI)
- 评分：10
- 可用格式：PDF（15.40 MB，599 页）
- 更新时间：2026-09-16 16:44:30

## 下载方式

本站不在 Markdown 页面直接提供文件地址。请前往规范页面，点击对应格式的下载按钮完成下载。

### PDF

- 文件格式：PDF
- 文件大小：15.40 MB
- 页数：599 页
- 下载说明：请打开规范页面 https://pdfs.top/book/6yucl，点击 PDF 的下载按钮完成下载。


## 内容简介

本书是 Haggai Roitman 所著《The Hitchhiker's Guide to Agentic AI: From Foundations to Systems》一书的非官方中文译本。

全书 30 章、6 个板块、598 页，系统覆盖了从 Transformer 内部机制、GPU 训练系统、强化学习、对齐方法、推理模型，到智能体编排、多智能体协作与 Agentic UI 的完整技术栈。面向希望快速建立"从底层硬件 → 训练算法 → 智能体系统"完整图景的中文读者。

本书译文地址：https://github.com/Chasing1020/agentic-ai-guide-zh
英文版原文地址：https://arxiv.org/abs/2606.24937

构建智能 AI 系统，需要掌握极其广阔的知识——从 Transformer 内部如何处理语言，到使训练赖以达成的硬件与系统与高效的优化技术，再到教会模型推理并与人类意图对齐的强化学习算法，乃至大规模协调自主系统的多智能体架构。这些知识散落在数百篇论文、博客文章、代码仓库，以及少数实验室内部的“部落知识”之中。从业者需要一份覆盖整套技术栈的统一参考，不仅是理论，更需包括能让事物真正运转起来的实现细节。

面向想要理解并搭建现代 AI 完整技术栈的从业者，这份指南带领读者从第一性原理走到生产系统。构建优秀的 AI 系统需要理解整条流水线，而不仅是某一层：调试训练过程的工程师需要理解 GPU 显存层级与优化器动力学；做微调的从业者要知道何时 LoRA 已足够、何时全参数训练值得这个成本；Agent 开发者需要理解底层模型是如何训练出来的；评估框架的技术负责人需要理解每个框架做出了怎样的权衡。本书将提供这幅完整的图景。

这本开源书共 30 章，被组织为六个部分。

- 第一部分“基础篇”（第 1~3 章）铺垫 LLM 架构与优化、AI 系统技术栈，以及经典强化学习理论知识。

- 第二部分“面向 LLM 的 RL 方法”（第 4~12 章）首先介绍语言模型的 RL 基础，再完整地数学化处理 PPO、DPO、GRPO 与偏好优化变体、reward 模型训练、SFT 最佳实践、大规模系统架构，以及基于轨迹级 RL 的智能体训练。

- 第三部分“推理篇”（第 13 章）讲解大型推理模型 RL 如何发现思维链、MCTS、过程奖励模型与测试时算力扩展。

- 第四部分“评估篇”（第 14 章）全面介绍 LLM 评估方法论，包括评估指标、LLM-as-Judge、人工标注、基准套件、污染检测，以及智能体评估。

- 第五部分“智能体 AI”（第 15~27 章）阐明完整的智能体技术栈，包括智能体 AI 基础、检索增强生成（RAG）与检索、记忆系统、编排与上下文管理、循环工程（Loop Engineering）、设计模式、智能体环境与基准、MCP、Agent Skills、A2A 通信、多智能体系统、开发框架以及智能体 UI。

- 第六部分“自测与参考”（第 28~30 章）覆盖全部主题的 108 道详细测验题与完整解答；快速参考一览，整合关键公式、API 参考与失败模式诊断；以及关于未来方向的总结。

阅读本书将使学习者丰获满满：

- 理解 LLM 内部机制，包括注意力机制、位置编码、MoE 路由和 Flash Attention；

- 理解 GPU 系统、分布式训练、推理优化和基于 vLLM 的生产部署；

- 掌握 LoRA/QLoRA、量化、知识蒸馏、优化器选择和学习率调度等高效训练与微调方法；

- 理解 RLHF、DPO、GRPO、KTO 等偏好优化流程，以及奖励黑客和模式崩塌等常见问题；

- 理解 DeepSeek-R1、OpenAI o1/o3 和 QwQ 等推理模型如何通过强化学习获得推理能力；

- 掌握 Agent 编排、记忆设计、MCP 工具集成、A2A 多 Agent 协调和 Agent 评估方法。
