人工智能书籍推荐:理论、工程实践与大规模并行训练
人工智能前沿方向发展迅速,但真正经久不衰的知识仍来自算法、概率、优化、计算理论和扎实的工程训练。这份书单不追求罗列热门模型,而是试图搭出一条从“能完成机器学习项目”到“能读懂方法、论文与理论边界”的路径。书目信息核对于 2026 年 9 月 2 日,为最新版和预出版稿提供时间语境。
怎样使用这份书单
| 层次 | 书籍 | 当前版本 | 主要作用 |
|---|---|---|---|
| 数学先修 | Introduction to Applied Linear Algebra | 2018 年版 | 向量、矩阵、最小二乘及应用建模 |
| 基础·实践 | Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow | 第 3 版,2022;2025 年第三次修订发布 | 经典机器学习与 TensorFlow/Keras 工程实践 |
| 基础·实践 | Hands-On Machine Learning with Scikit-Learn and PyTorch | 2025 年首版 | 面向 PyTorch、Hugging Face 的新实践路线 |
| 基础·全景 | Artificial Intelligence: A Modern Approach | 第 4 版,2020(©2021) | 搜索、推理、学习、规划、伦理等 AI 全景 |
| 基础至进阶 | Computer Vision: A Modern Approach | 第 2 版,2011(©2012) | 成像、几何与传统视觉方法 |
| 进阶·算法 | Introduction to Algorithms | 第 4 版,2022 | 算法设计与复杂度分析 |
| 进阶·优化 | Convex Optimization | 2004 年版 | 凸分析、对偶与数值优化 |
| 进阶·概率 | Probability and Computing | 第 2 版,2017 | 计算机科学中的概率工具与随机分析 |
| 进阶·随机算法 | Randomized Algorithms | 1995 年版 | 随机算法设计与严格分析 |
| 进阶·理论 | Introduction to the Theory of Computation | 第 3 版,2012(©2013) | 自动机、可计算性与复杂性理论 |
| 专题·深度学习 | Understanding Deep Learning | 2023 年版 | 现代深度学习机制与模型族 |
| 专题·视觉 | Computer Vision: Algorithms and Applications | 第 2 版,2022 | 现代计算机视觉的系统参考 |
| 专题·概率学习 | Probabilistic Machine Learning: An Introduction | 2022 年版 | 概率建模、推断与决策 |
| 系统·GPU | Programming Massively Parallel Processors | 第 5 版,2026 | CUDA、GPU 内核与多 GPU 编程 |
| 系统·分布式模式 | Distributed Machine Learning Patterns | 2023 年版 | 通信、训练、容错与编排模式 |
| 系统·LLM 训练 | The Ultra-Scale Playbook | 2025 年版 | 大模型五维并行与通信—计算重叠 |
| 系统·集群全景 | Machine Learning Systems at Scale | 公开草稿 v0.2.1,2026 | 算力、网络、存储、训练、推理与运维 |
基础:建立工程能力与 AI 全景
1. Hands-On Machine Learning with Scikit-Learn, Keras, and TensorFlow, 3rd Edition

- 作者: Aurélien Géron
- 版本与出版: 第 3 版,O’Reilly Media,2022 年 10 月;该版第三次修订发布于 2025 年 3 月 7 日
- ISBN: 978-1-098-12597-4(纸书)
- 资料: O’Reilly 书籍页面
这是清单中最适合作为第一本动手教材的书。前半部分覆盖回归、分类、支持向量机、树模型、集成学习、降维和无监督学习,后半部分转向 Keras 与 TensorFlow 下的神经网络、CNN、序列模型、Transformer、生成模型和强化学习。
它的优势是把数据准备、训练、评估、调参与部署意识放进同一套工作流;局限则是框架细节会比数学原理更快过时。阅读时应实际运行作者的 Notebook,并为每章保留一个可复现的小项目,而不是只阅读代码片段。
2. Hands-On Machine Learning with Scikit-Learn and PyTorch

- 作者: Aurélien Géron
- 版本与出版: 首版,O’Reilly Media,2025 年 10 月
- ISBN: 979-8-3416-0797-2(电子版)
- 资料: O’Reilly 书籍页面
这是对原清单的必要补充。它延续 Géron 的项目式讲解,但把深度学习实践转到 PyTorch,并纳入 Hugging Face 生态、Transformer、扩散模型等内容。
两本 Hands-On Machine Learning 不必全部通读:如果课程、已有项目或部署环境使用 TensorFlow/Keras,选择第 3 版;如果从零开始且希望贴近当前研究代码生态,可优先选择 PyTorch 版本。Scikit-Learn 部分在两条路线中都很重要。
3. Artificial Intelligence: A Modern Approach, 4th Edition

- 作者: Stuart Russell、Peter Norvig
- 版本与出版: 第 4 版,Pearson,2020 年出版(©2021)
- ISBN: 978-0-13-461099-3(美国版精装)
- 资料: 作者维护的 AIMA 网站、Pearson 书籍页面
AIMA 的价值不是教会某个框架,而是展示 AI 的完整问题版图:智能体、搜索、约束满足、逻辑、规划、不确定性、决策、机器学习、强化学习、自然语言处理、机器人以及 AI 伦理。第 4 版还加强了深度学习、概率编程、多智能体决策、公平性与安全等内容。
这本书体量很大,更适合充当“地图”和长期参考书。初读可以选择第 1—6 章建立智能体与搜索框架,再按方向选读概率推理、机器学习、强化学习或 NLP 部分。
4. Computer Vision: A Modern Approach, 2nd Edition

- 作者: David A. Forsyth、Jean Ponce
- 版本与出版: 第 2 版,Pearson,2011 年出版(©2012)
- ISBN: 978-0-13-608592-8
- 资料: Pearson 书籍页面
本书系统讲解图像形成、相机模型、光照与颜色、滤波与局部特征、立体视觉、运动恢复结构、分割、跟踪、配准和三维几何。它很适合建立“图像为何如此形成、几何约束从何而来”的物理与数学直觉。
需要注意的是,第 2 版成书于深度学习成为视觉主流之前,不能单独承担“现代计算机视觉全貌”的任务。学习时可用它打牢成像与几何基础,再以 Richard Szeliski 的 Computer Vision: Algorithms and Applications, 2nd ed.(2022)补充更近年的系统视角。
进阶:算法、概率、优化与计算边界
5. Introduction to Algorithms, 4th Edition(《算法导论》)

- 作者: Thomas H. Cormen、Charles E. Leiserson、Ronald L. Rivest、Clifford Stein
- 版本与出版: 第 4 版,The MIT Press,2022 年 4 月 5 日
- ISBN: 978-0-262-04630-5(精装)
- 资料: MIT Press 书籍页面
CLRS 是算法设计与分析的综合参考。第 4 版新增或扩充了二分图匹配、在线算法、机器学习相关算法、递推式、哈希表、势能方法和后缀数组,并增加了彩色图示与大量新习题。
与 AI 最直接相关的阅读重点包括:渐近分析、分治、随机算法、动态规划、贪心法、图算法、网络流、线性规划和 NP 完全性。没有必要线性通读 1300 多页;应围绕课程或研究问题选章,并完成一部分证明题和实现题。
6. Convex Optimization

- 作者: Stephen Boyd、Lieven Vandenberghe
- 版本与出版: Cambridge University Press,2004 年;目前没有第 2 版
- ISBN: 978-0-521-83378-3(精装)
- 资料: 作者主页与出版社授权 PDF、Cambridge 书籍页面
这本书的核心价值是训练识别与重写问题的能力:什么是凸集和凸函数,怎样建立凸优化模型,怎样理解对偶性、KKT 条件、无约束/等式约束优化和内点法。它连接了机器学习中的损失函数、正则化、最大似然估计、支持向量机与许多工程设计问题。
建议先具备线性代数、多元微积分和基础概率知识。阅读时把公式落到 CVXPY 等工具上,亲自建模几个回归、分类、稀疏估计或资源分配问题,收益会明显高于只推导公式。
7. Probability and Computing, 2nd Edition

- 作者: Michael Mitzenmacher、Eli Upfal
- 版本与出版: 第 2 版,Cambridge University Press,2017 年
- ISBN: 978-1-107-15488-9(精装)
- 资料: Cambridge 第 2 版前言与书目信息
相较 2005 年第 1 版,第 2 版加入或加强了正态分布、样本复杂度、VC 维、Rademacher 复杂度、幂律、Cuckoo Hashing、Lovász 局部引理,以及与机器学习和大数据分析相关的内容。
如果只能在这本书与 Randomized Algorithms 中先选一本,通常建议先读本书:它对概率工具的铺垫更系统,内容也更接近现代数据分析。重点应放在期望与条件期望、矩方法、集中不等式、随机过程和概率方法上。
8. Randomized Algorithms

- 作者: Rajeev Motwani、Prabhakar Raghavan
- 版本与出版: Cambridge University Press,1995 年;2013 年为电子化时间,并非第 2 版
- ISBN: 978-0-521-47465-8
- 资料: Cambridge 书籍页面
这是一部关于随机算法设计与分析的经典著作。前半部分建立概率分析工具,后半部分将其用于数据结构、计算几何、图算法、数论、枚举、并行算法和在线算法。
书龄并不等于内容失效,但例子与术语带有明显的时代背景。它更适合已经掌握概率基础、希望理解随机化为何能降低复杂度或简化算法的读者;若概率基础尚弱,应先读前一本。
9. Introduction to the Theory of Computation, 3rd Edition(《计算理论导引》)

- 作者: Michael Sipser
- 版本与出版: 第 3 版,Cengage,2012 年 6 月出版(©2013)
- ISBN: 978-1-133-18779-0(精装)
- 资料: Cengage 书籍页面
本书分为自动机与形式语言、可计算性理论、复杂性理论三个部分。它回答的不是“怎样训练一个更好的模型”,而是更根本的问题:哪些问题可以计算,哪些不能;可以计算的问题需要多少时间与空间;证明不可判定或 NP 完全意味着什么。
对偏工程的 AI 学习者,它不是最紧迫的第一本书;对算法、学习理论、形式化方法或理论计算机科学方向的读者,它能建立十分重要的边界意识。建议配合习题学习,因为归约和复杂性证明只有亲自完成才会真正形成能力。
线性代数也许是一切的基石
10. Introduction to Applied Linear Algebra: Vectors, Matrices, and Least Squares

- 作者: Stephen Boyd、Lieven Vandenberghe
- 版本与出版: Cambridge University Press,2018 年 8 月 23 日;目前没有第 2 版
- ISBN: 978-1-316-51896-0(精装)
- 资料: 作者网站、课程材料与勘误、作者提供的免费 PDF、Cambridge 书籍页面
这本书把向量、矩阵、线性函数、范数、线性方程和最小二乘放在数据拟合、分类、聚类、动态系统与网络等应用中讲解。它不以抽象证明体系为主,而是强调“怎样把现实问题写成线性代数模型”,与机器学习实践以及本书单中的 Convex Optimization 衔接尤其自然。
推荐先读向量、线性函数、矩阵和最小二乘,再做书中的数值练习;矩阵分解、正交投影和条件数则可随模型训练中的具体问题回补。若目标是纯数学或需要更严格的向量空间理论,还应另配一部证明导向教材;但作为 AI 路线的一本线性代数书,这一本覆盖面和应用性较平衡。
现代深度学习、现代视觉与概率机器学习
11. Understanding Deep Learning

- 作者: Simon J. D. Prince
- 版本与出版: The MIT Press,2023 年 12 月 5 日
- ISBN: 978-0-262-04864-4(精装)、978-0-262-37710-2(电子版)
- 资料: MIT Press 书籍页面、作者网站、开放获取全文与 Notebook
这本书从监督学习、损失函数、训练与正则化出发,逐步进入卷积网络、残差网络、Transformer、图神经网络、生成对抗网络、扩散模型和深度强化学习。图示与几何直觉是它的突出优点,适合已经做过基础项目、想把“会调用框架”提升为“理解模型为何这样构造”的读者。
它覆盖的模型族很广,但不能替代线性代数、概率和优化的系统训练。建议选择与当前方向有关的章节,自己推导张量形状、损失函数和梯度,再运行配套 Notebook;不要把目标设成短期内逐页通读。
12. Computer Vision: Algorithms and Applications, 2nd Edition

- 作者: Richard Szeliski
- 版本与出版: 第 2 版,Springer Cham,2022 年
- ISBN: 978-3-030-34371-2(精装)、978-3-030-34372-9(电子版)
- 资料: 作者网站与个人学习用电子版、Springer 书籍页面
本书覆盖图像形成、处理、特征、分割、对齐、运动估计、计算摄影、三维重建、识别与深度学习,比 Forsyth 与 Ponce 的第 2 版更接近当代视觉系统。它既能作为课程教材,也适合在项目中按问题查阅,是视觉方向最值得补入的综合参考书之一。
两本视觉书不是简单的替代关系:Forsyth 与 Ponce 更适合巩固成像、几何和经典方法的推理过程,Szeliski 第 2 版覆盖范围更宽、更新。实际路线可先用前者选读基础,再把本书作为长期案头参考。
13. Probabilistic Machine Learning: An Introduction

- 作者: Kevin P. Murphy
- 版本与出版: The MIT Press,2022 年 3 月 1 日
- ISBN: 978-0-262-04682-4(精装)、978-0-262-36930-5(电子版)
- 资料: MIT Press 书籍页面、作者网站、开放获取全文与代码
Murphy 用概率建模统一回归、分类、深度神经网络、贝叶斯推断、潜变量模型、图模型和生成模型,并把决策理论、优化与信息论放进同一框架。它适合希望理解不确定性、模型假设与推断过程的读者,而不只是记忆一组彼此孤立的算法。
全书 800 多页,先修要求也高于入门实践书。比较实际的读法是先掌握概率、线性代数与微积分,随后选读第 1—4 部分的核心章节,并用作者的 JAX/Python 代码验证推导。若研究重点落在贝叶斯方法或概率生成模型,再继续阅读配套的 Advanced Topics。
大模型在超大规模加速器集群上的并行计算
这里把“超大规模阵列”理解为由大量 GPU、TPU 或其他 AI 加速器以及高速互连组成的训练/推理集群。这个主题至少包含四层:单卡内核和存储层次、多卡模型切分、跨节点通信,以及集群级调度与容错。没有一本书能同时把四层讲透,下面四本应互相配合。
14. Programming Massively Parallel Processors: A Hands-on Approach, 5th Edition

- 作者: Wen-mei W. Hwu、David B. Kirk、Izzat El Hajj
- 版本与出版: 第 5 版,Morgan Kaufmann / Elsevier,2026 年;这是已经出版的最新版
- ISBN: 978-0-443-43900-1(纸书)、978-0-443-43901-8(电子版)
- 资料: Elsevier / ScienceDirect 书籍页面
这本书解决“一个高效并行算子究竟怎样落到 GPU 上”的问题:CUDA 执行模型、内存层次、线程调度、平铺、卷积、归约、扫描、稀疏计算、图算法与矩阵乘法优化。第 5 版增加了大语言模型、进一步的矩阵乘法优化,以及 NCCL、NVSHMEM 等多 GPU 内容,因此应选第 5 版而不是仍常见的第 4 版。
它是理解算子性能、Tensor Core 利用率、内存带宽瓶颈和 kernel fusion 的底层基础,但不是完整的 LLM 集群训练手册。建议先掌握矩阵乘法、归约和性能分析,再进入后面的多 GPU 与 LLM 章节。
15. Distributed Machine Learning Patterns

- 作者: Yuan Tang
- 版本与出版: Manning,2023 年 11 月
- ISBN: 978-1-61729-902-5
- 资料: Manning 书籍页面
本书以“模式”组织参数服务器、集合通信、数据摄取、分布式训练、模型服务、容错、自动扩缩容和工作流编排,帮助读者建立跨框架的系统词汇。它对理解 All-Reduce、训练任务生命周期和 Kubernetes 上的机器学习工作流很有价值。
需要注意,它并不是专为大模型写的,示例也较偏 TensorFlow、Kubeflow 与 Kubernetes。把它作为分布式系统和 MLOps 的桥梁,而不是具体的万卡 LLM 配置手册,会更符合它的定位。
16. The Ultra-Scale Playbook: Training LLMs on GPU Clusters
上图为本站制作的书籍信息卡,并非出版社官方封面。
- 作者: Nouamane Tazi、Ferdinand Mom、Haojun Zhao、Phuc Nguyen、Mohamed Mekkouri、Leandro von Werra、Thomas Wolf
- 版本与出版: 2025 年;纸书 246 页,CC BY-NC-SA 许可
- 资料: Hugging Face 在线版、Lulu 纸书页面
这是四本中最贴近“大模型在数百至数千 GPU 上训练”的一本。它从单卡显存构成出发,依次讲数据并行、张量并行、流水线并行、序列/上下文并行、ZeRO、激活重计算、专用内核,以及如何重叠通信与计算;内容还建立在 4,000 多组、最高 512 GPU 的扩展实验之上。
它的优势是把 5D 并行组合与性能权衡讲得直观,并能对照教学实现 Picotron 和生产框架 Nanotron。局限是这类系统演进很快,具体 API 和最优配置会变化;应把原理、显存账本和通信量推导学扎实,再用当前框架文档落实。
17. Machine Learning Systems at Scale

- 作者: Vijay Janapa Reddi
- 版本状态: 公开预出版稿 v0.2.1,2026 年 7 月 3 日更新;计划由 The MIT Press 于 2027 年出版,尚不能当作正式定稿
- 资料: Volume II 在线书、公开 PDF
这本书从“集群是一台计算机”的角度组织计算基础设施、网络拓扑、存储、数据/张量/流水线并行、集合通信、容错、编排、训练性能、在线推理和集群运维。相较前一本,它对网络、存储、可靠性与服务系统的覆盖更完整,适合补齐 fleet-level 的系统视角。
当前版本仍是持续更新的公开草稿,章节编号和内容可能变化。它适合在线阅读与查阅,不宜按已出版版本引用;正式写论文或技术报告时,应记录访问日期和草稿版本。
并行方法与书籍的对应关系
| 问题层次 | 关键方法 | 优先阅读 |
|---|---|---|
| 单卡算子 | CUDA 执行/存储模型、平铺、融合、Tensor Core、矩阵乘法 | Programming Massively Parallel Processors 第 5 版 |
| 数据并行与参数分片 | DDP、Reduce-Scatter / All-Gather、ZeRO / FSDP | The Ultra-Scale Playbook;Machine Learning Systems at Scale |
| 模型并行 | 张量、流水线、序列、上下文与专家并行,混合并行拓扑 | The Ultra-Scale Playbook |
| 集群通信 | All-Reduce、All-to-All、通信—计算重叠、拓扑感知放置 | The Ultra-Scale Playbook;Distributed Machine Learning Patterns |
| 可靠性与编排 | Checkpoint、故障恢复、弹性训练、调度与可观测性 | Machine Learning Systems at Scale;Distributed Machine Learning Patterns |
| 大模型推理 | KV Cache、连续批处理、张量/流水线并行、Prefill/Decode 解耦 | Machine Learning Systems at Scale,并结合当前推理引擎文档 |
这几本书仍不能取代快速变化的实现资料。实际搭建系统时,应继续核对 NVIDIA Megatron Core 文档、DeepSpeed 教程 与 PyTorch Distributed 总览,并以目标硬件上的 profiling 与故障演练验证结论。若“阵列”特指片上众核、晶圆级系统或 FPGA/脉动阵列,则还需要另补计算机体系结构、互连网络和硬件编译器资料;这里的四本主要面向当前 GPU/加速器集群。
一个可执行的阅读顺序
如果目标是进入 AI 研究或研发,可以按下列阶段推进:
- 数学先修: 用 Introduction to Applied Linear Algebra 掌握矩阵、投影和最小二乘;微积分、概率薄弱的部分同步回补。
- 工程起步: Géron 的 TensorFlow 或 PyTorch 版本二选一,完整做出至少两个端到端项目。
- 建立地图: 选读 AIMA 的智能体、搜索、不确定性、学习和目标方向章节。
- 补齐骨架: 交叉学习 CLRS、Probability and Computing 和 Convex Optimization;每本都以习题和代码验证为主。
- 方向深入: 视觉方向读 Forsyth & Ponce 与 Szeliski;深度学习方向读 Prince;概率建模方向读 Murphy;理论方向读 Sipser 与 Randomized Algorithms。
- 进入大模型系统: 先用 Programming Massively Parallel Processors 建立 GPU 性能直觉,再读 The Ultra-Scale Playbook 学习混合并行,随后用另外两本补集群通信、容错、编排和服务。
- 连接研究与生产: 转向论文、技术报告、当前框架文档和真实集群 profiling,建立自己的文献、实验与故障记录。
最后,书单只能规定知识范围,不能替代练习、实现和质疑。每读完一个主题,最好能回答三个问题:它解决什么问题,依赖哪些假设,在哪些条件下会失败。能持续给出这三个答案,比“读完了多少本书”更接近真正掌握。
封面图片仅用于书目信息与阅读评论展示,版权归相应作者和出版社所有;版本、ISBN 与出版时间以文中链接的作者或出版社页面为准。