
《解构大语言模型:从线性回归到通用人工智能》PDF下载
唐亘著
内容简介
《解构大语言模型:从线性回归到通用人工智能》由数据科学家唐亘编著,电子工业出版社出版。本书以大语言模型为核心,从模型结构和数据基础两个维度进行系统拆解,旨在帮助读者理解大语言模型的基本原理,并进一步理解和搭建类似 ChatGPT 的人工智能系统。作者没有将大语言模型作为一个孤立的黑箱进行介绍,而是从经典机器学习和深度学习模型出发,逐步建立理解现代大模型所需要的知识体系。
在模型结构方面,本书首先介绍多层感知器、卷积神经网络和循环神经网络等经典神经网络模型,再进一步进入注意力机制。由于大语言模型本质上属于深度神经网络,而注意力机制是现代大语言模型的重要设计基础,因此这些经典模型能够帮助读者理解从传统神经网络到大语言模型的技术演进过程。书中同时关注模型开发和调优,并提供重构类似 ChatGPT 系统的相关内容以及配套代码资源。
在数据基础方面,本书讨论了模型训练所涉及的反向传播等工程基础,同时介绍监督学习、无监督学习、迁移学习和强化学习等不同的数据使用与学习方式。通过这些内容,读者可以理解模型结构与训练数据、训练方法之间的关系,而不仅仅停留在调用大语言模型 API 的应用层面。
本书另一个比较有特色的方向,是尝试从统计分析、计量经济学和经典机器学习模型中寻找解决大模型问题的思路。作者关注模型的稳定性和可解释性,希望借助传统数据科学领域已经积累的方法,为理解和改进现代人工智能模型提供新的视角。这使本书不仅涉及深度学习和 LLM,也体现了统计学、机器学习与人工智能之间的联系。
本书适合希望深入理解大语言模型原理的程序员、AI 工程师、数据科学家以及人工智能从业者,也适合作为计算机及相关专业师生的参考读物。对于已经能够使用 ChatGPT、各种大模型 API 或 AI 编程工具,但希望进一步理解模型底层机制的开发者,本书可以帮助建立从经典机器学习、神经网络到大语言模型的知识链条,为进一步学习 Transformer、LLM 训练、模型微调以及通用人工智能等方向打下基础。
书籍信息
- 书名
- 解构大语言模型:从线性回归到通用人工智能
- 作者
- 唐亘
- 出版日期
- 2024年5月
- ISBN
- 9787121477409
- 页数
- 432 页
- 语言
- 中文
- 文件格式
- 文件大小
- 104.12 MB
- 文件标签
- OCR PDF
备用下载地址
****