自由 开放 发现 分享 专业 助力
注册

知识底色 · 统计素养 · 公开站点

An Introduction to Statistical Learning

一本把统计学习讲到能上手的标准教科书
它把数学压到最低,每一章末尾都留一段能跑的代码。
statlearning.com

一句话定位

它是一本讲统计学习的教科书,写法上刻意避重就轻:把数学门槛压低,保住的是方法能不能用起来这一条。

它覆盖的是数据量变大之后必须会的那套工具:回归、分类、重抽样、正则化、树模型、支持向量机、深度学习、无监督学习。

统计素养教科书统计学习R 与 Python配套实验

它把统计学习当成一门要动手的课

书的第一章问的不是公式,是一个很实际的问题:什么是统计学习。它从「有数据、想预测」这个处境出发,而不是从定义出发。

作者的取舍写在页面上:这是一本广而不深的书,面向的是想用当代工具做数据分析的人,不要求先读完一本概率论。

它假定读者会有一点编程基础,然后把方法怎么落到代码上,留给每一章末尾的实验。

四个作者分在四所学校

Gareth James 在埃默里大学商学院任职,Daniela Witten 在华盛顿大学任统计与生物统计教授,Trevor Hastie 与 Rob Tibshirani 都在斯坦福。

四个人的方向并不一样:有偏统计理论的,有偏生物医学数据的,也有长期做统计学习方法的。书能同时守住「讲得清」和「站得住」,与这个搭配有关。

Python 版另加了一位作者 Jonathan Taylor,同样来自斯坦福统计系。

它先出 R 版,又出了 Python 版

第一版二〇一三年出版,代码全部用 R。第二版二〇二一年出,Python 版另在二〇二三年单独出版。

两个版本的正文内容基本对应,差别在每一章末尾的实验:一个用 R 写,一个用 Python 写。选哪一本,取决于你手上用的是哪个工具。

书里反复用的是几组公开数据集,两个版本的实验都基于同一批数据,换语言不用换例子。

它覆盖哪些主题

  • 回归与分类。从最简单的一条直线讲到逻辑回归,先把「模型在做什么」讲透。
  • 重抽样与模型选择。交叉验证、自助法,以及变量多的时候怎么筛。
  • 正则化与非线性。岭回归与套索,以及把直线换成更灵活的形状之后要付什么代价。
  • 树、向量机与深度学习。几类主流的预测方法,各自讲清楚在什么情形下更合适。
  • 无监督与多重检验。没有标签时怎么找结构,以及同时做很多次检验时怎么不骗自己。

它被翻成了七种语言

站方列出的译本包括中文、意大利文、日文、韩文、蒙古文、俄文与越南文。

译本由不同的人或机构自行推进,官网只做登记。对不习惯读英文教材的人来说,这些译本是同一套体系的入口。

原版与译本的章节编号基本对齐,方便两本对着看。

每一章都以一段能跑的代码收尾

这个安排是这本书最被称道的地方:读完一章的方法,紧接着就有一段实验,把这一章的概念在真实数据上跑一遍。

实验不长,但要求动手:读数据、拟合、看结果、改一个参数再看一遍。公式里的符号在这一步变成屏幕上的数字。

对有了一点编程基础、想补统计这块短板的人来说,这个安排省掉了「理论懂了但不知从哪下手」的那一段。

一句话总结

一本把数学门槛压低、把动手写进每一章的统计学习教科书,R 版与 Python 版并行,被翻成七种语言。想系统地补统计学习这块,又不想先啃一本概率论,从这里开始最省力。

想看这本书的目录与作者信息,或者想确认 R 版与 Python 版分别是哪一本,可以从这里进。

前往 statlearning.com

回顶部

Copyright © 2021-2026 陕ICP备2021016533号-1法律条款