Python Data Science Handbook
一句话定位
它是一本讲 Python 数据科学工具链的手册,整本以笔记本的形式挂在网上。作者是 Jake VanderPlas。
它不是入门编程的书,假定读者已经会写 Python,从这里接着讲「用 Python 处理数据要会哪几样工具」。
它是用笔记本形式放出来的整本书
整个网站就是这本书本身,内容是交互式笔记本,不是静态的网页正文。
代码可以一段一段自己跑,改一个参数立刻能看到结果。这一点让它同时具备书与练习场两种用法。
书另有纸本版本,由一家技术出版社出版。线上版不收钱,代码部分用宽松的开源许可。
它分成五块
- IPython 与笔记本。先把工作环境讲清楚,包括怎么在笔记本里写代码、看结果。
- NumPy。讲数组这一层,包括索引、切片、运算与广播这类容易踩坑的地方。
- Pandas。讲带标签的数据表:怎么读、怎么筛、怎么分组汇总。
- Matplotlib。讲怎么把数据画出来,从简单折线到多子图排布。
- 机器学习。用一套统一的接口走一遍常见的模型:分类、回归、聚类、降维。
它假定你已经有编程基础
书的第一页就把边界划了出来:这里不教 Python 语法,也不教数据科学是什么,假定读者已经会写代码、知道自己在做什么分析。
正因为省掉了入门部分,它的节奏比一般的教程快:一块内容常常几十页就把核心用法讲完。
这条边界也让它的定位很清楚:它是补工具链的,不是从零起步的。
它的代码可以逐段跑
因为是笔记本,每一段代码都能单独执行,出错也会停在那一段上,不用从头查。
这对「看懂」与「会用」之间的那段距离很关键:光读会以为懂了,自己跑一遍才会发现卡在哪。
在线版直接把代码框和输出摆在一起,读的时候就在同一个页面上。
它把几样工具串成了一条顺序
书里的顺序不是随便排的:先是环境,再是数组,再是数据表,再是画图,最后是模型。
这个顺序与真实工作里的顺序基本一致:任何一次分析,通常都是先把数据弄进来、整理、看一眼分布,再谈建模。
按这个顺序读下来,五块内容会接成一条链,而不是五个互不相干的工具说明。
一句话总结
一本用笔记本形式免费公开的 Python 数据工具手册,五块内容分别对应环境、数组、数据表、画图与机器学习,代码可以逐段跑。已经会写 Python、想补上数据这一块的人,从这里补最快。
想直接读全文,或者想找其中某一块(比如数据表或画图)先看,可以从这里进。







