从零开始写Python爬虫 — 导言

从零开始写Python爬虫
我是一名努力想做 coder 的小伙,目前自学Python有大半年了,期间也写过一些小的爬虫。说起来当时想成为程序员就是因为无意间了解到 爬虫 这个神奇的东西。这里会记录自己 重新梳理 学习Python爬虫的路线。也希望能成为一篇不错的入门爬虫教程,总之,希望自己能坚持把这个系列专栏写完。

学习之前需要哪些准备?
一颗热爱学习,不屈不挠的心
一台有键盘的电脑(什么系统都行。我用的os x,所以例子会以这个为准)
html相关的一些知识。不需要精通,能懂一点就行
Python的基础语法知识 。
如果我一点编程基础都没有怎么办?
现在开始学!Python是一门非常适合做入门学习的语言。

如果你没有任何其他编程语言的基础,那么就来学Python吧。
Life is short, Use Python

有什么推荐的入门教材么?
如何零基础自学入门Python
笨办法学Python
廖大的Python3教程
自强学堂的教程
菜鸟学习资
html入门学习
看看知乎大V们是如何回答这个问题的?
具体的学习路线是什么?
总体分为三个大方面:

一: 简单的定向脚本爬虫(request —- bs4 —- re)

二: 大型框架式爬虫(Scrapy框架为主)

三:浏览器模拟爬虫 (Mechanize模拟 和 Selenium 模拟)

具体的步骤:
一:Beautiful Soup 爬虫
requests库的安装与使用
安装beautiful soup 爬虫环境
beautiful soup 的解析器
bs4 爬虫实践: 获取百度贴吧的内容
bs4 爬虫实践: 获取Dota游戏结果
bs4 爬虫实践: 小说批量下载
bs4 爬虫实践: 获取电影信息
bs4 爬虫实践: 获取悦音台榜单

二: Scrapy 爬虫框架
安装Scrapy
Scrapy中的选择器 Xpath和CSS
Scrapy 爬虫实践:天气预报&数据存储
Scrapy 爬虫实践:代理获取和验证
Scrapy 爬虫实践:糗事百科
Scrapy 爬虫实践: 重构排行榜小说爬虫&Mysql数据库

三: 浏览器模拟爬虫
Selenium模块的安装与使用
Selenium & PhantomJS 实践: 获取代理
Selenium & PhantomJS 实践: 漫画爬虫

四: 练手项目:
爬虫实践:螺纹钢数据&Cookies
爬虫实践:登录正方教务系统
爬虫应用: requests+django实现微信公众号后台
爬虫应用: 12306火车票信息查询
爬虫应用: 利用斗鱼Api抓取弹幕
爬虫应用: 获取支付宝账单信息
爬虫应用:IT之家热门段子(评论)爬取
爬虫应用:一号店 商品信息查询程序
从零开始写Python爬虫 — 老司机开夜车 刹都刹不住
公司里是怎么做数据抓取的? — 搜狗词库抓取&解析