从零开始写Python爬虫 --- 导言

从零开始写Python爬虫 --- 导言

没想到真的写完这个系列了


其实专栏里有一篇文章专门说如何自学Python编程

是我自学经历的一些总结,这里分享出来给大家:

Ehco:如何零基础自学入门Pythonzhuanlan.zhihu.com图标


------------------------------分割线------------------------------


我是一名努力想做 coder 的小伙,目前自学Python有大半年了期间也写过一些小的爬虫。说起来当时想成为程序员就是因为无意间了解到 爬虫 这个神奇的东西。
所以这里会记录 重新梳理 学习Python爬虫的路线。
也希望能成为一篇不错的入门爬虫教程,
总之,希望自己能坚持把这个系列专栏写完。

学习之前需要哪些准备?

  1. 一颗热爱学习,不屈不挠的心
  2. 一台有键盘的电脑(什么系统都行。我用的os x,所以例子会以这个为准)
  3. html相关的一些知识。不需要精通,能懂一点就行
  4. Python的基础语法知识 。

如果我一点编程基础都没有怎么办?

现在开始学!Python是一门非常适合做入门学习的语言。

如果你没有任何其他编程语言的基础,那么就来学Python吧。

Life is short, Use Python

有什么推荐的入门教材么?

具体的学习路线是什么?

总体分为三个大方面:

一: 简单的定向脚本爬虫(request —- bs4 —- re)

二: 大型框架式爬虫(Scrapy框架为主)

三:浏览器模拟爬虫 (Selenium 模拟)

具体的步骤:

一:Beautiful Soup 爬虫

Ehco:从零开始写Python爬虫 --- 1.1 requests库的安装与使用zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 1.2 BS4库的安装与使用zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 1.3 BS4库的解析器zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 1.5 爬虫实践: 获取百度贴吧内容zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 1.6 爬虫实践: DOTA'菠菜'结果查询zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 1.7 爬虫实践: 排行榜小说批量下载zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 1.8 爬虫实践: 电影排行榜和图片批量下载zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 1.9 爬虫实践:悦音台mv排行榜与反爬虫技术zhuanlan.zhihu.com图标

二: Scrapy 爬虫框架

Ehco:从零开始写Python爬虫 --- 2.1 Scrapy 爬虫框架的安装与基本介绍zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 2.2 Scrapy 选择器和基本使用zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 2.3 爬虫实践:天气预报&数据存储zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 2.4 爬虫实践:代理的爬取和验证zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 2.5 爬虫实践:糗事百科&爬虫攻防zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 2.6 爬虫实践:重构排行榜小说爬虫&Mysql数据库zhuanlan.zhihu.com图标

三: 浏览器模拟爬虫

Ehco:从零开始写Python爬虫 --- 3.1 Selenium模拟浏览器zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 3.2 爬虫实践:获取快代理zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 3.3 爬虫实践:漫画批量下载zhuanlan.zhihu.com图标

四: 练手项目:

Ehco:从零开始写Python爬虫 --- 爬虫实践:螺纹钢数据&Cookieszhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 爬虫实践:登录正方教务系统zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 爬虫应用: requests+django实现微信公众号后台zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 爬虫应用: 12306火车票信息查询zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 爬虫应用: 利用斗鱼Api抓取弹幕zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 爬虫应用: 获取支付宝账单信息zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 爬虫应用:IT之家热门段子(评论)爬取zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 爬虫应用:一号店 商品信息查询程序zhuanlan.zhihu.com图标Ehco:从零开始写Python爬虫 --- 老司机开夜车 刹都刹不住zhuanlan.zhihu.com图标公司里是怎么做数据抓取的? --- 搜狗词库抓取&解析zhuanlan.zhihu.com图标Ehco:上古网盘长啥样?批量下载复古游戏资源zhuanlan.zhihu.com图标Ehco:用Python自动填写问卷星zhuanlan.zhihu.com图标Ehco:用Python抓腾讯漫画?zhuanlan.zhihu.com图标

五: 自己写点小工具:

Ehco:爬虫存储海量数据太麻烦? 换个姿势试一试!zhuanlan.zhihu.com图标Ehco:爬虫会用到的小工具: LazySpider 发布啦!zhuanlan.zhihu.com图标


每天的学习记录都会同步更新到:

编辑于 2019-07-29

文章被以下专栏收录