python爬虫具体要学哪些内容？_Python

5条回答

流流流年

2楼 · 2020-08-28 10:19

1. 学习Python基础知识并实现基本的爬虫过程

一般获取数据的过程都是按照发送请求-获得页面反馈-解析并且存储数据这三个流程来实现的。这个过程其实就是模拟了一个人工浏览网页的过程。

Python中爬虫相关的包很多：urllib、requests、bs4、scrapy、pyspider 等，我们可以按照requests 负责连接网站，返回网页，Xpath 用于解析网页，便于抽取数据。

2.了解非结构化数据的存储

爬虫抓取的数据结构复杂传统的结构化数据库可能并不是特别适合我们使用。我们前期推荐使用MongoDB 就可以。

3. 掌握一些常用的反爬虫技巧

使用代理IP池、抓包、验证码的OCR处理等处理方式即可以解决大部分网站的反爬虫策略。

4.了解分布式存储

分布式这个东西，听起来很恐怖，但其实就是利用多线程的原理让多个爬虫同时工作，需要你掌握 Scrapy + MongoDB + Redis 这三种工具就可以了。

敦敦宁

3楼 · 2020-08-28 10:41

学爬虫先学什么？有人说是编程，对也不对。对的是爬虫也是以一定的编程语言为基础的，对于连编程都不是很熟悉的纯小白来说，建议你去从编程学起。

不对，是因为对于已经有些编程基础的爬虫小白来说，学习到python爬虫的编程套路，你也不一定会真正了解爬虫，灵活运用。

事实上，我们并不缺少python爬虫的各类教程，在网络上搜索，文章、视频，比比皆是。什么“十分钟教会你用python爬取网页”，“**行代码就能让你学会爬虫”，“零基础爬虫速成指南”，还有scrapy框架的爬取策略，甚至根本不需要懂代码的爬虫工具等等。

各种爬虫实战的文章、案例、全程代码等等，也如漫天星斗，数不胜数，有的爬豆瓣、知乎、大众点评，有的爬淘宝、京东、58同城，有的爬微信、博客、论坛等等。。

在基础教材足够的条件下，貌似我们分分钟就可以学会爬虫，但是，事实如此吗？

（2）我曾经的学习困惑：会模仿但不会应用

编程最好的一个学习方式就是模仿。

我也曾经基于案例或实战去学习python爬虫，比如Urllib库、模拟浏览器、正则表达式、Beautiful Soup的用法等等。

但是，我学过n个案例之后还是很困惑，我学会了爬豆瓣，但我只能爬豆瓣，我学会了爬百度贴吧，也只会爬百度贴吧，我只能会一个案例就只会爬一个网站，世上网站千千万，换了一个陌生网站，我却不知道如何抓取信息。

我只会模仿别人的程序模式，却不会融会贯通。

我知道Urllib库是用来向网页发出请求，并实现解析，我知道增加headers以及一些代理来应对反爬机制，使用Beautiful Soup、Xpath以及正则表达式来在解析文本中搜索、抓取具体信息…..但我不知道，换了另一个网页，在茫茫的文本中，我所需要的信息（名称、标签）等等，如何定位到，如何去掉多余信息，精准抓取出来？

（3）我所理解的爬虫

事实上，我犯了一个错误，当我拥有了python这一爬虫工具后，我就自以为掌握了爬虫的钥匙，无坚不摧，所向披靡，但是我忽视了所针对的对象——网页是千变万化，多种多样的，掌握了一种方法，不一定能用在其他地方。只有掌握了对象的本质与共通点，你才能融会贯通。

有人把爬虫比喻成蜘蛛，我觉得这个比喻不甚恰当，因为蜘蛛的那个网结构很简单，一眼就能望穿。但是现实中的网，是很巨大的，是很多样化的，也是结构复杂的，相比较于爬虫工具，我们所面临的解析对象很复杂，这也使得我们的工具、方法不断在升级。

曾经有个综艺节目《奔跑吧，兄弟》，经常有的一个游戏环节就是在一座大厦里，有很多楼层、房间，在很多角落里藏着包含信息或物件的盒子，让游戏者去找。

我所理解的爬虫与此类似，一个网站就相当于一座大厦，有很多相同的楼层及房间，在每个楼层或房间都在同一位置隐藏着相关信息，如果单靠人力去找，也能找到，但是很累，很慢，也不能全部找到。

而爬虫就相当于我们手里有了一个机器人，它会代替我们去向这座大厦发送访问申请，会伪装自己来应对反爬虫机制，会将整个大厦的布局降维输出，形成平面图（文本），会根据平面图精准定位每个房间的某个标记为price的盒子，并将所有房间的所有盒子里的信息抓取到。

但是这个机器人并不是完全智能的，它需要我们设置一些命令，才能完成这个工作，就比如在精准定位上，它可能需要我们对整个大厦布局了然如胸的基础上，发出定位指令，才能完成。

（4）学爬虫之前不妨学一些简单的网页结构基础

学爬虫之前不妨学一些简单的网页结构基础知识，也就是认识一下网页的基本架构是什么，甚至还要自己去动手模仿着做一个简单的网站。

磨刀不误砍柴工。我在学习很多python爬虫案例之后，仍然很迷惘，但是当我开始学习了一些网页基本架构知识，动手做完一个简单静态网站之后，豁然开朗，面对千变万化的网页，我知道它的一些共通点，我知道如何在各种资料的帮助下对于任何一个陌生网站，都可以去获取我想要的信息。

一般来说，网站由导航栏、栏目、及正文内容组成，在每个部分中一些div元素、标题a元素、属性class、段落p等等组成，万变不离其宗。

就像前边这幅图，右边的代码就表示多个div结构性区域下，用不同class属性，并结合不同文字格式，把整个网页构建起来，当我们爬取信息时，就要找到它在什么div下的什么class以及什么块样式span下的某一块里。这样我们使用起来解析函数或者正则表达式，也应心得手。

这样也就可以——既见树木又见森林，树木是每一个网页的不同点，在python爬虫时，结合不同手段实现；森林则是所有网页的内在构造，即相通之处，面对成千上万个不同网站，我们也能找到爬取的关键所在

我是大脸猫

4楼 · 2020-08-28 10:55

现在之所以有这么多的小伙伴热衷于爬虫技术，无外乎是因为爬虫可以帮我们做很多事情，比如搜索引擎、采集数据、广告过滤等，以Python为例，Python爬虫可以用于数据分析，在数据抓取方面发挥巨大的作用。

　　但是这并不意味着单纯掌握一门Python语言，就对爬虫技术触类旁通，要学习的知识和规范还有喜很多，包括但不仅限于HTML 知识、HTTP/HTTPS 协议的基本知识、正则表达式、数据库知识，常用抓包工具的使用、爬虫框架的使用等。而且涉及到大规模爬虫，还需要了解分布式的概念、消息队列、常用的数据结构和算法、缓存，甚至还包括机器学习的应用，大规模的系统背后都是靠很多技术来支撑的。

　　零基础如何学爬虫技术？对于迷茫的初学者来说，爬虫技术起步学习阶段，最重要的就是明确学习路径，找准学习方法，唯有如此，在良好的学习习惯督促下，后期的系统学习才会事半功倍，游刃有余。

　　用Python写爬虫，首先需要会Python，把基础语法搞懂，知道怎么使用函数、类和常用的数据结构如list、dict中的常用方法就算基本入门。作为入门爬虫来说，需要了解 HTTP协议的基本原理，虽然 HTTP 规范用一本书都写不完，但深入的内容可以放以后慢慢去看，理论与实践相结合后期学习才会越来越轻松。关于爬虫学习的具体步骤，我大概罗列了以下几大部分，大家可以参考：

　　网络爬虫基础知识:

　　爬虫的定义

　　爬虫的作用

　　Http协议

　　基本抓包工具(Fiddler)使用

　　Python模块实现爬虫：

　　urllib3、requests、lxml、bs4 模块大体作用讲解

　　使用requests模块 get 方式获取静态页面数据

　　使用requests模块 post 方式获取静态页面数据

　　使用requests模块获取 ajax 动态页面数据

　　使用requests模块模拟登录网站

　　使用Tesseract进行验证码识别

　　Scrapy框架与Scrapy-Redis：

　　Scrapy 爬虫框架大体说明

　　Scrapy spider 类

　　Scrapy item 及 pipeline

　　Scrapy CrawlSpider 类

　　通过Scrapy-Redis 实现分布式爬虫

　　借助自动化测试工具和浏览器爬取数据：

　　Selenium + PhantomJS 说明及简单实例

　　Selenium + PhantomJS 实现网站登录

　　Selenium + PhantomJS 实现动态页面数据爬取

　　爬虫项目实战：

　　分布式爬虫+ Elasticsearch 打造搜索引擎

appleshve

5楼 · 2020-08-28 11:11

①要具备扎实的python语法基础，这是一切的根基

②对前端知识有一定的了解，起码做到能看懂

③如何获取目标数据：requests模块等

④如何解析目标数据：正则，xpath，jsonpath等

⑤如何做到做到反反爬：经验总结

⑥如何大规模批量获取数据：scrapy框架

如果想入门学习的话，可以了解u就业的课程，欢迎加群https://jq.qq.com/?_wv=1027&k=abUuMTQm，和大家一起沟通交流，帮助解决学习疑难问题。

【python爬虫】python爬虫具体要学哪些内容？

相关问题推荐

等你来答

热门问答

相关文章

【python爬虫】python爬虫具体要学哪些内容？

相关问题推荐

等你来答

热门问答

相关文章

采纳回答

编辑标签

举报内容

检举类型

检举原因

检举说明(必填)

打开微信“扫一扫”，打开网页后点击屏幕右上角分享按钮

付费偷看金额在0.1-10元之间