澳门金沙线上娱乐,金沙澳门官网(WAP手机版)
首页 > 网站公告

有两个版本,根据需要选择自己的版本

作者:  来源:  浏览:58
作者简介:孙亖,软件工程师,长期从事企业信息化系统的研发工作,主要擅长后台业务功能的设计开发。

本文来自作者在 GitChat 上分享「如何用 Python 爬取网页制作电子书」主题内容。



有人爬取数据分析黄金周旅游景点,有人爬取数据分析相亲,有人大数据分析双十一,连小学生写论文都用上了大数据。

我们每个人每天都在往网上通过微信、微博、淘宝等上传我们的个人信息,现在就连我们的钱都是放在网上,以后到强人工智能,我们连决策都要依靠网络。网上的数据就是资源和宝藏,我们需要一把铲子来挖掘它。

最近,AI 的兴起让 Python 火了一把。实际上 Python 拥有庞大的第三方支持,生态系统非常完整,可以适用各种场景和行业。

这次,我们准备通过 Python 学习爬虫的开发,既简单有趣,而且是数据采集重要一环。同时脱离应用谈技术就是耍流氓,通过制作电子书学习数据的收集与整理,即能学到东西又有实用价值。

我们将通过爬取网页信息这个很小的应用场景来体会数据预处理的思想,并从中学习了解数据处理中抓取、处理、分组、存储等过程的实现。

我这次分享主要分为以下几个部分:

Python 语法:通过分享掌握简单的 Python 开发语法和思路,侧重于后面爬虫开发的需要用的内容;

Scrapy 爬虫开发:通过分享了解基本的 Scrapy 开发,并实现从网络爬取数据,使用 Sigil 制作 epub 电子书;

最后,我希望通过分享,让更多人能够入门并喜欢上 Python 开发,掌握 Scrapy 爬虫开发的思路和方法。

一、Python 开发

1.1 Windows 下环境安装

熟悉 Windows 的安装 Python 不难,首先官网下载:https://www.python.org/downloads/。

有两个版本,根据需要选择自己的版本,现在越来越多的库开始支持 3,所以建议下载 3,这里我们以 2 为例。

双击下载的安装文件,一路 Next 即可,但是要注意勾选 __pip__ 和 Add python.exe to Path:



pip 是 Python 生态体系里面的包管理工具,很多第三方库可以通过它方便的
上一篇:尽量刷短词,但是同时又要保证刷手能找到。
下一篇:银河中心到底有什么东西
QQ交流群:666888    作者QQ:888666(并非该网站站长)闽ICP备12010380号