《Python网络爬虫权威指南第二2版 Python 3网络爬虫开发实战入教程数据采集数据爬取数据挖掘书人民邮》瑞安·米切尔著【摘要书评在线阅读】-苏宁易购图书

云钻刮券活动规则

活动时间

活动自2017年6月2日上线，敬请关注云钻刮券活动规则更新。

活动形式

会员打开苏宁易购wap端、PC端、苏宁易购APP端方可参与活动。
活动方式为云钻刮券，每次刮券需要扣除200云钻。奖励分为无敌券和店铺云券两种，100%刮出无敌券，最低2元。店铺券由店铺提供，用户可以根据购物需求，在无敌券和店铺云券之间二选一。如因为网络、用户关闭等原因，造成页面关闭，导致用户没有或无法选择，系统将在5分钟内自动按照获得的无敌券面额发放到用户账户。
每人每天参与刮券次数上限为1次。活动每日限量，如用户参与时已达到活动最高上限，则不能再继续参与，次日可以继续参与。
如会员在刮券时选择了店铺云券，券发至账户后则无法再更改为平台的无敌券；如会员在刮券时选择了平台的无敌券，券发至账户后则无法再更改为店铺云券。
云钻刮券获得的不固定面值的券，会随机获得无敌券：2~2.2元、5元、10元、20元、50元的无敌券或不同面额的店铺云券。
券是否成功发放，可在“我的优惠券”中查询。

其他

如活动受政府机关指令需要停止举办的，或活动遭受严重网络攻击需暂停举办的，或者系统故障导致的其它意外问题，苏宁无需为此承担赔偿或者进行补偿。

券使用规则

不同面额的无敌券有不同的使用门槛，2~2.2元、5元、10元、20元、50元无敌券为无门槛使用，具体以实际发放券说明为准。配送方式仅限选择配送使用，不能抵扣运费部分。
用户刮券获得的店铺云券可与店铺内领取的店铺易券叠加使用。
店铺云券使用门槛等具体信息以商家在其店铺内的设置使用说明为准。
无敌券可用于单件商品的付款，也可用于购物车合并下单付款，同时支持在跨店铺订单中使用。店铺云券仅可使用在指定店铺中，注：部分店铺活动商品不支持用券，以订单实际提交为准。
云钻刮券获得的无敌券可以购买大聚惠、抢购、团购、手机专享价，但不可购买闪拍、预售、S码、名品特卖、海外购、秒杀、虚拟产品、法律规定限制产品如一段奶粉（包括但不仅限列出的商品）等、云钻加钱兑及云钻全额兑。
在购物时，点击购买后，页面会提示可使用易购券，只要点击选择易购券即可抵用扣除对应金额。云钻刮券获得无敌券或店铺云券使用时可用于抵扣商品金额，不能抵扣运费、运费险、增值服务等非商品金额。
云钻刮券获得的无敌券或店铺云券可与店铺页面领取的店铺易券叠加使用，付款时默认优先使用力度较大的店铺优惠券，如使用店铺易券后的订单金额仍然满足云钻刮券所获得店铺云券使用条件，可继续叠加使用店铺云券。（举例：店铺在页面设置满199减50元的店铺易券，同时用户在店铺刮券获得一张满20元减20元的店铺云券，如商品订单金额为200元，会员在用已使用领取的50元店铺易券情况下，仍然可以使用云钻刮券获得20元店铺云券）
云钻刮券获得的无敌券或店铺云券不得提现，不得转赠他人，不得为他人付，不得拆分使用。
一个订单最多使用6张易购券。
云钻刮券获得的有效期为：自获得之日起7天内有效（部分活动券可能存在不同有效期，具体详见“我的优惠券”内易购券有效期说明）。
在获取和使用券过程中，如果出现违规行为（如作弊领取、恶意套现、刷取信誉、虚假交易等），苏宁将取消用户的中奖资格，并有权撤销违规交易、收回易购券（含已使用的易购券及未使用的易购券）,必要时追究法律责任。
使用易购券的订单若交易未成功或发生退款及售后，在交易所使用的易购券有效期内订单取消完成的，易购券将退回用户账户，退回后的易购券有效期不变。如在使用的易购券有效期之外发生退款，所使用的券退回当天有效，过期不予退还。如发生售后退款，易购券退回当天有效，过期不予退还。

人民邮电出版社旗舰店

商品参数

作者：瑞安·米切尔著
出版社：人民邮电出版社
出版时间：2019年4月
开本：16开
ISBN：9787115509260
出版周期：年刊
版权提供：人民邮电出版社

内容介绍

本书采用简洁强大的Python 语言，介绍了网页抓取，并为抓取新式网络中的各种数据类型提供了全面的指导。

第一部分重点介绍网页抓取的基本原理：如何用Python 从网络服务器请求信息，如何对服务器的响应进行基本处理，以及如何以自动化手段与网站进行交互。

第二部分介绍如何用网络爬虫测试网站，自动化处理，以及如何通过更多的方式接入网络。

前言　　xi
第　一部分创建爬虫
第　1 章初见网络爬虫　3
1.1　网络连接　3
1.2　BeautifulSoup 简介　5
1.2.1　安eautifulSoup　6
1.2.2　运行BeautifulSoup　8
1.2.3　可靠的网络连接以及异常的处理　9
第　2 章复杂HTML 解析　13
2.1　不是一直都要用锤子　13
2.2　再端一碗BeautifulSoup　14
2.2.1　BeautifulSoup 的find() 和find_all()　16
2.2.2　其他BeautifulSoup 对象　18
2.2.3　导航树　18
2.3　正则表达式　22
2.4　正则表达式和BeautifulSoup　25
2.5　获取属性　26
2.6　Lambda 表达式　26
第3　章编写网络爬虫　28
3.1　遍历单个域名　28
3.2　抓取整个网站　32
3.3　在互联网上抓取　36
第4　章网络爬虫模型　41
4.1　规划和定义对象　41
4.2　处理不同的网站布局　45
4.3　结构化爬虫　49
4.3.1　通过搜索抓取网站　49
4.3.2　通过链接抓取网站　52
4.3.3　抓取多种类型的页面　54
4.4　关于网络爬虫模型的思考　55
第5　章 Scrapy　57
5.1　安装Scrapy　57
5.2　创建一个简易爬虫　59
5.3　带规则的抓取　60
5.4　创建item　64
5.5　输出item　66
5.6　item 管线组件　66
5.7　Scrapy 日志管理　69
5.8　更多资源　70
第6　章存储数据　71
6.1　媒体文件　71
6.2　把数据存储到CSV　74
6.3　MySQL　75
6.3.1　安装MySQL　76
6.3.2　基本命令　78
6.3.3　与Python 整合　81
6.3.4　数据库技术与*佳实践　84
6.3.5　MySQL 里的“六度空间游戏”　86
6.4　Email　88
*二部分　*级网页抓取
第7　章读取文档　93
7.1　文档编码　93
7.2　纯文本　94
7.3　CSV　98
7.4　PDF　100
7.5　微软Word 和.docx　102
第8　章数据清洗　106
8.1　编写代码清洗数据　106
8.2　数据存储后再清洗　111
第9　章自然语言处理　115
9.1　概括数据　116
9.2　马尔可夫模型　119
9.3　自然语言工具包　124
9.3.1　安装与设置　125
9.3.2　用NLTK 做统计分析　126
9.3.3　用NLTK 做词性分析　128
9.4　其他资源　131
第　10 章穿越网页表单与登录窗口进行抓取　132
10.1　Python Requests 库　132
10.2　提交一个基本表单　133
10.3　单选按钮、复选框和其他输入　134
10.4　提交文件和图像　136
10.5　处理登录和cookie　136
10.6　其他表单问题　139
第　11 章抓取JavaScript　140
11.1　JavaScript 简介　140
11.2　Ajax 和动态HTML　143
11.2.1　在Python 中用Selenium 执行JavaScript　144
11.2.2　Selenium 的其他webdriver　149
11.3　处理重定向　150
11.4　关于JavaScript 的*后提醒　151
第　12 章利用API 抓取数据　152
12.1　API 概述　152
12.1.1　HTTP 方法和API　154
12.1.2　更多关于API 响应的介绍　155
12.2　解析JSON 数据　156
12.3　无文档的API　157
12.3.1　查找无文档的API　159
12.3.2　记录未被记录的API　160
12.3.3　自动查找和记录API　160
12.4　API 与其他数据源结合　163
12.5　再说一点API　165
第　13 章图像识别与文字处理　167
13.1　OCR 库概述　168
13.1.1　Pillow　168
13.1.2　Tesseract　168
13.1.3　NumPy　170
13.2　处理格式规范的文字　171
13.2.1　自动调整图像　173
13.2.2　从网站图片中抓取文字　176
13.3　读取验证码与训练Tesseract　178
13.4　获取验证码并提交答案　183
第　14 章避开抓取陷阱　186
14.1　道德规范　186
14.2　让网络机器人看着像人类用户　187
14.2.1　修改请求头　187
14.2.2　用JavaScript 处理cookie　189
14.2.3　时间就是一切　191
14.3　常见表单安全措施　191
14.3.1　隐含输入字段值　192
14.3.2　避免蜜罐　192
14.4　问题检查表　194
第　15 章用爬虫测试网站　196
15.1　测试简介　196
15.2　Python 单元测试　197
15.3　Selenium 单元测试　201
15.4　单元测试与Selenium 单元测试的选择　205
第　16 章并行网页抓取　206
16.1　进程与线程　206
16.2　多线程抓取　207
16.2.1　竞争条件与队列　209
16.2.2　threading 模块　212
16.3　多进程抓取　214
16.3.1　多进程抓取　216
16.3.2　进程间通信　217
16.4　多进程抓取的另一种方法　219
第　17 章远程抓取　221
17.1　为什么要用远程服务器　221
17.1.1　避免IP 地址被封杀　221
17.1.2　移植性与扩展性　222
17.2　Tor 代理服务器　223
17.3　远程主机　224
17.3.1　从网站主机运行　225
17.3.2　从云主机运行　225
17.4　其他资源　227
第　18 章网页抓取的法律与道德约束　228
18.1　商标、版权、　228
18.2　侵害动产　230
18.3　计算机欺与滥用法　232
18.4　robots.txt 和服务协议　233
18.5　3 个网络爬虫　236
18.5.1　eBay 起诉Bidder’s Edge 侵害其动产　236
18.5.2　美国起诉Auernheimer 与《计算机欺与滥用法》　237
18.5.3　Field 起诉Google：版权和robots.txt　239
18.6　勇往直前　239
关于作者　241
关于封面　241

作者介绍

瑞安·米切尔（Ryan Mitchell）数据科学家、软件工程师，有丰富的网络爬虫和数据分析实战经验，目前就职于美国格理集团，经常为网页数据采集项目提供咨询服务，并在美国东北大学和美国欧林工程学院任教。

关联推荐

Python 3网络爬虫开发入书籍，全面介绍网页抓取技术，解决Web数据采集、转换和使用中的诸多常见问题和痛点

查看全部评论>

Python网络爬虫权威指南第二2版 Python 3网络爬虫开发实战入教程数据采集数据爬取数据挖掘书人民邮

本店商品均为正版，保证质量；如收到货有任何问题请联系客服~

看了又看

商品预定流程：

预约抢购流程说明：

云钻刮券

刮券规则

云钻刮券活动规则

活动时间

活动形式

其他

券使用规则

店铺装修中

搜索店内商品

商品分类

人民邮电出版社旗舰店

售后保障

最近浏览

猜你喜欢

Python网络爬虫权威指南 第二2版 Python 3网络爬虫开发实战入教程 数据采集数据爬取数据挖掘书 人民邮

本店商品均为正版，保证质量；如收到货有任何问题请联系客服~

看了又看

商品预定流程：

预约抢购流程说明：

云钻刮券

刮券规则

云钻刮券活动规则

活动时间

活动形式

其他

券使用规则

店铺装修中

搜索店内商品

商品分类

期刊/杂志排行榜

人民邮电出版社旗舰店

售后保障

最近浏览

猜你喜欢

Python网络爬虫权威指南第二2版 Python 3网络爬虫开发实战入教程数据采集数据爬取数据挖掘书人民邮