由于此商品库存有限,请在下单后15分钟之内支付完成,手慢无哦!
100%刮中券,最高99元无敌券,券有效期7天
活动自2017年6月2日上线,敬请关注云钻刮券活动规则更新。
如活动受政府机关指令需要停止举办的,或活动遭受严重网络攻击需暂停举办的,或者系统故障导致的其它意外问题,苏宁无需为此承担赔偿或者进行补偿。
正版新书]大数据技术基础——基于Hadoop与Spark罗福强 李瑶
¥ ×1
第1章 大数据技术概述
1.1 大数据技术的发展背景
1.1.1 大数据技术的发展过程
1.1.2 大数据技术的影响
1.1.3 大数据发展的重大事件
1.2 大数据的概念、特征及意义
1.2.1 什么是大数据
1.2.2 大数据的特征
1.2.3 大数据来自哪儿
1.2.4 大数据的挑战
1.2.5 研究大数据的意义
1.3 大数据的存储与计算模式
1.3.1 大数据的存储模式
1.3.2 大数据的计算模式
1.4 大数据的典型应用
1.4.1 智慧医疗的应用
1.4.2 智慧农业的应用
1.4.3 金融行业的应用
1.4.4 零售行业的应用
1.4.5 电子商务行业的应用
1.4.6 电子政务的应用
1.5 初识Hadoop大数据平台
1.5.1 Hadoop的发展过程
1.5.2 Hadoop的优势
1.5.3 Hadoop的生态系统
1.5.4 Hadoop的版本
1.6 习题
第2章 Hadoop平台的安装与配置
2.1 安装准备
2.1.1 硬件要求
2.1.2 安装Linux
2.1.3 安装Java
2.2 Hadoop的集群安装
2.2.1 Hadoop的运行模式
2.2.2 Linux系统设置
2.2.3 SSH的安装
2.2.4 Hadoop的安装
2.2.5 Hadoop的配置
2.2.6 Hadoop的测试
2.3 Hadoop开发平台的安装
2.3.1 Eclipse的安装
2.3.2 下载hadoop-eclipse-plugin插件
2.3.3 在Eclipse中配置Hadoop
2.4 习题
2.5 实训
第3章 Hadoop分布式文件系统
3.1 HDFS概述
3.1.1 HDFS简介
3.1.2 HDFS的基本概念
3.1.3 HDFS的特点
3.2 HDFS的体系结构
3.2.1 HDFS设计目标
3.2.2 HDFS的结构模型
3.2.3 HDFS文件的读写
3.2.4 HDFS的数据组织机制
3.2.5 HDFS的高可用性机制
3.3 HDFS Shell操作
3.3.1 Shell命令介绍
3.3.2 HDFS Shell帮助
3.3.3 文件操作命令
3.3.4 跨文件系统的交互操作命令
3.3.5 权限管理操作
3.4 习题
3.5 实训
第4章 HDFS API编程
第5章 Hadoop分布式计算框架
第6章 MapReduce API编程
第7章 MapReduce 高级编程
第8章 Spark概述
第9章 Spark Streaming编程
第10章 Spark SQL编程
参考文献
罗福强,副教授,畅销教材作者。其编写的《Visual C#.NET程序设计教程》教材,累计销售数万册。
《大数据技术基础——基于Hadoop与Spark》: (1)输入数据 默认情况下,接收器收到的数据是以StorageLevel.MEMORY_AND_DISK_SER_2的存储级别存储到执行器(Executor)内存中的。也就是说,收到的数据会被序列化以减少GC(Garbage Collection,垃圾回收)开销,同时保存两个副本以容错。同时,数据会优先保存在内存里,当内存不足时才吐出到磁盘上。很明显,这个过程中会有数据序列化的开销。接收器首先将收到的数据反序列化,然后再以Spark所配置的指定格式来序列化数据。 (2)Spark Streaming算子所生产的持久化的RDD Spark Streaming计算所生成的RDD可能会持久化到内存中。例如,基于窗口的算子会将数据持久化到内存,因为窗口数据可能会被多次处理。所不同的是,Spark默认用StorageLevel.MEMORY_ONLY级别持久化RDD数据,而Spark Streaming默认使用StorageLevel.MEMORY_ONLY_SER级别持久化接收到的数据,以便尽量减少垃圾回收开销。 不管是上面哪一种数据,都可以使用Kryo序列化来减少CPU和内存开销。 Spark Streaming应用在集群中占用的内存量严重依赖于具体所使用的Transformation算子。例如,如果想要用一个窗口算子操纵最近5min的数据,那么你的集群至少需要在内存里保留5nun的数据;另一个例子是updateStateByKey,如果Key很多的话,相对应的保存的Key的State也会很多,而这些都需要占用内存。而如果你的应用只是做一个简单的“映射—过滤—存储”(map—filter—store)操作的话,那需要的内存就很少了。一般情况下,Spark Streaming接收器接收到的数据会以StorageLevel.MEM ORY—AND_DISK_SER_2这个存储级别存到Spark中,也就是说,如果内存装不下,数据将被吐到磁盘上。数据吐到磁盘上会大大降低Spark Streaming应用的性能,因此还是建议根据应用处理的数据量,提供充足的内存。最好就是,先小规模地放大内存,再观察评估,然后再放大,再评估。 ……
适读人群 :计算机专业学生,适合零售和培训
一、重点突出,避免市场上大多数的大数据书籍面面俱到、不适合教学的弊端 二、内容结构完整,根据循序渐进的认识规律设计章节顺序 三、提供了大量的案例,所有案例代码都是完整的,都通过了JDK 1.8调试并给出了运行效果 四、全书配备了丰富的、符合初学者习惯的思考和实践任务 五、全书不仅包含了Hadoop 和 Spark的概念、原理及其应用方法,还通过应用案例以图文并茂的方式展示了大数据应用系统的设计与实现过程,为读者深入学习Hadoop与Spark技术提供了颇具价值的参考
亲,大宗购物请点击企业用户渠道>小苏的服务会更贴心!
亲,很抱歉,您购买的宝贝销售异常火爆让小苏措手不及,请稍后再试~
非常抱歉,您前期未参加预订活动,
无法支付尾款哦!
抱歉,您暂无任性付资格
