返回首页
苏宁会员
购物车 0
易付宝
手机苏宁

服务体验

店铺评分与同行业相比

用户评价:----

物流时效:----

售后服务:----

  • 服务承诺: 正品保障
  • 公司名称:
  • 所 在 地:

  • 正版新书]Hadoop+Spark大数据巨量分析与机器学习整合开发实战林
  • 全店均为全新正版书籍,欢迎选购!新疆西藏青海(可包挂刷).港澳台及海外地区bu bao快递
    • 作者: 林大贵著 | 林大贵编 | 林大贵译 | 林大贵绘
    • 出版社: 清华大学出版社
    • 出版时间:2017-01-01
    送至
  • 由""直接销售和发货,并提供售后服务
  • 加入购物车 购买电子书
    服务

    看了又看

    商品预定流程:

    查看大图
    /
    ×

    苏宁商家

    商家:
    君凤文轩图书专营店
    联系:
    • 商品

    • 服务

    • 物流

    搜索店内商品

    商品分类

    商品参数
    • 作者: 林大贵著| 林大贵编| 林大贵译| 林大贵绘
    • 出版社:清华大学出版社
    • 出版时间:2017-01-01
    • 版次:1
    • 印次:1
    • 印刷时间:2016-11-01
    • 字数:730000
    • 页数:425
    • 开本:16开
    • ISBN:9787302453758
    • 版权提供:清华大学出版社
  • 作者: 林大贵
  • 著: 林大贵
  • 装帧: 暂无
  • 印次: 1
  • 定价: 79
  • ISBN: 9787302453758
  • 出版社: 清华大学出版社
  • 开本: 16开
  • 印刷时间: 2016-11-01
  • 语种: 中文
  • 出版时间: 2017-01-01
  • 页数: 425
  • 外部编号: 五三A46740
  • 版次: 1
  • 成品尺寸: 暂无
  • 第1章 大数据与机器学习
    1.1 大数据定义
    1.2 Hadoop简介
    1.3 Hadoop HDFS分布式文件系统
    1.4 Hadoop MapReduce的介绍
    1.5 Spark的介绍
    1.6 机器学习的介绍
    第2章 VirtualBox虚拟机软件的安装
    2.1 VirtualBox的下载和安装
    2.2 设置VirtualBox语言版本
    2.3 设置VirtualBox存储文件夹
    2.4 在VirtualBox创建虚拟机
    第3章 Ubuntu Linux操作系统的安装
    3.1 下载安装Ubuntu的光盘文件
    3.2 在Virtual设置Ubuntu虚拟光盘文件
    3.3 开始安装Ubuntu
    3.4 启动Ubuntu
    3.5 安装增强功能
    3.6 设置默认输入法
    3.7 设置“终端”程序
    3.8 设置“终端”程序为白底黑字
    3.9 设置共享剪贴板
    第4章 Hadoop Single Node Cluster的安装
    4.1 安装JDK
    4.2 设置SSH无密码登录
    4.3 下载安装Hadoop
    4.4 设置Hadoop环境变量
    4.5 修改Hadoop配置设置文件
    4.6 创建并格式化HDFS目录
    4.7 启动Hadoop
    4.8 打开Hadoop ResourceManager Web界面
    4.9 NameNode HDFS Web界面
    第5章 Hadoop Multi Node Cluster的安装
    5.1 把Single Node Cluster复制到data1
    5.2 设置VirtualBox网卡
    5.3 设置data1服务器
    5.4 复制data1服务器到data2、data3、master
    5.5 设置data2、data3服务器
    5.6 设置master服务器
    5.7 master连接到data1、data2、data3创建HDFS目录
    5.8 创建并格式化NameNode HDFS目录
    5.9 启动Hadoop Multi Node Cluster
    5.10 打开Hadoop ResourceManager Web界面
    5.11 打开NameNode Web界面
    第6章 Hadoop HDFS命令
    6.1 启动Hadoop Multi-Node Cluster
    6.2 创建与查看HDFS目录
    6.3 从本地计算机复制文件到HDFS
    6.4 将HDFS上的文件复制到本地计算机
    6.5 复制与删除HDFS文件
    6.6 在Hadoop HDFS Web用户界面浏览HDFS
    第7章 Hadoop MapReduce
    7.1 介绍wordCount.Java
    7.2 编辑wordCount.Java
    7.3 编译wordCount.Java
    7.4 创建测试文本文件
    7.5 运行wordCount.Java
    7.6 查看运行结果
    7.7 Hadoop MapReduce的缺点
    第8章 Spark的安装与介绍
    8.1 Spark的Cluster模式架构图
    8.2 Scala的介绍与安装
    8.3 安装Spark
    8.4 启动spark-shell交互界面
    8.5 设置spark-shell显示信息
    8.6 启动Hadoop
    8.7 本地运行spark-shell程序
    8.8 在Hadoop YARN运行spark-shell
    8.9 构建Spark Standalone Cluster执行环境
    8.10 在Spark Standalone运行spark-shell
    第9章 Spark RDD
    9.1 RDD的特性
    9.2 基本RDD“转换”运算
    9.3 多个RDD“转换”运算
    9.4 基本“动作”运算
    9.5 RDD Key-Value 基本“转换”运算
    9.6 多个RDD Key-Value“转换”运算
    9.7 Key-Value“动作”运算
    9.8 Broadcast广播变量
    9.9 accumulator累加器
    9.10 RDD Persistence持久化
    9.11 使用Spark创建WordCount
    9.12 Spark WordCount详细解说
    第10章 Spark的集成开发环境
    10.1 下载与安装eclipse Scala IDE
    10.2 下载项目所需要的Library
    10.3 启动eclipse
    10.4 创建新的Spark项目
    10.5 设置项目链接库
    10.6 新建scala程序
    10.7 创建WordCount测试文本文件
    10.8 创建WordCount.scala
    10.9 编译WordCount.scala程序
    10.10 运行WordCount.scala程序
    10.11 导出jar文件
    10.12 spark-submit的详细介绍
    10.13 在本地local模式运行WordCount程序
    10.14 在Hadoop yarn-client运行WordCount程序
    10.15 在Spark Standalone Cluster上运行WordCount程序
    10.16 本书范例程序的安装说明
    第11章 创建推荐引擎
    11.1 推荐算法介绍
    11.2 “推荐引擎”大数据分析使用场景
    11.3 ALS推荐算法的介绍
    11.4 ml-100k推荐数据的下载与介绍
    11.5 使用spark-shell导入ml-100k数据
    11.6 查看导入的数据
    11.7 使用ALS.train进行训练
    11.8 使用模型进行推荐
    11.9 显示推荐的电影名称
    11.10 创建Recommend项目
    11.11 Recommend.scala程序代码
    11.12 创建PrepareData()数据准备
    11.13 recommend()推荐程序代码
    11.14 运行Recommend.scala
    11.15 创建AlsEvaluation.scala调校推荐引擎参数
    11.16 创建PrepareData()数据准备
    11.17 进行训练评估
    11.18 运行AlsEvaluation
    11.19 修改Recommend.scala为佳参数组合
    第12章 StumbleUpon数据集
    12.1 StumbleUpon数据集简介
    12.2 下载StumbleUpon数据
    12.3 用LibreOffice Calc 电子表格查看train.tsv
    12.4 二元分类算法
    第13章 决策树二元分类
    13.1 决策树的介绍
    13.2 创建Classification项目
    13.3 开始输入RunDecisionTreeBinary.scala程序
    13.4 数据准备阶段
    13.5 训练评估阶段
    13.6 预测阶段
    13.7 运行RunDecisionTreeBinary.scala
    13.6 修改RunDecisionTreeBinary调校训练参数
    13.7 运行RunDecisionTreeBinary进行参数调校
    13.8 运行RunDecisionTreeBinary不进行参数调校
    第14章 逻辑回归二元分类
    14.1 逻辑回归分析介绍
    14.2 RunLogisticRegression WithSGDBinary.scala程序说明
    14.3 运行RunLogisticRegression WithSGDBinary.scala进行参数调校
    14.4 运行RunLogisticRegression WithSGDBinary.scala不进行参数调校
    第15章 支持向量机SVM二元分类
    15.1 支持向量机SVM算法的基本概念
    15.2 RunSVMWithSGDBinary.scala 程序说明
    15.3 运行SVMWithSGD.scala进行参数调校
    15.4 运行SVMWithSGD.scala不进行参数调校
    第16章 朴素贝叶斯二元分类
    16.1 朴素贝叶斯分析原理的介绍
    16.2 RunNaiveBayesBinary.scala程序说明
    16.3 运行NaiveBayes.scala进行参数调校
    16.4 运行NaiveBayes.scala不进行参数调校
    第17章 决策树多元分类
    17.1 “森林覆盖植被”大数据问题分析场景
    17.2 UCI Covertype数据集介绍
    17.3 下载与查看数据
    17.4 创建RunDecisionTreeMulti.scala
    17.5 修改RunDecisionTreeMulti.scala程序
    17.6 运行RunDecisionTreeMulti.scala进行参数调校
    17.7 运行RunDecisionTreeMulti.scala不进行参数调校
    第18章 决策树回归分析
    18.1 Bike Sharing大数据问题分析
    18.2 Bike Sharing数据集
    18.3 下载与查看数据
    18.4 创建RunDecisionTreeRegression.scala
    18.5 修改RunDecisionTreeRegression.scala
    18.6 运行RunDecisionTreeRegression. scala进行参数调校
    18.7 运行RunDecisionTreeRegression. scala不进行参数调校
    第19章 使用Apache Zeppelin 数据可视化
    19.1 Apache Zeppelin简介
    19.2 安装Apache Zeppelin
    19.3 启动Apache Zeppelin
    19.4 创建新的Notebook
    19.5 使用Zeppelin运行Shell 命令
    19.6 创建临时表UserTable
    19.7 使用Zeppelin运行年龄统计Spark SQL
    19.8 使用Zeppelin运行性别统计Spark SQL
    19.9 按照职业统计
    19.10 Spark SQL加入文本框输入参数
    19.11 加入选项参数
    19.12 同时显示多个统计字段
    19.13 设置工具栏
    19.14 设置段落标题
    19.15 设置Paragraph段落的宽度
    19.16 设置显示模式

    1.1大数据定义大数据(Bigdata)又称为巨量资料、巨量数据或海量数据。一般来说大数据的特性可归类为3V:? Volume(大量数据)? 因特网、企业IT、物联网、社区、短信、电话、网络搜索、在线交易等,随时都在快速累积庞大的数据。
    ? 数据量很容易达到TB(Terabyte,1024GB),甚至PB(Petabyte,1024TB)或EB(Exabyte,1024PB)的等级。
    ? Variety(多样性)大数据的数据类型非常多样化,可分为非结构化信息和结构化信息。
    ? 非结构化信息:文字、图片、图像、视频、音乐、地理位置信息、个人化信息——如社区、交友数据等。
    ? 结构化信息:数据库、数据仓库等。
    ? Velocity(时效性)? 数据的传输流动:随着带宽越来越大、设备越来越多,每秒产生的数据流越来越大。
    ? 组织必须能实时处理大量的信息:因为时间太久就失去了数据的价值,数据必须能在最短时间内得出分析结果。
    大数据的影响已经深入到各个领域和行业,在商业、经济及其他领域中,将大量数据进行分析后,就可得出许多数据的关联性。可用于预测商业趋势、营销研究、金融财务、疾病研究、打击犯罪等。决策行为将基于数据和分析的结果,而不是依靠经验和直觉。
    1.2Hadoop简介Hadoop是存储与处理大量数据的平台,是Apache软件基金会的开放源码、免费且广泛使用的软件。Hadoop名称来自于原作者孩子的黄色小象玩具。这个名字容易拼字与发音,适合作为软件开发代码,黄色小象因此成为Hadoop的标志。
    ? Hadoop的发展历史2002年DougCutting与MikeCafarelia开始进行Nutch项目。
    2003年Google发表GFS(GoogleFileSystem)与MapReduce论文。
    2004年DougCutting开始将DFS与MapReduce加入Nutch项目。
    2006年DougCutting加入Yahoo团队,并将Nutch改名为Hadoop。
    2008年Yahoo使用Hadoop包含了910个集群,对1TB的数据排序花了297秒。
    ? Hadoop特性特性说明可扩展性(Scalable)由于Hadoop采用分布式计算与存储,当我们扩充容量或运算时,不需要更换整个系统,只需要增加新的数据节点服务器即可经济性(Economical)由于Hadoop采用分布式计算与存储,不必使用昂贵高端的服务器,只需一般等级的服务器就可架构出高性能、高容量的集群弹性(Flexible)传统的关系数据库存储数据时必须有数据表结构schema(各个数据对象的集合),然而Hadoop存储的数据是非结构化(schema-less)的,也就是说可以存储各种形式、不同数据源的数据可靠性(Reliable)Hadoop采用分布式架构,因此即使某一台服务器硬件坏掉,甚至整个机架坏掉,HDFS仍可正常运行,因为数据还会有另外2个副本

    售后保障

    最近浏览

    猜你喜欢

    该商品在当前城市正在进行 促销

    注:参加抢购将不再享受其他优惠活动

    x
    您已成功将商品加入收藏夹

    查看我的收藏夹

    确定

    非常抱歉,您前期未参加预订活动,
    无法支付尾款哦!

    关闭

    抱歉,您暂无任性付资格

    此时为正式期SUPER会员专享抢购期,普通会员暂不可抢购