
会员
Spark 3.0大数据分析与挖掘:基于机器学习
王晓华 罗凯靖编著更新时间:2023-09-21 10:31:02
最新章节:13.6 小结开会员,本书免费读 >
Spark作为新兴的、应用范围广泛的大数据处理开源框架,吸引了大量的大数据分析与挖掘从业人员进行相关内容的学习与开发,其中ML是Spark3.0机器学习框架使用的核心。本书用于Spark3.0ML大数据分析与挖掘入门,配套示例源码、PPT课件、数据集、思维导图、开发环境和作者答疑服务。本书共分13章,从Spark3.0大数据分析概述、基础安装和配置开始,依次介绍ML的DataFrame、ML的基本概念,以及协同过滤、线性回归、分类、决策树与随机森林、聚类、关联规则、数据降维、特征提取和转换等数据处理方法;最后通过经典的鸢尾花分析实例,回顾前面的学习内容,实现了一个完整的数据分析与挖掘过程。本书采取实例和理论相结合的方式,讲解细致直观,示例丰富,适合Spark3.0机器学习初学者、大数据分析和挖掘人员,也适合高等院校和培训机构人工智能与大数据相关专业的师生教学参考。
品牌:清华大学
上架时间:2022-03-01 00:00:00
出版社:清华大学出版社
本书数字版权由清华大学提供,并由其授权上海阅文信息技术有限公司制作发行
最新章节
王晓华 罗凯靖编著
主页
最新上架
- 会员
算法设计与分析
为了便于读者进行系统学习、分类整理知识点及遇到问题时能够快速找到求解的方法,本书按照算法策略进行划分,每一章都引入了若干个经典问题。通过问题的分析、计算模型的建立、算法的设计与描述、算法的分析来深入解读每一种算法策略所能解决的问题范畴及方法。全书共分9章,内容包括:算法设计基础、算法效率分析基础、迭代法、蛮力法、分治策略、回溯与分支界限、贪心算法、动态规划、随机算法。本书非常注重教材的可读性和实用计算机9.4万字 - 会员
云计算服务保障体系
云计算是一种商业计算模型,它将计算任务分布在大量计算机构成的资源池上,使用户能够按需获取计算能力、存储空间和信息服务。与以往的计算模式不同,云计算环境下,信息安全和服务保障问题更严重、更突出。本书从云计算的安全技术和服务质量评价两个方面论述云计算服务保障的体系架构,安全技术方面主要阐述了基于可信计算的实时度量、基于角色的数据隔离访问、云节点信任链的动态维护模型与验证机制和多级安全访问控制模型;服务计算机9.5万字 - 会员
MySQL数据库基础实例教程
本书较全面地介绍了MySQL数据库的基础知识及其应用。本书共11章,包括数据库基础,MySQL的安装与配置,数据库的基本操作,数据表的基本操作,表数据的增、改、删操作,数据查询,视图,索引,存储过程与触发器,事务,数据安全等内容。本书采用案例教学方式,每章以应用实例的方式阐述知识要点,再通过实训项目分析综合应用,最后辅以思考与练习巩固所学知识。应用实例、实训项目、思考与练习这3个部分分别采用3个不计算机7.8万字 - 会员
一本书讲透首席数据官:CDO知识体系与能力模型详解
这是一本能指导首席数据官(CDO)快速构建知识体系和能力模型的标准指南。本书融合了作者对CDO角色的深刻理解和深厚的工程实践经验,系统而全面地介绍了CDO所需的核心知识体系与能力模型。本书从CDO的基本概念出发,逐步深入探讨了CDO在政策环境、数字化转型、组织数据体系建设与管理、数据价值创造等方面的关键作用。书中不仅详细阐述了CDO应具备的基础数据知识和组织数据管理能力,还通过丰富的案例和实战技巧计算机17.3万字 - 会员
业务数据分析:五招破解业务难题
本书主要向读者介绍基于互联网技术的数据分析原理与方法,帮助读者理解并掌握数据分析能力,可使用到实践中并提升工作能力。本书具体内容包括学数据分析有什么用,数据分析的基础方法,数据分析的起点,数据分析的基础,数据分析的准备;通过数据分析看清现实,通过数据分析抓住业务增长机会,通过数据分析发现异常、处理异常、防止异常,通过数据分析预测与推荐,通过数据分析服务线下业务,数据分析结果汇报,以及让数据分析结果计算机10.3万字 - 会员
深入浅出数字孪生
本书基于工业4.0背景,阐述了数字孪生作为一种科学范式,为物理对象/系统及其数字对应体提供了非凡的优势和灵活性。本书结合数字孪生在各行业的应用来阐述其基本知识和运行方式。本书首先介绍了数字孪生的基本定义、相关概念、发展历程、构成要素、工作原理、类型、特性、解决方案架构等内容;其次介绍了数字孪生的优势、挑战、研究与应用;然后介绍了数字孪生在医疗、建筑、石油和天然气、制药等行业以及智慧城市、结构健康检计算机9.8万字 - 会员
Redis应用实例
本书将从内部组件、外部应用和数据结构3个方面为读者介绍Redis常见、经典的用法与实例,并且所有实例均附有完整的Python代码,方便读者学习和参考。全书分3个部分:第一部分讲内部组件,介绍的实例通常用于系统内部,如缓存、锁、计数器、迭代器、速率限制器等,这些都是很多系统中不可或缺的部分;第二部分讲外部应用,介绍的实例都是一些日常常见的、用户可以直接接触到的应用,如直播弹幕、社交关系、排行榜、分页计算机7.4万字 - 会员
城市计算
本书概述了城市计算的定义、框架和主要研究问题,以典型应用为案例着重介绍大数据中异构数据的融合和协同计算技术,根据城市计算的框架分成四个部分:概念和框架、城市感知和数据采集、城市数据管理、城市数据分析。第一部分(第1章和第2章)给出城市计算的概述。第二部分(第3章)介绍了数据的来源和收集方法。第三部分由第4~6章组成,介绍了空间和时空数据的数据管理。第四部分由第7~10章组成,介绍了从城市大数据中挖计算机30.4万字 - 会员
数据产品开发与经营:从数据资源到数据资本
本书全面介绍数据产品开发与经营,全书共13章,分为数据产品基础、数据产品开发、数据产品实践、数据产品经营四篇。第一篇深入分析国家和地方层面的数据资产政策,提出数据资产运营框架,并介绍数据资源的治理和数据产品。第二篇详细阐述数据产品开发三大策略、数据产品设计五步法、数据产品开发方法以及数据产品运营方法。第三篇全面介绍数据产品开发的实践案例,特别从数据要素型企业、数商型企业两个角度说明数据产品开发的实计算机33.6万字
同类书籍最近更新
- 会员
数据要素价值化蓝图:全景、认知与路径
本书内容分为五篇。第一篇从数据要素的基本概念和发展历程入手,帮助读者建立对数据要素的初步认知,并在此基础上探索与数据要素相关的政策导向和环境,了解数据在当今社会中的地位和影响。第二篇详细阐述如何实现数据要素价值化,具体包括数据资产管理、数据治理与确权、数据资产评估与定价等多个方面,还介绍了数据资源入表,数据监管、合规与安全,数据资产的交易等知识。第三篇重点介绍公共数据要素基本知识和公共数据要素价值数据库20.8万字 - 会员
深入浅出数字孪生
本书基于工业4.0背景,阐述了数字孪生作为一种科学范式,为物理对象/系统及其数字对应体提供了非凡的优势和灵活性。本书结合数字孪生在各行业的应用来阐述其基本知识和运行方式。本书首先介绍了数字孪生的基本定义、相关概念、发展历程、构成要素、工作原理、类型、特性、解决方案架构等内容;其次介绍了数字孪生的优势、挑战、研究与应用;然后介绍了数字孪生在医疗、建筑、石油和天然气、制药等行业以及智慧城市、结构健康检数据库9.8万字