本课程主要讲解Spark技术,借助Spark对外提供的Python接口,使用Python语言开发。涉及到Spark内核原理、Spark基础知识及应用、Spark基于DataFrame的Sql应用、机器学习及深度学习等内容。由浅到深的带大家深入学习大数据领域最火的项目Spark。帮助大家进入大数据领域,抓住大数据浪潮的尾巴。
软件版本:
内容涉及:
-
pyspark 基础模块
-
pyspark.sql 模块
-
pyspark.ml 基于DataFrame的机器学习模块
-
pyspark.mllib package 基于RDD的机器学习模块
-
中间还会涉及到云计算中的docker容器技术,课程的学习环境就是使用Docker三个容器搭建的分布式环境
-
pyspark中Numpy、Pandas、Scikit-learn的互操作和相互对比