您的位置: 首页 > 文章 > SparkSQL基本操作----作业一

SparkSQL基本操作----作业一

分类: 文章 • 2024-06-28 21:58:34

题目：

SparkSQL基本操作将下列JSON格式数据复制到Linux系统中，并保存命名为employee. json。

{ "id": 1 , "name":" Ella" , "age": 36 }

{ "id": 2, "name":" Bob","age": 29 }

{ "id": 3 , "name":" Jack","age": 29 }

{ "id": 4 , "name":" Jim","age": 28 }

{ "id": 4 , "name":" Jim","age": 28 }

{ "id": 5 , "name":" Damon" }

{ "id": 5 , "name":" Damon" }

为 employee. json创建DataFrame，并写出Scala语句完成下列操作：

查询所有数据；
查询所有数据，并去除重复的数据；
查询所有数据，打印时去除id字段；
筛选出 age> 30的记录；
将数据按 age 分组；
将数据按 name 升序排列；
取出前 3 行数据；
查询所有记录的 name 列，并为其取别名为 username；
查询年龄 age 的平均值；
查询年龄 age 的最小值。

代码：

启动hadoop，spark；

spark-shell

1、查询所有数据；

SparkSQL基本操作----作业一

2、查询所有数据，并去除重复的数据；

SparkSQL基本操作----作业一

3、查询所有数据，打印时去除 id 字段；

SparkSQL基本操作----作业一

4、筛选出 age> 30 的记录；

SparkSQL基本操作----作业一

5、将数据按 age 分组；

SparkSQL基本操作----作业一

6、将数据按 name 升序排列；

SparkSQL基本操作----作业一

7、取出前 3 行数据；

SparkSQL基本操作----作业一

8、查询所有记录的 name 列，并为其取别名为 username；

SparkSQL基本操作----作业一

9、查询年龄 age 的平均值；

SparkSQL基本操作----作业一

10、查询年龄 age 的最小值。

SparkSQL基本操作----作业一