当前位置：首页 > news >正文

wordpress动漫视频网站网络舆情应急预案

news 2026/4/6 13:31:02

wordpress动漫视频网站,网络舆情应急预案,网站出现用户名密码提示,公众号开发单位内容目录创建SparkSession对象从CSV文件中读取从JSON文件中读取从Parquet文件中读取从数据列表中创建DataFrame从字典列表中创建DataFrame选择一列选择多列过滤年龄大于30的数据过滤名字为Alice的数据可以使用and、or、not等操作符进行组合查询按照年龄分组并计算平均年龄和最大…

内容目录

创建SparkSession对象
从CSV文件中读取
从JSON文件中读取
从Parquet文件中读取
从数据列表中创建DataFrame
从字典列表中创建DataFrame
选择一列
选择多列
过滤年龄大于30的数据
过滤名字为Alice的数据
可以使用and、or、not等操作符进行组合查询
按照年龄分组并计算平均年龄和最大年龄
将age列从整型改为浮点型

Spark的DataFrame是一种类似于表格的数据结构，可以进行各种数据处理操作。使用DataFrame可以很方便地处理结构化数据（如CSV、JSON、Parquet等格式的数据）。

DataFrame是Spark SQL中的概念，因此需要首先引入Spark SQL库：

from pyspark.sql import SparkSession

创建SparkSession对象

spark = SparkSession.builder.appName(“example”).getOrCreate()
创建DataFrame
从文件中读取
可以使用SparkSession的read方法从不同类型的文件中读取数据，例如：

从CSV文件中读取

df = spark.read.csv(“file.csv”, header=True, inferSchema=True)

从JSON文件中读取

df = spark.read.json(“file.json”)

从Parquet文件中读取

df = spark.read.parquet(“file.parquet”)
直接创建
也可以使用SparkSession的createDataFrame方法直接创建DataFrame，例如：

从数据列表中创建DataFrame

data = [(“Alice”, 25), (“Bob”, 30), (“Charlie”, 35)]
df = spark.createDataFrame(data, [“name”, “age”])

从字典列表中创建DataFrame

data = [{“name”: “Alice”, “age”: 25}, {“name”: “Bob”, “age”: 30}, {“name”: “Charlie”, “age”: 35}]
df = spark.createDataFrame(data)
DataFrame的基本操作
显示DataFrame
使用show方法可以将DataFrame中的数据显示出来，例如：

df.show()
查看DataFrame的结构
使用printSchema方法可以查看DataFrame的结构，例如：

df.printSchema()
选择列
使用select方法可以选择一列或多列，例如：