【Spark系列5】Dataframe下常用算子API

周润发的弟弟

已于 2024-01-30 13:27:50 修改

阅读量866

点赞数 8

分类专栏：从零开始搞大数据文章标签： spark 大数据分布式

于 2024-01-30 13:11:38 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.youkuaiyun.com/qq_33592535/article/details/135930595

版权

Apache Spark DataFrame API 提供了丰富的方法来处理分布式数据集。以下是一些常见的 DataFrame API 类别和方法，但这不是一个完整的列表，因为 API 非常广泛。这些方法可以分为几个主要类别：

转换操作（Transformations）

这些方法不会立即执行，但会返回一个新的 DataFrame，通常用于构建计算的执行计划。

select(): 选择一列或多列。
filter(), where(): 根据给定的条件过滤行。
groupBy(): 根据某一列或多列对数据进行分组。
sort(), orderBy(): 根据一列或多列对数据进行排序。
join(): 将两个 DataFrame 根据指定的条件连接起来。
union(): 合并两个 DataFrame 的行。
withColumn(): 添加一个新列或替换一个现有列。
withColumnRenamed(): 重命名一个列。
drop(): 删除一列或多列。
distinct(): 返回一个只包含不同行的新 DataFrame。
groupBy().agg(): 分组后的聚合操作。
pivot(): 用于创建数据透视表。
window(): 定义窗口函数。
withWatermark(): 用于流数据处理中的事件时间。

动作操作（Actionsÿ

最低0.47元/天解锁文章

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

周润发的弟弟 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。