spark源码action系列-collect

本文详细探讨了Spark中的RDD.collect操作,讲解了如何在ResultTask.runTask中执行function,以及当结果超过driver.maxResultSize配置时的处理方式。collect操作将所有Task的返回数组合并成一个大数组,需要注意避免单个Task或所有Task结果总和超过1GB的限制。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

RDD.collect的操作

collect操作,在最后的ResultTask.runTask,执行的function的操作为下面代码.

由于对ResultTask的runTask这个函数的返回值就是这个runTask函数在执行完成RDD传入的function后的返回值.这里要说明下如果task的结果超过了spark.driver.maxResultSize配置的最大值时,默认是1G,直接对task的结果进行丢掉,不处理,

def 

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值