- 博客(1)
- 收藏
- 关注
原创 pyspark下读取minio数据
@pyspark下读取minio数据文件的问题总结记录一下自己花了一下午时间在pyspark读取minio数据文件遇到的坑因为spark没法直接进行像pd.read_csv一样对HTTPresponse的url的读取,但是minio支持s3的接口,所以按照对于s3的读取就ok了。spark读取s3文件时,需要两个额外的jar外部依赖包,hadoop-aws.jar 和aws-java-sdk.jar ,同时这两个版本是需要对应的。并且要确保hadoop-common和hadoop-aws的版本必须一致
2021-08-10 17:06:46
1178
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人