python2.7 pyspark显示以及插入hive表中文编码问题

在Python 2.7环境下读取Excel,print pandas的DataFrame时中文可正常显示,但转换成Spark的DataFrame后,show或写入Hive表出现中文乱码。使用pyspark.sql.functions的decode和encode函数,先从utf - 8解码,再以ISO - 8859 - 1编码,解决了中文显示问题。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

我用python2.7的环境下读取excel,这个时候print pandas的dataframe时中文是可以显示的,说明不是python2.7的问题,然后将其转换成spark的dataframe的时候,show或者write到hive表的时候出现了中文乱码,这个时候我使用了pyspark.sql.functions.decode和encode函数,首先将它从utf-8进行解码,然后以ISO-8859-1进行编码,此时中文可以正常显示。

df = df.withColumn(column,encode(decode(col(column),'UTF-8'),'ISO-8859-1'))

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值