python2.7 pyspark显示以及插入hive表中文编码问题

Python转Spark DataFrame中文乱码解决

最新推荐文章于 2024-07-05 03:31:56 发布

原创最新推荐文章于 2024-07-05 03:31:56 发布 · 1k 阅读

0 ·

CC 4.0 BY-SA版权

文章标签：

#大数据

pyspark 专栏收录该内容

3 篇文章

订阅专栏

在Python 2.7环境下读取Excel，print pandas的DataFrame时中文可正常显示，但转换成Spark的DataFrame后，show或写入Hive表出现中文乱码。使用pyspark.sql.functions的decode和encode函数，先从utf - 8解码，再以ISO - 8859 - 1编码，解决了中文显示问题。

我用python2.7的环境下读取excel，这个时候print pandas的dataframe时中文是可以显示的，说明不是python2.7的问题，然后将其转换成spark的dataframe的时候，show或者write到hive表的时候出现了中文乱码，这个时候我使用了pyspark.sql.functions.decode和encode函数，首先将它从utf-8进行解码，然后以ISO-8859-1进行编码，此时中文可以正常显示。

df = df.withColumn(column,encode(decode(col(column),'UTF-8'),'ISO-8859-1'))