我用python2.7的环境下读取excel,这个时候print pandas的dataframe时中文是可以显示的,说明不是python2.7的问题,然后将其转换成spark的dataframe的时候,show或者write到hive表的时候出现了中文乱码,这个时候我使用了pyspark.sql.functions.decode和encode函数,首先将它从utf-8进行解码,然后以ISO-8859-1进行编码,此时中文可以正常显示。
df = df.withColumn(column,encode(decode(col(column),'UTF-8'),'ISO-8859-1'))
Python转Spark DataFrame中文乱码解决
在Python 2.7环境下读取Excel,print pandas的DataFrame时中文可正常显示,但转换成Spark的DataFrame后,show或写入Hive表出现中文乱码。使用pyspark.sql.functions的decode和encode函数,先从utf - 8解码,再以ISO - 8859 - 1编码,解决了中文显示问题。
5381

被折叠的 条评论
为什么被折叠?



