推荐专题：

1500字范文 > 【Python 必会技巧】利用 utf-8-sig 编码格式解决写入 csv 文件乱码问题

【Python 必会技巧】利用 utf-8-sig 编码格式解决写入 csv 文件乱码问题

时间：2019-10-06 21:26:01

相关推荐

【Python 必会技巧】利用 utf-8-sig 编码格式解决写入 csv 文件乱码问题

先举个例子，分别以不指定编码、指定编码为 utf-8、指定编码为 utf-8-sig三种方式来做比较，再将写入 csv 文件和 txt 文件来做个对比

一、不指定编码方式，直接存入 csv 文件

import csvwith open('test.csv', 'w') as fp:writer = csv.writer(fp)writer.writerow(['汉语', '俄语', '韩语', '日语', '英语'])writer.writerow(['爱你', 'люблю тебя', '사랑해요', '愛しています', 'love you'])

此时运行程序会报以下错误：

UnicodeEncodeError: 'gbk' codec can't encode character '\uc0ac' in position 14: illegal multibyte sequence

二、指定编码为 utf-8，再存入 csv 文件

接下来尝试将内容以utf-8编码方式存入 test.csv 文件中，可以看到除了英文，其他的全都是乱码：

import csvwith open('test.csv', 'w', encoding='utf-8') as fp:writer = csv.writer(fp)writer.writerow(['汉语', '俄语', '韩语', '日语', '英语'])writer.writerow(['爱你', 'люблю тебя', '사랑해요', '愛しています', 'love you'])

三、指定编码为 utf-8-sig，再存入 csv 文件

当将编码方式换成utf-8-sig之后，显示为正常：

import csvwith open('test.csv', 'w', encoding='utf-8-sig') as fp:writer = csv.writer(fp)writer.writerow(['汉语', '俄语', '韩语', '日语', '英语'])writer.writerow(['爱你', 'люблю тебя', '사랑해요', '愛しています', 'love you'])

四、不指定编码方式，直接存入 txt 文件

with open('test.txt','w') as fp:fp.write('爱你, люблю тебя, 사랑해요, 愛しています, love you')

和存入 csv 文件一样，也会报以下错误：

UnicodeEncodeError: 'gbk' codec can't encode character '\uc0ac' in position 16: illegal multibyte sequence

五、指定编码为 utf-8 / utf-8-sig，再存入 txt 文件

以utf-8或者utf-8-sig编码方式存入 test.txt 文件中，内容都是完全正常的：

with open('test.txt','w', encoding='utf-8') as fp:fp.write('爱你, люблю тебя, 사랑해요, 愛しています, love you')

with open('test.txt','w', encoding='utf-8-sig') as fp:fp.write('爱你, люблю тебя, 사랑해요, 愛しています, love you')

utf-8 与 utf-8-sig 有什么区别？

utf-8以字节为编码单元，它的字节顺序在所有系统中都是一样的，没有字节序问题，也因此它实际上并不需要 BOM；

uft-8-sig中 sig 全拼为 signature，即带有签名的 utf-8（UTF-8 with BOM）；

BOM全称 ByteOrder Mark，字节顺序标记，出现在文本文件头部，Unicode编码标准中用于标识文件是采用哪种格式的编码。

为什么写入 csv 文件要用 utf-8-sig 编码？

Excel 在读取 csv 文件的时候是通过读取文件头上的 BOM 来识别编码的，如果文件头无 BOM 信息，则默认按照 Unicode 编码读取。

当我们使用 utf-8 编码来生成 csv 文件的时候，并没有生成 BOM 信息，Excel 就会自动按照 Unicode 编码读取，就会出现乱码问题了。

为什么写入 txt 文件要用 utf-8 编码？

在写入 txt 文件时，Windows 会默认转码成 gbk，遇到某些 gbk 不支持的字符就会报错，在打开文件时就声明编码方式为 utf-8 就能避免这个错误。

本内容不代表本网观点和政治立场，如有侵犯你的权益请联系我们处理。

网友评论

网友评论仅供其表达个人看法，并不表明网站立场。

相关阅读

java写入文件编码格式为ansi_Java读取写入文件如何解决乱码问题

2023-02-16

utf-8和utf-8-sig的区别（CSV文件乱码）

2022-03-08

python读写csv确定编码格式_Python使用utf8编码读写csv文件

2022-04-06

python打开csv文件乱码_python3写入csv乱码怎么解决

2023-12-27

最近发布

关于享受的作文：享受一杯苦咖啡1500字作文

2024-07-25

大雁塔与喷泉：传统与现代交融的美丽景观

2024-07-25

心灵触动：边城阅读体验与感悟

2024-07-25

吹皱一池春水1500字作文素材大全

2024-07-25

感恩之心携手成长——班会演讲稿范文1500字

2024-07-25

秋天1500字作文素材大全

2024-07-25

小白兔奇遇记1500字作文素材大全

2024-07-25

写给海的一封信作文1500字

2024-07-25

初二写人作文:似雪非雪的爱1500字

2024-07-25

高三写景作文 :水之韵1500字

2024-07-25

推荐专题

大学生职业生涯规划书1500字红楼梦1500字读后感心理学论文1500字 1500米加油稿200字左右思想汇报1500字 2019入党申请书1500字最美家庭1500字材料免费名著读后感1500字大学生自传范文1500字尿裤子的作文1500字矛盾论读后感1500字湄公河行动影评1500字军训感想1500字昆虫记读书笔记1500字信仰观后感1500字