Python如何处理GBK编码的XML文件文件编码问题解决

月夜之吻

发布时间：2026-02-16 09:39:10

767人浏览过

来源于php中文网

原创

python读取gbk编码xml文件需显式指定encoding='gbk'，避免默认utf-8导致乱码；推荐用open()读取后交et.parse()解析，并注意bom、编码混杂等问题。

python如何处理gbk编码的xml文件文件编码问题解决

Python读取GBK编码的XML文件时，核心是明确指定编码格式，避免默认用UTF-8解码导致乱码或报错。关键不在XML解析逻辑本身，而在文件打开和字符流传递环节。

用open()显式指定encoding='gbk'再传给xml.etree.ElementTree

ElementTree默认不处理编码声明（如），它依赖输入字节流或字符串的正确性。推荐做法是先用内置open()以gbk编码读取为字符串，再交给ET解析：

确保文件真实保存为GBK（不是GB2312或GBK变种如GB18030，如有疑问可用notepad++查看编码）

代码示例：

import xml.etree.ElementTree as ET
<p>with open('data.xml', 'r', encoding='gbk') as f:
tree = ET.parse(f)  # 或 ET.fromstring(f.read())
root = tree.getroot()

如果遇到UnicodeDecodeError: 'gbk' codec can't decode byte，说明文件里混入了非GBK字节（比如BOM、UTF-8残留或编辑器自动转码），可改用errors='ignore'或errors='replace'容错：
with open('data.xml', 'r', encoding='gbk', errors='ignore') as f:

用codecs.open()兼容老版本Python或需更细粒度控制

Python 2.x不支持open()的encoding参数，或你需要统一处理多种编码时，可用codecs模块：

文赋Ai论文

专业/高质量智能论文AI生成器-在线快速生成论文初稿

下载

import codecs
with codecs.open('data.xml', 'r', 'gbk') as f:
后续仍传给ET.parse()即可，效果等同于第一种方法
注意：codecs.open返回的是文本流，不是bytes流，无需额外decode

解析含XML声明encoding="GBK"的文件时不要依赖它

XML声明中的encoding属性仅是提示，ElementTree不会自动按该值重新解码。它只对从bytes读取且未指定编码时起作用（如ET.parse(io.BytesIO(b'...'))），但这种用法易出错，不推荐。

立即学习“Python免费学习笔记（深入）”；

错误示范（可能失败）：

with open('data.xml', 'rb') as f:  # 读成bytes<br>
    tree = ET.parse(f)  # ET会尝试读声明，但实际环境常不准

正确思路：始终主动控制解码过程，把编码责任收归Python层，而非交给XML解析器猜测
若必须用bytes输入（如网络响应），请手动decode后再解析：
```
content = response.content.decode('gbk')<br>
root = ET.fromstring(content)
```

写回GBK编码XML时保持一致性

修改后保存为GBK，需手动写入XML声明并指定encoding：

ET.write()默认输出UTF-8，且不加XML声明。要输出GBK，需自己拼接：
tree.write('output.xml', encoding='gbk', xml_declaration=True)
注意：Python 3.9+支持该写法；旧版本需先tostring再手动写文件：

xml_str = ET.tostring(root, encoding='gbk').decode('gbk')<br>
with open('output.xml', 'w', encoding='gbk') as f:<br>
    f.write('<?xml version="1.0" encoding="GBK"?>\n' + xml_str)

Python xml.etree iterfind 迭代查找特定标签的用法

Python解析XML命名空间 findall方法匹配带ns的标签

Python xml.etree.ElementTree教程标准库ET模块增删改查

Python lxml etree.tostring encoding 生成带编码声明的XML字节流

XML文件转Protobuf schema工具根据XML生成proto定义

相关标签:

python 编码 xml 字符串 bom

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：XML文件注释快捷键 Eclipse与IntelliJ注释XML组合键下一篇：Python lxml保存文件缩进配置pretty_print格式化输出

作者最新文章

Win11强制更新怎么关？超详细教程教你彻底禁用Windows 11更新

2026-02-13 17:17

个人所得税起征点怎么在APP查个税查询操作步骤【技巧】

2026-02-13 17:22

Edge浏览器如何导出收藏夹为HTML文件书签备份方法【教程】

2026-02-13 17:24

Win11怎么彻底关死自动更新？学会这一招，系统从此不更新

2026-02-13 17:25

龙虾机器人支持流式输出(Streaming)吗？实时获取AI回答的教程

2026-02-13 17:29

Edge浏览器怎么长截图 Edge浏览器自带网页长截图方法

2026-02-13 17:31

Win11怎么开启内置的安卓子系统WSA Windows11安装安卓App教程

2026-02-13 17:38

电脑总是卡在“更新并关机”？教你彻底关掉Win11更新的实用技巧

2026-02-13 17:41

樱花漫画永久免费入口_最新防屏蔽入口最新地址

2026-02-13 17:43

一吨多少千克一千克多少吨

2026-02-13 17:44

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI 编程开发 AI 聊天问答

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI 编程开发 AI大模型

通义千问

阿里巴巴推出的全能AI助手

AI 编程开发 Agent智能体

腾讯元宝

腾讯混元平台推出的AI助手

文档处理 AI 聊天问答

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI 编程开发 AI 文本写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

AI 文本写作中文写作

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

AI 图片处理图片拼接

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI 编程开发 AI 文本写作

智谱清言 - 免费全能的AI助手

AI 编程开发 Agent智能体

相关专题

pdf怎么转换成xml格式

将 pdf 转换为 xml 的方法：1. 使用在线转换器；2. 使用桌面软件（如 adobe acrobat、itext）；3. 使用命令行工具（如 pdftoxml）。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

1927

2024.04.01

xml怎么变成word

步骤：1. 导入 xml 文件；2. 选择 xml 结构；3. 映射 xml 元素到 word 元素；4. 生成 word 文档。提示：确保 xml 文件结构良好，并预览 word 文档以验证转换是否成功。想了解更多xml的相关内容，可以阅读本专题下面的文章。

2103

2024.08.01

xml是什么格式的文件

xml是一种纯文本格式的文件。xml指的是可扩展标记语言，标准通用标记语言的子集，是一种用于标记电子文件使其具有结构性的标记语言。想了解更多相关的内容，可阅读本专题下面的相关文章。

1123

2024.11.28

js 字符串转数组

js字符串转数组的方法：1、使用“split()”方法；2、使用“Array.from()”方法；3、使用for循环遍历；4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容，供大家免费下载体验。

552

2023.08.03

js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容，供大家免费下载体验。

216

2023.09.04

java基础知识汇总

java基础知识有Java的历史和特点、Java的开发环境、Java的基本数据类型、变量和常量、运算符和表达式、控制语句、数组和字符串等等知识点。想要知道更多关于java基础知识的朋友，请阅读本专题下面的的有关文章，欢迎大家来php中文网学习。

1552

2023.10.24

字符串介绍

字符串是一种数据类型，它可以是任何文本，包括字母、数字、符号等。字符串可以由不同的字符组成，例如空格、标点符号、数字等。在编程中，字符串通常用引号括起来，如单引号、双引号或反引号。想了解更多字符串的相关内容，可以阅读本专题下面的文章。

640

2023.11.24

java读取文件转成字符串的方法

Java8引入了新的文件I/O API，使用java.nio.file.Files类读取文件内容更加方便。对于较旧版本的Java，可以使用java.io.FileReader和java.io.BufferedReader来读取文件。在这些方法中，你需要将文件路径替换为你的实际文件路径，并且可能需要处理可能的IOException异常。想了解更多java的相关内容，可以阅读本专题下面的文章。

925

2024.03.22