0

0

使用 ElementTree 高效解析 XML:条件式提取属性并构建列表

心靈之曲

心靈之曲

发布时间:2025-09-18 13:40:43

|

919人浏览过

|

来源于php中文网

原创

使用 elementtree 高效解析 xml:条件式提取属性并构建列表

本文详细介绍了如何使用 Python 的 xml.etree.ElementTree 库解析复杂的 XML 数据。教程将演示如何从嵌套结构中提取特定的属性值,并根据是否存在子标签的属性来动态地组合这些值,最终生成一个符合特定逻辑的字符串列表。通过清晰的示例代码和解释,帮助读者掌握 XML 属性的条件式提取与处理技巧。

1. 理解 XML 数据结构与目标

在处理 XML 数据时,首先需要清晰地理解其结构以及我们希望从中提取的信息。考虑以下 XML 片段:


    
        
            
                ...
            
        
        
            
                ...
            
        
    

我们的目标是从每个 标签中提取 name 属性的值。此外,如果 标签内部的 标签包含 groups 属性,并且其值为逗号分隔的字符串,则需要将 inter 的 name 与 groups 中的每个值组合起来(例如 "nim_us_m-groupA", "nim_us_m-groupB")。如果 标签没有 groups 属性,则只保留 inter 的 name (例如 "nim_turk")。最终,所有提取和组合后的值应存储在一个列表中。

2. ElementTree 基础解析

Python 的 xml.etree.ElementTree 模块提供了一个轻量级且高效的 API 来解析和操作 XML 数据。

2.1 加载 XML 文件

首先,我们需要将 XML 文件加载到 ElementTree 对象中。假设 XML 内容保存在 test_xml.xml 文件中。

import xml.etree.ElementTree as ET

# 解析 XML 文件并获取根元素
tree = ET.parse("test_xml.xml")
root = tree.getroot()

或者,如果 XML 是字符串形式:

import xml.etree.ElementTree as ET

xml_string = """

    

"""
root = ET.fromstring(xml_string)

3. 实现核心解析逻辑

核心逻辑在于遍历 标签,并在每个 标签内部检查 标签的 groups 属性。

磁力开创
磁力开创

快手推出的一站式AI视频生产平台

下载

3.1 遍历目标元素

我们首先需要定位到所有的 标签。它们位于 / 路径下。我们可以使用 XPath 表达式 .//inters 来找到 标签,然后遍历其所有子元素(即 标签)。

result = [] # 用于存储最终结果的列表

# 查找  标签
inters_element = root.find('.//inters')

if inters_element is not None:
    # 遍历  下的所有  标签
    for inter_elem in inters_element:
        # 获取  标签的 'name' 属性
        inter_name = inter_elem.get('name')
        if inter_name is None:
            continue # 如果没有 'name' 属性,则跳过

        # 在当前  内部查找带有 'groups' 属性的  标签
        # 注意:这里使用 find 而不是 findall,因为我们只需要检查是否存在一个这样的 
        # XPath 表达式 .//work[@groups] 表示查找当前元素下的任意层级的  标签,且该标签必须有 'groups' 属性
        work_with_groups = inter_elem.find(".//work[@groups]")

        if work_with_groups is not None:
            # 如果找到了带有 'groups' 属性的  标签
            groups_attr_value = work_with_groups.get('groups')
            if groups_attr_value: # 确保 groups 属性值不为空
                # 分割 groups 属性值
                group_names = groups_attr_value.split(',')
                for g_name in group_names:
                    # 组合 inter_name 和 group_name
                    combined_name = f"{inter_name}-{g_name.strip()}"
                    result.append(combined_name)
        else:
            # 如果没有找到带有 'groups' 属性的  标签,则只添加 inter_name
            result.append(inter_name)

print(result)

3.2 完整示例代码

将上述逻辑整合到一起,形成完整的 Python 脚本:

import xml.etree.ElementTree as ET

# 模拟 XML 文件内容
xml_content = """

    dub
    statusd
    worklogs
    
        nim-us
    

    999

    
        
            dairy
            slm.sh
            
                youyou-11
            
        
    
    
        
            
                
                    
                        180000
                    
                
                
                    
                        180000
                    
                
            
        
        
            
                
                    
                        120000
                        xmas_size=1200000
                        of_obopaying_threads=2
                    
                
                
                    
                        120000
                        xmas_size=1200000
                    
                
            
        
    

"""

# 将 XML 字符串解析为 ElementTree 对象
root = ET.fromstring(xml_content)

result = [] # 存储最终结果的列表

# 查找  标签
inters_element = root.find('.//inters')

if inters_element is not None:
    # 遍历  下的所有  标签
    for inter_elem in inters_element:
        # 获取  标签的 'name' 属性
        inter_name = inter_elem.get('name')
        if inter_name is None:
            continue # 如果没有 'name' 属性,则跳过当前 

        # 在当前  内部查找带有 'groups' 属性的  标签
        # 使用 find() 方法查找第一个匹配的元素
        work_with_groups = inter_elem.find(".//work[@groups]")

        if work_with_groups is not None:
            # 如果找到了带有 'groups' 属性的  标签
            groups_attr_value = work_with_groups.get('groups')
            if groups_attr_value: # 确保 groups 属性值不为空
                # 分割 groups 属性值,并去除可能存在的空白字符
                group_names = groups_attr_value.split(',')
                for g_name in group_names:
                    # 组合 inter_name 和 group_name,使用 '-' 分隔
                    combined_name = f"{inter_name}-{g_name.strip()}"
                    result.append(combined_name)
        else:
            # 如果没有找到带有 'groups' 属性的  标签,则只添加 inter_name
            result.append(inter_name)

print(result)

预期输出:

['nim_turk', 'nim_us_m-groupA', 'nim_us_m-groupB']

4. 注意事项与最佳实践

  • XPath 表达式的精确性: ElementTree 支持有限的 XPath 表达式。findall() 和 find() 方法中的 . 表示当前元素,// 表示任意后代元素。[@attribute] 用于筛选具有特定属性的元素。
  • get() 方法的安全性: 使用 element.get('attribute_name') 方法来获取属性值是一个好习惯。如果属性不存在,它会返回 None 而不是抛出 KeyError,这使得代码更健壮。
  • 相对路径与绝对路径: 在上述代码中,root.find('.//inters') 是从根元素开始的相对搜索。而 inter_elem.find(".//work[@groups]") 是在 inter_elem 内部进行相对搜索,这有助于限制搜索范围,提高效率和准确性。
  • 处理空值: 在分割 groups 属性值之前,最好检查其是否为空,以避免对 None 或空字符串进行 split() 操作。
  • 错误处理: 在实际应用中,应考虑文件不存在 (FileNotFoundError) 或 XML 格式错误 (ParseError) 等异常情况,使用 try-except 块进行捕获。
  • 内存效率: 对于非常大的 XML 文件,ElementTree.iterparse 提供了一种迭代解析的方式,可以避免一次性将整个文件加载到内存中,从而提高内存效率。

5. 总结

本教程演示了如何利用 xml.etree.ElementTree 库高效地解析 XML 数据,并根据复杂的条件逻辑提取和组合属性值。通过精确的 XPath 表达式、get() 方法的安全使用以及在特定元素内部进行相对搜索,我们能够构建出灵活且健壮的 XML 解析方案。掌握这些技巧将有助于您在 Python 项目中更有效地处理各种 XML 数据。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
pdf怎么转换成xml格式
pdf怎么转换成xml格式

将 pdf 转换为 xml 的方法:1. 使用在线转换器;2. 使用桌面软件(如 adobe acrobat、itext);3. 使用命令行工具(如 pdftoxml)。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

1898

2024.04.01

xml怎么变成word
xml怎么变成word

步骤:1. 导入 xml 文件;2. 选择 xml 结构;3. 映射 xml 元素到 word 元素;4. 生成 word 文档。提示:确保 xml 文件结构良好,并预览 word 文档以验证转换是否成功。想了解更多xml的相关内容,可以阅读本专题下面的文章。

2091

2024.08.01

xml是什么格式的文件
xml是什么格式的文件

xml是一种纯文本格式的文件。xml指的是可扩展标记语言,标准通用标记语言的子集,是一种用于标记电子文件使其具有结构性的标记语言。想了解更多相关的内容,可阅读本专题下面的相关文章。

1060

2024.11.28

js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

298

2023.08.03

js截取字符串的方法
js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容,供大家免费下载体验。

212

2023.09.04

java基础知识汇总
java基础知识汇总

java基础知识有Java的历史和特点、Java的开发环境、Java的基本数据类型、变量和常量、运算符和表达式、控制语句、数组和字符串等等知识点。想要知道更多关于java基础知识的朋友,请阅读本专题下面的的有关文章,欢迎大家来php中文网学习。

1500

2023.10.24

字符串介绍
字符串介绍

字符串是一种数据类型,它可以是任何文本,包括字母、数字、符号等。字符串可以由不同的字符组成,例如空格、标点符号、数字等。在编程中,字符串通常用引号括起来,如单引号、双引号或反引号。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

623

2023.11.24

java读取文件转成字符串的方法
java读取文件转成字符串的方法

Java8引入了新的文件I/O API,使用java.nio.file.Files类读取文件内容更加方便。对于较旧版本的Java,可以使用java.io.FileReader和java.io.BufferedReader来读取文件。在这些方法中,你需要将文件路径替换为你的实际文件路径,并且可能需要处理可能的IOException异常。想了解更多java的相关内容,可以阅读本专题下面的文章。

613

2024.03.22

Python 自然语言处理(NLP)基础与实战
Python 自然语言处理(NLP)基础与实战

本专题系统讲解 Python 在自然语言处理(NLP)领域的基础方法与实战应用,涵盖文本预处理(分词、去停用词)、词性标注、命名实体识别、关键词提取、情感分析,以及常用 NLP 库(NLTK、spaCy)的核心用法。通过真实文本案例,帮助学习者掌握 使用 Python 进行文本分析与语言数据处理的完整流程,适用于内容分析、舆情监测与智能文本应用场景。

10

2026.01.27

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 22.3万人学习

Django 教程
Django 教程

共28课时 | 3.6万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.3万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号