0

0

将HTML结构化数据转换为Pandas DataFrame教程

碧海醫心

碧海醫心

发布时间:2025-09-14 11:19:35

|

779人浏览过

|

来源于php中文网

原创

将HTML结构化数据转换为Pandas DataFrame教程

本教程详细介绍了如何利用Beautiful Soup库解析复杂的HTML div结构,提取出非结构化的文本信息,并通过巧妙的分隔符处理将其转化为键值对。随后,我们将这些结构化数据导入Pandas DataFrame,并通过转置和重命名操作,最终生成一个符合分析需求的整洁表格数据。

1. 引言与问题背景

在数据抓取和分析过程中,我们经常会遇到需要从html页面中提取结构化信息的情况。虽然许多html表格可以直接使用pandas的read_html函数进行解析,但对于非标准表格结构,特别是嵌套在div标签中的键值对信息,则需要更精细的解析方法。本教程将展示如何结合beautiful soup和pandas,将一个包含多个div标签的html片段转换为一个规整的pandas dataframe,以便后续的数据分析。

假设我们有以下HTML片段,其中包含公司的一些基本信息:

Employees

17000

Equity Type

ORD

我们的目标是将其转换为如下Pandas DataFrame:

+--------------------------------+------------+-----------+-------------+
|            Industry            |   Sector   | Employees | Equity Type |
+--------------------------------+------------+-----------+-------------+
| Life Sciences Tools & Services | Healthcare |     17000 | ORD         |
+--------------------------------+------------+-----------+-------------+

2. 准备工作

在开始之前,请确保您的Python环境中已安装beautifulsoup4和pandas库。如果尚未安装,可以使用pip进行安装:

pip install beautifulsoup4 pandas

3. 使用Beautiful Soup解析HTML

首先,我们需要使用Beautiful Soup解析HTML字符串,并定位到包含目标信息的父div元素。

立即学习前端免费学习笔记(深入)”;

from bs4 import BeautifulSoup
import pandas as pd

html_content = """
Employees

17000

Equity Type

ORD

""" # 创建Beautiful Soup对象 soup = BeautifulSoup(html_content, "html.parser") # 查找包含公司信息的父div company_profile_div = soup.find("div", class_="companyProfileHeader") # 提取每个子div中的文本信息 # 使用get_text(strip=True, separator="~")方法,可以在提取文本时自动去除空白, # 并用指定的分隔符连接不同标签内的文本。这对于区分键和值非常关键。 extracted_texts = [ div.get_text(strip=True, separator="~") for div in company_profile_div.find_all("div") ] print("原始提取文本列表:", extracted_texts) # 输出: ['Industry~Life Sciences Tools & Services', 'Sector~Healthcare', 'Employees~17000', 'Equity Type~ORD']

在上述代码中,get_text(strip=True, separator="~")是关键。它能够将每个div标签内的所有文本内容(包括子标签如

中的文本)连接起来,并用~符号分隔。这样,我们就能得到一个清晰的"键~值"字符串。

MOKI
MOKI

MOKI是美图推出的一款AI短片创作工具,旨在通过AI技术自动生成分镜图并转为视频素材。

下载

接下来,我们需要将这些"键~值"字符串分割成独立的键和值对。

# 将每个字符串按"~"分割成键值对
final_lst = [item.split("~") for item in extracted_texts]

print("分割后的键值对列表:", final_lst)
# 输出: [['Industry', 'Life Sciences Tools & Services'], ['Sector', 'Healthcare'], ['Employees', '17000'], ['Equity Type', 'ORD']]

现在,final_lst是一个列表的列表,每个子列表包含一个键和其对应的值。

4. 转换为Pandas DataFrame

有了final_lst,我们可以将其轻松转换为Pandas DataFrame。然而,直接转换会得到一个两列的DataFrame,其中第一列是键,第二列是值。为了得到期望的输出格式(键作为列名,值作为一行数据),我们需要进行一些转置和重命名操作。

# 1. 将列表转换为DataFrame
# 此时DataFrame的行是键值对,列是索引0和1
df = pd.DataFrame(final_lst)
print("\n初始DataFrame:\n", df)
# 输出:
#          0                               1
# 0  Industry  Life Sciences Tools & Services
# 1    Sector                      Healthcare
# 2 Employees                           17000
# 3 Equity Type                             ORD

# 2. 转置DataFrame
# 将原来的行变为列,列变为行。现在第一行包含所有键,第二行包含所有值。
df = df.transpose()
print("\n转置后的DataFrame:\n", df)
# 输出:
#           0           1          2            3
# 0  Industry      Sector  Employees  Equity Type
# 1  Life Sciences Tools & Services  Healthcare      17000          ORD

# 3. 将第一行设置为列名
# df.iloc[0] 获取DataFrame的第一行作为新的列名
df.rename(columns=df.iloc[0], inplace=True)
print("\n设置列名后的DataFrame:\n", df)
# 输出:
#          Industry      Sector Employees Equity Type
# 0  Industry      Sector Employees Equity Type
# 1  Life Sciences Tools & Services  Healthcare     17000         ORD

# 4. 删除作为列名的第一行
# 因为第一行现在已经作为列名,其数据本身已无用,需要删除。
df.drop(df.index[0], inplace=True)
print("\n最终DataFrame:\n", df)
# 输出:
#                        Industry    Sector Employees Equity Type
# 1  Life Sciences Tools & Services  Healthcare     17000         ORD

通过这四个步骤,我们成功地将HTML中的结构化信息转换为一个整洁、易于分析的Pandas DataFrame。

5. 完整代码示例

from bs4 import BeautifulSoup
import pandas as pd

# 待解析的HTML内容
html_content = """
Employees

17000

Equity Type

ORD

""" # 1. 使用Beautiful Soup解析HTML并提取文本 soup = BeautifulSoup(html_content, "html.parser") company_profile_div = soup.find("div", class_="companyProfileHeader") if company_profile_div: # 提取每个子div中的文本,并用"~"分隔键和值 extracted_texts = [ div.get_text(strip=True, separator="~") for div in company_profile_div.find_all("div") ] # 将"键~值"字符串分割成独立的键和值对 final_lst = [item.split("~") for item in extracted_texts] # 2. 转换为Pandas DataFrame df = pd.DataFrame(final_lst) # 3. 转置DataFrame,使键成为一行,值成为另一行 df = df.transpose() # 4. 将第一行(包含键)设置为列名 df.rename(columns=df.iloc[0], inplace=True) # 5. 删除作为列名的第一行 df.drop(df.index[0], inplace=True) print("最终生成的DataFrame:") print(df) else: print("未找到指定的HTML元素 'companyProfileHeader'。")

6. 注意事项与扩展

  • 分隔符的选择: 在get_text(separator="~")中,分隔符~的选择很重要。应选择一个在实际数据中极不可能出现的字符,以避免数据混淆。如果数据中可能包含~,可以考虑使用更复杂的正则表达式或Beautiful Soup的其他方法来精确提取键和值。
  • HTML结构变化: 本教程的方法依赖于HTML结构的相对稳定性(即键和值都位于同一个div内,并且可以通过get_text提取)。如果HTML结构发生变化,例如键和值位于不同的兄弟div中,则需要调整Beautiful Soup的解析逻辑。
  • 错误处理: 在实际应用中,应加入更多的错误处理机制,例如检查company_profile_div是否为None,或者split("~")后列表长度是否为2,以确保数据的完整性和代码的健壮性。
  • 数据类型转换: 提取出的数据默认为字符串类型。如果需要进行数值计算(如Employees),请记得使用df['Employees'] = pd.to_numeric(df['Employees'])等方法进行类型转换。
  • 多个记录: 如果HTML中包含多个companyProfileHeader类似的结构,表示多条公司记录,则需要在一个循环中处理每个记录,并将每个记录生成的DataFrame追加到一个列表中,最后使用pd.concat合并所有DataFrame。

7. 总结

通过本教程,我们学习了如何利用Beautiful Soup库的强大解析能力和Pandas库的数据处理功能,将复杂的HTML div结构中的非结构化文本数据有效地转换为结构化的Pandas DataFrame。这种方法对于处理那些不规则或非标准的HTML表格数据尤其有用,为后续的数据清洗、分析和可视化奠定了坚实的基础。掌握这种技巧,将大大提升从网页中获取和利用数据的效率。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
python开发工具
python开发工具

php中文网为大家提供各种python开发工具,好的开发工具,可帮助开发者攻克编程学习中的基础障碍,理解每一行源代码在程序执行时在计算机中的过程。php中文网还为大家带来python相关课程以及相关文章等内容,供大家免费下载使用。

778

2023.06.15

python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

686

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

769

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

740

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

1445

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

571

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

581

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

752

2023.08.11

Python 自然语言处理(NLP)基础与实战
Python 自然语言处理(NLP)基础与实战

本专题系统讲解 Python 在自然语言处理(NLP)领域的基础方法与实战应用,涵盖文本预处理(分词、去停用词)、词性标注、命名实体识别、关键词提取、情感分析,以及常用 NLP 库(NLTK、spaCy)的核心用法。通过真实文本案例,帮助学习者掌握 使用 Python 进行文本分析与语言数据处理的完整流程,适用于内容分析、舆情监测与智能文本应用场景。

6

2026.01.27

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
最新Python教程 从入门到精通
最新Python教程 从入门到精通

共4课时 | 22.3万人学习

Django 教程
Django 教程

共28课时 | 3.5万人学习

SciPy 教程
SciPy 教程

共10课时 | 1.3万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号