使用 BeautifulSoup 从 HTML 中提取文本

花韻仙語

发布时间：2025-08-31 18:18:01

425人浏览过

来源于php中文网

原创

使用 beautifulsoup 从 html 中提取文本

本文介绍了如何使用 Python 的 BeautifulSoup 库从 HTML 文档中提取文本内容。通过 get_text() 方法，可以轻松地从 HTML 标签中剥离标签信息，仅保留文本数据，从而方便后续的数据处理和分析。本文提供了示例代码，展示了如何针对特定 HTML 结构提取所需文本，并将其组织成易于使用的数据结构。

在使用 BeautifulSoup 进行网页抓取时，经常需要从 HTML 标签中提取纯文本内容，而去除 HTML 标签本身。 BeautifulSoup 提供了 get_text() 方法，可以方便地实现这一目标。

以下是一个示例，展示了如何使用 get_text() 方法从 HTML 表格中提取数据，并将其存储为字典列表：

from bs4 import BeautifulSoup
import requests

website = 'https://www.klavkarr.com/data-trouble-code-obd2.php?dtc=p0000-p0299#dtc'
result = requests.get(website)
content = result.text

soup = BeautifulSoup(content, 'lxml')

box = soup.find('div', class_='main_article-blog')

title = box.find('table')

headers = [header for header in title.find_all('th')]
results = [
    {
        headers[i].get_text(): cell.get_text() 
        for i, cell in enumerate(row.find_all('td'))
    }
    for row in title.find_all('tr')
]

print(results)

代码解释：

立即学习“前端免费学习笔记（深入）”；

Fotor

Fotor 在线照片编辑器

下载

导入库： 首先，导入 BeautifulSoup 和 requests 库。requests 用于获取网页内容，BeautifulSoup 用于解析 HTML。
获取网页内容： 使用 requests.get() 方法获取指定 URL 的网页内容。
创建 BeautifulSoup 对象： 使用 BeautifulSoup 将 HTML 内容解析为 BeautifulSoup 对象。 'lxml' 是一个解析器，需要安装pip install lxml。
定位目标元素： 使用 find() 或 find_all() 方法定位包含目标数据的 HTML 元素。在本例中，首先找到 div 标签，其 class 属性为 'main_article-blog'，然后在该 div 中找到 table 标签。
提取文本内容： 使用列表推导式和 get_text() 方法提取每个 td 标签中的文本内容，并将其与对应的表头文本组合成字典。
- headers[i].get_text(): 提取表头元素的文本内容。
- cell.get_text(): 提取单元格元素的文本内容。

注意事项：

get_text() 方法会提取元素及其所有子元素的文本内容，并将它们连接成一个字符串。
如果需要更精细的控制，可以使用 stripped_strings 属性迭代元素的所有文本子节点，并进行自定义处理。
确保安装了 lxml 解析器，以便 BeautifulSoup 可以正确解析 HTML。可以使用 pip install lxml 命令安装。

总结：

get_text() 方法是 BeautifulSoup 中一个非常实用的方法，可以方便地从 HTML 元素中提取纯文本内容。通过结合列表推导式和其他 BeautifulSoup 方法，可以灵活地处理各种 HTML 结构，并提取所需的数据。使用时注意选择合适的解析器，并根据实际需求进行适当的文本处理。

如何安全地在 Apache 环境中执行 Python 脚本而不暴露源码

Python 中实现匿名函数作为可变参数传递的完整教程

Python 中如何匿名传递多个函数作为参数（类似 PHP 的可变函数参数）

Python 中如何匿名传递多个函数作为参数

如何在 Python 中安全地向 PHP 命令行脚本传递参数

HTML速学教程(入门课程)

HTML怎么学习？HTML怎么入门？HTML在哪学？HTML怎么学才快？不用担心，这里为大家提供了HTML速学教程(入门课程)，有需要的小伙伴保存下载就能学习啦！

下载

相关标签:

php python html ai beautifulsoup pip 字符串数据结构 class 对象 table td

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：提取 HTML 文本的 BeautifulSoup 教程下一篇：使用 Z3 求解器寻找冰冻湖上的路径

作者最新文章

Laravel 中动态显示悬浮内容时 HTML 元素意外消失的解决方案

2026-03-15 16:33

如何在 Spring Boot 原生镜像（Native Image）中嵌入文件

2026-03-15 16:41

Java中高效提取字符串列表中的纯数字：正则表达式与流式处理实战指南

2026-03-15 16:41

如何解决视差动画在元素滚动进入视口时的延迟问题

2026-03-15 16:43

如何在 Windows 命令行中正确编译和运行 Java 程序

2026-03-15 16:52

为同一 HTML 元素 ID 实现差异化悬停效果：正确分离与精准控制

2026-03-15 16:52

如何用单条 SQL 查询统计全年每日设备在线数量

2026-03-15 16:58

MongoDB 动态查询中正确合并 $or 条件的 PHP 实践指南

2026-03-15 17:01

Spring Kafka消费者失败消息重试机制详解与正确配置指南

2026-03-15 17:07

Laravel Livewire 表单中蜜罐字段导致输入框失焦的解决方案

2026-03-15 17:53

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI编程开发 AI聊天问答

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI编程开发 AI大模型

WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

AI办公学习 Agent智能体

腾讯元宝

腾讯混元平台推出的AI助手

文档处理 Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI编程开发 AI文本写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

AI文本写作中文写作

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI编程开发 AI文本写作

智谱清言 - 免费全能的AI助手

AI编程开发 Agent智能体

相关专题

Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据，或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

293

2023.11.13

pip安装使用方法

安装步骤：1、确保Python已经正确安装在您的计算机上；2、下载“get-pip.py”脚本；3、按下Win + R键，然后输入cmd并按下Enter键来打开命令行窗口；4、在命令行窗口中，使用cd命令切换到“get-pip.py”所在的目录；5、执行安装命令；6、验证安装结果即可。大家可以访问本专题下的文章，了解pip安装使用方法的更多内容。

373

2023.10.09

更新pip版本

更新pip版本方法有使用pip自身更新、使用操作系统自带的包管理工具、使用python包管理工具、手动安装最新版本。想了解更多相关的内容，请阅读专题下面的文章。

437

2024.12.20

pip设置清华源

设置方法：1、打开终端或命令提示符窗口；2、运行“touch ~/.pip/pip.conf”命令创建一个名为pip的配置文件；3、打开pip.conf文件，然后添加“[global];index-url = https://pypi.tuna.tsinghua.edu.cn/simple”内容，这将把pip的镜像源设置为清华大学的镜像源；4、保存并关闭文件即可。

804

2024.12.23