从动态网页高效提取数据：requests结合API与正则表达式的实战指南

心靈之曲

发布时间：2025-12-05 11:56:31

921人浏览过

来源于php中文网

原创

从动态网页高效提取数据：requests结合API与正则表达式的实战指南

本文深入探讨了在使用python的`requests`和`beautifulsoup`库抓取动态加载内容时遇到的常见问题，即`beautifulsoup`无法解析javascript渲染的数据。针对这一挑战，文章提供了两种高效的解决方案：利用网站提供的api接口直接获取结构化数据，以及通过正则表达式从初始html中提取嵌入的javascript变量数据。旨在帮助开发者更准确、稳定地从复杂网页中获取所需信息。

在进行网页数据抓取时，Python的requests库用于发送HTTP请求，而BeautifulSoup库则擅长解析HTML或XML文档。然而，当目标网页的内容是通过JavaScript动态加载时，仅使用requests.get()获取的HTML文本通常不包含这些动态生成的数据，导致BeautifulSoup无法找到相应的元素。例如，尝试从一个区块链地址页面获取最新交易金额时，如果该金额是JavaScript渲染的，直接查找class_="input_value"可能会返回None或空列表。

为了克服这一限制，我们可以采用以下两种策略来有效获取动态加载的数据。

策略一：利用网站提供的API接口

许多现代网站，特别是那些涉及实时数据展示的平台，通常会通过内部API（应用程序编程接口）来获取和渲染数据。这些API接口直接返回结构化的数据，如JSON格式，而不是完整的HTML页面。通过直接调用这些API，我们可以绕过JavaScript渲染的环节，直接获取到最原始、最准确的数据。

实现步骤：

识别API接口： 通常可以通过浏览器的开发者工具（Network标签页）来监控页面加载过程中发出的XHR（XMLHttpRequest）请求，从而找到用于获取数据的API地址。
发送API请求： 使用requests库向API地址发送GET请求。
解析JSON数据： API返回的数据通常是JSON格式，可以使用.json()方法将其转换为Python字典或列表，然后按键值对访问所需信息。

示例代码：

假设我们发现目标网站（如ltc.tokenview.io）提供了一个API接口来获取地址的余额趋势数据。

import requests

# 目标地址的API URL
# 注意：实际使用时，需要根据实际网站的API文档或通过抓包工具获取正确的API地址
api_url = "https://ltc.tokenview.io/api/address/balancetrend/ltc/M8T1B2Z97gVdvmfkQcAtYbEepune1tzGua"

try:
    # 发送GET请求获取API数据
    response = requests.get(api_url)
    response.raise_for_status()  # 检查请求是否成功

    data = response.json()  # 将响应解析为JSON格式

    # 打印最新一条数据（假设数据按时间倒序排列）
    if data and "data" in data and data["data"]:
        # API返回的数据结构可能不同，这里假设最新数据在列表的第一个元素
        print("最新交易/余额数据:", data["data"][0])
    else:
        print("未从API获取到有效数据。")

except requests.exceptions.RequestException as e:
    print(f"请求API时发生错误: {e}")
except ValueError:
    print("API响应不是有效的JSON格式。")

输出示例：

最新交易/余额数据: {'2024-01-06': '2504667.37296058'}

优点：

数据结构清晰，易于解析。
通常比解析HTML更稳定，不易受页面结构变化影响。
效率高，直接获取所需数据，无需渲染。

缺点：

并非所有网站都提供公开或易于发现的API。
需要额外的工作来识别和理解API的参数和响应格式。

策略二：通过正则表达式从初始HTML中提取嵌入数据

在某些情况下，即使页面内容是动态渲染的，但所需的数据可能已经作为JavaScript变量或数据结构嵌入在初始加载的HTML源代码中。这些数据通常以JSON字符串的形式存在于<script>标签内部，或者作为HTML元素的data-*属性。此时，我们可以使用正则表达式（re模块）来匹配并提取这些嵌入的数据。

零沫AI工具导航

零沫AI工具导航-AI导航新标杆,探索全球实用AI工具

下载

实现步骤：

获取完整的HTML文本： 使用requests.get()获取页面的原始HTML源代码。
分析HTML结构： 检查HTML源代码，寻找可能包含目标数据的<script>标签内容或特定模式的字符串。
构建正则表达式： 根据找到的数据模式，编写一个正则表达式来精确匹配和捕获所需的值。
执行匹配： 使用re.search()或re.findall()方法在HTML文本中查找匹配项。

示例代码：

假设在页面的HTML源代码中，交易金额以特定的JavaScript变量形式存在，例如：value:"0.02387814"。

import re
import requests

url = "https://ltc.tokenview.io/en/address/M8T1B2Z97gVdvmfkQcAtYbEepune1tzGua"

try:
    # 发送GET请求获取HTML文本
    response = requests.get(url)
    response.raise_for_status()
    html_text = response.text

    # 使用正则表达式匹配并提取交易金额
    # 这个正则表达式会查找 'value:"' 后面的非引号字符，直到遇到下一个 '"'
    # 捕获组 () 用于提取实际的数值
    match = re.search(r'value:"([^"]+).*?value:"([^"]+)', html_text)

    if match:
        # match.groups() 返回所有捕获组的内容
        inp, out = match.groups()
        print(f"输入金额 (inp): {inp}")
        print(f"输出金额 (out): {out}")
    else:
        print("未通过正则表达式找到匹配的交易金额。")

except requests.exceptions.RequestException as e:
    print(f"请求URL时发生错误: {e}")

输出示例：

输入金额 (inp): 0.02387814
输出金额 (out): 0.02319739

优点：

无需依赖外部API，适用于没有明确API接口的网站。
可以提取嵌入在HTML中的各种格式数据。

缺点：

正则表达式的编写相对复杂，且容易出错。
对页面HTML结构变化非常敏感，一旦HTML结构改变，正则表达式可能需要重新调整。
提取的数据可能需要进一步清洗和格式化。

总结与注意事项

在从动态加载的网页中提取数据时，BeautifulSoup与requests的组合虽然强大，但必须认识到其局限性。当遇到JavaScript渲染的内容时，应优先考虑以下策略：

API调用（首选）: 如果能找到网站提供的API接口，这是最稳定、高效且推荐的方法。它直接提供了结构化的数据，减少了解析复杂HTML的麻烦。
正则表达式匹配： 当API不可用或难以发现时，检查初始HTML源代码中是否存在嵌入的JavaScript变量或数据块。使用正则表达式可以有效地提取这些数据，但需要对HTML结构有一定了解，并且要警惕页面结构变化带来的维护成本。
Selenium等浏览器自动化工具（备选，但通常更重）: 如果上述两种方法都无法奏效，或者需要模拟用户交互（如点击、滚动）才能加载数据，那么Selenium等工具可以驱动真实浏览器来渲染页面并获取最终内容。然而，这种方法资源消耗大，运行速度慢，通常作为最后手段。

在实际操作中，建议从浏览器开发者工具入手，分析网络请求和页面源代码，以确定最适合的数据获取策略。选择正确的方法不仅能提高数据抓取的成功率，还能大大提升脚本的稳定性和维护性。

Flutter 页面中动态显示的输入框自动化点击与文本输入教程

如何阻止表单提交导致的页面跳转（Route 变更）

Flask Fetch 响应解析错误：正确提取 JSON 数据并安全渲染到页面

如何从网页中安全提取并解析嵌入的 JavaScript JSON 数据

如何从网页脚本中安全提取并解析嵌入的 JSON 数据

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：Kivy ScreenManager下跨屏幕动态修改Label文本指南下一篇：解析非标准多对象JSON响应的Python教程

作者最新文章

如何在 MAMP 中正确访问本地 PHP 项目文件

2026-03-12 16:13

如何让 Flex 布局的双栏页脚在移动端自动堆叠显示

2026-03-12 16:17

Steam新主机配件短缺 V社在GDC上公开求购内存条

2026-03-12 16:26

Go 标准库中无函数体的导出函数是如何工作的？

2026-03-12 16:34

如何在 Reactor 非阻塞线程中安全获取并复用 API 认证 Token

2026-03-12 16:48

vscode安装包打开后怎么安装

2026-03-12 16:50

如何在 JavaScript 对象中为多个数组批量插入新元素（如新增关键帧）

2026-03-12 17:03

《零红蝶：重制版》Steam多半好评：移植出色玩法升级

2026-03-12 17:04

Spring Boot 服务层事务失效的典型原因与解决方案

2026-03-12 17:37

PHP中true == "expired"为何为真？深入理解松散比较与类型转换

2026-03-12 17:45

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI编程开发 AI聊天问答

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI编程开发 AI大模型

WorkBuddy

腾讯云推出的AI原生桌面智能体工作台

AI办公学习 Agent智能体

腾讯元宝

腾讯混元平台推出的AI助手

文档处理 Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI编程开发 AI文本写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

AI文本写作中文写作

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI编程开发 AI文本写作

智谱清言 - 免费全能的AI助手

AI编程开发 Agent智能体

相关专题

json数据格式

JSON是一种轻量级的数据交换格式。本专题为大家带来json数据格式相关文章，帮助大家解决问题。

457

2023.08.07

json是什么

JSON是一种轻量级的数据交换格式，具有简洁、易读、跨平台和语言的特点，JSON数据是通过键值对的方式进行组织，其中键是字符串，值可以是字符串、数值、布尔值、数组、对象或者null，在Web开发、数据交换和配置文件等方面得到广泛应用。本专题为大家提供json相关的文章、下载、课程内容，供大家免费下载体验。

549

2023.08.23