0

0

从动态网页高效提取数据:requests结合API与正则表达式的实战指南

心靈之曲

心靈之曲

发布时间:2025-12-05 11:56:31

|

921人浏览过

|

来源于php中文网

原创

从动态网页高效提取数据:requests结合API与正则表达式的实战指南

本文深入探讨了在使用python的`requests`和`beautifulsoup`库抓取动态加载内容时遇到的常见问题,即`beautifulsoup`无法解析javascript渲染的数据。针对这一挑战,文章提供了两种高效的解决方案:利用网站提供的api接口直接获取结构化数据,以及通过正则表达式从初始html中提取嵌入的javascript变量数据。旨在帮助开发者更准确、稳定地从复杂网页中获取所需信息。

在进行网页数据抓取时,Python的requests库用于发送HTTP请求,而BeautifulSoup库则擅长解析HTML或XML文档。然而,当目标网页的内容是通过JavaScript动态加载时,仅使用requests.get()获取的HTML文本通常不包含这些动态生成的数据,导致BeautifulSoup无法找到相应的元素。例如,尝试从一个区块链地址页面获取最新交易金额时,如果该金额是JavaScript渲染的,直接查找class_="input_value"可能会返回None或空列表。

为了克服这一限制,我们可以采用以下两种策略来有效获取动态加载的数据。

策略一:利用网站提供的API接口

许多现代网站,特别是那些涉及实时数据展示的平台,通常会通过内部API(应用程序编程接口)来获取和渲染数据。这些API接口直接返回结构化的数据,如JSON格式,而不是完整的HTML页面。通过直接调用这些API,我们可以绕过JavaScript渲染的环节,直接获取到最原始、最准确的数据。

实现步骤:

  1. 识别API接口: 通常可以通过浏览器的开发者工具(Network标签页)来监控页面加载过程中发出的XHR(XMLHttpRequest)请求,从而找到用于获取数据的API地址。
  2. 发送API请求: 使用requests库向API地址发送GET请求。
  3. 解析JSON数据: API返回的数据通常是JSON格式,可以使用.json()方法将其转换为Python字典或列表,然后按键值对访问所需信息。

示例代码:

假设我们发现目标网站(如ltc.tokenview.io)提供了一个API接口来获取地址的余额趋势数据。

import requests

# 目标地址的API URL
# 注意:实际使用时,需要根据实际网站的API文档或通过抓包工具获取正确的API地址
api_url = "https://ltc.tokenview.io/api/address/balancetrend/ltc/M8T1B2Z97gVdvmfkQcAtYbEepune1tzGua"

try:
    # 发送GET请求获取API数据
    response = requests.get(api_url)
    response.raise_for_status()  # 检查请求是否成功

    data = response.json()  # 将响应解析为JSON格式

    # 打印最新一条数据(假设数据按时间倒序排列)
    if data and "data" in data and data["data"]:
        # API返回的数据结构可能不同,这里假设最新数据在列表的第一个元素
        print("最新交易/余额数据:", data["data"][0])
    else:
        print("未从API获取到有效数据。")

except requests.exceptions.RequestException as e:
    print(f"请求API时发生错误: {e}")
except ValueError:
    print("API响应不是有效的JSON格式。")

输出示例:

最新交易/余额数据: {'2024-01-06': '2504667.37296058'}

优点:

  • 数据结构清晰,易于解析。
  • 通常比解析HTML更稳定,不易受页面结构变化影响。
  • 效率高,直接获取所需数据,无需渲染。

缺点:

  • 并非所有网站都提供公开或易于发现的API。
  • 需要额外的工作来识别和理解API的参数和响应格式。

策略二:通过正则表达式从初始HTML中提取嵌入数据

在某些情况下,即使页面内容是动态渲染的,但所需的数据可能已经作为JavaScript变量或数据结构嵌入在初始加载的HTML源代码中。这些数据通常以JSON字符串的形式存在于

Mistral AI
Mistral AI

Mistral AI被称为“欧洲版的OpenAI”,也是目前欧洲最强的 LLM 大模型平台

下载

实现步骤:

  1. 获取完整的HTML文本: 使用requests.get()获取页面的原始HTML源代码。
  2. 分析HTML结构: 检查HTML源代码,寻找可能包含目标数据的
  3. 构建正则表达式: 根据找到的数据模式,编写一个正则表达式来精确匹配和捕获所需的值。
  4. 执行匹配: 使用re.search()或re.findall()方法在HTML文本中查找匹配项。

示例代码:

假设在页面的HTML源代码中,交易金额以特定的JavaScript变量形式存在,例如:value:"0.02387814"。

import re
import requests

url = "https://ltc.tokenview.io/en/address/M8T1B2Z97gVdvmfkQcAtYbEepune1tzGua"

try:
    # 发送GET请求获取HTML文本
    response = requests.get(url)
    response.raise_for_status()
    html_text = response.text

    # 使用正则表达式匹配并提取交易金额
    # 这个正则表达式会查找 'value:"' 后面的非引号字符,直到遇到下一个 '"'
    # 捕获组 () 用于提取实际的数值
    match = re.search(r'value:"([^"]+).*?value:"([^"]+)', html_text)

    if match:
        # match.groups() 返回所有捕获组的内容
        inp, out = match.groups()
        print(f"输入金额 (inp): {inp}")
        print(f"输出金额 (out): {out}")
    else:
        print("未通过正则表达式找到匹配的交易金额。")

except requests.exceptions.RequestException as e:
    print(f"请求URL时发生错误: {e}")

输出示例:

输入金额 (inp): 0.02387814
输出金额 (out): 0.02319739

优点:

  • 无需依赖外部API,适用于没有明确API接口的网站。
  • 可以提取嵌入在HTML中的各种格式数据。

缺点:

  • 正则表达式的编写相对复杂,且容易出错。
  • 对页面HTML结构变化非常敏感,一旦HTML结构改变,正则表达式可能需要重新调整。
  • 提取的数据可能需要进一步清洗和格式化。

总结与注意事项

在从动态加载的网页中提取数据时,BeautifulSoup与requests的组合虽然强大,但必须认识到其局限性。当遇到JavaScript渲染的内容时,应优先考虑以下策略:

  1. API调用(首选): 如果能找到网站提供的API接口,这是最稳定、高效且推荐的方法。它直接提供了结构化的数据,减少了解析复杂HTML的麻烦。
  2. 正则表达式匹配: 当API不可用或难以发现时,检查初始HTML源代码中是否存在嵌入的JavaScript变量或数据块。使用正则表达式可以有效地提取这些数据,但需要对HTML结构有一定了解,并且要警惕页面结构变化带来的维护成本。
  3. Selenium等浏览器自动化工具(备选,但通常更重): 如果上述两种方法都无法奏效,或者需要模拟用户交互(如点击、滚动)才能加载数据,那么Selenium等工具可以驱动真实浏览器来渲染页面并获取最终内容。然而,这种方法资源消耗大,运行速度慢,通常作为最后手段。

在实际操作中,建议从浏览器开发者工具入手,分析网络请求和页面源代码,以确定最适合的数据获取策略。选择正确的方法不仅能提高数据抓取的成功率,还能大大提升脚本的稳定性和维护性。

相关专题

更多
python开发工具
python开发工具

php中文网为大家提供各种python开发工具,好的开发工具,可帮助开发者攻克编程学习中的基础障碍,理解每一行源代码在程序执行时在计算机中的过程。php中文网还为大家带来python相关课程以及相关文章等内容,供大家免费下载使用。

758

2023.06.15

python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

639

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

761

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

618

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

1265

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

548

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

579

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

709

2023.08.11

高德地图升级方法汇总
高德地图升级方法汇总

本专题整合了高德地图升级相关教程,阅读专题下面的文章了解更多详细内容。

43

2026.01.16

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
React 教程
React 教程

共58课时 | 3.8万人学习

TypeScript 教程
TypeScript 教程

共19课时 | 2.3万人学习

Bootstrap 5教程
Bootstrap 5教程

共46课时 | 2.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号