0

0

动态加载网页图片抓取:Dermnet案例与Google CSE API利用指南

碧海醫心

碧海醫心

发布时间:2025-09-23 14:55:23

|

602人浏览过

|

来源于php中文网

原创

动态加载网页图片抓取:Dermnet案例与Google CSE API利用指南

本教程旨在解决Dermnet等采用JavaScript动态加载图片的网站抓取难题。当传统方法如BeautifulSoup或Selenium受阻时,我们将展示如何通过浏览器开发者工具识别并直接调用隐藏的Google自定义搜索API(CSE)。通过分析API请求参数并解析返回的JSON数据,本指南提供了一种高效、稳定的图片抓取策略,并涵盖了分页处理和实践中的注意事项。

理解动态加载的挑战

在进行网页数据抓取时,我们经常会遇到内容通过javascript动态加载的网站。这类网站在初始html响应中可能不包含所需的图片链接或数据,而是通过客户端脚本在页面加载完成后异步请求数据并渲染。对于这类场景,仅仅使用requests库获取html并结合beautifulsoup解析静态内容往往会失败,因为beautifulsoup无法执行javascript。虽然selenium等自动化测试工具可以模拟浏览器行为,执行javascript并等待内容加载,但其资源消耗较大,且在某些复杂场景下(如本案例中内容来自第三方api)仍然可能难以直接定位到渲染后的元素。

识别隐藏的API调用

解决动态加载问题的关键在于“透过现象看本质”,即找出页面数据实际的来源。许多动态加载的内容并非直接嵌入在JavaScript代码中,而是通过JavaScript向后端API发送请求获取。我们可以利用浏览器的开发者工具来发现这些隐藏的API调用。

  1. 打开开发者工具: 在目标网站(例如Dermnet的搜索结果页)上,按下F12键(或右键点击页面选择“检查”/“Inspect”)打开开发者工具。
  2. 切换到“网络”(Network)标签页: 这个标签页会显示浏览器在加载页面时发出的所有HTTP请求。
  3. 过滤和观察: 刷新页面,并仔细观察网络请求。通常,动态加载的数据请求会以XHR(XMLHttpRequest)或Fetch的形式出现。在本案例中,我们可以观察到有针对cse.google.com的请求。这类请求往往是Google自定义搜索(Google Custom Search Engine, CSE)的API调用。
  4. 分析API请求: 找到类似https://cse.google.com/cse/element/v1?rsz=large&num=16&hl=en&source=gcsc&gss=.com&cselibv=...&searchtype=image&cx=...&q=...&safe=off&cse_tok=...&exp=csqr,cc,bf&callback=google.search.cse.api...的URL。这个URL就是获取图片数据的API接口。点击该请求,查看其“响应”(Response)标签页,你会发现返回的是一个JSON对象,其中包含results字段,里面就是我们需要的图片信息。

构建API请求与解析响应

一旦识别出API接口,我们就可以绕过前端渲染,直接向该API发送请求并解析其JSON响应。

1. API URL参数分析

上述API URL包含多个关键参数,理解它们对于构建请求至关重要:

谱乐AI
谱乐AI

谱乐AI,集成 Suno、Udio 等顶尖AI音乐模型的一站式AI音乐生成平台。

下载
  • q: 搜索关键词(例如basal%20cell%20carcinoma%20dermoscopy)。
  • cx: Google CSE的自定义ID,用于标识特定的搜索引擎。
  • num: 每页返回结果的数量。
  • start: 控制分页,表示从第几个结果开始返回。
  • cse_tok: 一个动态生成的令牌(token),可能是用于身份验证或防止滥用。这个参数需要特别注意,它可能会随时间或请求而变化。
  • cselibv: 可能是一个版本号或动态生成的标识符,也建议从实际的网络请求中获取最新值。
  • callback: 通常用于JSONP请求,指定回调函数名。在直接请求纯JSON时,通常可以忽略或移除。

2. 使用Python发送API请求

我们可以使用Python的requests库来模拟这些API请求。

import requests
import json
import re
import time
import os
from urllib.parse import urlparse

def fetch_dermnet_images_via_api(query, max_pages=3, delay_seconds=1):
    """
    通过Google CSE API抓取Dermnet的图片链接。
    注意:cse_tok和cselibv参数可能需要动态获取或定期更新。
    """
    base_api_url = "https://cse.google.com/cse/element/v1"

    # 从浏览器开发者工具中获取的关键参数。
    # cse_tok和cselibv通常是动态的,这里使用示例值,实际应用中可能需要更复杂的策略来获取。
    # cx是Google CSE的ID,通常是固定的。
    params = {
        "rsz": "large",
        "num": "16", # 每页图片数量
        "hl": "en",
        "source": "gcsc",
        "gss": ".com",
        "cselibv": "8e77c7877b8339e2", # 示例值,请从网络请求中获取最新
        "searchtype": "image",
        "cx": "015036873904746004277:nz7deehiccq", # Dermnet的CSE ID
        "q": query,
        "safe": "off",
        "cse_tok": "AFW0emwRaupmNcwPmPDnZm7vKaJV:1684998350721", # 示例token,请从网络请求中获取最新
        "exp": "csqr,cc,bf",
        # "callback": "google.search.cse.api10440" # 如果直接请求JSON,可以不带callback参数
    }

    all_image_urls = []

    for page in range(1, max_pages + 1):
        print(f"Fetching page {page} for query: '{query}'")
        # Google CSE API通过start参数控制分页,start表示从第几个结果开始
        params["start"] = (page - 1) * int(params["num"]) + 1 

        try:
            # 移除callback参数以获取纯JSON响应,如果存在的话
            temp_params = params.copy()
            if "callback" in temp_params:
                del temp_params["callback"]

            # 模拟浏览器User-Agent
            headers = {
                "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/91.0.4472.124124 Safari/537.36"
            }

            response = requests.get(base_api_url, params=temp_params, headers=headers, timeout=15)
            response.raise_for_status() # 检查HTTP请求是否成功

            # Google CSE API返回的响应通常是JSONP格式,即以函数调用

相关专题

更多
python开发工具
python开发工具

php中文网为大家提供各种python开发工具,好的开发工具,可帮助开发者攻克编程学习中的基础障碍,理解每一行源代码在程序执行时在计算机中的过程。php中文网还为大家带来python相关课程以及相关文章等内容,供大家免费下载使用。

751

2023.06.15

python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

636

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

758

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

618

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

1262

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

547

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

577

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

706

2023.08.11

Java 桌面应用开发(JavaFX 实战)
Java 桌面应用开发(JavaFX 实战)

本专题系统讲解 Java 在桌面应用开发领域的实战应用,重点围绕 JavaFX 框架,涵盖界面布局、控件使用、事件处理、FXML、样式美化(CSS)、多线程与UI响应优化,以及桌面应用的打包与发布。通过完整示例项目,帮助学习者掌握 使用 Java 构建现代化、跨平台桌面应用程序的核心能力。

36

2026.01.14

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
React 教程
React 教程

共58课时 | 3.6万人学习

TypeScript 教程
TypeScript 教程

共19课时 | 2.2万人学习

Bootstrap 5教程
Bootstrap 5教程

共46课时 | 2.9万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号