0

0

如何使用 Selenium 自动将网页保存为 PDF(无需手动点击打印对话框)

花韻仙語

花韻仙語

发布时间:2026-02-12 10:54:14

|

958人浏览过

|

来源于php中文网

原创

如何使用 Selenium 自动将网页保存为 PDF(无需手动点击打印对话框)

本文详解如何通过 selenium + chromedriver 实现网页自动“打印为 pdf”,避开浏览器弹出的交互式打印对话框,利用 `--kiosk-printing` 等关键参数实现静默导出,并提供稳定、可复用的完整代码方案。

在 Web 自动化场景中,常需将目标网页导出为 PDF 文件(如生成报告、存档页面等)。但直接调用 window.print() 会触发 Chrome 的图形化打印对话框,而 Selenium 默认无法操作该原生系统级 UI,导致脚本阻塞超时——这正是原始代码失败的根本原因。

要真正实现无交互、自动化、静默生成 PDF,必须绕过前端 JavaScript 的“触发打印”行为,转而配置 Chrome 启动参数,使其在调用 window.print() 后自动执行“另存为 PDF”动作。核心在于两个关键 Chrome 启动选项:

  • --kiosk-printing:启用免提示打印模式,自动选择“另存为 PDF”打印机并确认保存;
  • --no-sandbox 和 --disable-dev-shm-usage(推荐补充):提升容器/无头环境下的稳定性;
  • ⚠️ 移除 --disable-gpu:该参数在新版 Chrome 中可能导致 PDF 渲染异常或打印流程中断;
  • ⚠️ 移除 set_script_timeout():window.print() 是异步触发行为,设置脚本超时无实际意义,反而干扰流程。

此外,需配合合理的等待策略:implicitly_wait() 用于全局元素加载等待(非针对打印),而对 PDF 生成完成的判断,不能依赖 time.sleep() —— 因 PDF 写入是后台异步过程,更可靠的方式是监听输出目录中文件是否生成并具备合理大小(例如 >10 KB)。

以下为优化后的完整可运行示例(兼容 Chrome 115+,支持 Windows/macOS/Linux):

boardmix博思白板
boardmix博思白板

boardmix博思白板,一个点燃团队协作和激发创意的空间,集aigc,一键PPT,思维导图,笔记文档多种创意表达能力于一体,将团队工作效率提升到新的层次。

下载
from selenium import webdriver
from selenium.webdriver.chrome.options import Options
import os
import time

def save_webpage_as_pdf(url: str, output_path: str, timeout: int = 30) -> bool:
    """
    使用 Selenium 将指定 URL 页面静默保存为 PDF

    :param url: 目标网页地址
    :param output_path: PDF 输出路径(需包含 .pdf 后缀)
    :param timeout: 最大等待时间(秒),用于检测 PDF 是否生成成功
    :return: 成功返回 True,否则 False
    """
    # 确保输出目录存在
    os.makedirs(os.path.dirname(output_path), exist_ok=True)

    chrome_options = Options()
    chrome_options.add_argument("--kiosk-printing")           # 关键:静默打印到 PDF
    chrome_options.add_argument("--no-sandbox")
    chrome_options.add_argument("--disable-dev-shm-usage")
    chrome_options.add_argument("--disable-background-timer-throttling")
    chrome_options.add_argument("--disable-renderer-backgrounding")
    # 注意:不要添加 --disable-gpu 或 --headless(除非明确需要无头,但 PDF 生成在有界面模式下更稳定)

    # 设置下载路径(仅当使用 Chrome 默认 PDF 打印机时有效)
    # 实际上,--kiosk-printing 会自动使用系统默认 PDF 打印机(即“另存为 PDF”),无需额外配置下载行为
    driver = webdriver.Chrome(options=chrome_options)

    try:
        driver.implicitly_wait(10)  # 全局隐式等待,用于页面加载和元素查找
        driver.get(url)

        # 等待页面基本内容加载(可选:根据实际需求加显式等待)
        time.sleep(3)

        # 触发打印 → 自动保存为 PDF
        driver.execute_script("window.print();")

        # 等待 PDF 文件生成(轮询检查)
        start_time = time.time()
        while time.time() - start_time < timeout:
            if os.path.exists(output_path) and os.path.getsize(output_path) > 10 * 1024:  # >10KB
                print(f"✅ PDF 已成功保存至:{output_path}")
                return True
            time.sleep(1)

        print(f"❌ 超时未检测到 PDF 文件生成,请检查 Chrome 版本及权限设置。")
        return False

    finally:
        driver.quit()

# 使用示例
if __name__ == "__main__":
    pdf_path = "output/google_homepage.pdf"
    success = save_webpage_as_pdf("https://www.google.com", pdf_path)
    if not success:
        exit(1)

关键注意事项总结:

  • --kiosk-printing 必须与 window.print() 配合使用,单独设置无效;
  • 该方案依赖 Chrome 内置的“另存为 PDF”虚拟打印机,无需额外安装 PDF 驱动;
  • 若在 Docker 或 CI 环境中运行,建议添加 --headless=new(Chrome 112+)并确保已安装字体库(如 fonts-liberation),否则 PDF 可能出现乱码或空白;
  • 对于需要精确控制页边距、纸张尺寸、背景图形等高级 PDF 样式的需求,建议改用 print_options(Chrome DevTools Protocol)方式,而非 window.print();
  • 不要混淆“Print to PDF”(本方案)与“Save as HTML”或“MHTML”——二者技术路径与输出格式完全不同。

掌握这一模式后,即可将网页快照、报表、票据等一键固化为标准 PDF,无缝集成进自动化测试、监控告警或文档归档流水线。

相关文章

全能打印神器
全能打印神器

全能打印神器是一款非常好用的打印软件,可以在电脑、手机、平板电脑等设备上使用。支持无线打印和云打印,操作非常简单,使用起来也非常方便,有需要的小伙伴快来保存下载体验吧!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
chrome什么意思
chrome什么意思

chrome是浏览器的意思,由Google开发的网络浏览器,它在2008年首次发布,并迅速成为全球最受欢迎的浏览器之一。本专题为大家提供chrome相关的文章、下载、课程内容,供大家免费下载体验。

932

2023.08.11

chrome无法加载插件怎么办
chrome无法加载插件怎么办

chrome无法加载插件可以通过检查插件是否已正确安装、禁用和启用插件、清除插件缓存、更新浏览器和插件、检查网络连接和尝试在隐身模式下加载插件方法解决。更多关于chrome相关问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

776

2023.11.06

chrome什么意思
chrome什么意思

chrome是浏览器的意思,由Google开发的网络浏览器,它在2008年首次发布,并迅速成为全球最受欢迎的浏览器之一。本专题为大家提供chrome相关的文章、下载、课程内容,供大家免费下载体验。

932

2023.08.11

chrome无法加载插件怎么办
chrome无法加载插件怎么办

chrome无法加载插件可以通过检查插件是否已正确安装、禁用和启用插件、清除插件缓存、更新浏览器和插件、检查网络连接和尝试在隐身模式下加载插件方法解决。更多关于chrome相关问题,详情请看本专题下面的文章。php中文网欢迎大家前来学习。

776

2023.11.06

python中print函数的用法
python中print函数的用法

python中print函数的语法是“print(value1, value2, ..., sep=' ', end=' ', file=sys.stdout, flush=False)”。本专题为大家提供print相关的文章、下载、课程内容,供大家免费下载体验。

191

2023.09.27

python print用法与作用
python print用法与作用

本专题整合了python print的用法、作用、函数功能相关内容,阅读专题下面的文章了解更多详细教程。

11

2026.02.03

windows查看端口占用情况
windows查看端口占用情况

Windows端口可以认为是计算机与外界通讯交流的出入口。逻辑意义上的端口一般是指TCP/IP协议中的端口,端口号的范围从0到65535,比如用于浏览网页服务的80端口,用于FTP服务的21端口等等。怎么查看windows端口占用情况呢?php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1046

2023.07.26

查看端口占用情况windows
查看端口占用情况windows

端口占用是指与端口关联的软件占用端口而使得其他应用程序无法使用这些端口,端口占用问题是计算机系统编程领域的一个常见问题,端口占用的根本原因可能是操作系统的一些错误,服务器也可能会出现端口占用问题。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

1145

2023.07.27

2026春节习俗大全
2026春节习俗大全

本专题整合了2026春节习俗大全,阅读专题下面的文章了解更多详细内容。

189

2026.02.11

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
成为PHP架构师-自制PHP框架
成为PHP架构师-自制PHP框架

共28课时 | 2.5万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号