0

0

如何将PDF合同按章节提取为结构化HTML或富文本文件

花韻仙語

花韻仙語

发布时间:2026-01-17 13:39:09

|

878人浏览过

|

来源于php中文网

原创

如何将PDF合同按章节提取为结构化HTML或富文本文件

本文介绍使用pdftohtml工具将法律合同类pdf精准转换为带语义标签(如h1–h6、p)的html,再借助beautiful soup解析标题与正文并分段导出为独立文本文件的完整流程。

在处理结构清晰但无交互能力的PDF文档(如标准法律合同)时,直接提取“标题+对应内容”是常见需求。由于PDF本质是布局导向而非语义导向,无法直接读取逻辑章节,因此需借助语义重建策略:先将PDF转换为结构化HTML(保留标题层级与段落关系),再通过DOM解析实现精准切分。

✅ 推荐方案:pdftohtml + Python(Beautiful Soup)

pdftohtml 是成熟稳定的开源工具(基于Poppler),能将PDF中识别出的视觉层级(如字体大小、加粗、缩进等启发式特征)映射为HTML语义标签(如

),特别适合格式规整的合同类文档。

1. 安装与基础转换

macOS 用户可通过 Homebrew 安装:

brew install pdftohtml

Windows/Linux 用户可从 pdftohtml 官网 下载二进制包,或使用 poppler-utils 中的 pdftohtml(Ubuntu/Debian):

Napkin AI
Napkin AI

Napkin AI 可以将您的文本转换为图表、流程图、信息图、思维导图视觉效果,以便快速有效地分享您的想法。

下载

立即学习前端免费学习笔记(深入)”;

sudo apt-get install poppler-utils

执行转换(启用结构化输出,保留标题语义):

pdftohtml -c -s -i input_contract.pdf output.html
  • -c:启用CSS样式(提升结构可读性)
  • -s:生成单文件HTML(非分页碎片)
  • -i:忽略图像(合同文本为主时可提速并减少干扰)
⚠️ 注意:pdftohtml 的标题识别依赖PDF内嵌字体信息与排版线索。若原PDF为扫描件(图片型),需先用OCR工具(如 pdf2image + pytesseract)转为可搜索PDF,再进行转换。

2. 解析HTML并按章节拆分

安装依赖:

pip install beautifulsoup4

Python 脚本示例(自动识别

标题,并将后续非标题内容归入该节,直到下一标题出现):
from bs4 import BeautifulSoup
import re

def split_by_heading(html_path, output_dir="sections"):
    import os
    os.makedirs(output_dir, exist_ok=True)

    with open(html_path, "r", encoding="utf-8") as f:
        soup = BeautifulSoup(f, "html.parser")

    # 移除脚注、页眉页脚等干扰区域(根据实际HTML结构调整)
    for elem in soup(["script", "style", "footer", "header", "nav"]):
        elem.decompose()

    headings = soup.find_all(re.compile(r"^h[1-6]$"))
    for i, h in enumerate(headings):
        title = h.get_text(strip=True)
        if not title:
            continue

        # 生成安全的文件名(去除非法字符)
        safe_title = re.sub(r'[<>:"/\|?*]', "_", title)[:50]
        filename = f"{output_dir}/Section_{i+1}_{safe_title}.txt"

        # 收集该标题后所有连续段落(p)、列表(ul/ol)、甚至嵌套div
        content = [title]
        sibling = h.next_sibling
        while sibling and not sibling.name or not re.match(r"^h[1-6]$", sibling.name):
            if sibling.name in ["p", "ul", "ol", "div"] and sibling.get_text(strip=True):
                content.append(sibling.get_text(strip=True))
            sibling = sibling.next_sibling

        with open(filename, "w", encoding="utf-8") as f:
            f.write("

".join(content))
        print(f"✅ 已保存: {filename}")

# 使用示例
split_by_heading("output.html")

3. 进阶建议

  • 验证HTML质量:打开生成的 output.html,检查

    是否真实对应合同中的“第X条”“甲方义务”等标题;若错位,可微调 pdftohtml 参数(如 -zoom 1.5 提升识别精度)或预处理PDF(Acrobat “增强扫描”)。

  • 替代工具对比:pdfplumber(Python库)提供更细粒度的文本定位,适合自定义规则;pymupdf(fitz)速度快,支持直接提取带坐标的文本块,但需自行聚类标题。
  • 批量与自动化:可封装为CLI工具,支持通配符输入(如 *.pdf)及JSON元数据导出(含章节编号、页码范围)。

最终,你将获得一组命名清晰、内容完整的 .txt 文件,每份严格对应合同中的一个逻辑章节——无需人工复制粘贴,真正实现法律文档的结构化复用。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
json数据格式
json数据格式

JSON是一种轻量级的数据交换格式。本专题为大家带来json数据格式相关文章,帮助大家解决问题。

453

2023.08.07

json是什么
json是什么

JSON是一种轻量级的数据交换格式,具有简洁、易读、跨平台和语言的特点,JSON数据是通过键值对的方式进行组织,其中键是字符串,值可以是字符串、数值、布尔值、数组、对象或者null,在Web开发、数据交换和配置文件等方面得到广泛应用。本专题为大家提供json相关的文章、下载、课程内容,供大家免费下载体验。

546

2023.08.23

jquery怎么操作json
jquery怎么操作json

操作的方法有:1、“$.parseJSON(jsonString)”2、“$.getJSON(url, data, success)”;3、“$.each(obj, callback)”;4、“$.ajax()”。更多jquery怎么操作json的详细内容,可以访问本专题下面的文章。

331

2023.10.13

go语言处理json数据方法
go语言处理json数据方法

本专题整合了go语言中处理json数据方法,阅读专题下面的文章了解更多详细内容。

82

2025.09.10

DOM是什么意思
DOM是什么意思

dom的英文全称是documentobjectmodel,表示文件对象模型,是w3c组织推荐的处理可扩展置标语言的标准编程接口;dom是html文档的内存中对象表示,它提供了使用javascript与网页交互的方式。想了解更多的相关内容,可以阅读本专题下面的文章。

4239

2024.08.14

windows查看端口占用情况
windows查看端口占用情况

Windows端口可以认为是计算机与外界通讯交流的出入口。逻辑意义上的端口一般是指TCP/IP协议中的端口,端口号的范围从0到65535,比如用于浏览网页服务的80端口,用于FTP服务的21端口等等。怎么查看windows端口占用情况呢?php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1431

2023.07.26

查看端口占用情况windows
查看端口占用情况windows

端口占用是指与端口关联的软件占用端口而使得其他应用程序无法使用这些端口,端口占用问题是计算机系统编程领域的一个常见问题,端口占用的根本原因可能是操作系统的一些错误,服务器也可能会出现端口占用问题。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

1163

2023.07.27

windows照片无法显示
windows照片无法显示

当我们尝试打开一张图片时,可能会出现一个错误提示,提示说"Windows照片查看器无法显示此图片,因为计算机上的可用内存不足",本专题为大家提供windows照片无法显示相关的文章,帮助大家解决该问题。

833

2023.08.01

JavaScript浏览器渲染机制与前端性能优化实践
JavaScript浏览器渲染机制与前端性能优化实践

本专题围绕 JavaScript 在浏览器中的执行与渲染机制展开,系统讲解 DOM 构建、CSSOM 解析、重排与重绘原理,以及关键渲染路径优化方法。内容涵盖事件循环机制、异步任务调度、资源加载优化、代码拆分与懒加载等性能优化策略。通过真实前端项目案例,帮助开发者理解浏览器底层工作原理,并掌握提升网页加载速度与交互体验的实用技巧。

23

2026.03.06

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Sass 教程
Sass 教程

共14课时 | 0.9万人学习

Bootstrap 5教程
Bootstrap 5教程

共46课时 | 3.5万人学习

CSS教程
CSS教程

共754课时 | 40.5万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号