0

0

什么是AC自动机?多模式字符串匹配

星降

星降

发布时间:2025-08-25 13:46:01

|

393人浏览过

|

来源于php中文网

原创

AC自动机通过Trie树与Fail指针实现多模式串高效匹配,构建时先插入所有模式串形成Trie树,再用BFS建立Fail指针以实现失配跳转,匹配时对文本串一次扫描即可找出所有匹配模式,相比KMP在多模式场景下更高效。

什么是ac自动机?多模式字符串匹配

AC自动机,简单来说,就是一个能同时匹配多个模式串的字符串匹配算法。它是在Trie树(字典树)的基础上,加入了类似KMP算法的失配指针,从而实现高效的多模式匹配。

AC自动机,解决多模式字符串匹配问题的利器。

构建AC自动机,进行多模式匹配。

如何理解AC自动机的核心思想?

AC自动机的核心在于两个关键的数据结构:Trie树和Fail指针。Trie树用于存储所有的模式串,而Fail指针则用于在匹配失败时,快速跳转到下一个可能匹配的位置。

想象一下,你正在用一本字典查找多个单词,Trie树就像这本字典的目录,它告诉你每个字母开头的单词有哪些。当你查一个单词的时候,如果发现当前字母不对,Fail指针就像一个“推荐”功能,告诉你下一个可能匹配的单词是什么,而不用从头开始查找。

具体来说,构建AC自动机分为以下几个步骤:

  1. 构建Trie树: 将所有的模式串插入到Trie树中。每个节点代表一个字符串的前缀,根节点代表空字符串。

    class Node:
        def __init__(self):
            self.children = {}
            self.is_word = False
            self.fail = None # Fail指针
    
    class Trie:
        def __init__(self):
            self.root = Node()
    
        def insert(self, word):
            node = self.root
            for char in word:
                if char not in node.children:
                    node.children[char] = Node()
                node = node.children[char]
            node.is_word = True
  2. 构建Fail指针: 从根节点开始,使用BFS算法遍历Trie树。对于每个节点,如果它的父节点的Fail指针指向的节点存在一个和当前节点字符相同的子节点,那么当前节点的Fail指针就指向那个子节点;否则,就指向根节点。

    NeoAgent
    NeoAgent

    销售易推出的AI‑CRM智能体平台

    下载
    from collections import deque
    
    def build_fail_pointer(trie):
        root = trie.root
        queue = deque([root])
        root.fail = root # 根节点的fail指针指向自身
    
        while queue:
            node = queue.popleft()
            for char, child in node.children.items():
                if node == root:
                    child.fail = root
                else:
                    fail_node = node.fail
                    while fail_node != root and char not in fail_node.children:
                        fail_node = fail_node.fail
                    if char in fail_node.children:
                        child.fail = fail_node.children[char]
                    else:
                        child.fail = root
                queue.append(child)
  3. 进行匹配: 从文本串的第一个字符开始,沿着Trie树进行匹配。如果匹配成功,就继续匹配下一个字符;如果匹配失败,就沿着Fail指针跳转到下一个可能匹配的位置。

    def search(trie, text):
        node = trie.root
        results = []
        for i, char in enumerate(text):
            while node != trie.root and char not in node.children:
                node = node.fail
            if char in node.children:
                node = node.children[char]
            temp = node
            while temp != trie.root:
                if temp.is_word:
                    # 找到一个匹配的模式串,记录位置和模式串
                    results.append((i, temp)) # 实际应用中需要记录是哪个模式串
                    break
                temp = temp.fail
        return results

AC自动机相比于KMP算法,优势在哪里?

KMP算法是解决单模式串匹配问题的利器,而AC自动机则更擅长解决多模式串匹配问题。虽然可以对每个模式串都运行一次KMP算法,但当模式串数量很多时,AC自动机的效率更高。

AC自动机的优势主要体现在以下几个方面:

  • 一次扫描,匹配多个模式串: 只需对文本串进行一次扫描,就可以找到所有匹配的模式串。
  • 时间复杂度稳定: 匹配的时间复杂度为O(n),其中n为文本串的长度,与模式串的数量无关。
  • 空间复杂度可控: 空间复杂度主要取决于Trie树的大小,可以通过优化Trie树的结构来降低空间复杂度。

当然,KMP算法在单模式串匹配问题上仍然具有优势,因为它实现简单,空间复杂度也更低。选择哪种算法,取决于具体的应用场景和需求。

在实际应用中,AC自动机有哪些优化策略?

AC自动机在实际应用中,可能会面临一些挑战,比如内存占用过高、匹配速度不够快等。因此,需要采用一些优化策略来提高其性能。

  • 压缩Trie树: 可以使用Double-Array Trie等数据结构来压缩Trie树,减少内存占用。
  • 优化Fail指针: 可以使用Aho-Corasick算法的变种,比如Commentz-Walter算法,来优化Fail指针的跳转,提高匹配速度。
  • 并行处理: 可以将文本串分成多个片段,并行地进行匹配,提高匹配效率。
  • 过滤无效字符: 在构建Trie树之前,可以过滤掉文本串中不可能出现在模式串中的字符,减少无效匹配。

另外,还可以结合Bloom Filter等数据结构,快速判断一个字符串是否可能出现在模式串集合中,从而避免不必要的匹配操作。

总而言之,AC自动机是一个非常强大的字符串匹配算法,在信息安全、自然语言处理等领域都有着广泛的应用。通过不断地优化和改进,它可以更好地适应各种复杂的应用场景。

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

298

2023.08.03

js截取字符串的方法
js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容,供大家免费下载体验。

212

2023.09.04

java基础知识汇总
java基础知识汇总

java基础知识有Java的历史和特点、Java的开发环境、Java的基本数据类型、变量和常量、运算符和表达式、控制语句、数组和字符串等等知识点。想要知道更多关于java基础知识的朋友,请阅读本专题下面的的有关文章,欢迎大家来php中文网学习。

1497

2023.10.24

字符串介绍
字符串介绍

字符串是一种数据类型,它可以是任何文本,包括字母、数字、符号等。字符串可以由不同的字符组成,例如空格、标点符号、数字等。在编程中,字符串通常用引号括起来,如单引号、双引号或反引号。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

623

2023.11.24

java读取文件转成字符串的方法
java读取文件转成字符串的方法

Java8引入了新的文件I/O API,使用java.nio.file.Files类读取文件内容更加方便。对于较旧版本的Java,可以使用java.io.FileReader和java.io.BufferedReader来读取文件。在这些方法中,你需要将文件路径替换为你的实际文件路径,并且可能需要处理可能的IOException异常。想了解更多java的相关内容,可以阅读本专题下面的文章。

592

2024.03.22

php中定义字符串的方式
php中定义字符串的方式

php中定义字符串的方式:单引号;双引号;heredoc语法等等。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

586

2024.04.29

go语言字符串相关教程
go语言字符串相关教程

本专题整合了go语言字符串相关教程,阅读专题下面的文章了解更多详细内容。

170

2025.07.29

c++字符串相关教程
c++字符串相关教程

本专题整合了c++字符串相关教程,阅读专题下面的文章了解更多详细内容。

82

2025.08.07

拼多多赚钱的5种方法 拼多多赚钱的5种方法
拼多多赚钱的5种方法 拼多多赚钱的5种方法

在拼多多上赚钱主要可以通过无货源模式一件代发、精细化运营特色店铺、参与官方高流量活动、利用拼团机制社交裂变,以及成为多多进宝推广员这5种方法实现。核心策略在于通过低成本、高效率的供应链管理与营销,利用平台社交电商红利实现盈利。

1

2026.01.26

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
【web前端】Node.js快速入门
【web前端】Node.js快速入门

共16课时 | 2万人学习

550W粉丝大佬手把手从零学JavaScript
550W粉丝大佬手把手从零学JavaScript

共1课时 | 0.3万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号