0

0

C++怎么实现一个后缀数组(Suffix Array)_C++字符串算法与LCP数组

尼克

尼克

发布时间:2025-12-04 11:35:02

|

449人浏览过

|

来源于php中文网

原创

后缀数组通过排序字符串所有后缀实现高效字符串处理,配合LCP数组可快速求解最长重复子串等问题。

c++怎么实现一个后缀数组(suffix array)_c++字符串算法与lcp数组

后缀数组(Suffix Array)是处理字符串问题的重要工具,常用于查找最长重复子串、最长回文子串、字符串匹配等场景。它通过对字符串的所有后缀进行排序,得到一个按字典序排列的后缀索引数组。配合LCP(Longest Common Prefix)数组,可以高效解决多种字符串问题。

后缀数组的基本概念

给定一个字符串 S[0..n-1],它的后缀是指从某个位置开始到末尾的子串,即 S[i..n-1]。后缀数组 SA[0..n-1] 是一个整数数组,保存的是使得所有后缀 S[SA[i]..n-1] 按字典序升序排列的起始下标。

例如,S = "banana",其所有后缀为:

  • i=0: banana
  • i=1: anana
  • i=2: nana
  • i=3: ana
  • i=4: na
  • i=5: a

排序后:

立即学习C++免费学习笔记(深入)”;

  • a (i=5)
  • ana (i=3)
  • anana (i=1)
  • banana (i=0)
  • na (i=4)
  • nana (i=2)

所以 SA = [5, 3, 1, 0, 4, 2]

构造后缀数组:倍增法(Doubling Method)

直接对每个后缀排序时间复杂度为 O(n²logn),效率低。我们可以使用倍增法在 O(n log n) 时间内完成构造。

核心思想:按长度 1, 2, 4, 8... 的前缀对后缀排序,每次利用上一次排序的结果进行快速比较。

步骤如下:

  • 初始化:对每个字符排序,得到初始排名 rank[0..n-1]
  • 倍增:对于 k = 1, 2, 4, ..., 将每个后缀的排名表示为 pair(rank[i], rank[i+k])
  • 重新排序这些 pair,并更新 rank 数组
  • 当所有 rank 值唯一时停止

代码实现:

OpenArt
OpenArt

在线AI绘画艺术图片生成器工具

下载
#include 
#include 
#include 
using namespace std;

vector buildSuffixArray(const string& s) { int n = s.size(); vector sa(n), rank(n), temp(n);

// 初始化:按首字符排序
for (int i = 0; i zuojiankuohaophpcn n; i++) {
    sa[i] = i;
    rank[i] = s[i];
}

for (int k = 1; k zuojiankuohaophpcn n; k *= 2) {
    auto cmp = [&](int i, int j) {
        if (rank[i] != rank[j])
            return rank[i] zuojiankuohaophpcn rank[j];
        int ri = (i + k zuojiankuohaophpcn n) ? rank[i + k] : -1;
        int rj = (j + k zuojiankuohaophpcn n) ? rank[j + k] : -1;
        return ri zuojiankuohaophpcn rj;
    };
    sort(sa.begin(), sa.end(), cmp);

    temp[sa[0]] = 0;
    for (int i = 1; i zuojiankuohaophpcn n; i++) {
        temp[sa[i]] = temp[sa[i-1]] + (cmp(sa[i-1], sa[i]) ? 1 : 0);
    }
    rank = temp;
}
return sa;

}

LCP数组:最长公共前缀

LCP[i] 表示后缀 SA[i] 和 SA[i-1] 的最长公共前缀长度(i ≥ 1)。LCP 数组可用于快速查询任意两个后缀的 LCP(配合 RMQ),也能帮助找出最长重复子串。

计算方法:利用 height 数组的性质,通过 SA 和 rank 数组在 O(n) 时间内求出。

LCP数组构造代码:

vector buildLCP(const string& s, const vector& sa) {
    int n = s.size();
    vector rank(n), lcp(n);
    for (int i = 0; i < n; i++)
        rank[sa[i]] = i;
int h = 0;
lcp[0] = 0;
for (int i = 0; i zuojiankuohaophpcn n; i++) {
    if (rank[i] youjiankuohaophpcn 0) {
        int j = sa[rank[i] - 1]; // 前一个后缀的起始位置
        while (i + h zuojiankuohaophpcn n && j + h zuojiankuohaophpcn n && s[i+h] == s[j+h])
            h++;
        lcp[rank[i]] = h;
        if (h youjiankuohaophpcn 0) h--;
    }
}
return lcp;

}

应用示例:查找最长重复子串

利用后缀数组和 LCP 数组,LCP 数组中的最大值即为最长重复子串的长度,对应的位置可还原出具体子串。

例如,在 "banana" 中,LCP 数组为 [0,1,3,0,0,2],最大值为 3,说明存在长度为 3 的重复子串 "ana"。

只需遍历 LCP 数组找到最大值及其位置,再用 SA[i] 取出子串即可。

基本上就这些。后缀数组结合 LCP 能高效处理很多字符串难题,虽然构造稍复杂,但一旦掌握,威力强大。

相关专题

更多
js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

258

2023.08.03

js截取字符串的方法
js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容,供大家免费下载体验。

208

2023.09.04

java基础知识汇总
java基础知识汇总

java基础知识有Java的历史和特点、Java的开发环境、Java的基本数据类型、变量和常量、运算符和表达式、控制语句、数组和字符串等等知识点。想要知道更多关于java基础知识的朋友,请阅读本专题下面的的有关文章,欢迎大家来php中文网学习。

1465

2023.10.24

字符串介绍
字符串介绍

字符串是一种数据类型,它可以是任何文本,包括字母、数字、符号等。字符串可以由不同的字符组成,例如空格、标点符号、数字等。在编程中,字符串通常用引号括起来,如单引号、双引号或反引号。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

619

2023.11.24

java读取文件转成字符串的方法
java读取文件转成字符串的方法

Java8引入了新的文件I/O API,使用java.nio.file.Files类读取文件内容更加方便。对于较旧版本的Java,可以使用java.io.FileReader和java.io.BufferedReader来读取文件。在这些方法中,你需要将文件路径替换为你的实际文件路径,并且可能需要处理可能的IOException异常。想了解更多java的相关内容,可以阅读本专题下面的文章。

550

2024.03.22

php中定义字符串的方式
php中定义字符串的方式

php中定义字符串的方式:单引号;双引号;heredoc语法等等。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

545

2024.04.29

go语言字符串相关教程
go语言字符串相关教程

本专题整合了go语言字符串相关教程,阅读专题下面的文章了解更多详细内容。

162

2025.07.29

c++字符串相关教程
c++字符串相关教程

本专题整合了c++字符串相关教程,阅读专题下面的文章了解更多详细内容。

81

2025.08.07

高德地图升级方法汇总
高德地图升级方法汇总

本专题整合了高德地图升级相关教程,阅读专题下面的文章了解更多详细内容。

43

2026.01.16

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
C# 教程
C# 教程

共94课时 | 6.9万人学习

C 教程
C 教程

共75课时 | 4.1万人学习

C++教程
C++教程

共115课时 | 12.6万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号