suffix_array_query.hpp¶
Suffix array with O(1) suffix LCP queries and lexicographic pattern interval/search over a fixed string.
Verified by suffixarray.
基于后缀数组与 LCP 结构回答子串比较、最长公共前缀和模式出现区间。
Implementation¶
#ifndef NOYA_SUFFIX_ARRAY_QUERY_HPP
#define NOYA_SUFFIX_ARRAY_QUERY_HPP 1
/// @complexity Time: O(n log n) build, O(1) LCP, O(m log n) pattern interval.
/// Space: O(n log n).
#include "atcoder/string.hpp"
#include <algorithm>
#include <cassert>
#include <string>
#include <string_view>
#include <utility>
#include <vector>
namespace noya {
/// @brief Suffix array with O(1) suffix LCP queries and lexicographic pattern
/// interval/search over a fixed string.
struct suffix_array_query {
std::string text;
std::vector<int> suffix_array;
std::vector<int> rank;
std::vector<int> logarithm;
std::vector<std::vector<int>> sparse_lcp;
suffix_array_query() = default;
explicit suffix_array_query(std::string value) { build(std::move(value)); }
void build(std::string value) {
text = std::move(value);
suffix_array = atcoder::suffix_array(text);
rank.assign(text.size(), 0);
for (int index = 0; index < int(suffix_array.size()); index++) {
rank[suffix_array[index]] = index;
}
if (text.empty()) {
logarithm.assign(2, 0);
sparse_lcp.clear();
return;
}
std::vector<int> lcp = atcoder::lcp_array(text, suffix_array);
logarithm.assign(lcp.size() + 2, 0);
for (int value = 2; value < int(logarithm.size()); value++) {
logarithm[value] = logarithm[value / 2] + 1;
}
if (!lcp.empty()) {
sparse_lcp.push_back(lcp);
for (int level = 1; (1 << level) <= int(lcp.size()); level++) {
int length = int(lcp.size()) - (1 << level) + 1;
sparse_lcp.emplace_back(length);
for (int index = 0; index < length; index++) {
sparse_lcp[level][index] =
std::min(sparse_lcp[level - 1][index],
sparse_lcp[level - 1][index + (1 << (level - 1))]);
}
}
}
}
int longest_common_prefix(int first, int second) const {
assert(0 <= first && first < int(text.size()));
assert(0 <= second && second < int(text.size()));
if (first == second) {
return int(text.size()) - first;
}
int left = rank[first];
int right = rank[second];
if (left > right) {
std::swap(left, right);
}
int length = right - left;
int level = logarithm[length];
return std::min(sparse_lcp[level][left],
sparse_lcp[level][right - (1 << level)]);
}
/// @brief Return the half-open suffix-array interval whose suffixes start
/// with pattern. Empty pattern matches every nonempty suffix.
std::pair<int, int> interval(std::string_view pattern) const {
auto compare = [&](int suffix, std::string_view value) {
std::size_t length = std::min(value.size(), text.size() - suffix);
int comparison = std::string_view(text)
.substr(suffix, length)
.compare(value.substr(0, length));
if (comparison != 0) {
return comparison;
}
return length == value.size() ? 0 : -1;
};
int left =
int(std::lower_bound(suffix_array.begin(), suffix_array.end(), pattern,
[&](int suffix, std::string_view value) {
return compare(suffix, value) < 0;
}) -
suffix_array.begin());
int right =
int(std::upper_bound(suffix_array.begin(), suffix_array.end(), pattern,
[&](std::string_view value, int suffix) {
return compare(suffix, value) > 0;
}) -
suffix_array.begin());
return {left, right};
}
std::vector<int> occurrences(std::string_view pattern,
bool text_order = true) const {
auto [left, right] = interval(pattern);
std::vector<int> result(suffix_array.begin() + left,
suffix_array.begin() + right);
if (text_order) {
std::sort(result.begin(), result.end());
}
return result;
}
};
} // namespace noya
#endif // NOYA_SUFFIX_ARRAY_QUERY_HPP
#include <algorithm>
#include <cassert>
#include <numeric>
#include <string>
#include <string_view>
#include <utility>
#include <vector>
/// @complexity Time: O(n log n) build, O(1) LCP, O(m log n) pattern interval.
/// Space: O(n log n).
namespace atcoder {
namespace internal {
std::vector<int> sa_naive(const std::vector<int>& s) {
int n = int(s.size());
std::vector<int> sa(n);
std::iota(sa.begin(), sa.end(), 0);
std::sort(sa.begin(), sa.end(), [&](int l, int r) {
if (l == r) return false;
while (l < n && r < n) {
if (s[l] != s[r]) return s[l] < s[r];
l++;
r++;
}
return l == n;
});
return sa;
}
std::vector<int> sa_doubling(const std::vector<int>& s) {
int n = int(s.size());
std::vector<int> sa(n), rnk = s, tmp(n);
std::iota(sa.begin(), sa.end(), 0);
for (int k = 1; k < n; k *= 2) {
auto cmp = [&](int x, int y) {
if (rnk[x] != rnk[y]) return rnk[x] < rnk[y];
int rx = x + k < n ? rnk[x + k] : -1;
int ry = y + k < n ? rnk[y + k] : -1;
return rx < ry;
};
std::sort(sa.begin(), sa.end(), cmp);
tmp[sa[0]] = 0;
for (int i = 1; i < n; i++) {
tmp[sa[i]] = tmp[sa[i - 1]] + (cmp(sa[i - 1], sa[i]) ? 1 : 0);
}
std::swap(tmp, rnk);
}
return sa;
}
// SA-IS, linear-time suffix array construction
// Reference:
// G. Nong, S. Zhang, and W. H. Chan,
// Two Efficient Algorithms for Linear Time Suffix Array Construction
template <int THRESHOLD_NAIVE = 10, int THRESHOLD_DOUBLING = 40>
std::vector<int> sa_is(const std::vector<int>& s, int upper) {
int n = int(s.size());
if (n == 0) return {};
if (n == 1) return {0};
if (n == 2) {
if (s[0] < s[1]) {
return {0, 1};
} else {
return {1, 0};
}
}
if (n < THRESHOLD_NAIVE) {
return sa_naive(s);
}
if (n < THRESHOLD_DOUBLING) {
return sa_doubling(s);
}
std::vector<int> sa(n);
std::vector<bool> ls(n);
for (int i = n - 2; i >= 0; i--) {
ls[i] = (s[i] == s[i + 1]) ? ls[i + 1] : (s[i] < s[i + 1]);
}
std::vector<int> sum_l(upper + 1), sum_s(upper + 1);
for (int i = 0; i < n; i++) {
if (!ls[i]) {
sum_s[s[i]]++;
} else {
sum_l[s[i] + 1]++;
}
}
for (int i = 0; i <= upper; i++) {
sum_s[i] += sum_l[i];
if (i < upper) sum_l[i + 1] += sum_s[i];
}
auto induce = [&](const std::vector<int>& lms) {
std::fill(sa.begin(), sa.end(), -1);
std::vector<int> buf(upper + 1);
std::copy(sum_s.begin(), sum_s.end(), buf.begin());
for (auto d : lms) {
if (d == n) continue;
sa[buf[s[d]]++] = d;
}
std::copy(sum_l.begin(), sum_l.end(), buf.begin());
sa[buf[s[n - 1]]++] = n - 1;
for (int i = 0; i < n; i++) {
int v = sa[i];
if (v >= 1 && !ls[v - 1]) {
sa[buf[s[v - 1]]++] = v - 1;
}
}
std::copy(sum_l.begin(), sum_l.end(), buf.begin());
for (int i = n - 1; i >= 0; i--) {
int v = sa[i];
if (v >= 1 && ls[v - 1]) {
sa[--buf[s[v - 1] + 1]] = v - 1;
}
}
};
std::vector<int> lms_map(n + 1, -1);
int m = 0;
for (int i = 1; i < n; i++) {
if (!ls[i - 1] && ls[i]) {
lms_map[i] = m++;
}
}
std::vector<int> lms;
lms.reserve(m);
for (int i = 1; i < n; i++) {
if (!ls[i - 1] && ls[i]) {
lms.push_back(i);
}
}
induce(lms);
if (m) {
std::vector<int> sorted_lms;
sorted_lms.reserve(m);
for (int v : sa) {
if (lms_map[v] != -1) sorted_lms.push_back(v);
}
std::vector<int> rec_s(m);
int rec_upper = 0;
rec_s[lms_map[sorted_lms[0]]] = 0;
for (int i = 1; i < m; i++) {
int l = sorted_lms[i - 1], r = sorted_lms[i];
int end_l = (lms_map[l] + 1 < m) ? lms[lms_map[l] + 1] : n;
int end_r = (lms_map[r] + 1 < m) ? lms[lms_map[r] + 1] : n;
bool same = true;
if (end_l - l != end_r - r) {
same = false;
} else {
while (l < end_l) {
if (s[l] != s[r]) {
break;
}
l++;
r++;
}
if (l == n || s[l] != s[r]) same = false;
}
if (!same) rec_upper++;
rec_s[lms_map[sorted_lms[i]]] = rec_upper;
}
auto rec_sa =
sa_is<THRESHOLD_NAIVE, THRESHOLD_DOUBLING>(rec_s, rec_upper);
for (int i = 0; i < m; i++) {
sorted_lms[i] = lms[rec_sa[i]];
}
induce(sorted_lms);
}
return sa;
}
} // namespace internal
std::vector<int> suffix_array(const std::vector<int>& s, int upper) {
assert(0 <= upper);
for (int d : s) {
assert(0 <= d && d <= upper);
}
auto sa = internal::sa_is(s, upper);
return sa;
}
template <class T> std::vector<int> suffix_array(const std::vector<T>& s) {
int n = int(s.size());
std::vector<int> idx(n);
iota(idx.begin(), idx.end(), 0);
sort(idx.begin(), idx.end(), [&](int l, int r) { return s[l] < s[r]; });
std::vector<int> s2(n);
int now = 0;
for (int i = 0; i < n; i++) {
if (i && s[idx[i - 1]] != s[idx[i]]) now++;
s2[idx[i]] = now;
}
return internal::sa_is(s2, now);
}
std::vector<int> suffix_array(const std::string& s) {
int n = int(s.size());
std::vector<int> s2(n);
for (int i = 0; i < n; i++) {
s2[i] = s[i];
}
return internal::sa_is(s2, 255);
}
// Reference:
// T. Kasai, G. Lee, H. Arimura, S. Arikawa, and K. Park,
// Linear-Time Longest-Common-Prefix Computation in Suffix Arrays and Its
// Applications
template <class T>
std::vector<int> lcp_array(const std::vector<T>& s,
const std::vector<int>& sa) {
assert(s.size() == sa.size());
int n = int(s.size());
assert(n >= 1);
std::vector<int> rnk(n);
for (int i = 0; i < n; i++) {
assert(0 <= sa[i] && sa[i] < n);
rnk[sa[i]] = i;
}
std::vector<int> lcp(n - 1);
int h = 0;
for (int i = 0; i < n; i++) {
if (h > 0) h--;
if (rnk[i] == 0) continue;
int j = sa[rnk[i] - 1];
for (; j + h < n && i + h < n; h++) {
if (s[j + h] != s[i + h]) break;
}
lcp[rnk[i] - 1] = h;
}
return lcp;
}
std::vector<int> lcp_array(const std::string& s, const std::vector<int>& sa) {
int n = int(s.size());
std::vector<int> s2(n);
for (int i = 0; i < n; i++) {
s2[i] = s[i];
}
return lcp_array(s2, sa);
}
// Reference:
// D. Gusfield,
// Algorithms on Strings, Trees, and Sequences: Computer Science and
// Computational Biology
template <class T> std::vector<int> z_algorithm(const std::vector<T>& s) {
int n = int(s.size());
if (n == 0) return {};
std::vector<int> z(n);
z[0] = 0;
for (int i = 1, j = 0; i < n; i++) {
int& k = z[i];
k = (j + z[j] <= i) ? 0 : std::min(j + z[j] - i, z[i - j]);
while (i + k < n && s[k] == s[i + k]) k++;
if (j + z[j] < i + z[i]) j = i;
}
z[0] = n;
return z;
}
std::vector<int> z_algorithm(const std::string& s) {
int n = int(s.size());
std::vector<int> s2(n);
for (int i = 0; i < n; i++) {
s2[i] = s[i];
}
return z_algorithm(s2);
}
} // namespace atcoder
namespace noya {
/// @brief Suffix array with O(1) suffix LCP queries and lexicographic pattern
/// interval/search over a fixed string.
struct suffix_array_query {
std::string text;
std::vector<int> suffix_array;
std::vector<int> rank;
std::vector<int> logarithm;
std::vector<std::vector<int>> sparse_lcp;
suffix_array_query() = default;
explicit suffix_array_query(std::string value) { build(std::move(value)); }
void build(std::string value) {
text = std::move(value);
suffix_array = atcoder::suffix_array(text);
rank.assign(text.size(), 0);
for (int index = 0; index < int(suffix_array.size()); index++) {
rank[suffix_array[index]] = index;
}
if (text.empty()) {
logarithm.assign(2, 0);
sparse_lcp.clear();
return;
}
std::vector<int> lcp = atcoder::lcp_array(text, suffix_array);
logarithm.assign(lcp.size() + 2, 0);
for (int value = 2; value < int(logarithm.size()); value++) {
logarithm[value] = logarithm[value / 2] + 1;
}
if (!lcp.empty()) {
sparse_lcp.push_back(lcp);
for (int level = 1; (1 << level) <= int(lcp.size()); level++) {
int length = int(lcp.size()) - (1 << level) + 1;
sparse_lcp.emplace_back(length);
for (int index = 0; index < length; index++) {
sparse_lcp[level][index] =
std::min(sparse_lcp[level - 1][index],
sparse_lcp[level - 1][index + (1 << (level - 1))]);
}
}
}
}
int longest_common_prefix(int first, int second) const {
assert(0 <= first && first < int(text.size()));
assert(0 <= second && second < int(text.size()));
if (first == second) {
return int(text.size()) - first;
}
int left = rank[first];
int right = rank[second];
if (left > right) {
std::swap(left, right);
}
int length = right - left;
int level = logarithm[length];
return std::min(sparse_lcp[level][left],
sparse_lcp[level][right - (1 << level)]);
}
/// @brief Return the half-open suffix-array interval whose suffixes start
/// with pattern. Empty pattern matches every nonempty suffix.
std::pair<int, int> interval(std::string_view pattern) const {
auto compare = [&](int suffix, std::string_view value) {
std::size_t length = std::min(value.size(), text.size() - suffix);
int comparison = std::string_view(text)
.substr(suffix, length)
.compare(value.substr(0, length));
if (comparison != 0) {
return comparison;
}
return length == value.size() ? 0 : -1;
};
int left =
int(std::lower_bound(suffix_array.begin(), suffix_array.end(), pattern,
[&](int suffix, std::string_view value) {
return compare(suffix, value) < 0;
}) -
suffix_array.begin());
int right =
int(std::upper_bound(suffix_array.begin(), suffix_array.end(), pattern,
[&](std::string_view value, int suffix) {
return compare(suffix, value) > 0;
}) -
suffix_array.begin());
return {left, right};
}
std::vector<int> occurrences(std::string_view pattern,
bool text_order = true) const {
auto [left, right] = interval(pattern);
std::vector<int> result(suffix_array.begin() + left,
suffix_array.begin() + right);
if (text_order) {
std::sort(result.begin(), result.end());
}
return result;
}
};
} // namespace noya