近似字符串匹配的新索引方法
1. 引言
近似字符串匹配是计算机科学中多个领域的重要问题,尤其在文本搜索、计算生物学、模式识别和信号处理等领域应用广泛。该问题描述如下:给定一个长度为n的文本和一个较短的模式,长度为m,检索所有与该模式的编辑距离至多为k的文本片段(或称为“出现”)。编辑距离定义为使两个字符串相等所需的最小字符插入、删除和替换的数量。我们将“错误级别”定义为α=k/m。
在问题的在线版本中,可以对模式进行预处理,但文本不可预处理。经典的解法使用动态规划,时间复杂度为O(mn)。近年来,许多算法对此进行了改进。然而,当文本量非常大时,即使是最快的在线算法也显得不切实际,因此对文本进行预处理变得必要。
2. 新索引方法概述
Gonzalo Navarro 和 Ricardo Baeza-Yates 提出了一种新的索引方法,该方法结合了后缀树和模式划分技术,用于解决近似字符串匹配问题。该方法的检索时间复杂度为O(nλ),其中0 < λ < 1,且当误差水平α < 1 - e/√σ时有效(α是容许的误差水平,σ是字母表大小)。
2.1 后缀树与模式划分
后缀树是一种强大的数据结构,用于高效处理字符串匹配问题。通过将模式划分为多个子模式并在后缀树中查找,可以显著减少搜索范围。具体步骤如下:
- 构建文本的后缀树。
- 将模式划分为多个子模式。
- 在后缀树中查找每个子模式,允许一定数量的错误。
- 合并所有子模式的匹配结果,验证完整的模式匹配。
超级会员免费看
订阅专栏 解锁全文

1988

被折叠的 条评论
为什么被折叠?



