LCS分词扩展与求解子序列算法优化研究

Download PDF
莫若玉,  张秀娟,  杨婷,  朱洲森*

四川师范大学, 物理与电子工程学院, 四川成都 610101

摘     要: 相似度计算作为自然语言处理(Natural Language Processing, NLP)中一项最常见且关键的任务,在查重检测、信息检索等领域有着广泛的应用。为提高文本相似度计算的准确性,在深入分析传统LCS算法的基础上,本文提出一种基于分词与同义词匹配的LCS扩展算法。该算法结合自然语言处理研究的新成果,针对LCS用于文本相似度比较时无法甄别同义词替换等常见的抄袭、套改等手段,以及在求解最长公共子序列时采用的回溯算法时间复杂度高、性能较弱等问题,在分词的基础上通过同义词词林对词语间的相似度进行计算,实现序列间同义词的匹配,达到甄别对原文进行同义词替换等抄袭、套改手段。同时,该算法对求解LCS子序列的传统算法进行改进,通过记录最长公共子序列的字符在每个序列中的关联位置,适当增加空间复杂度,实现共有序列链式标记。实验结果表明,本文提出的LCS扩展算法可以准确识别文本中同义词的替换,文本相似度的计算结果更加准确,同时使求解LCS子序列的时间复杂度由O(2max(m,n))降低至线性级别O(n)。
关 键 词: 最长公共子序列; 动态规划; 中文分词; 同义词匹配; 链式标记
DOI: 10.57237/j.cst.2023.01.006
联系咨询

欢迎添加编辑微信,
了解期刊信息及投稿要求:

微信:18601600891(手机同号)

加入编委会

诚邀优秀学者加入期刊的编委会,共同推动学术成果的传播,并引领科研的发展方向。

加入编委会
成为审稿人

诚邀对审稿工作有浓厚兴趣的学者加入我们的审稿人团队,共同确保期刊的学术质量,展示高水平的科研成果。

成为审稿人