位置:成果数据库 > 期刊 > 期刊详情页
一种新的英文文本检索算法
  • ISSN号:1002-8331
  • 期刊名称:《计算机工程与应用》
  • 时间:0
  • 分类:TP391.4[自动化与计算机技术—计算机应用技术;自动化与计算机技术—计算机科学与技术]
  • 作者机构:[1]乐山师范学院数学系,四川乐山614000
  • 相关基金:国家自然科学基金No.10571127; 四川省教育厅科研项目(No.09ZB026)
作者: 高仕龙[1]
中文摘要:

提出一种新的英文文本检索算法,该算法将英文文本映射为26阶频率矩阵,然后通过奇异值分解,对文本表示空间进行降维处理,并融合第一奇异值分量和第二奇异值分量的特征,得到既反映字母统计频率,又反映文本字符间顺序结构的复特征向量,最后利用向量间余弦相似度作为文本检索的相似度度量。数据对比表明,算法取得了较好的实验效果,且在检索准确率和运算效率上优于经典的LSA算法。

英文摘要:

In this paper,a new retrieval algorithm for English texts is proposed.First of all,the English texts are mapped into frequency matrixes of order 26 and the dimensions of texts representation space are reduced through singular value decomposition.Second,it fuses the features of the first singular value component and the second one,and then gets the complex feature vectors which reflect not only the statistic frequency but also the sequential structure of letters.In the end,the cosine similarity of texts is used to measure the similarity between the query and documents.The data comparison indicates that this algorithm has well experimental results.Moreover,it gets the advantage over the classic LSA retrieval algorithm in precision and operational efficiency.

同期刊论文项目
同项目期刊论文
期刊信息
  • 《计算机工程与应用》
  • 北大核心期刊(2014版)
  • 主管单位:中国电子科技集团公司
  • 主办单位:华北计算技术研究所
  • 主编:怀进鹏
  • 地址:北京市海淀区北四环中路211号北京619信箱26分箱
  • 邮编:100083
  • 邮箱:ceaj@vip.163.com
  • 电话:
  • 国际标准刊号:ISSN:1002-8331
  • 国内统一刊号:ISSN:11-2127/TP
  • 邮发代号:82-605
  • 获奖情况:
  • 1. 2012年首批获得中国学术文献评价中心发布的 “...,2. 2001年获得新闻出版署“中国期刊方阵双效期刊”,3. 2008年首批入选国家科技部“中国精品科技期刊...,4.2003年-2011年连续获得工业和信息化部期刊最高...
  • 国内外数据库收录:
  • 俄罗斯文摘杂志,波兰哥白尼索引,美国剑桥科学文摘,英国科学文摘数据库,日本日本科学技术振兴机构数据库,中国中国科技核心期刊,中国北大核心期刊(2004版),中国北大核心期刊(2008版),中国北大核心期刊(2014版),中国北大核心期刊(2000版)
  • 被引量:97887