位置:成果数据库 > 期刊 > 期刊详情页
Tag—TextRank:一种基于Tag的网页关键词抽取方法
  • ISSN号:1000-1239
  • 期刊名称:《计算机研究与发展》
  • 分类:TP391[自动化与计算机技术—计算机应用技术;自动化与计算机技术—计算机科学与技术]
  • 作者机构:[1]中国科学院计算技术研究所,北京100190, [2]中国科学院研究生院,北京100049
  • 相关基金:国家自然科学基金资助项目(60873166);国家973资助项目(2007CB311103);国家863计划资助项目(2006AA010105);教育部科学技术研究重点资助项目(109028)
中文摘要:

针对搜索引擎查询结果缓存与预取问题,与传统的基于查询特性相关的方法不同,提出了一种基于用户特性的缓存与预取方法,用于提高搜索引擎系统性能,尤其针对部分用户效果更显著。通过对国内某著名商业搜索引擎用户的查询贡献分析得出,用户对搜索引擎的贡献具有长尾分布特性,结合该特性设计查询结果预测模型来进行预取和分区缓存。在该搜索引擎两个月的大规模真实用户查询日志上的实验结果表明,与传统的基于查询特性的典型方法相比,该方法可以获得3.03%~4.17%的命中率提升,对于查询贡献最大的0.25%的用户群体,可以获得20.52%~28.2%的命中率提升。

英文摘要:

Query results caching and prefetching are crucial to the efficiency of Web search engines. This paper presents a novel approach tailored for query results caching and prefetching based on the user characteristics. We describe an analysis of query logs originated from a famous Web search engine, and design a query results prediction model for prefetching and to partition the cache exploiting the characteristics of the users. We then use a real large scale query logs of 2-months to evaluate the approach, in contrast to the traditional methods and theoretical upper bounds. Experimental results show that this approach can achieve 3.03% to 4.17% increase for all requests as compared with state-of-the-art methods, and 20.52% to 28.2% increase for requests from the special users group who contributes most to Web search engines.

同期刊论文项目
期刊论文 8 会议论文 14
期刊论文 4 会议论文 8 专利 1
同项目期刊论文
期刊信息
  • 《计算机研究与发展》
  • 中国科技核心期刊
  • 主管单位:中国科学院
  • 主办单位:中国科学院计算技术研究所
  • 主编:徐志伟
  • 地址:北京市科学院南路6号中科院计算所
  • 邮编:100190
  • 邮箱:crad@ict.ac.cn
  • 电话:010-62620696 62600350
  • 国际标准刊号:ISSN:1000-1239
  • 国内统一刊号:ISSN:11-1777/TP
  • 邮发代号:2-654
  • 获奖情况:
  • 2001-2007百种中国杰出学术期刊,2008中国精品科...,中国期刊方阵“双效”期刊
  • 国内外数据库收录:
  • 俄罗斯文摘杂志,荷兰文摘与引文数据库,美国工程索引,日本日本科学技术振兴机构数据库,中国中国科技核心期刊,中国北大核心期刊(2004版),中国北大核心期刊(2008版),中国北大核心期刊(2011版),中国北大核心期刊(2014版),中国北大核心期刊(2000版)
  • 被引量:40349