位置:成果数据库 > 期刊 > 期刊详情页
中文网页信息检索测试集的构建、分析及应用
  • ISSN号:1003-0077
  • 期刊名称:《中文信息学报》
  • 时间:0
  • 分类:TP391[自动化与计算机技术—计算机应用技术;自动化与计算机技术—计算机科学与技术]
  • 作者机构:[1]北京大学,北京100871
  • 相关基金:国家自然科学基金资助项目(60435020,60603056);国家863计划资助项目(2006AA012196)
中文摘要:

随着WWW的迅速发展,Web信息检索技术成为研究者广泛关注的话题,但缺少合适的测试评测机制制约了中文网页信息检索技术的发展。参考国外测试集的构建经验,我们构建了大规模中文网页信息检索测试集CWT,并组织了SEWM中文网页检索评测,希望在国内外各个研究小组的共同参与下建立并完善CWT,一起推动中文网页信息检索技术的发展。本文在调研和分析国内外现有研究进展的基础上,详细介绍了CWT的构建原则和方法,并对CWT进行了有效的统计分析和实验研究。本文提出的构建测试集的方法为以后的研究提供了参考。

英文摘要:

With the rapid development of World Wide Web, Web information retrieval (IR) has been a hot research topic, but the research has been restricted by the lack of appropriate test collections. According to the framework of existing foreign test collections, we constructed large-scale Chinese Web Test collections (CWT), and organized SEWM Chinese Web search evaluation. Based on the investigation and analysis of current research, the details in constructing each component are introduced, and effective statistical analysis and experiments are carried through. The methodology used in engineering CWT should be readily applicable to the construction of future Web corpora.

同期刊论文项目
期刊论文 7 会议论文 2
同项目期刊论文
期刊信息
  • 《中文信息学报》
  • 北大核心期刊(2011版)
  • 主管单位:中国科学技术协会
  • 主办单位:中国中文信息学会 中国科学院软件研究所
  • 主编:孙茂松
  • 地址:北京海淀中关村南四街4号中科院软件所
  • 邮编:100190
  • 邮箱:jcip@iscas.ac.cn
  • 电话:010-62562916
  • 国际标准刊号:ISSN:1003-0077
  • 国内统一刊号:ISSN:11-2325/N
  • 邮发代号:
  • 获奖情况:
  • 国内外数据库收录:
  • 日本日本科学技术振兴机构数据库,中国中国科技核心期刊,中国北大核心期刊(2004版),中国北大核心期刊(2008版),中国北大核心期刊(2011版),中国北大核心期刊(2014版),中国北大核心期刊(2000版)
  • 被引量:9136