位置:成果数据库 > 期刊 > 期刊详情页
一种基于使用差异的词语领域性分析方法
  • 期刊名称:中文信息学报
  • 时间:0
  • 页码:72-78
  • 语言:中文
  • 分类:TP391[自动化与计算机技术—计算机应用技术;自动化与计算机技术—计算机科学与技术]
  • 作者机构:[1]北京大学计算语言学教育部重点实验室,北京100871, [2]山东菏泽学院,山东菏泽274000, [3]香港理工大学计算机系,香港
  • 相关基金:国家自然科学基金资助项目(60603093,60875042);国家973课题资助项目(2004CB318102)
  • 相关项目:应用于面向问题的自动文摘任务的篇章分析关键技术研究
中文摘要:

领域知识的表达形式最终体现在词汇的领域性上,因此对领域词及其部件的领域度分析是一个关键。该文在分词的基础上,对各个领域语料进行分析,利用词语之间的关系,引入链接分析方法分析词语在各个领域中的使用重要性,并通过词语在各个领域中的使用差异性计算其领域度,从而达到领域分析的目的,获取某个领域的领域部件词。该文采用以上方法在军事、娱乐等领域进行了实验,实验结果表明该方法相对于当前常用的tf×idf方法和Bootstrapping方法,可以更有效地进行领域分析获取领域部件词。

英文摘要:

The representation of domain knowledge usually focuses on the domain lexicons, and then domain analysis for terms or term components is a natural task. In this paper, we propose a novel domain analysis method based on the discrepancy of lexical usage. Based on the word segmentation result, we introduce a link analysis method to compute the usage degree of each word for several typical domain corpora. Then through analyzing the discrepancy of the word usage in different domains, we can acquire the domain term component with larger usage discrepancy. This method is experimented on several domains such as military, entertainment and so on, achieving better results than the commonly used tf× idf method and Bootstapping method.

同期刊论文项目
同项目期刊论文