位置:成果数据库 > 期刊 > 期刊详情页
基于弱监督学习的主页人物属性抽取方法
  • ISSN号:0253-2395
  • 期刊名称:《山西大学学报:自然科学版》
  • 时间:0
  • 分类:TP391[自动化与计算机技术—计算机应用技术;自动化与计算机技术—计算机科学与技术]
  • 作者机构:[1]中国科学院计算技术研究所,北京100190, [2]中国科学院大学计算机与控制学院,北京100190
  • 相关基金:国家863计划课题(2014AA015204); 国家科技支撑计划课题(2012BAH46B04); 国家自然科学基金(61303244)
中文摘要:

提出了一种基于弱监督学习的主页人物属性抽取方法,首先根据领域模式从个人主页中提取出人物属性的前导词,接着通过前导词获取人物属性作为初始的属性种子,在这些属性种子中提取属性的模式,并结合分类和bootstrapping方法不断迭代抽取出无前导词的人物属性。在整个抽取过程中,只需要少量的人工标注。在英文机构网站上的人物属性抽取对比实验结果表明,该方法较属性分类抽取方法在准确率上提高了7.8%,召回率上提高了7.5%。

英文摘要:

The approach to extract person attributes based on a weakly supervised learning method was introduced.Firstly,we extract the leading words of person attributes from homepages according to domain pattern;secondly,we extract person attributes with leading word and take them as the initial seed to extract attribute patterns;finally,we combine the classification and bootstrapping methods to extract attributes without leading word iteratively.It only requires a small amount of manual annotation throughout the whole extraction process.The experiment results showed that our method improve precision of 7.8% and recall rate increased by 7.5% compared with the method of classifying attributes in the English agency websites extraction.

同期刊论文项目
同项目期刊论文
期刊信息
  • 《山西大学学报:自然科学版》
  • 北大核心期刊(2011版)
  • 主管单位:山西省教育厅
  • 主办单位:山西大学
  • 主编:杨斌盛
  • 地址:太原市坞城路92号
  • 邮编:030006
  • 邮箱:xbbjb@sxu.edu.cn
  • 电话:0351-7010455
  • 国际标准刊号:ISSN:0253-2395
  • 国内统一刊号:ISSN:14-1105/N
  • 邮发代号:22-42
  • 获奖情况:
  • 边疆七年获山西省一级期刊荣誉(1993-1999)
  • 国内外数据库收录:
  • 俄罗斯文摘杂志,美国化学文摘(网络版),英国动物学记录,中国中国科技核心期刊,中国北大核心期刊(2004版),中国北大核心期刊(2008版),中国北大核心期刊(2011版),中国北大核心期刊(2014版)
  • 被引量:5651