位置:成果数据库 > 期刊 > 期刊详情页
基于全局搜索和局部分类的特定领域双语网站识别方法
  • ISSN号:0253-2395
  • 期刊名称:《山西大学学报:自然科学版》
  • 时间:0
  • 分类:TP391[自动化与计算机技术—计算机应用技术;自动化与计算机技术—计算机科学与技术]
  • 作者机构:[1]苏州大学计算机科学与技术学院,苏州215006
  • 相关基金:国家自然科学基金(No.61272259;61272260;61373097)
中文摘要:

根据领域性较强的网站往往蕴含大量平行或可比较双语样本这一特点,针对特定领域双语网站的自动识别问题,提出了一种基于全局搜索和局部分类的方法。以电子器件领域为目标,采用全局搜索方法获得该领域双语网站18 944个,随机抽取其中3 000个网站进行人工标注,在标注语料上,采用局部分类方法识别该领域双语网站的性能(F值)达到85.19%。在此基础上,利用识别出的目标领域双语网站中的双语句对,扩充特定领域机器翻译系统的训练集进行实验。实验结果表明,相同测试集下,特定领域机器翻译系统的性能获得显著提升,验证了本文所提出的自动识别特定领域双语网站方法的有效性。

英文摘要:

Based on the phenomena that domain-specific bilingual websites tend to contain large amounts of parallel or comparable bilingual texts,we proposed a novel method for specific-domain bilingual websites identification.The method devotes to identify those websites automatically based on global retrieval and local classification.And it optimizes the identification process from the aspects of recall and precision.We experiment on the domain of electronic devices and obtain a total of 18 944 websites in the process of global retrieval.The local classification is based on 3 000 samples extracted randomly from the obtained websites and annotated manually,which gets a F1-Measure of 85.19%.Additionally,we expand the training set of a specific-domain translation system with bilingual corpus extracted from identified websites and achieve improvements,which verifies the availability of our method.

同期刊论文项目
同项目期刊论文
期刊信息
  • 《山西大学学报:自然科学版》
  • 北大核心期刊(2011版)
  • 主管单位:山西省教育厅
  • 主办单位:山西大学
  • 主编:杨斌盛
  • 地址:太原市坞城路92号
  • 邮编:030006
  • 邮箱:xbbjb@sxu.edu.cn
  • 电话:0351-7010455
  • 国际标准刊号:ISSN:0253-2395
  • 国内统一刊号:ISSN:14-1105/N
  • 邮发代号:22-42
  • 获奖情况:
  • 边疆七年获山西省一级期刊荣誉(1993-1999)
  • 国内外数据库收录:
  • 俄罗斯文摘杂志,美国化学文摘(网络版),英国动物学记录,中国中国科技核心期刊,中国北大核心期刊(2004版),中国北大核心期刊(2008版),中国北大核心期刊(2011版),中国北大核心期刊(2014版)
  • 被引量:5651