位置:成果数据库 > 期刊 > 期刊详情页
基于语义的文本特征加权分类算法
  • ISSN号:1001-3695
  • 期刊名称:计算机应用研究
  • 时间:2012
  • 页码:4476-4478
  • 分类:TP391[自动化与计算机技术—计算机应用技术;自动化与计算机技术—计算机科学与技术]
  • 作者机构:[1]山东师范大学信息科学与工程学院,济南250014, [2]山东省分布式计算机软件新技术重点实验室,济南250014
  • 相关基金:国家自然科学基金资助项目(61170145); 国家教育部高等学校博士点专项基金资助项目(20113704110001); 山东省自然科学基金资助项目和科技攻关计划项目(ZR2010FM021,2008B0026,2010G0020115)
  • 相关项目:基于特征建模优化与判别学习的Web spam识别技术研究
中文摘要:

文本分类存在维数灾难、数据集噪声及特征词对分类贡献不同等问题,影响文本分类精度。为提高文本分类精度,在数据处理方面提出一种新方法。该方法首先对数据集进行去噪处理,结合特征提取算法和语义分析方法对数据实现降维,再利用词语语义相关度对文本特征向量中每个特征词赋予不同权重;并利用经过上述处理的文本数据学习分类器。实验结果表明,该文本处理方法能够有效提高文本分类精度。

英文摘要:

Text categorization faces the problems of dimensionality curse,noise data and different classification contributions for different feature words.In order to improve text classification accuracy,this paper presented a new approach to data processing.The approach first removed the noise data,and then employed feature extraction algorithms and semantic analysis methods to implement dimensionality reduction.Different weights were assigned to different text features based on a semantic similarity evaluation.The processed data were used to construct classifiers.Experimental results show that the text processing method can effectively improve the accuracy of text classification.

同期刊论文项目
同项目期刊论文
期刊信息
  • 《计算机应用研究》
  • 北大核心期刊(2011版)
  • 主管单位:四川省科学技术厅
  • 主办单位:四川省计算机研究院
  • 主编:刘营
  • 地址:成都市成科西路3号
  • 邮编:610041
  • 邮箱:arocmag@163.com
  • 电话:028-85210177 85249567
  • 国际标准刊号:ISSN:1001-3695
  • 国内统一刊号:ISSN:51-1196/TP
  • 邮发代号:62-68
  • 获奖情况:
  • 第二届国家期刊奖百种重点科技期刊,国内计算技术类重点核心期刊,国内外著名数据库收录期刊
  • 国内外数据库收录:
  • 俄罗斯文摘杂志,波兰哥白尼索引,英国科学文摘数据库,日本日本科学技术振兴机构数据库,中国中国科技核心期刊,中国北大核心期刊(2004版),中国北大核心期刊(2008版),中国北大核心期刊(2011版),中国北大核心期刊(2014版),中国北大核心期刊(2000版)
  • 被引量:60049