位置:成果数据库 > 期刊 > 期刊详情页
中文微博情感倾向性分析特征工程
  • ISSN号:0253-2395
  • 期刊名称:《山西大学学报:自然科学版》
  • 时间:0
  • 分类:TP391[自动化与计算机技术—计算机应用技术;自动化与计算机技术—计算机科学与技术]
  • 作者机构:[1]哈尔滨工业大学计算机科学与技术学院信息检索研究中心,黑龙江哈尔滨150001, [2]哈尔滨工业大学机电学院媒体系,黑龙江哈尔滨150001
  • 相关基金:国家自然科学基金重点项目(61133012);国家自然科学青年基金项目(61300113);国家自然科学基金面上项目(61273321)
中文摘要:

情感倾向性分析是情感分析的重要组成部分,是一种按照情感倾向对文本进行分类的任务。微博与传统的评论文本相比更加口语化与符号化,因此对微博进行情感倾向性分析是一个非常有挑战性的任务。基于机器学习的方法是情感倾向性分析最经典的算法,核心是要进行特征的分析和选择,例如词袋特征等。然而,由于中文语言的独特性,前人很多有效的特征都是语言相关的,将其直接用于中文微博效果不佳。在中文微博语料上,还没有学者进行细致的特征工程建设。基于此,文章综合国内外诸多特征,并考虑到中文的独特性,对中文微博的褒贬中倾向性判别特征工程的词、词组、数值和句法特征分别进行了研究,并提出了基于词典规则的情感评分的新特征。最后经过大量实验与分析,得出了可靠的特征组合。实验结果表明,此方法能够明显提高情感倾向性分析的结果。

英文摘要:

Sentiment classification,a basic sentiment analysis task,aims to classify a sentiment sentence into positive,negative and neutral.Sentiment analysis on microblog is challenging,which is different from it on common product reviews,due to the characteristics of microblog.Many previous works used machine learning based approaches to solve this task,the core of which is to try and select useful features,for instance,"bag of words".However,these proposed features may not be suitable for Chinese due to linguistic differences.What is more,there is no feature engineering for Chinese microblog in details.In this paper,we do some feature engineering for Chinese microblog sentiment classification,from words,phrases,numbers,syntactic features,and new feature named dictionary-rule based sentiment score,in order to make a better performance beyond the baseline.At last,we obtain reliable feature set through a large number of experiments and analysis.Our approach significantly improves the results of sentiment classification.

同期刊论文项目
同项目期刊论文
期刊信息
  • 《山西大学学报:自然科学版》
  • 北大核心期刊(2011版)
  • 主管单位:山西省教育厅
  • 主办单位:山西大学
  • 主编:杨斌盛
  • 地址:太原市坞城路92号
  • 邮编:030006
  • 邮箱:xbbjb@sxu.edu.cn
  • 电话:0351-7010455
  • 国际标准刊号:ISSN:0253-2395
  • 国内统一刊号:ISSN:14-1105/N
  • 邮发代号:22-42
  • 获奖情况:
  • 边疆七年获山西省一级期刊荣誉(1993-1999)
  • 国内外数据库收录:
  • 俄罗斯文摘杂志,美国化学文摘(网络版),英国动物学记录,中国中国科技核心期刊,中国北大核心期刊(2004版),中国北大核心期刊(2008版),中国北大核心期刊(2011版),中国北大核心期刊(2014版)
  • 被引量:5651