东篱科研大数据发现系统（DRDS）

位置：成果数据库 > 期刊 > 期刊详情页

基于两步策略的中文短文本分类研究

ISSN号：1006-7736
期刊名称：大连海事大学学报
时间：0
页码：121-124
语言：中文
分类：TP18[自动化与计算机技术—控制科学与工程;自动化与计算机技术—控制理论与控制工程]
作者机构：[1]重庆邮电大学计算机科学与技术研究所,重庆400065
相关基金：国家自然科学基金资助项目（60703010）;重庆市自然科学基金资助项目（2006BB2374）;重庆市教委科学技术研究项目（KJ070519）;教育部回国留学人员启动基金资助项目（教外司留[2007]1109号）.
相关项目：基于特征联想的中文短文本分类方法研究

作者：樊兴华|王鹏|

关键词：中文短文本, 文本分类, 两步策略, 朴素贝叶斯(NB), K近邻(KNN), Chinese short-text, text classification, two-steps strategy, naive Bayesian （NB） , k-nearest neighbor （KNN）

中文摘要：

为更好地挖掘文本信息,研究了将两步策略用于中文短文本分类的3个关键问题,提出了基于组合朴素贝叶斯（NB）和K近邻（KNN）分类器的两步中文短文本分类方法：（1）直接利用NB和KNN的输出构造其对应的二维空间,根据该空间内错误文本的分布将测试文本集分为3部分：能被KNN可靠分类的文本集A,不能被KNN可靠分类但能被NB可靠分类的文本集B,其他文本集C.（2）用KNN、NB分别对文本集A和B进行分类,根据训练语料的类别分布,直接给属于文本集C的文本分配标签.与NB、KNN和支持向量机（SVM）的对比实验表明,该方法可获得较高的分类性能.

英文摘要：

Three key issues of classifying Chinese short-text in two-steps were discussed to mine text information effectively, and a method of combining naive Bayesian （NB） with k-nearest neighbor （KNN） classifiers for this task was developed. Firstly, the test text collection was divided into three parts： part-A which could be classified reliably by KNN, part-B which could not be classified reliably by KNN but could be classified reliably by NB and the another part-C. All above was implemented by utilizing the outputs of NB or KNN classifier to construct the corresponding two-dimension space respectively, and thereby making the division according to the distribution of texts misclassified in the space. Then, part-A and part-B was classified respectively by using KNN and NB classifiers, and part-C was assigned directly the labels according to the distribution of categorization in the training data. The experimental results show that the proposed method achieves high performance comparing with KNN, NB and support vector machine （SVM）.

同期刊论文项目

基于特征联想的中文短文本分类方法研究

期刊论文 18 会议论文 8 专利 1

同项目期刊论文

中文文本分类的两步特征选择法

混合统计模型与规则相结合的中文命名实体识别

Utilizing High-quality Feature Extension Mode to Classify Chinese Short-text

一种基于聚类的主题模型短文本分类方法

一种改进的贝叶斯网络短文本分类算法

中文文本分类中利用依存关系的实验研究

利用上下位关系的中文短文本分类

A Link Strength based Language Model for Chinese Short-text Categorization

Utilizing the Relations between Entities to Recognize Organization Name in Chinese Short-text

Link Distribution Dependency Model for Document Retrival

基于领域词语本体的短文本分类

一种新的词语相似度计算方法

面向短文本的命名实体识别

一种基于特征扩展的中文短文本分类方法

一种改进的增量贝叶斯分类算法

影响力扩散概率模型及其用于意见领袖发现研究

一种基于扩展的两步文本倾向性分析方法

期刊信息

《大连海事大学学报：自然科学版》
北大核心期刊（2011版）

主管单位:交通部
主办单位:大连海事大学
主编：孙玉清
地址：大连凌海路1号
邮编：116026
邮箱：xuebao@dlmu.edu.cn
电话：0411-84727810

国际标准刊号：ISSN：1006-7736
国内统一刊号：ISSN：21-1360/U
邮发代号:

获奖情况:

国内外数据库收录:
俄罗斯文摘杂志,美国化学文摘（网络版）,波兰哥白尼索引,荷兰文摘与引文数据库,美国剑桥科学文摘,日本日本科学技术振兴机构数据库,中国中国科技核心期刊,中国北大核心期刊（2004版）,中国北大核心期刊（2008版）,中国北大核心期刊（2011版）,中国北大核心期刊（2014版）,中国北大核心期刊（2000版）

被引量:6141