东篱科研大数据发现系统（DRDS）

欢迎您！东篱公司退出

申报数据库
1. 申报指南
立项数据库
成果数据库
1. 期刊论文
2. 会议论文
3. 著作
4. 专利
项目获奖数据库

位置：成果数据库 > 期刊 > 期刊详情页

基于类别分布差异和特征熵的维吾尔语文本特征选择

ISSN号：1001-3695
期刊名称：计算机应用研究
时间：2013.10.10
页码：2958-2961
分类：TP391.1[自动化与计算机技术—计算机应用技术;自动化与计算机技术—计算机科学与技术]
作者机构：[1]新疆大学现代教育技术中心,乌鲁木齐830046, [2]新疆大学信息科学与工程学院,乌鲁木齐830046
相关基金：国家自然科学基金资助项目（61063026,61063043,61163028,61262060）
相关项目：维吾尔文不良信息过滤关键技术的研究

作者：阿力木江·艾沙|吐尔根·依布拉音|库尔班·吾布力|瓦依提·阿不力孜|艾山·吾买尔|

关键词：特征选择, 文本分类, 特征熵, 支持向量机, 维吾尔语, feature selection, text categorization , term entropy , SVM , uyghur language

中文摘要：

文本特征选择是在文本自动分类中最重要的一个环节。为了更好地解决维吾尔文文本分类中特征空间的高维性和文档表示向量的稀疏性问题，提出一种基于特征的类别分布差异和信息熵的维吾尔文文本特征选择方法。该方法不仅要考虑特征在类别间的分布情况，而且也要考虑特征在类别内的分布情况。采用本方法对维吾尔文文本语料进行了分类实验，并与一些传统的特征选择方法进行了比较。从结果来看，本方法在所选特征数更少的情况下，达到了比其他方法更高的分类MacroF，值85．3％，比传统的IG和CHI等方法在MacroF，值上分别高出了4．3％和6．1％。

英文摘要：

Text feature selection is the most important phase in automatic text categorization. In order to solve the high dimen- sionality and sparsness of text vector in Uyghur text categorization, this paper proposed the new Uyghur text feature selection method based on class distribution difference and term entropy. The propesed method not only considered the inter-class distri- bution of the term, but also considered the inner-class distribution of the term. It conducted the categorization experiments on the Uyghur text corpus using proposed method and compared with the traditional feature selection methods. The experimental results show that the categorization MacroF, value is reached 85.3% and achieves the improvement of 4.3% and 6. 1% re- spectivly comparing to IG and CHI.

同期刊论文项目

基于短语的维汉统计机器翻译关键技术的研究

期刊论文 25 会议论文 5

维吾尔文命名实体识别关键技术研究

期刊论文 6

维吾尔文不良信息过滤关键技术的研究

期刊论文 13 会议论文 5

维吾尔文手写签名识别与验证的关键技术研究

期刊论文 12 会议论文 8 著作 1

同项目期刊论文

基于决策树算法的 P2P 蠕虫检测模型构建

深度搜索在舆情控制系统中的应用研究

基于条件随机场的维吾尔文组块分析

基于词干提取的维吾尔语事件类时间短语识别

基于简易密写架构的维文反过滤技术研究

《新疆首例网络黑客案》侦查分析

Windows系统取证研究

基于词典和统计相结合的维吾尔语拼写检查方法

细粒度意见挖掘中维吾尔语文本情感分析研究

维吾尔语比较句识别研究

基于决策树算法的P2P蠕虫检测模型构建

基于双层模型的维吾尔语突发事件因果关系抽取

基于多分辨几何特征的维吾尔文脱机签名识别

维吾尔文Bigram文本特征提取

Off-line writer identification based on Uyghur, Kazakh, and Kyrgyz handwriting

Flash-Based Platform for Teaching Stored Program-Controlled SwitchingCourses

Study on the Combined Multi-features based Off-line Uyghur Handwritten Signature Identification

基于维、哈、柯手写样本的笔迹鉴别研究

基于类别分布差异和特征熵的维吾尔文文本特征选择

基于短语的维吾尔文文本分类

高能效的数字信号处理教学：基于Praat的方法（英文）

基于密度特征的维吾尔文离线签名识别

纹理特征加权融合的中亚多文种文档图像文种识别

维吾尔语词法中音变现象的自动还原模型

维吾尔语词法分析的有向图模型

一种哈萨克语句子相似度计算方法的研究

基于SVM的维吾尔文文本分类研究

新疆少数民族语言文字信息处理研究与应用

维吾尔文智能输入法研究

基于机器学习的维吾尔文文本分类研究

基于N元模型的维吾尔语词性标注实验研究

基于条件随机场的维吾尔文组块分析

基于词典和统计相结合的维吾尔语拼写检查方法

维吾尔文-汉文计算机辅助翻译系统中双向翻译记忆子系统的设计与实现

基于WCF的维汉机器翻译系统的设计与实现

维汉/汉维机器翻译译后编辑器的设计与实现

融合奇异性和扩散过程的协同过滤模型

评分可信度条件下的协同过滤模型

细粒度意见挖掘中维吾尔语文本情感分析研究

维吾尔语比较句识别研究

混合策略的汉维辅助翻译系统的设计与实现

汉维时间数字和量词的识别与翻译研究

基于双层模型的维吾尔语突发事件因果关系抽取

混合策略的维吾尔语名词词干提取系统

基于条件随机场的维吾尔文组块分析

基于词典和统计相结合的维吾尔语拼写检查方法

混合策略的汉维辅助翻译系统的设计与实现

汉维时间数字和量词的识别与翻译研究

期刊信息

《计算机应用研究》
北大核心期刊（2011版）

主管单位:四川省科学技术厅
主办单位:四川省计算机研究院
主编：刘营
地址：成都市成科西路3号
邮编：610041
邮箱：arocmag@163.com
电话：028-85210177 85249567

国际标准刊号：ISSN：1001-3695
国内统一刊号：ISSN：51-1196/TP
邮发代号:62-68

获奖情况:
第二届国家期刊奖百种重点科技期刊,国内计算技术类重点核心期刊,国内外著名数据库收录期刊

国内外数据库收录:
俄罗斯文摘杂志,波兰哥白尼索引,英国科学文摘数据库,日本日本科学技术振兴机构数据库,中国中国科技核心期刊,中国北大核心期刊（2004版）,中国北大核心期刊（2008版）,中国北大核心期刊（2011版）,中国北大核心期刊（2014版）,中国北大核心期刊（2000版）

被引量:60049