位置:成果数据库 > 期刊 > 期刊详情页
文本分类中连续属性离散化方法的研究
  • 期刊名称:小型微型计算机系统,2009,30(11),2222-2225,
  • 时间:0
  • 分类:TP18[自动化与计算机技术—控制科学与工程;自动化与计算机技术—控制理论与控制工程]
  • 作者机构:[1]西北大学信息科学与技术学院,陕西西安710069, [2]北京师范大学信息科学与技术学院,北京100875
  • 相关基金:基金项目:国家自然科学基金重点项目(60736008)资助;陕西省教育厅自然科学专项(09JK738)资助.
  • 相关项目:颅面形态学和颅面重构的研究
中文摘要:

针对机器学习领域的一些分类算法不能处理连续属性的问题,提出一种基于词出现和信息增益相结合的多区间连续属性离散化方法.该算法定义了一个离散化过程,离散化了采用传统信息检索的加权技术生成的非二值特征词空间,然后判断原特征空间中每个特征词属于或不属于某给定子区间,将问题转换成二值表示方式,以使得这些分类算法适用于连续属性值.实验结果表明,该算法离散过程简单高效,预测精度高,可理解性强.

英文摘要:

Aiming at the problem that some good algorithm in machine learning cann't deal with continuous attribute, the paper puts forward a method of multi-interval discretization based on term presence and information gain, which defines a diseretization procedure discretizing the non-binary term space produced by classical weighting technique of information retrieval. The problem is then transformed into binary pattern after judging the original terms belong to or not belong to one given sub-intervals so as to make it adaptable to the continuous attribute. The evaluation results show that the method is simple, efficient, precise and understandable as well.

同期刊论文项目
期刊论文 77 会议论文 28 获奖 4 著作 4
同项目期刊论文