东篱科研大数据发现系统（DRDS）

欢迎您！东篱公司退出

申报数据库
1. 申报指南
立项数据库
成果数据库
1. 期刊论文
2. 会议论文
3. 著作
4. 专利
项目获奖数据库

位置：成果数据库 > 期刊 > 期刊详情页

基于词向量和EMD距离的短文本聚类

ISSN号：1671-9352
期刊名称：《山东大学学报：理学版》
时间：0
分类：TP391.1[自动化与计算机技术—计算机应用技术;自动化与计算机技术—计算机科学与技术]
作者机构：大连理工大学信息检索研究室,辽宁大连116023
相关基金：国家自然科学基金资助项目（61572102,61602078,61562080）;国家高技术研究发展计划（863）资助项目（2006AA012151）;辽宁省自然科学基金资助项目（201202031,2014020003）;教育部留学回国人员科研启动基金和高等学校博士学科点专项科研基金资助课题（20090041110002）;中央高校基本科研业务费专项资金资助

作者：黄栋, 徐博, 许侃, 林鸿飞, 杨志豪

关键词：短文本, EMD距离, 词向量, 相似度计算, 聚类, short text, earth mover＇s distance, word embeddings, similarity calculation, clustering

中文摘要：

短文本聚类在数据挖掘中发挥着重要的作用，传统的短文本聚类模型存在维度高、数据稀疏和缺乏语义信息等问题，针对互联网短文本特征稀疏、语义存在奇异性和动态性而导致的短文本聚类性能较差的问题，提出了一种基于特征词向量的文本表示和基于特征词移动距离的短文本聚类算法。首先使用Skip—gram模型（Continuous Skipgram Model）在大规模语料中韧I练得到表示特征词语义的词向量；然后利用欧式距离计算特征词相似度，引入EMD（Earth Mover，SDistance）来计算短文本间的相似度；最后将其应用到Kmeans聚类算法中实现短文本聚类。在3个数据集上进行的评测结果表明，效果优于传统的聚类算法。

英文摘要：

Short text clustering plays an important role in data mining. The traditional short text clustering model has some problems, such as high dimensionality,sparse data and lack of semantic information. To overcome the shortcomings of short text clustering caused by sparse features ,semantic ambiguity ,dynamics and other reasons, this paper presents a feature based on the word embeddings representation of text and short text clustering algorithm based on the moving distance of the characteristic words. Initially, the word embeddings that represents semantics of the feature word was gained through training in large-scale corpus with the Continous Skip-gram Model. Furthermore, use the Euclidean distance calculation feature word similarity. Additionally, EMD （Earth Mover＇s Distance） was used to calculate the similarity between the short text. Finally, apply the similarity between the short text to Kmeans clustering algorithm implemented in the short text clustering. The evaluation results on three data sets show that the effect of this method is superi- or to traditional clustering algorithms.

同期刊论文项目

基于排序学习和深度学习的专利检索研究

期刊论文 2

　基于认知语境的文本情感计算模型

期刊论文 36

新疆暴恐事件国际舆论倾向性分析

期刊论文 9

面向社交网络的药物不良反应的隐含知识发现

期刊论文 11

同项目期刊论文

基于似然损失函数的组样本排序学习方法

基于神经网络的微生物生长环境关系抽取方法

基于示例语义的音乐检索模型

基于情感常识的微博事件公众情感趋势预测

面向迁移学习的文本特征对齐算法

幽默计算及其应用研究

基于情感距离和领域自适应的评论者声誉度

微信息进程与流量检测指令分布下的倾向性检测模型

微博社交网络的用户影响力评价方法

基于混合模型的生物事件触发词检测

基于神经网络的微生物生长环境关系抽取方法

基于似然损失函数的组样本排序学习方法

面向迁移学习的文本特征对齐算法

幽默计算及其应用研究

基于情感距离和领域自适应的评论者声誉度

基于社会化标注和网页分类的个性化检索方法

面向序列迁移学习的似然比模型选择方法

利用源域结构的粒迁移学习及词性标注应用

微博社交网络的用户影响力评价方法

基于产品属性的条件句倾向性分析

评论挖掘中产品属性归类问题研究

文本中人物性别识别研究

日本地震的微博热点事件分析

基于SimRank的跨领域情感倾向性分析算法研究

基于情感分布的微博热点事件发现

一种基于社会化标注的网页检索方法

基于LDA模型的餐馆评论排序

融合字特征的平滑最大熵模型消解交集型歧义

基于权重标准化SimRank方法的查询扩展技术研究

基于LDA模型的博客垃圾评论发现

基于语义资源的生物医学文献知识发现

基于项目和标签的随机游走个性化信息推荐模型

基于神经网络的Listwise排序学习方法的研究

基于文献的知识发现：一个面向H1N1的研究

基于用户信息平滑聚类的协同推荐方法

语言模型在信息检索中的应用

一种基于位置优化的排序学习方法

基于实体关系的犯罪网络识别机制

基于词向量的情感新词发现方法

追踪事件微博报道：一种流的动态话题模型

自然语言处理技术在网络案情分析系统中的应用

文本挖掘技术在互联网赌博案情分析中的应用

基于加权SimRank的跨领域文本情感倾向性分析

基于特征耦合泛化的药名实体识别

基于卷积神经网络的微博情感倾向性分析

基于类别参与度的社区问答专家发现方法

基于改进潜在语义分析的跨语言检索

基于语境歧义词的句子情感倾向性分析

基于网页查询结果的广告查询扩展研究

一种基于社会化标注的查询扩展方法

基于情感向量空间模型的歌曲情感标签预测模型

维基百科中争议性文章的发现方法研究

一种基于主题类别信息问句检索的新方法

微博社交网络的用户影响力评价方法

期刊信息

《山东大学学报：理学版》
北大核心期刊（2011版）

主管单位:中华人民共和国教育部
主办单位:山东大学
主编：刘建亚
地址：济南市经十路17923号
邮编：250061
邮箱：xblxb@sdu.edu.cn
电话：0531-88396917

国际标准刊号：ISSN：1671-9352
国内统一刊号：ISSN：37-1389/N
邮发代号:24-222

获奖情况:

国内外数据库收录:
美国化学文摘（网络版）,美国数学评论（网络版）,波兰哥白尼索引,德国数学文摘,中国中国科技核心期刊,中国北大核心期刊（2008版）,中国北大核心期刊（2011版）,中国北大核心期刊（2014版）,英国英国皇家化学学会文摘

被引量:6243