位置:成果数据库 > 期刊 > 期刊详情页
基于树形结构的Web信息抽取
  • ISSN号:1000-5277
  • 期刊名称:《福建师范大学学报:自然科学版》
  • 时间:0
  • 分类:TP311.131[自动化与计算机技术—计算机软件与理论;自动化与计算机技术—计算机科学与技术]
  • 作者机构:[1]福建师范大学数学与计算机科学学院,福建福州350108, [2]厦门大学计算机科学系,福建厦门361005
  • 相关基金:基金项目:国家自然科学基金资助项目(50474033);福建省自然科学基金资助项目(A0310008);福建省重点科技项目(2003H043)
中文摘要:

提出了一种基于树形结构的Web结构化数据抽取算法.该算法基于HTML的树形层次结构,包括HTML树构造算法,数据区域挖掘算法,数据记录挖掘算法以及数据记录模式生成算法.算法引入了页面元素布局位置等信息用于清洗页面,采用层次划分思想实现页面数据区域的挖掘,并通过树匹配生成记录模式,实现最终数据项抽取.实验表明,该方法可以有效地实现Web结构化数据抽取.

英文摘要:

It proposes tree structure based Web data extraction algorithm in view of the inadequacies of the existing methods. The tree structure based algorithm includes: the algorithm of HTML tree construction, the algorithm of data region mining, the algorithm of data record mining, and the algorithm of record schema generation. The algorithm cleans the Web pages using the position information of page elements, mines data region by hierarchical Clustering, and generates record schema finishing data item extraction through tree matching. Experimental results show that our algorithm can-improve the accuracy and efficiency of Web data extraction.

同期刊论文项目
期刊论文 8 会议论文 1 著作 2
同项目期刊论文
期刊信息
  • 《福建师范大学学报:自然科学版》
  • 北大核心期刊(2011版)
  • 主管单位:福建师范大学
  • 主办单位:福建师范大学
  • 主编:余望
  • 地址:福州市福建师范大学旗山校区
  • 邮编:350117
  • 邮箱:linmin@fjnu.edu.cn
  • 电话:0591-22867857
  • 国际标准刊号:ISSN:1000-5277
  • 国内统一刊号:ISSN:35-1074/N
  • 邮发代号:34-43
  • 获奖情况:
  • 福建省优秀科技期刊,全国优秀高校自然科学学报,华东地区优秀期刊
  • 国内外数据库收录:
  • 美国化学文摘(网络版),德国数学文摘,美国剑桥科学文摘,中国中国科技核心期刊,中国北大核心期刊(2004版),中国北大核心期刊(2008版),中国北大核心期刊(2011版),中国北大核心期刊(2014版)
  • 被引量:7294