计算机工程与应用 ›› 2012, Vol. 48 ›› Issue (30): 151-156.
段晓丽1,王 宇1,谷 静2,刘玮楠1
DUAN Xiaoli1, WANG Yu1, GU Jing2, LIU Weinan1
摘要: Web正文信息抽取是信息检索、文本挖掘等Web信息处理工作的基础。在统计分析了主题网页的正文特征及结构特征的基础上,提出了一种结合网页正文信息特征及HTML标签特点的主题网页正文信息抽取方法。在将Web页面解析成DOM树的基础上,根据页面DOM树结构获取正文信息块,分析正文信息块块内噪音信息的特点,去除块内噪音信息。实验证明,这种方法具有很好的准确率及召回率。