上传者: 27595745
|
上传时间: 2021-08-08 13:07:20
|
文件大小: 741KB
|
文件类型: PDF
13.1 应用场景
舆情分析、企业竞争对手分析
互联网专业信息收集
…
13.2 学习目标
在学习完本章后,您应能够:
解释什么是web挖掘、如何使用web挖掘,以及使用web挖掘有哪些好处。
识别web挖掘可能采取的各种格式,以便进行web挖掘。
连接至web url,并将其导入为web挖掘模型的数据来源。
在 RapidMiner 中开发一个web挖掘模型
对web挖掘结果进行信息抽取、转储。
13.3 概览
本章介绍web挖掘。由于大部分交流信息多数出现在互联网上,且以文本格式保存,web挖掘是挖掘中的一个重要领域。我们将建立一个RapidMiner挖掘流程,来学习如何通过连接到生物医学期刊网站,获取蛋白质相关论文的web数据,从中找到用户关心的某些信息内容:某蛋白质近年来论文发表数量趋势,及该蛋白质论文的作者、联系邮箱、通讯地址等信息(对于蛋白质生产厂商,他一定关心如何找到这些信息进行广告投放)。我们会利用web挖掘技术、结合文本挖掘技术,把这些信息从互联网上获取存储到本地磁盘,然后利用web挖掘、文本挖掘技术对这些信息进行拆分解析,将有用信息存储到mysql数据库中。
以下为我们主要执行的挖掘步骤:
– 安装web挖掘插件
– 加载网站url到 RapidMiner web挖掘算子中
– 获取并保存web页面到本地磁盘