基于hadoop对某网站日志分析部署实践课程设计报告参考模板.doc

文档资料 hadoop 大数据分布式

基于Hadoop部署实践对网站日志分析 1. 项目概述本次要实践的数据日志来源于国内某技术学习论坛，该论坛由某培训机构主办，汇聚了众多技术学习者，每天都有人发帖、回帖。至此，我们通过Python网络爬虫手段进行数据抓取，将我们网站数据（2013-05-30,2013-05-31）保存为两个日志文件，由于文件大小超出我们一般的分析工具处理的范围，故借助Hadoop来完成本次的实践。 2. 总体设计 2.1 Hadoop插件安装及部署第一步：Hadoop环境部署和源数据准备安装好VMware（查看）第二步：使用python开发的mapper reducer进行数据处理。第三步：创建hive数据库，将处理的数据导入hive数据库第四步：将分析数据导入mysql 3. 详细实现步骤操作纪要 3.1 hadoop环境准备首先开启Hadoop集群：start-all.sh：开启所有的Hadoop所有进程，在主节点上进行 NameNode它是Hadoop 中的主服务器，管理文件系统名称空间和对集群中存储的文件的访问。 Secondary NameNode.....

文件下载

评论信息

其他资源

免责申明

【只为小站】的资源来自网友分享，仅供学习研究，请务必在下载后24小时内给予删除，不得用于其他任何用途，否则后果自负。基于互联网的特殊性，【只为小站】无法对用户传输的作品、信息、内容的权属或合法性、合规性、真实性、科学性、完整权、有效性等进行实质审查；无论【只为小站】经营者是否已进行审查，用户均应自行承担因其传输的作品、信息、内容而可能或已经产生的侵权或权属纠纷等法律责任。
本站所有资源不代表本站的观点或立场，基于网友分享，根据中国法律《信息网络传播权保护条例》第二十二条之规定，若资源存在侵权或相关问题请联系本站客服人员，zhiweidada#qq.com，请把#换成@，本站将给予最大的支持与配合，做到及时反馈和处理。关于更多版权及免责申明参见版权及免责申明

基于hadoop对某网站日志分析部署实践课程设计报告参考模板.doc

文件下载

评论信息

其他资源

免责申明

个人信息

相关资源标签

热门下载

最新下载