使用python的requests配合re对微博评论进行获取存储在mysql数据库中 使用pandas库对数据进行分析处理 使用snownlp对文本进行分析 使用echarts.js将分析的数据进行可视化呈现 总体框架使用python 的Django框架
2023-02-24 16:36:53 628KB 爬虫 数据可视化 数据分析 情感分析
1
新浪微博需要登录才能爬取,这里使用m.weibo.cn这个移动端网站即可实现简化操作,用这个访问可以直接得到的微博id。 分析新浪微博的评论获取方式得知,其采用动态加载。所以使用json模块解析json代码 单独编写了字符优化函数,解决微博评论中的嘈杂干扰字符 本函数是用python写网络爬虫的终极目的,所以采用函数化方式编写,方便后期优化和添加各种功能 # -*- coding:gbk -*- import re import requests import json from lxml import html #测试微博4054483400791767 comments=[] def
2023-02-21 11:09:15 47KB python python函数 python实例
1
能够对微博进行爬取,爬取相关的内容及评论。
2022-10-24 20:34:05 1.26MB spider 爬取微博 爬取微博评论 微博
1
选取知微数据平台2022年热点数据前五名 对微博评论区简单的数据爬取
2022-06-08 13:11:29 138KB 数据集
1
利用500万条微博语料对微博评论进行情感分析-附件资源
2022-04-25 20:22:43 106B
1
weibo-comments-word-cloud Generates a Chinese word-cloud with the comments data crawled from WeiBo.  根据微博评论生成词云。 Steps: A crawler that crawles comments from Weibo 一个抓取微博评论的爬虫。 Data Cleaning. 数据清洗。 Generates word cloud. 生成词云。
2022-03-25 15:42:53 59.97MB Python
1
前几天,杨超越编程大赛火了,大家都在报名参加,而我也是其中的一员。 在我们的项目中,我负责的是数据爬取这块,我主要是把对于杨超越 的每一条评论的相关信息。 数据格式:{“name”:评论人姓名,”comment_time”:评论时间,”comment_info”:评论内容,”comment_url”:评论人的主页} 以上就是我们需要的信息。 爬虫前的分析: 以上是杨超越的微博主页,这是我们首先需要获取到的内容。 因为我们需要等到这个主页内这些微博详情页 的链接,但是我们向下刷新,会发现微博的主页信息是ajax动态加载出来的, 这张图片就是我们向下刷新获取到 的新的链接,这个就是我们需要获取
2022-03-18 10:20:31 735KB ajax info python
1
微博评论区代码,模仿微博评论区模块制作,可以发表情包,发文字
1
【Python爬虫实例学习篇】——5、【超详细记录】从爬取微博评论数据(免登陆)到生成词云 个人博客地址:ht/tps://www.asyu17.cn/ 精彩部分提醒: (1)微博评论页详情链接为一个js脚本 (2)获取js脚本链接需要该条微博的mid参数 (3)获取mid参数需要访问微博主页 (4)访问微博主页需要先进行访客认证 (5)微博主页几乎是由弹窗构成,所有html代码被隐藏在FM.view()函数的参数中,该参数是json格式 工具: Python 3.6 requests 库 json 库 lxml 库 urllib 库 jieba 库(进行分词) WordCloud 库(产生词
2021-12-28 01:38:49 3.65MB 学习 数据 爬虫
1
文本情感分析技术鉴于主题模型在文本挖掘领域的优势,基于主题的文本情感分析技术也成为人们关注的热点,其主要任务是通过挖掘用户评论所蕴含的主题、以及对这些主题的情感偏好,来提高文本情感分析的性能。
2021-12-20 23:30:15 20.79MB 内有代码,部分数据,成果图 NLP
1