如何用python抓取小破站数据
这篇文章主要介绍“如何用python抓取小破站数据”,在日常操作中,相信很多人在如何用python抓取小破站数据问题上存在疑惑,小编查阅了各式资料,整理出简单好用的操作方法,希望对大家解答”如何用python抓取小破站数据”的疑惑有所帮助!接下来,请跟着小编一起来学习吧!
概述可以获取的数据包括:
video-视频模块
user-用户模块
dynamic-动态模块
这次用“Running Man”十周年特辑的视频,来做个获取弹幕的Demo。
我是对比没有对比,就没有伤害,就像最近的“哈工大”某学生和“浙大”某学生一样。
这是之前获取弹幕的过程:
1、弹幕数据接口
https://comment.bilibili.com/123072475.xml (一个固定的url地址 + 视频的cid + .xml)
2、利用Request模块,获取数据
3、利用Xpath解析数据
接下来,是时候表演真正的技术了。
经过bilibili_api的封装,弹幕数据获取的部分仅用了一行代码:
danmu=video_info.get_danmaku()
相应的获取视频的基本信息和评论信息也是一样的便捷。
basic_info=video_info.get_video_info()comments=video_info.get_comments()快速开始
接下来,本文将用bilibili_api获取“Running Man”十周年特辑的弹幕数据,并绘制词云。
B站有av号和bv号,改版之后,在链接中直接显示的是bv号,这两个必须提供一个。
bvid是b站新的视频唯一标识符,由12位数字、字母组成,大小写敏感,传入时请包含头部的“BV”
比如:“BV1gC4y1h722”
1)安装过程安装需要依赖request 模块,它是把B站数据的API封装起来了。
通过pip安装即可:
pipinstallbilibili_api
导入模块
frombilibili_apiimportVerifyfrombilibili_api.videoimportVideoInfofrombilibili_api.videoimportDanmaku
VideoInfo类-获取视频的信息(弹幕、评论、投币数量、播放量等)
Danmaku类-弹幕类,用于获取和发送弹幕
Verify 类,可用可不用。部分视频信息需要登录(即需要 SESSDATA )后才能使用(如历史弹幕获取)。
对视频进行点赞、投币等用户操作则需要 SESSDATA 和 csrf 。
2)获取弹幕数据创建VideoInfo对象,传入两个参数:
bvid="BV1gC4y1h722"(视频的BV号)
verify=verify(根据sessdata和csrf,获取弹幕)
获取的弹幕数据为“Danmaku类”的列表,通过遍历,打印它的text即可
贴个代码:
verify=Verify(sessdata="你的",csrf="你的")video_info=VideoInfo(bvid="BV1gC4y1h722",verify=verify)danmu=video_info.get_danmaku()foriindanmu:print(i.text)3)绘制词云
通过jieba分词和WorldCloud绘制词云。
可通过WordCloud对象,传入“背景颜色”,“背景图”,“字体”等参数。
贴个代码:
wc=WordCloud(background_color='white',mask=background_Image,font_path=r'./SourceHanSerifCN-Medium.otf',color_func=random_color_func,random_state=50,)word_cloud=wc.generate(words_str)#产生词云word_cloud.to_file("rm.jpg")#保存图片#显示词云图片plt.imshow(word_cloud)plt.axis('off')plt.show()
到此,关于“如何用python抓取小破站数据”的学习就结束了,希望能够解决大家的疑惑。理论与实践的搭配能更好的帮助大家学习,快去试试吧!若想继续学习更多相关知识,请继续关注亿速云网站,小编会继续努力为大家带来更多实用的文章!
声明:本站所有文章资源内容,如无特殊说明或标注,均为采集网络资源。如若本站内容侵犯了原著者的合法权益,可联系本站删除。