python弹幕拼脸_完全小白篇-用python爬取B站弹幕(非彩色弹幕以及尝试生成词云图)...

本文主要是介绍python弹幕拼脸_完全小白篇-用python爬取B站弹幕(非彩色弹幕以及尝试生成词云图)...,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

目标

爬取B站弹幕(今天是2020/8/31,最近的时间点以下方法肯定行得通)

分析网页

关于B站的弹幕,其实一个系列视频的所有弹幕是可以在其中任何一集视频就能得到的,所以这篇文章的目的并不完全算是python教程,而只是告诉大家怎么找弹幕在哪以及生成词云图。

以“小甲鱼”的python教程系列为例,我们选择打开网页源代码:

2dd053723ef1b6fed9c9ba9e470b433c.png

d21991c2022280c4fe43f357b54d6187.png

我们再根据cid号打开https://api.bilibili.com/x/v1/dm/list.so?oid=6534573(这是随便挑的一个cid对应的号,验证一下弹幕到底在不在那)

67033e11a0c5f79b71d3cb155e98fd2a.png

事实上,所有弹幕都是从b站后台另一个网页加载到当前集数的视频中的。我们看这些cid号,每个cid后都有对应的一个编号。上图是p=4第四集的网页源代码,可以发现cid这一块根本不会随着p号改变而改变,所以只需要把这一部分所有有效cid获取到就可以了。

import requests

from bs4 import BeautifulSoup

import re

import json

import os

def getHtml(baseurl):

head = { #模拟浏览器身份头向对方发送消息

"user-agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.56 (KHTML, like Gecko) Chrome/83.0.4103.116 Safari/537.56"

}

try:

response = requests.get(url = baseurl, headers = head)

if response.status_code==200:

return response.content.decode("utf-8")

except:

print("请求失败")

def main():

print("这是bv号弹幕获取软件")

bv = input("请输入bv号: ")

p = int(input("请输入p号: "))

baseurl = "https://www.bilibili.com/video/BV"+str(bv)+"?p="+str(p)

# 获取网页的源代码

req=getHtml(baseurl)

# cid所在的位置是window.__INITIAL_STATE__={}里面,所以要在这里找各个cid号

pattern = r'\'

# result结果得是string

result = re.findall(pattern, req)[0]

match_rule = r'{"cid":(.*?),'

cid = re.findall(match_rule, result)

# 打开弹幕资源位置

baseurl = "https://api.bilibili.com/x/v1/dm/list.so?oid="+str(cid[p-1])

req = getHtml(baseurl)

soup = BeautifulSoup(req,'html.parser')

match_rule = r'(.*?)'

cid = ""

for item in soup.find_all('d'):

item = str(item)

danmu = re.findall(match_rule, item)[0]

cid = cid + danmu + " "

print(cid)

os.system("pause")

if __name__ == "__main__":

main()

1e9cf494d0c912efc1341475035e6d38.png

那么,本集视频的所有弹幕的内容就如上啦~

顶部、底部彩色弹幕的获取目前还不是很懂,但是一般采集数据的话都是采集浮动无色弹幕吧,希望对大家有帮助。

另外嘞,如果不想通过网页源代码里找cid的话,也可以通过特殊的request直接获取这些cid。网页视频开始播放的时候,B站的方法是发一个叫pagelist的数据包,如下图:

28aa34c2cd56be8d17acf555b4cf2d01.png我们可以看到response就是这些cid,所以模仿浏览器写一个和它一模一样的header就可以访问它啦!这一点就不多赘述了

词云图

词云图的生成方法简直不要太多,python的扩展性确实是十分丰富!

为了生成词云图,

from matplotlib import pyplot as plt

from wordcloud import WordCloud,ImageColorGenerator

from PIL import Image

import numpy as np

def getWordCloud(text):

# 打开图片文件的路径,并利用机器学习

# numpy分析的话是对一张图片每一块像素的[R,G,B]值进行记录的,到时候生成词云的颜色就由它的分析结果完成

path_img = "./ciyun.jpg"

background_img = np.array(Image.open(path_img))

print("打开成功")

wc = WordCloud(

# 设置词云的字体

font_path="./FZZJ-YZDKJW.TTF",

width=800,

height = 900,

min_font_size = 10,

background_color = "white",

mask=background_img

).generate(text)

image_colors = ImageColorGenerator(background_img)

# 有这几句话的话可以在exe直接打开预览查看

plt.imshow(wc.recolor(color_func=image_colors), interpolation="bilinear")

plt.axis("off")

plt.show()

# 保存成图片

wc.to_file("shuchu.jpg")

这里用到的库有matplotlib、wordcloud、PIL以及numpy。所有句子的具体含义见上:

运行结果:

0f0e8b9c6a0afb39804837caf329d74c.png

其他的词云库网上有,这里不全介绍了。一般都是用jieba库进行分词的,不过试了试jieba,发现它其实还是针对文件里没有空格间隔的信息比较好用(但是分词结果还是美到不忍直视)。对于获取的弹幕数据我们其实完全也可以存储到sqlite之类的数据库进行记录。总之,词云也好,数据库、柱状图也好,python记录和展示数据的方式多种多样!

其他类视频弹幕的获取

bv号算是普通视频。其实就算是番剧、电影,也是一样的道理,只要有网页源代码就一切ok。大会员特权的番剧当然要大会员的身份,获取特权视频的网页源代码的方式可见完全小白篇-用Python爬取B站大会员番剧集

希望以上对大家有帮助。

本文同步分享在 博客“怡宝的代言人连高波”(CSDN)。

如有侵权,请联系 support@oschina.cn 删除。

本文参与“OSC源创计划”,欢迎正在阅读的你也加入,一起分享。

这篇关于python弹幕拼脸_完全小白篇-用python爬取B站弹幕(非彩色弹幕以及尝试生成词云图)...的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/500197

相关文章

使用python生成固定格式序号的方法详解

《使用python生成固定格式序号的方法详解》这篇文章主要为大家详细介绍了如何使用python生成固定格式序号,文中的示例代码讲解详细,具有一定的借鉴价值,有需要的小伙伴可以参考一下... 目录生成结果验证完整生成代码扩展说明1. 保存到文本文件2. 转换为jsON格式3. 处理特殊序号格式(如带圈数字)4

Java使用Swing生成一个最大公约数计算器

《Java使用Swing生成一个最大公约数计算器》这篇文章主要为大家详细介绍了Java使用Swing生成一个最大公约数计算器的相关知识,文中的示例代码讲解详细,感兴趣的小伙伴可以了解一下... 目录第一步:利用欧几里得算法计算最大公约数欧几里得算法的证明情形 1:b=0情形 2:b>0完成相关代码第二步:加

Python版本信息获取方法详解与实战

《Python版本信息获取方法详解与实战》在Python开发中,获取Python版本号是调试、兼容性检查和版本控制的重要基础操作,本文详细介绍了如何使用sys和platform模块获取Python的主... 目录1. python版本号获取基础2. 使用sys模块获取版本信息2.1 sys模块概述2.1.1

一文详解Python如何开发游戏

《一文详解Python如何开发游戏》Python是一种非常流行的编程语言,也可以用来开发游戏模组,:本文主要介绍Python如何开发游戏的相关资料,文中通过代码介绍的非常详细,需要的朋友可以参考下... 目录一、python简介二、Python 开发 2D 游戏的优劣势优势缺点三、Python 开发 3D

Python函数作用域与闭包举例深度解析

《Python函数作用域与闭包举例深度解析》Python函数的作用域规则和闭包是编程中的关键概念,它们决定了变量的访问和生命周期,:本文主要介绍Python函数作用域与闭包的相关资料,文中通过代码... 目录1. 基础作用域访问示例1:访问全局变量示例2:访问外层函数变量2. 闭包基础示例3:简单闭包示例4

Python实现字典转字符串的五种方法

《Python实现字典转字符串的五种方法》本文介绍了在Python中如何将字典数据结构转换为字符串格式的多种方法,首先可以通过内置的str()函数进行简单转换;其次利用ison.dumps()函数能够... 目录1、使用json模块的dumps方法:2、使用str方法:3、使用循环和字符串拼接:4、使用字符

Python版本与package版本兼容性检查方法总结

《Python版本与package版本兼容性检查方法总结》:本文主要介绍Python版本与package版本兼容性检查方法的相关资料,文中提供四种检查方法,分别是pip查询、conda管理、PyP... 目录引言为什么会出现兼容性问题方法一:用 pip 官方命令查询可用版本方法二:conda 管理包环境方法

基于Python开发Windows自动更新控制工具

《基于Python开发Windows自动更新控制工具》在当今数字化时代,操作系统更新已成为计算机维护的重要组成部分,本文介绍一款基于Python和PyQt5的Windows自动更新控制工具,有需要的可... 目录设计原理与技术实现系统架构概述数学建模工具界面完整代码实现技术深度分析多层级控制理论服务层控制注

pycharm跑python项目易出错的问题总结

《pycharm跑python项目易出错的问题总结》:本文主要介绍pycharm跑python项目易出错问题的相关资料,当你在PyCharm中运行Python程序时遇到报错,可以按照以下步骤进行排... 1. 一定不要在pycharm终端里面创建环境安装别人的项目子模块等,有可能出现的问题就是你不报错都安装

全网最全Tomcat完全卸载重装教程小结

《全网最全Tomcat完全卸载重装教程小结》windows系统卸载Tomcat重新通过ZIP方式安装Tomcat,优点是灵活可控,适合开发者自定义配置,手动配置环境变量后,可通过命令行快速启动和管理... 目录一、完全卸载Tomcat1. 停止Tomcat服务2. 通过控制面板卸载3. 手动删除残留文件4.