python弹幕拼脸_完全小白篇-用python爬取B站弹幕(非彩色弹幕以及尝试生成词云图)...

本文主要是介绍python弹幕拼脸_完全小白篇-用python爬取B站弹幕(非彩色弹幕以及尝试生成词云图)...,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

目标

爬取B站弹幕(今天是2020/8/31,最近的时间点以下方法肯定行得通)

分析网页

关于B站的弹幕,其实一个系列视频的所有弹幕是可以在其中任何一集视频就能得到的,所以这篇文章的目的并不完全算是python教程,而只是告诉大家怎么找弹幕在哪以及生成词云图。

以“小甲鱼”的python教程系列为例,我们选择打开网页源代码:

2dd053723ef1b6fed9c9ba9e470b433c.png

d21991c2022280c4fe43f357b54d6187.png

我们再根据cid号打开https://api.bilibili.com/x/v1/dm/list.so?oid=6534573(这是随便挑的一个cid对应的号,验证一下弹幕到底在不在那)

67033e11a0c5f79b71d3cb155e98fd2a.png

事实上,所有弹幕都是从b站后台另一个网页加载到当前集数的视频中的。我们看这些cid号,每个cid后都有对应的一个编号。上图是p=4第四集的网页源代码,可以发现cid这一块根本不会随着p号改变而改变,所以只需要把这一部分所有有效cid获取到就可以了。

import requests

from bs4 import BeautifulSoup

import re

import json

import os

def getHtml(baseurl):

head = { #模拟浏览器身份头向对方发送消息

"user-agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.56 (KHTML, like Gecko) Chrome/83.0.4103.116 Safari/537.56"

}

try:

response = requests.get(url = baseurl, headers = head)

if response.status_code==200:

return response.content.decode("utf-8")

except:

print("请求失败")

def main():

print("这是bv号弹幕获取软件")

bv = input("请输入bv号: ")

p = int(input("请输入p号: "))

baseurl = "https://www.bilibili.com/video/BV"+str(bv)+"?p="+str(p)

# 获取网页的源代码

req=getHtml(baseurl)

# cid所在的位置是window.__INITIAL_STATE__={}里面,所以要在这里找各个cid号

pattern = r'\'

# result结果得是string

result = re.findall(pattern, req)[0]

match_rule = r'{"cid":(.*?),'

cid = re.findall(match_rule, result)

# 打开弹幕资源位置

baseurl = "https://api.bilibili.com/x/v1/dm/list.so?oid="+str(cid[p-1])

req = getHtml(baseurl)

soup = BeautifulSoup(req,'html.parser')

match_rule = r'(.*?)'

cid = ""

for item in soup.find_all('d'):

item = str(item)

danmu = re.findall(match_rule, item)[0]

cid = cid + danmu + " "

print(cid)

os.system("pause")

if __name__ == "__main__":

main()

1e9cf494d0c912efc1341475035e6d38.png

那么,本集视频的所有弹幕的内容就如上啦~

顶部、底部彩色弹幕的获取目前还不是很懂,但是一般采集数据的话都是采集浮动无色弹幕吧,希望对大家有帮助。

另外嘞,如果不想通过网页源代码里找cid的话,也可以通过特殊的request直接获取这些cid。网页视频开始播放的时候,B站的方法是发一个叫pagelist的数据包,如下图:

28aa34c2cd56be8d17acf555b4cf2d01.png我们可以看到response就是这些cid,所以模仿浏览器写一个和它一模一样的header就可以访问它啦!这一点就不多赘述了

词云图

词云图的生成方法简直不要太多,python的扩展性确实是十分丰富!

为了生成词云图,

from matplotlib import pyplot as plt

from wordcloud import WordCloud,ImageColorGenerator

from PIL import Image

import numpy as np

def getWordCloud(text):

# 打开图片文件的路径,并利用机器学习

# numpy分析的话是对一张图片每一块像素的[R,G,B]值进行记录的,到时候生成词云的颜色就由它的分析结果完成

path_img = "./ciyun.jpg"

background_img = np.array(Image.open(path_img))

print("打开成功")

wc = WordCloud(

# 设置词云的字体

font_path="./FZZJ-YZDKJW.TTF",

width=800,

height = 900,

min_font_size = 10,

background_color = "white",

mask=background_img

).generate(text)

image_colors = ImageColorGenerator(background_img)

# 有这几句话的话可以在exe直接打开预览查看

plt.imshow(wc.recolor(color_func=image_colors), interpolation="bilinear")

plt.axis("off")

plt.show()

# 保存成图片

wc.to_file("shuchu.jpg")

这里用到的库有matplotlib、wordcloud、PIL以及numpy。所有句子的具体含义见上:

运行结果:

0f0e8b9c6a0afb39804837caf329d74c.png

其他的词云库网上有,这里不全介绍了。一般都是用jieba库进行分词的,不过试了试jieba,发现它其实还是针对文件里没有空格间隔的信息比较好用(但是分词结果还是美到不忍直视)。对于获取的弹幕数据我们其实完全也可以存储到sqlite之类的数据库进行记录。总之,词云也好,数据库、柱状图也好,python记录和展示数据的方式多种多样!

其他类视频弹幕的获取

bv号算是普通视频。其实就算是番剧、电影,也是一样的道理,只要有网页源代码就一切ok。大会员特权的番剧当然要大会员的身份,获取特权视频的网页源代码的方式可见完全小白篇-用Python爬取B站大会员番剧集

希望以上对大家有帮助。

本文同步分享在 博客“怡宝的代言人连高波”(CSDN)。

如有侵权,请联系 support@oschina.cn 删除。

本文参与“OSC源创计划”,欢迎正在阅读的你也加入,一起分享。

这篇关于python弹幕拼脸_完全小白篇-用python爬取B站弹幕(非彩色弹幕以及尝试生成词云图)...的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/500197

相关文章

Conda与Python venv虚拟环境的区别与使用方法详解

《Conda与Pythonvenv虚拟环境的区别与使用方法详解》随着Python社区的成长,虚拟环境的概念和技术也在不断发展,:本文主要介绍Conda与Pythonvenv虚拟环境的区别与使用... 目录前言一、Conda 与 python venv 的核心区别1. Conda 的特点2. Python v

Python使用python-can实现合并BLF文件

《Python使用python-can实现合并BLF文件》python-can库是Python生态中专注于CAN总线通信与数据处理的强大工具,本文将使用python-can为BLF文件合并提供高效灵活... 目录一、python-can 库:CAN 数据处理的利器二、BLF 文件合并核心代码解析1. 基础合

Python使用OpenCV实现获取视频时长的小工具

《Python使用OpenCV实现获取视频时长的小工具》在处理视频数据时,获取视频的时长是一项常见且基础的需求,本文将详细介绍如何使用Python和OpenCV获取视频时长,并对每一行代码进行深入解析... 目录一、代码实现二、代码解析1. 导入 OpenCV 库2. 定义获取视频时长的函数3. 打开视频文

Python中你不知道的gzip高级用法分享

《Python中你不知道的gzip高级用法分享》在当今大数据时代,数据存储和传输成本已成为每个开发者必须考虑的问题,Python内置的gzip模块提供了一种简单高效的解决方案,下面小编就来和大家详细讲... 目录前言:为什么数据压缩如此重要1. gzip 模块基础介绍2. 基本压缩与解压缩操作2.1 压缩文

Python设置Cookie永不超时的详细指南

《Python设置Cookie永不超时的详细指南》Cookie是一种存储在用户浏览器中的小型数据片段,用于记录用户的登录状态、偏好设置等信息,下面小编就来和大家详细讲讲Python如何设置Cookie... 目录一、Cookie的作用与重要性二、Cookie过期的原因三、实现Cookie永不超时的方法(一)

Python内置函数之classmethod函数使用详解

《Python内置函数之classmethod函数使用详解》:本文主要介绍Python内置函数之classmethod函数使用方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地... 目录1. 类方法定义与基本语法2. 类方法 vs 实例方法 vs 静态方法3. 核心特性与用法(1编程客

Python函数作用域示例详解

《Python函数作用域示例详解》本文介绍了Python中的LEGB作用域规则,详细解析了变量查找的四个层级,通过具体代码示例,展示了各层级的变量访问规则和特性,对python函数作用域相关知识感兴趣... 目录一、LEGB 规则二、作用域实例2.1 局部作用域(Local)2.2 闭包作用域(Enclos

Python实现对阿里云OSS对象存储的操作详解

《Python实现对阿里云OSS对象存储的操作详解》这篇文章主要为大家详细介绍了Python实现对阿里云OSS对象存储的操作相关知识,包括连接,上传,下载,列举等功能,感兴趣的小伙伴可以了解下... 目录一、直接使用代码二、详细使用1. 环境准备2. 初始化配置3. bucket配置创建4. 文件上传到os

使用Python实现可恢复式多线程下载器

《使用Python实现可恢复式多线程下载器》在数字时代,大文件下载已成为日常操作,本文将手把手教你用Python打造专业级下载器,实现断点续传,多线程加速,速度限制等功能,感兴趣的小伙伴可以了解下... 目录一、智能续传:从崩溃边缘抢救进度二、多线程加速:榨干网络带宽三、速度控制:做网络的好邻居四、终端交互

Python中注释使用方法举例详解

《Python中注释使用方法举例详解》在Python编程语言中注释是必不可少的一部分,它有助于提高代码的可读性和维护性,:本文主要介绍Python中注释使用方法的相关资料,需要的朋友可以参考下... 目录一、前言二、什么是注释?示例:三、单行注释语法:以 China编程# 开头,后面的内容为注释内容示例:示例:四