python弹幕拼脸_完全小白篇-用python爬取B站弹幕(非彩色弹幕以及尝试生成词云图)...

本文主要是介绍python弹幕拼脸_完全小白篇-用python爬取B站弹幕(非彩色弹幕以及尝试生成词云图)...,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

目标

爬取B站弹幕(今天是2020/8/31,最近的时间点以下方法肯定行得通)

分析网页

关于B站的弹幕,其实一个系列视频的所有弹幕是可以在其中任何一集视频就能得到的,所以这篇文章的目的并不完全算是python教程,而只是告诉大家怎么找弹幕在哪以及生成词云图。

以“小甲鱼”的python教程系列为例,我们选择打开网页源代码:

2dd053723ef1b6fed9c9ba9e470b433c.png

d21991c2022280c4fe43f357b54d6187.png

我们再根据cid号打开https://api.bilibili.com/x/v1/dm/list.so?oid=6534573(这是随便挑的一个cid对应的号,验证一下弹幕到底在不在那)

67033e11a0c5f79b71d3cb155e98fd2a.png

事实上,所有弹幕都是从b站后台另一个网页加载到当前集数的视频中的。我们看这些cid号,每个cid后都有对应的一个编号。上图是p=4第四集的网页源代码,可以发现cid这一块根本不会随着p号改变而改变,所以只需要把这一部分所有有效cid获取到就可以了。

import requests

from bs4 import BeautifulSoup

import re

import json

import os

def getHtml(baseurl):

head = { #模拟浏览器身份头向对方发送消息

"user-agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.56 (KHTML, like Gecko) Chrome/83.0.4103.116 Safari/537.56"

}

try:

response = requests.get(url = baseurl, headers = head)

if response.status_code==200:

return response.content.decode("utf-8")

except:

print("请求失败")

def main():

print("这是bv号弹幕获取软件")

bv = input("请输入bv号: ")

p = int(input("请输入p号: "))

baseurl = "https://www.bilibili.com/video/BV"+str(bv)+"?p="+str(p)

# 获取网页的源代码

req=getHtml(baseurl)

# cid所在的位置是window.__INITIAL_STATE__={}里面,所以要在这里找各个cid号

pattern = r'\'

# result结果得是string

result = re.findall(pattern, req)[0]

match_rule = r'{"cid":(.*?),'

cid = re.findall(match_rule, result)

# 打开弹幕资源位置

baseurl = "https://api.bilibili.com/x/v1/dm/list.so?oid="+str(cid[p-1])

req = getHtml(baseurl)

soup = BeautifulSoup(req,'html.parser')

match_rule = r'(.*?)'

cid = ""

for item in soup.find_all('d'):

item = str(item)

danmu = re.findall(match_rule, item)[0]

cid = cid + danmu + " "

print(cid)

os.system("pause")

if __name__ == "__main__":

main()

1e9cf494d0c912efc1341475035e6d38.png

那么,本集视频的所有弹幕的内容就如上啦~

顶部、底部彩色弹幕的获取目前还不是很懂,但是一般采集数据的话都是采集浮动无色弹幕吧,希望对大家有帮助。

另外嘞,如果不想通过网页源代码里找cid的话,也可以通过特殊的request直接获取这些cid。网页视频开始播放的时候,B站的方法是发一个叫pagelist的数据包,如下图:

28aa34c2cd56be8d17acf555b4cf2d01.png我们可以看到response就是这些cid,所以模仿浏览器写一个和它一模一样的header就可以访问它啦!这一点就不多赘述了

词云图

词云图的生成方法简直不要太多,python的扩展性确实是十分丰富!

为了生成词云图,

from matplotlib import pyplot as plt

from wordcloud import WordCloud,ImageColorGenerator

from PIL import Image

import numpy as np

def getWordCloud(text):

# 打开图片文件的路径,并利用机器学习

# numpy分析的话是对一张图片每一块像素的[R,G,B]值进行记录的,到时候生成词云的颜色就由它的分析结果完成

path_img = "./ciyun.jpg"

background_img = np.array(Image.open(path_img))

print("打开成功")

wc = WordCloud(

# 设置词云的字体

font_path="./FZZJ-YZDKJW.TTF",

width=800,

height = 900,

min_font_size = 10,

background_color = "white",

mask=background_img

).generate(text)

image_colors = ImageColorGenerator(background_img)

# 有这几句话的话可以在exe直接打开预览查看

plt.imshow(wc.recolor(color_func=image_colors), interpolation="bilinear")

plt.axis("off")

plt.show()

# 保存成图片

wc.to_file("shuchu.jpg")

这里用到的库有matplotlib、wordcloud、PIL以及numpy。所有句子的具体含义见上:

运行结果:

0f0e8b9c6a0afb39804837caf329d74c.png

其他的词云库网上有,这里不全介绍了。一般都是用jieba库进行分词的,不过试了试jieba,发现它其实还是针对文件里没有空格间隔的信息比较好用(但是分词结果还是美到不忍直视)。对于获取的弹幕数据我们其实完全也可以存储到sqlite之类的数据库进行记录。总之,词云也好,数据库、柱状图也好,python记录和展示数据的方式多种多样!

其他类视频弹幕的获取

bv号算是普通视频。其实就算是番剧、电影,也是一样的道理,只要有网页源代码就一切ok。大会员特权的番剧当然要大会员的身份,获取特权视频的网页源代码的方式可见完全小白篇-用Python爬取B站大会员番剧集

希望以上对大家有帮助。

本文同步分享在 博客“怡宝的代言人连高波”(CSDN)。

如有侵权,请联系 support@oschina.cn 删除。

本文参与“OSC源创计划”,欢迎正在阅读的你也加入,一起分享。

这篇关于python弹幕拼脸_完全小白篇-用python爬取B站弹幕(非彩色弹幕以及尝试生成词云图)...的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/500197

相关文章

Python中edge-tts实现便捷语音合成

《Python中edge-tts实现便捷语音合成》edge-tts是一个功能强大的Python库,支持多种语言和声音选项,本文主要介绍了Python中edge-tts实现便捷语音合成,具有一定的参考价... 目录安装与环境设置文本转语音查找音色更改语音参数生成音频与字幕总结edge-tts 是一个功能强大的

使用Python和PaddleOCR实现图文识别的代码和步骤

《使用Python和PaddleOCR实现图文识别的代码和步骤》在当今数字化时代,图文识别技术的应用越来越广泛,如文档数字化、信息提取等,PaddleOCR是百度开源的一款强大的OCR工具包,它集成了... 目录一、引言二、环境准备2.1 安装 python2.2 安装 PaddlePaddle2.3 安装

Python+PyQt5开发一个Windows电脑启动项管理神器

《Python+PyQt5开发一个Windows电脑启动项管理神器》:本文主要介绍如何使用PyQt5开发一款颜值与功能并存的Windows启动项管理工具,不仅能查看/删除现有启动项,还能智能添加新... 目录开篇:为什么我们需要启动项管理工具功能全景图核心技术解析1. Windows注册表操作2. 启动文件

Python datetime 模块概述及应用场景

《Pythondatetime模块概述及应用场景》Python的datetime模块是标准库中用于处理日期和时间的核心模块,本文给大家介绍Pythondatetime模块概述及应用场景,感兴趣的朋... 目录一、python datetime 模块概述二、datetime 模块核心类解析三、日期时间格式化与

Java调用Python的四种方法小结

《Java调用Python的四种方法小结》在现代开发中,结合不同编程语言的优势往往能达到事半功倍的效果,本文将详细介绍四种在Java中调用Python的方法,并推荐一种最常用且实用的方法,希望对大家有... 目录一、在Java类中直接执行python语句二、在Java中直接调用Python脚本三、使用Run

使用Python开发Markdown兼容公式格式转换工具

《使用Python开发Markdown兼容公式格式转换工具》在技术写作中我们经常遇到公式格式问题,例如MathML无法显示,LaTeX格式错乱等,所以本文我们将使用Python开发Markdown兼容... 目录一、工具背景二、环境配置(Windows 10/11)1. 创建conda环境2. 获取XSLT

Python如何调用指定路径的模块

《Python如何调用指定路径的模块》要在Python中调用指定路径的模块,可以使用sys.path.append,importlib.util.spec_from_file_location和exe... 目录一、sys.path.append() 方法1. 方法简介2. 使用示例3. 注意事项二、imp

PyQt5+Python-docx实现一键生成测试报告

《PyQt5+Python-docx实现一键生成测试报告》作为一名测试工程师,你是否经历过手动填写测试报告的痛苦,本文将用Python的PyQt5和python-docx库,打造一款测试报告一键生成工... 目录引言工具功能亮点工具设计思路1. 界面设计:PyQt5实现数据输入2. 文档生成:python-

Python中Flask模板的使用与高级技巧详解

《Python中Flask模板的使用与高级技巧详解》在Web开发中,直接将HTML代码写在Python文件中会导致诸多问题,Flask内置了Jinja2模板引擎,完美解决了这些问题,下面我们就来看看F... 目录一、模板渲染基础1.1 为什么需要模板引擎1.2 第一个模板渲染示例1.3 模板渲染原理二、模板

使用Python创建一个功能完整的Windows风格计算器程序

《使用Python创建一个功能完整的Windows风格计算器程序》:本文主要介绍如何使用Python和Tkinter创建一个功能完整的Windows风格计算器程序,包括基本运算、高级科学计算(如三... 目录python实现Windows系统计算器程序(含高级功能)1. 使用Tkinter实现基础计算器2.