用python 做一个词云图:复仇者联盟4:终局之战。短评分析

2023-10-28 08:21

本文主要是介绍用python 做一个词云图:复仇者联盟4:终局之战。短评分析,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

#短评网址
u1='https://movie.douban.com/subject/26100958/comments?start=40&limit=20&sort=new_score&status=P'
u1

输出结果为网址

#因为只有start的值不一样,所以我们可以采用格式化字符串%i来代替
u0='https://movie.douban.com/subject/26100958/comments?start=%i&limit=20&sort=new_score&status=P' %20
u0
#获取5个页面网址,并把它保存到一个列表中
url_lst=[]
for i in range(0,81,20):u0='https://movie.douban.com/subject/26100958/comments?start=%i&limit=20&sort=new_score&status=P' %iurl_lst.append(u0)
url_lst

输出结果为:为5个网址

#访问网页
import requests  #访问的工具包
import pandas as pd
from bs4 import BeautifulSoup #解析的工具包
u1=url_lst[0]#提取第一个网址
#返回response[200]代表向网页请求成功
r=requests.get(u1)
r

输出结果为:
<Response [200]>

#解析网页,会显示网页所有代码,我们就可以解析它的标签
soup=BeautifulSoup(r.text,'lxml')
#例如我要去找到复仇者联盟4:终极之战短评这几个字,是h1的标签
soup.h1

输出结果为:

复仇者联盟4:终局之战 短评

#看过(221799)
soup.find('li',class_='is-active')

输出结果为:

  • 看过(221812)
  • #所有的评论在这个大的div下面
    div=soup.find('div',id='comments')
    div
    
    #构建获取页面URL的函数
    def get_urls(n):urllst=[]for i in range(n):urllst.append('https://movie.douban.com/subject/26100958/comments?start=%i&limit=20&sort=new_score&status=P' %(i*20))return urllst
    urllsts=get_urls(50)
    urllsts[:2]
    

    输出结果为:前两个页面的网址

    # 构建网页信息获取函数def get_data(urli):try:ri = requests.get(url = u)ri.encoding = 'utf-8'# 访问网页soupi = BeautifulSoup(ri.text)# 解析网页infor_lst = soupi.find('div',id="comments").find_all('div',class_="comment-item")# 获取所有招聘标签divdatalsti = []for infor in infor_lst[:]:dic = {}dic['评论者'] = infor.find('span',class_="comment-info").find('a').textdic['评分'] = int(infor.find('span',class_="comment-info").find_all('span')[1]['class'][0][-2:])dic['评论时间'] = infor.find('span',class_="comment-time").text.replace(' ','').replace('\n','')dic['有用数量'] = int(infor.find('span',class_="votes").text)dic['评论内容'] = infor.find('p').text.replace('\n','')datalsti.append(dic)return datalstiexcept:return []u = 'https://movie.douban.com/subject/26100958/comments?start=0&limit=20&sort=new_score&status=P'
    get_data(u)[:2]
    

    输出结果为:
    在这里插入图片描述

    df=pd.DataFrame(datalst)
    df.head()
    

    在这里插入图片描述

    #数据分布分析
    #评论字数的分析
    df['评论字数']=df['评论内容'].str.len()
    df
    
    import matplotlib.pyplot as plt
    %matplotlib inline
    df['评论字数'] = df['评论内容'].str.len()
    plt.figure(figsize = (12,5))
    plt.title('评论字数数据分布')
    df['评论字数'].hist(bins = 20,edgecolor = 'white')
    plt.grid(linestyle='--')
    

    在这里插入图片描述

    #评论数量与有用数量的关系,用散点图来表示
    plt.figure(figsize = (12,5))
    plt.title('评论时间与有用数量关系')
    plt.scatter(df['评论时间'],df['有用数量'],alpha = 0.4)
    plt.xlabel('评论时间')
    plt.ylabel('有用数量')
    plt.grid(linestyle='--')
    

    在这里插入图片描述

    #关键人物的分析
    keyword='灭霸'
    n=0
    for i in df['评论内容']:if keyword in i:n=n+1
    print(n)
    
    #用DataFrame实现
    len(df[df['评论内容'].str.contains('灭霸')])
    
    #定义一个函数,去输出不同的人物在评论中出现的次数
    def name_count1(namei):return len((df[df['评论内容'].str.contains(namei)]))
    print('函数构建成功!')
    
    name_count1('美队')
    
    #词频的出现次数
    namelst=['美队','钢铁侠','灭霸','雷神','浩克','惊奇队长','奇异博士','死']
    for i in namelst:print(i,name_count1(i))
    

    输出结果为:
    美队 13
    钢铁侠 17
    灭霸 10
    雷神 13
    浩克 2
    惊奇队长 10
    奇异博士 3
    死 22
    最后做成词云图
    在这里插入图片描述

这篇关于用python 做一个词云图:复仇者联盟4:终局之战。短评分析的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/291939

相关文章

关于MyISAM和InnoDB对比分析

《关于MyISAM和InnoDB对比分析》:本文主要介绍关于MyISAM和InnoDB对比分析,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录开篇:从交通规则看存储引擎选择理解存储引擎的基本概念技术原理对比1. 事务支持:ACID的守护者2. 锁机制:并发控制的艺

基于Python开发Windows屏幕控制工具

《基于Python开发Windows屏幕控制工具》在数字化办公时代,屏幕管理已成为提升工作效率和保护眼睛健康的重要环节,本文将分享一个基于Python和PySide6开发的Windows屏幕控制工具,... 目录概述功能亮点界面展示实现步骤详解1. 环境准备2. 亮度控制模块3. 息屏功能实现4. 息屏时间

Python如何去除图片干扰代码示例

《Python如何去除图片干扰代码示例》图片降噪是一个广泛应用于图像处理的技术,可以提高图像质量和相关应用的效果,:本文主要介绍Python如何去除图片干扰的相关资料,文中通过代码介绍的非常详细,... 目录一、噪声去除1. 高斯噪声(像素值正态分布扰动)2. 椒盐噪声(随机黑白像素点)3. 复杂噪声(如伪

Python中图片与PDF识别文本(OCR)的全面指南

《Python中图片与PDF识别文本(OCR)的全面指南》在数据爆炸时代,80%的企业数据以非结构化形式存在,其中PDF和图像是最主要的载体,本文将深入探索Python中OCR技术如何将这些数字纸张转... 目录一、OCR技术核心原理二、python图像识别四大工具库1. Pytesseract - 经典O

基于Linux的ffmpeg python的关键帧抽取

《基于Linux的ffmpegpython的关键帧抽取》本文主要介绍了基于Linux的ffmpegpython的关键帧抽取,实现以按帧或时间间隔抽取关键帧,文中通过示例代码介绍的非常详细,对大家的学... 目录1.FFmpeg的环境配置1) 创建一个虚拟环境envjavascript2) ffmpeg-py

python使用库爬取m3u8文件的示例

《python使用库爬取m3u8文件的示例》本文主要介绍了python使用库爬取m3u8文件的示例,可以使用requests、m3u8、ffmpeg等库,实现获取、解析、下载视频片段并合并等步骤,具有... 目录一、准备工作二、获取m3u8文件内容三、解析m3u8文件四、下载视频片段五、合并视频片段六、错误

Python中提取文件名扩展名的多种方法实现

《Python中提取文件名扩展名的多种方法实现》在Python编程中,经常会遇到需要从文件名中提取扩展名的场景,Python提供了多种方法来实现这一功能,不同方法适用于不同的场景和需求,包括os.pa... 目录技术背景实现步骤方法一:使用os.path.splitext方法二:使用pathlib模块方法三

Python打印对象所有属性和值的方法小结

《Python打印对象所有属性和值的方法小结》在Python开发过程中,调试代码时经常需要查看对象的当前状态,也就是对象的所有属性和对应的值,然而,Python并没有像PHP的print_r那样直接提... 目录python中打印对象所有属性和值的方法实现步骤1. 使用vars()和pprint()2. 使

使用Python和OpenCV库实现实时颜色识别系统

《使用Python和OpenCV库实现实时颜色识别系统》:本文主要介绍使用Python和OpenCV库实现的实时颜色识别系统,这个系统能够通过摄像头捕捉视频流,并在视频中指定区域内识别主要颜色(红... 目录一、引言二、系统概述三、代码解析1. 导入库2. 颜色识别函数3. 主程序循环四、HSV色彩空间详解

一文深入详解Python的secrets模块

《一文深入详解Python的secrets模块》在构建涉及用户身份认证、权限管理、加密通信等系统时,开发者最不能忽视的一个问题就是“安全性”,Python在3.6版本中引入了专门面向安全用途的secr... 目录引言一、背景与动机:为什么需要 secrets 模块?二、secrets 模块的核心功能1. 基