《哪吒》VS《姜子牙》,用Python对比—我发现了这个......

2023-10-11 06:59

本文主要是介绍《哪吒》VS《姜子牙》,用Python对比—我发现了这个......,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

目录

前言

一、票房对比分析

    1.获取票房数据

    2.票房走势分析

二、评价对比分析

    1.爬取影评

        1.1获取评论页面

        1.2 解析页面中的评论

        1.3 定义爬取函数

        1.4 完整代码

    2.词云分析

        2.1 完整代码

        2.2 结果展示

前言

随着国内疫情得到有效控制,每个地区的电影院都陆陆续续的开放了,而很多本应该在春节档上映的电影因为疫情撤档,现在也重新上映了。

想必和不少小伙伴一样,我一直对《姜子牙》满怀期待。于是,国庆第2天我便杀入影院。而关于《姜子牙》的评价呈现了两极分化,而它也经常被拿来和去年上映的《哪吒》对比。关于电影本身,我不做过多评价,主要是从数据的角度出发,把《姜子牙》和《哪吒》进行一个对比分析。

一、票房对比分析

为了使得数据统一,我选取上映的前9日的票房数据(将持续更新):

注:票房数据来源于网络,不保证完全准确。将其存于本地excel表格中,命名为“票房数据.xlsx”。

2.票房走势分析

利用pandas库对票房数据进行分析,并绘制折线图:

import pandas as pd
import matplotlib.pyplot as plt# 票房分析
plt.rcParams['font.sans-serif'] = ['SimHei']  # 用来正常显示中文标签    
data = pd.read_excel('票房数据.xlsx',index_col=0)
data.plot(style='.-.')
plt.title('票房数据')
plt.ylabel('票房(亿元)')
plt.xlabel('上映时间')
plt.savefig('票房数据.png')

结果如下:

从图可以看出(仅代表个人观点):

  • 1 首映当日《姜子牙》票房明显高于《哪吒》。这大概是源于观众的期待,这也说明前期的宣传工作做到位了;

  • 2 从走势来看,《姜子牙》呈现出明显下滑。这大概是因为上映后口碑上出现了两级分化,电影本身没有到达观众原本的期待;

  • 3 从走势来看,《哪吒》后续走势强劲有力。这大概是因为上映后《哪吒》作为国产动漫的代表口口相传,吸引了越来越多的观众。

二、评价对比分析

这一部分主要是对观众的影评进行分析,评价数据来源于某瓣。

1.爬取影评

在网站简单搜索之后可以发现一个电影短评的接口:

https://movie.douban.com/subject/26794435/comments?start=20&limit=20&status=P&sort=new_score

其中,26794435表示电影的编号l;start参数表示评论起始位置;limit表示每次请求的评论数。

1.1获取评论页面
def get_comment(mid,page):'''获得评论页面的HTML'''start = (page-1)*20url = 'https://movie.douban.com/subject/%s/comments?start=%d&limit=20&status=P&sort=new_score'%(mid,start)headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.3; Win64; x64; rv:81.0) Gecko/20100101 Firefox/81.0','Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8','Accept-Language': 'zh-CN,zh;q=0.8,zh-TW;q=0.7,zh-HK;q=0.5,en-US;q=0.3,en;q=0.2','Connection': 'keep-alive','Upgrade-Insecure-Requests': '1'}cookies = {}res = requests.get(url,headers=headers,cookies=cookies)html = res.textreturn html
## 注意:请求需要带上登陆后的cookies,否则将只能获取10页的评论。
1.2 解析页面中的评论
def parse_comment(html):'''解析HTML中的评论'''comment = re.findall('<span class="short">(.*?)</span>',html)return comment
1.3 定义爬取函数
def crawl_comment(mid,N,name):'''爬取指定页数的评论,并保存在本地'''comments = []for p in range(1,N+1):html = get_comment(mid,p)comment = parse_comment(html)comments.extend(comment)print('《%s》第%d页评论爬取完成(%d条)'%(name,p,len(comment)))time.sleep(random.uniform(3,5))with open('%s.txt'%name,'w') as f:f.write(json.dumps(comments))## 注意:time.sleep()很重要,否则请求过于频繁将触发安全机制,导致403
1.4 完整代码
# -*- coding: utf-8 -*-
"""
Created on Sat Oct 10 12:01:35 2020@author: kimol_love
"""
import re
import time
import json
import random
import requests# 定义相关函数
def get_comment(mid,page):'''获得评论页面的HTML'''start = (page-1)*20url = 'https://movie.douban.com/subject/%s/comments?start=%d&limit=20&status=P&sort=new_score'%(mid,start)headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 6.3; Win64; x64; rv:81.0) Gecko/20100101 Firefox/81.0','Accept': 'text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,*/*;q=0.8','Accept-Language': 'zh-CN,zh;q=0.8,zh-TW;q=0.7,zh-HK;q=0.5,en-US;q=0.3,en;q=0.2','Connection': 'keep-alive','Upgrade-Insecure-Requests': '1'}cookies = {}res = requests.get(url,headers=headers,cookies=cookies)html = res.textreturn htmldef parse_comment(html):'''解析HTML中的评论'''comment = re.findall('<span class="short">(.*?)</span>',html)return commentdef crawl_comment(mid,N,name):'''爬取指定页数的评论,并保存在本地'''comments = []for p in range(1,N+1):html = get_comment(mid,p)comment = parse_comment(html)comments.extend(comment)print('《%s》第%d页评论爬取完成(%d条)'%(name,p,len(comment)))time.sleep(random.uniform(3,5))with open('%s.txt'%name,'w') as f:f.write(json.dumps(comments))# 爬取姜子牙评论
crawl_comment('25907124',25,'姜子牙')# 爬取哪吒评论
crawl_comment('26794435',25,'哪吒')
2.词云分析

利用python的jieba库和wordcloud库对评论进行分析,绘制出词云。其中相应库的安装如下:

pip install jieba
pip install wordcloud
2.1 完整代码

先利用jieba对评论进行分词处理,再利用wordcloud对词频进行统计并绘制出词云。

# -*- coding: utf-8 -*-
"""
Created on Sat Oct 10 12:22:53 2020@author: kimol_love
"""
import json
import jieba
from wordcloud import WordCloud# 定义相关函数
def create_wordcloud(comments,name):'''根据评论列表创建词云'''content = ''.join(comments)wl = jieba.cut(content,cut_all=True)wl_space_split = ' '.join(wl)wc = WordCloud('simhei.ttf',background_color='white', # 背景颜色width=1000,height=600,).generate(wl_space_split)wc.to_file('%s.png'%name)# 词云数据分析
with open('姜子牙.txt','r') as f:comments_jiang = json.loads(f.read())create_wordcloud(comments_jiang,'姜子牙评论')
with open('哪吒.txt','r') as f:comments_ne = json.loads(f.read())create_wordcloud(comments_ne,'哪吒评论')
2.2 结果展示

《姜子牙》评论词云:

可以看出:在关于《姜子牙》的评论中,往往会伴随着与《哪吒》的比较。同时,其中的剧情、故事也是大家比较关注的一个问题。

《哪吒》评论词云:

可以看出:在关于《哪吒》的评论中,大家往往涉及到了国产、动画等关键词,而这也与大家对《哪吒》的主流定位不谋而合。

近期八大热门:发现一个舔狗福利!这个Python爬虫神器太爽了,自动下载妹子图片!
盗墓热再起!我爬取了6万条《重启之极海听雷》的评论,发现了这些秘密
用Python一键生成炫酷九宫格图片,火了朋友圈
菜鸟也疯狂!8分钟用Python做一个酷炫的家庭随手记
Github获8300星!用Python开发的一个命令行的网易云音乐
一道Python面试题,硬是没憋出来,最后憋出一身汗!卧槽!Pdf转Word用Python轻松搞定!教你6招,不错的Python代码技巧!
程序员GitHub,现已正式上线!接下来我们将会在该公众号上,为大家分享GitHub上优质的开源神器,程序员圈的趣事,坚持每天一篇原创文章的输出,感兴趣的小伙伴可以关注一下哈!
点这里,领取一波福利!

这篇关于《哪吒》VS《姜子牙》,用Python对比—我发现了这个......的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!


原文地址:https://blog.csdn.net/cainiao_python/article/details/109476286
本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.chinasem.cn/article/186354

相关文章

使用Python实现Windows系统垃圾清理

《使用Python实现Windows系统垃圾清理》Windows自带的磁盘清理工具功能有限,无法深度清理各类垃圾文件,所以本文为大家介绍了如何使用Python+PyQt5开发一个Windows系统垃圾... 目录一、开发背景与工具概述1.1 为什么需要专业清理工具1.2 工具设计理念二、工具核心功能解析2.

Python实现一键PDF转Word(附完整代码及详细步骤)

《Python实现一键PDF转Word(附完整代码及详细步骤)》pdf2docx是一个基于Python的第三方库,专门用于将PDF文件转换为可编辑的Word文档,下面我们就来看看如何通过pdf2doc... 目录引言:为什么需要PDF转Word一、pdf2docx介绍1. pdf2docx 是什么2. by

Python函数返回多个值的多种方法小结

《Python函数返回多个值的多种方法小结》在Python中,函数通常用于封装一段代码,使其可以重复调用,有时,我们希望一个函数能够返回多个值,Python提供了几种不同的方法来实现这一点,需要的朋友... 目录一、使用元组(Tuple):二、使用列表(list)三、使用字典(Dictionary)四、 使

Python程序的文件头部声明小结

《Python程序的文件头部声明小结》在Python文件的顶部声明编码通常是必须的,尤其是在处理非ASCII字符时,下面就来介绍一下两种头部文件声明,具有一定的参考价值,感兴趣的可以了解一下... 目录一、# coding=utf-8二、#!/usr/bin/env python三、运行Python程序四、

python web 开发之Flask中间件与请求处理钩子的最佳实践

《pythonweb开发之Flask中间件与请求处理钩子的最佳实践》Flask作为轻量级Web框架,提供了灵活的请求处理机制,中间件和请求钩子允许开发者在请求处理的不同阶段插入自定义逻辑,实现诸如... 目录Flask中间件与请求处理钩子完全指南1. 引言2. 请求处理生命周期概述3. 请求钩子详解3.1

Linux中的more 和 less区别对比分析

《Linux中的more和less区别对比分析》在Linux/Unix系统中,more和less都是用于分页查看文本文件的命令,但less是more的增强版,功能更强大,:本文主要介绍Linu... 目录1. 基础功能对比2. 常用操作对比less 的操作3. 实际使用示例4. 为什么推荐 less?5.

使用Python实现网页表格转换为markdown

《使用Python实现网页表格转换为markdown》在日常工作中,我们经常需要从网页上复制表格数据,并将其转换成Markdown格式,本文将使用Python编写一个网页表格转Markdown工具,需... 在日常工作中,我们经常需要从网页上复制表格数据,并将其转换成Markdown格式,以便在文档、邮件或

Python使用pynput模拟实现键盘自动输入工具

《Python使用pynput模拟实现键盘自动输入工具》在日常办公和软件开发中,我们经常需要处理大量重复的文本输入工作,所以本文就来和大家介绍一款使用Python的PyQt5库结合pynput键盘控制... 目录概述:当自动化遇上可视化功能全景图核心功能矩阵技术栈深度效果展示使用教程四步操作指南核心代码解析

Python实现pdf电子发票信息提取到excel表格

《Python实现pdf电子发票信息提取到excel表格》这篇文章主要为大家详细介绍了如何使用Python实现pdf电子发票信息提取并保存到excel表格,文中的示例代码讲解详细,感兴趣的小伙伴可以跟... 目录应用场景详细代码步骤总结优化应用场景电子发票信息提取系统主要应用于以下场景:企业财务部门:需

基于Python实现智能天气提醒助手

《基于Python实现智能天气提醒助手》这篇文章主要来和大家分享一个实用的Python天气提醒助手开发方案,这个工具可以方便地集成到青龙面板或其他调度框架中使用,有需要的小伙伴可以参考一下... 目录项目概述核心功能技术实现1. 天气API集成2. AI建议生成3. 消息推送环境配置使用方法完整代码项目特点