用Python分析9万条数据告诉你复仇者联盟谁才是绝对C 位！

2023-10-28 08:20

文章标签 python 分析数据联盟绝对告诉万条复仇者

本文主要是介绍用Python分析9万条数据告诉你复仇者联盟谁才是绝对C 位！，希望对大家解决编程问题提供一定的参考价值，需要的开发者们随着小编来一起学习吧！

01 抓取数据

业界朋友们，在电影分析中，使用猫眼的数据比较多。在本文中，笔者也使用了猫眼的接口来获取数据，方便处理，数据量也比较多。

有关接口，大家可以自己去猫眼的网站上看，也可以使用如下地址：

http://m.maoyan.com/mmdb/comments/movie/248172.json?_v_=yes&offset=20&startTime=2019-04-24%2002:56:46

在 Python 中，使用 Request 可以很方便地发送请求，拿到接口返回的 JSON 数据，来看代码：

请求返回的是一个 JSON 数据，拿到我们想要的评论原始数据，并将数据存储在数据库中：

经过大概两个小时，终于从猫眼爬取了大约 9 万条数据。数据库文件已经超过了 100M 了。

02 数据清洗

因为在上面抓取下来的数据，直接进行了原数据的存储，没有进行数据的解析处理。接口中包含了很多数据，有用户信息、评论信息等。本次分析，只使用了部分数据，所以需要将用到的相关数据清洗出来：

通过 JSON 库将原始数据解析出来，将我们需要的信息存储到新的数据表中。

03 数据分析

因为没有任何一个平台能够拿到用户的购票数据，我们只能从评论的数据中，以小见大，从这些数据中，分析出一些走势。在评论数据中，我们能看到评论用户所在的城市。将数据所在的位置解析，划分到各对应的行政省，可以看到每个省评论数量，见下图（颜色越红，用户评论数量越多）：

城市

从图中可以看到，上海、广州、四川用户的数量显然要比其他城市的用户数量要多得多。再来看一下代码：

漫威电影一直深受中国朋友们喜欢的高分电影。豆瓣评分 8.7 分，那我们的评论用户中，又是一个什么样的趋势呢？见下图：

评分数

从图中可以看到，评 5 分的数量远高于其他评分，可见中国的观众朋友确实喜欢漫威的科幻电影。

复联从 1 开始便是漫威宇宙各路超级英雄的集结，到现在的第 4 部，更是全英雄的汇聚。那么，在这之中，哪位英雄人物更受观众欢迎？先看代码：

运行结果如下图，可以看到钢铁侠钢铁侠是实至名归的 C 位，不仅电影在电影中是，在评论区仍然也是实至名归的 C 位，甚至于远超美队、寡姐和雷神：

英雄评论次数

从以上观众分布和评分的数据可以看到，这一部剧，观众朋友还是非常地喜欢。前面，从猫眼拿到了观众的评论数据。现在，笔者将通过 Jieba 把评论进行分词，然后通过 Wordcloud 制作词云，来看看，观众朋友们对《复联》的整体评价：

词云分析

可以看到，灭霸和钢铁侠出现的词频比其他英雄要高很多。这是否表示，这部剧的主角就是他们两个呢？

细心的朋友应该发现了，钢铁侠、灭霸的数量在词云和评论数量里面不一致。原因在于，评论数量就按评论条数来统计的，而词云中，使用的是词频，同一条评论中，多次出现会多次统计。所以，灭霸出现的次数居然高于了钢铁侠。

最后，再来分析一下钢铁侠与灭霸的情感分析，先上代码：

此处，使用 SnowNLP 来进行情感分析。

情感分析，又称为意见挖掘、倾向性分析等。简单而言，是对带有情感色彩的主观性文本进行分析、处理、归纳和推理的过程。

灭霸

钢铁侠

从图中看到，钢铁侠的正向情感要比灭霸的正向情感要高，反派角色就是容易被人抗拒。

最最后，从《银河护卫队》时期穿越而来的灭霸在最后分钟变成了粉末消散而去，这也给我们程序员一个警钟：

重构代码，改善设计，降低系统复杂度，这样做很好。但是，一定要保证系统的稳定运行，不留安全隐患，不然，早晚会丢掉自己的工作。

这篇关于用Python分析9万条数据告诉你复仇者联盟谁才是绝对C 位！的文章就介绍到这儿，希望我们推荐的文章对编程师们有所帮助！

http://www.chinasem.cn/article/291938。 23002807@qq.com

相关文章

Django开发时如何避免频繁发送短信验证码（python图文代码）

Django开发时如何避免频繁发送短信验证码（python图文代码）

《Django开发时如何避免频繁发送短信验证码（python图文代码）》Django开发时,为防止频繁发送验证码,后端需用Redis限制请求频率,结合管道技术提升效率,通过生产者消费者模式解耦业务逻辑... 目录避免频繁发送验证码1. www.chinasem.cn避免频繁发送验证码逻辑分析2. 避免频繁

阅读更多...

批量导入txt数据到的redis过程

批量导入txt数据到的redis过程

《批量导入txt数据到的redis过程》用户通过将Redis命令逐行写入txt文件,利用管道模式运行客户端,成功执行批量删除以Product*匹配的Key操作,提高了数据清理效率... 目录批量导入txt数据到Redisjs把redis命令按一条一行写到txt中管道命令运行redis客户端成功了批量删除k

阅读更多...

精选20个好玩又实用的的Python实战项目(有图文代码)

精选20个好玩又实用的的Python实战项目(有图文代码)

《精选20个好玩又实用的的Python实战项目(有图文代码)》文章介绍了20个实用Python项目,涵盖游戏开发、工具应用、图像处理、机器学习等,使用Tkinter、PIL、OpenCV、Kivy等库... 目录① 猜字游戏② 闹钟③ 骰子模拟器④ 二维码⑤ 语言检测⑥ 加密和解密⑦ URL缩短⑧ 音乐播放

阅读更多...

python panda库从基础到高级操作分析

python panda库从基础到高级操作分析

《pythonpanda库从基础到高级操作分析》本文介绍了Pandas库的核心功能,包括处理结构化数据的Series和DataFrame数据结构,数据读取、清洗、分组聚合、合并、时间序列分析及大数据... 目录1. Pandas 概述2. 基本操作：数据读取与查看3. 索引操作：精准定位数据4. Group

阅读更多...

Python pandas库自学超详细教程

Python pandas库自学超详细教程

《Pythonpandas库自学超详细教程》文章介绍了Pandas库的基本功能、安装方法及核心操作,涵盖数据导入（CSV/Excel等）、数据结构（Series、DataFrame）、数据清洗、转换... 目录一、什么是Pandas库（1）、Pandas 应用（2）、Pandas 功能（3）、数据结构二、安

阅读更多...

Python使用Tenacity一行代码实现自动重试详解

Python使用Tenacity一行代码实现自动重试详解

《Python使用Tenacity一行代码实现自动重试详解》tenacity是一个专为Python设计的通用重试库,它的核心理念就是用简单、清晰的方式,为任何可能失败的操作添加重试能力,下面我们就来看... 目录一切始于一个简单的 API 调用Tenacity 入门：一行代码实现优雅重试精细控制：让重试按我

阅读更多...

Python安装Pandas库的两种方法

Python安装Pandas库的两种方法

《Python安装Pandas库的两种方法》本文介绍了三种安装PythonPandas库的方法,通过cmd命令行安装并解决版本冲突,手动下载whl文件安装,更换国内镜像源加速下载,最后建议用pipli... 目录方法一：cmd命令行执行pip install pandas方法二：找到pandas下载库，然后

阅读更多...

MySQL中EXISTS与IN用法使用与对比分析

MySQL中EXISTS与IN用法使用与对比分析

《MySQL中EXISTS与IN用法使用与对比分析》在MySQL中,EXISTS和IN都用于子查询中根据另一个查询的结果来过滤主查询的记录,本文将基于工作原理、效率和应用场景进行全面对比... 目录一、基本用法详解1. IN 运算符2. EXISTS 运算符二、EXISTS 与 IN 的选择策略三、性能对比

阅读更多...

SpringBoot多环境配置数据读取方式

SpringBoot多环境配置数据读取方式

《SpringBoot多环境配置数据读取方式》SpringBoot通过环境隔离机制,支持properties/yaml/yml多格式配置,结合@Value、Environment和@Configura... 目录一、多环境配置的核心思路二、3种配置文件格式详解2.1 properties格式（传统格式）1.

阅读更多...

Python实现网格交易策略的过程

Python实现网格交易策略的过程

《Python实现网格交易策略的过程》本文讲解Python网格交易策略,利用ccxt获取加密货币数据及backtrader回测,通过设定网格节点,低买高卖获利,适合震荡行情,下面跟我一起看看我们的第一... 网格交易是一种经典的量化交易策略，其核心思想是在价格上下预设多个“网格”，当价格触发特定网格时执行买

阅读更多...