Python实战 | “端午节” 送亲戚,送长辈,粽子可视化大屏来帮忙!

2024-03-15 23:30

本文主要是介绍Python实战 | “端午节” 送亲戚,送长辈,粽子可视化大屏来帮忙!,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

公众号:「杰哥的IT之旅」,后台回复:「粽子」即可获取本文完整数据

本文简介

今年,我用 Python 爬取了京东上面的 “粽子数据” 进行分析,看看有啥发现吧!

本文就从数据爬取数据清洗数据可视化,这三个方面入手,但你简单完成一个小型的数据分析项目,让你对知识能够有一个综合的运用。

整个思路如下:
  • 爬取网页: https://www.jd.com/
  • 爬取说明: 基于京东网站,我们搜索网站“粽子”数据,大概有100页。我们爬取的字段,既有一级页面的相关信息,还有二级页面的部分信息;
  • 爬取思路: 先针对某一页数据的一级页面做一个解析,然后再进行二级页面做一个解析,最后再进行翻页操作;
  • 爬取字段: 分别是粽子的名称(标题)、价格、品牌(店铺)、类别(口味);
  • 使用工具: requests+lxml+pandas+time+re+pyecharts
  • 网站解析方式: xpath
最终的效果如下:

图片

数据爬取

京东网站,一般是动态加载的,也就是说,采用一般方式只能爬取到某个页面的前30个数据(一个页面一共60个数据)。

基于本文,我仅用最基本的方法,爬取了每个页面的前30条数据(如果大家有兴趣,可以自行下去爬取所有的数据)。

那么,本文究竟爬取了哪些字段呢?我给大家做一个展示,大家有兴趣,可以爬取更多的字段,做更为详细的分析。

图片

下面为大家展示爬虫代码:

import pandas as pd
import requests
from lxml import etree
import chardet
import time
import redef get_CI(url):headers = {'User-Agent':'Mozilla/5.0 (Windows NT 6.1; Win64; X64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/71.0.3578.80 Safari/537.36'}rqg = requests.get(url,headers=headers)rqg.encoding = chardet.detect(rqg.content)['encoding']html = etree.HTML(rqg.text)# 价格p_price = html.xpath('//div/div[@class="p-price"]/strong/i/text()')# 名称p_name = html.xpath('//div/div[@class="p-name p-name-type-2"]/a/em')p_name = [str(p_name[i].xpath('string(.)')) for i in range(len(p_name))]# 深层urldeep_ur1 = html.xpath('//div/div[@class="p-name p-name-type-2"]/a/@href')deep_url = ["http:" + i for i in deep_ur1]# 从这里开始,我们获取“二级页面”的信息           brands_list = []kinds_list = []for i in deep_url:rqg = requests.get(i,headers=headers)rqg.encoding = chardet.detect(rqg.content)['encoding']html = etree.HTML(rqg.text)# 品牌brands = html.xpath('//div/div[@class="ETab"]//ul[@id="parameter-brand"]/li/@title')brands_list.append(brands)# 类别kinds = re.findall('>类别:(.*?)</li>',rqg.text)kinds_list.append(kinds)data = pd.DataFrame({'名称':p_name,'价格':p_price,'品牌':brands_list,'类别':kinds_list})return(data)x = "https://search.jd.com/Search?keyword=%E7%B2%BD%E5%AD%90&qrst=1&wq=%E7%B2%BD%E5%AD%90&stock=1&page="
url_list = [x + str(i) for i in range(1,200,2)] 
res = pd.DataFrame(columns=['名称','价格','品牌','类别'])# 这里进行“翻页”操作
for url in url_list:res0 = get_CI(url)res = pd.concat([res,res0])time.sleep(3)# 保存数据
res.to_csv('aliang.csv',encoding='utf_8_sig')
最终爬取到的数据:

图片

数据清洗

从上图可以看到,整个数据算是很整齐的,不是特别乱,我们只做一些简单的操作即可。

先使用pandas库,来读取数据。

import pandas as pddf = pd.read_excel("粽子.xlsx",index_col=False)
df.head()

结果如下:

图片

我们分别针对 “品牌”“类别”**** 两个字段,去掉中括号。

df["品牌"] = df["品牌"].apply(lambda x: x[1:-1])
df["类别"] = df["类别"].apply(lambda x: x[1:-1])
df.head()

结果如下:

图片

粽子品牌排名前10的店铺
df["品牌"].value_counts()[:10]

结果如下:

图片

粽子口味排名前5的味道
def func1(x):if x.find("甜") > 0:return "甜粽子"else:return x
df["类别"] = df["类别"].apply(func1)
df["类别"].value_counts()[1:6] 

结果如下:

图片

粽子售卖价格区间划分
def price_range(x): # 按照我的购物习惯,划分价格if x <= 50:return '<50元'elif x <= 100:return '50-100元'elif x <= 300:return '100-300元'elif x <= 500:return '300-500元'elif x <= 1000:return '500-1000元'else:return '>1000元'df["价格区间"] = df["价格"].apply(price_range)
df["价格区间"].value_counts()

结果如下:

图片

由于数据不是很多,没有很多字段,也就没有很多乱数据。因此,这里也没有做数据去重、缺失值填充等操作。所以,大家可以下去获取更多字段,更多数据,用于数据分析。

数据可视化

俗话说:字不如表,表不如图。通过可视化分析,我们可以将数据背后 “隐藏” 的信息,给展现出来。

拓展: 当然,这里只是 “抛砖引玉”,我并没有获取太多的数据,也没有获取太多的字段。这里给学习的朋友当一个作业题,自己下去用更多的数据、更多的字段,做更透彻的分析。

在这里,我们基于以下几个问题,做一个可视化展示,分别是:

  • 粽子销售店铺Top10柱形图;
  • 粽子口味排名Top5柱形图;
  • 粽子销售价格区间划分饼图;
  • 粽子商品名称词云图;

鉴于整个文章排版,本文可视化部分的代码均可在本文末尾获取。

粽子销售店铺Top10柱形图

图片

结论分析: 去年,我们分析了一些月饼的数据,“五芳斋”“北京稻香村” 这几个牌子记忆犹新,可谓是做月饼、粽子的老店。像 “三全”“思念”,在我印象中一直以为它们只做水饺和汤圆,粽子是否值得一试呢?当然,这里还有一些新的牌子,像 “诸老大”“稻香私房” 等一些牌子,大家都可以下去搜索一下。买东西,就是要精挑细选,品牌也重要。

粽子口味排名Top5柱形图

图片

结论分析: 在我印象中,小时候一直吃的最多的就是 “甜粽子”,直到我上了初中才知道,粽子还可以有肉?当然,从图中可以看出,卖 “鲜肉粽” 的店铺还是居多,毕竟这个送人,还是显得高端、大气一些。这里还有一些口味,像 “蜜枣粽”“豆沙粽”,我基本没吃过。如果你送人,你会送什么口味的呢?

粽子销售价格区间划分饼图

图片

结论分析: 这里,我故意把价格区间细分。这个饼图也很符合实际,毕竟每年就过一次端午节,还是以薄利多销为主,接近80%的粽子,售价都在100元以下。当然,还有一些中档的粽子,价格在100-300元。大于300元,我觉得也没有吃的必要,反正我是不会花这么多钱去买粽子。

粽子商品名称词云图

图片

结论分析: 从图中,可以大致看出商家的卖点了。毕竟是节日,“送礼”“礼品” 体现了节日氛围。“猪肉”“豆沙” 体现了粽子口味。当然,它是否是 “早餐” 好选择呢?购买的话,还支持 “团购” 哦。这些字眼,多多少少都会各自吸引一部分人的眼球。

图形组合为大屏

图片

本文的可视化采用的pyecharts库,进行绘制。我们先单独做好每一张图,然后进行图形整合,即可做出一张漂亮的可视化大屏。关于如何制作,可以文末获取我的源代码文件!【粽子.ipynb】

图片

推荐阅读

我去,原来 520 情人节大家都在买这款口红!

利用 Python 爬取了 13966 条运维招聘信息,我得出了哪些结论?

利用 Python 爬取了 37483 条上海二手房信息,我得出的结论是?

利用 Python 分析了某化妆品企业的销售情况,我得出的结论是?

我用 Python 分析了一波热卖年货,原来大家都在买这些东西?

原文链接:Python实战 | “端午节” 送亲戚,送长辈,粽子可视化大屏来帮忙!


原创不易,码字不易。 觉得这篇文章对你有点用的话,麻烦你为本文点个赞,留言或转发一下,因为这将是我输出更多优质文章的动力,感谢!

⬇⬇⬇⬇⬇⬇⬇⬇

这篇关于Python实战 | “端午节” 送亲戚,送长辈,粽子可视化大屏来帮忙!的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/813606

相关文章

一文教你Python如何快速精准抓取网页数据

《一文教你Python如何快速精准抓取网页数据》这篇文章主要为大家详细介绍了如何利用Python实现快速精准抓取网页数据,文中的示例代码简洁易懂,具有一定的借鉴价值,有需要的小伙伴可以了解下... 目录1. 准备工作2. 基础爬虫实现3. 高级功能扩展3.1 抓取文章详情3.2 保存数据到文件4. 完整示例

使用Python实现IP地址和端口状态检测与监控

《使用Python实现IP地址和端口状态检测与监控》在网络运维和服务器管理中,IP地址和端口的可用性监控是保障业务连续性的基础需求,本文将带你用Python从零打造一个高可用IP监控系统,感兴趣的小伙... 目录概述:为什么需要IP监控系统使用步骤说明1. 环境准备2. 系统部署3. 核心功能配置系统效果展

基于Python打造一个智能单词管理神器

《基于Python打造一个智能单词管理神器》这篇文章主要为大家详细介绍了如何使用Python打造一个智能单词管理神器,从查询到导出的一站式解决,感兴趣的小伙伴可以跟随小编一起学习一下... 目录1. 项目概述:为什么需要这个工具2. 环境搭建与快速入门2.1 环境要求2.2 首次运行配置3. 核心功能使用指

Python实现微信自动锁定工具

《Python实现微信自动锁定工具》在数字化办公时代,微信已成为职场沟通的重要工具,但临时离开时忘记锁屏可能导致敏感信息泄露,下面我们就来看看如何使用Python打造一个微信自动锁定工具吧... 目录引言:当微信隐私遇到自动化守护效果展示核心功能全景图技术亮点深度解析1. 无操作检测引擎2. 微信路径智能获

Python中pywin32 常用窗口操作的实现

《Python中pywin32常用窗口操作的实现》本文主要介绍了Python中pywin32常用窗口操作的实现,pywin32主要的作用是供Python开发者快速调用WindowsAPI的一个... 目录获取窗口句柄获取最前端窗口句柄获取指定坐标处的窗口根据窗口的完整标题匹配获取句柄根据窗口的类别匹配获取句

利用Python打造一个Excel记账模板

《利用Python打造一个Excel记账模板》这篇文章主要为大家详细介绍了如何使用Python打造一个超实用的Excel记账模板,可以帮助大家高效管理财务,迈向财富自由之路,感兴趣的小伙伴快跟随小编一... 目录设置预算百分比超支标红预警记账模板功能介绍基础记账预算管理可视化分析摸鱼时间理财法碎片时间利用财

Python中的Walrus运算符分析示例详解

《Python中的Walrus运算符分析示例详解》Python中的Walrus运算符(:=)是Python3.8引入的一个新特性,允许在表达式中同时赋值和返回值,它的核心作用是减少重复计算,提升代码简... 目录1. 在循环中避免重复计算2. 在条件判断中同时赋值变量3. 在列表推导式或字典推导式中简化逻辑

python处理带有时区的日期和时间数据

《python处理带有时区的日期和时间数据》这篇文章主要为大家详细介绍了如何在Python中使用pytz库处理时区信息,包括获取当前UTC时间,转换为特定时区等,有需要的小伙伴可以参考一下... 目录时区基本信息python datetime使用timezonepandas处理时区数据知识延展时区基本信息

Python位移操作和位运算的实现示例

《Python位移操作和位运算的实现示例》本文主要介绍了Python位移操作和位运算的实现示例,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一... 目录1. 位移操作1.1 左移操作 (<<)1.2 右移操作 (>>)注意事项:2. 位运算2.1

使用Python和Pyecharts创建交互式地图

《使用Python和Pyecharts创建交互式地图》在数据可视化领域,创建交互式地图是一种强大的方式,可以使受众能够以引人入胜且信息丰富的方式探索地理数据,下面我们看看如何使用Python和Pyec... 目录简介Pyecharts 简介创建上海地图代码说明运行结果总结简介在数据可视化领域,创建交互式地