Python爬虫案例入门教程(纯小白向)——夜读书屋小说

2023-10-04 09:26

本文主要是介绍Python爬虫案例入门教程(纯小白向)——夜读书屋小说,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

Python爬虫案例——夜读书屋小说

前言

如果你是python小白并且对爬虫有着浓厚的兴趣,但是面对网上错综复杂的实战案例看也看不懂,那么你可以尝试阅读我的文章,我也是从零基础python开始学习爬虫,非常清楚在过程中所遇到的困难,如果觉得我的文章对你的成长有所帮助,可以点上关注❤❤❤,我们一起进步!

文章目录

  • Python爬虫案例——夜读书屋小说
    • 前言
    • 实战案例
    • 爬取前的准备
    • 开始爬取
      • 函数讲解
      • 网页源代码的解析
      • 爬取结果呈现
      • 源代码
      • 总结

实战案例

我们今天所爬取的是一个小说网站,并且我们爬取的小说是南派三叔的藏海花(爬取的小说可以自行选择哈)
网站链接:https://www.yekan360.com/canghaihua/

在这里插入图片描述

我们的爬取目标是将这个网页里的全部章节爬取到我们的本地文件夹里,并且这次爬取我们将采用异步协程的方法来提高爬虫的效率

爬取前的准备

编译的环境是Pycharm,我们需要引入的头文件如下:

import requests
import asyncio
import aiohttp
import aiofiles
import os
from lxml import etree

如果你的Pycharm里没有安装aiohttp和aiofiles,那么可以参考一下Python中aiohttp和aiofiles模块的安装该篇文章

开始爬取

函数讲解

创建main()函数主入口

if __name__ == '__main__':main()

定义main函数,再里面定义一个获取小说章节网站的函数,再将返回值放入href_list变量中,最后利用asyncio中的run函数来运行,具体详细代码下面讲解

def main():href_list=get_chapter_url()asyncio.run(download(href_list))

定义get_chapter_url函数,在内部使用request模块中的get函数来获取到网站的resp(该网站不需要引入headers和cookie就能访问),之后我们应用xpath模块来爬取到我们想要的内容,最后将所需内容返回。
页面源代码的抓取下文细说哇(大家不要着急❤)

def get_chapter_url():url="https://www.yekan360.com/canghaihua/"resp=requests.get(url).text.encode("utf-8")#print(resp)tree=etree.HTML(resp)href_list=tree.xpath("//div[@id='play_0']/ul/li[@class='line3']/a/@href")return href_list

现在讲解在asyncio.run(download(href_list))中的download函数,其中download的前缀必须是async(将函数变为async对象,才能应用多任务),再应用for循环将href_list将href一一遍历出来,将拼接出完整的url,将url传入get_page_source函数(在下面讲解)来获取我们想要得到的信息,将每个获取网址内容的操作变为一个一个的任务,存放在我们所定义的tasks[ ]的列表中,再将tasks丢进asyncio.wait里让它们不断循环进行来大大提高效率

async def download(href_list):tasks=[]for href in href_list:url="http://yk360.kekikc.xyz/"+hreft=asyncio.create_task(get_page_source(url))tasks.append(t)await asyncio.wait(tasks)

定义get_page_source函数来获取子页面里小说信息,我们运用aiohttp模块来对页面url的处理来获取信息,得到的信息同样可以用xpath来筛选获取。然后运用os模块创建文件,最后运用aiofiles模块将内容下载到所创建的文件夹中

async def get_page_source(url):while 1:try:async with aiohttp.ClientSession() as session:async with session.get(url) as resp:page_source=await resp.text()tree=etree.HTML(page_source)title="\n".join(tree.xpath("//div[@class='m-title col-md-12']/h1/text()")).replace("[]","")body="\n".join(tree.xpath("//div[@class='panel-body']//p/text()")).replace("\u3000","")if not os.path.exists("./藏海花"):os.mkdir("./藏海花")async with aiofiles.open(f"./藏海花/{title}.txt",mode="w",encoding="utf-8") as f:await f.write(body)breakexcept:print("报错了,重试一下",url)print("下载完毕",url)

网页源代码的解析

  • 小说主页源代码解析
    在这里插入图片描述

可以由图看出,该源代码对于小白来说算相当友好的,每个章节的url全部都整齐的排列出来,但是获取的url只是一部分,是需要拼接操作的。我们可以用tree.xpath(“//div[@id=‘play_0’]/ul/li[@class=‘line3’]/a/@href”),对div的id定位,再对ul的深入,最后对li中的a的属性获取即可

tree.xpath("//div[@id='play_0']/ul/li[@class='line3']/a/@href")
  • 章节页面源代码解析

由于页面源代码不好看清楚其中的嵌套结构,因此我们采用对页面的检查来对信息的抓取

在这里插入图片描述

由图可见,我们需要的标题信息是div中的class='m-title col-md-12’里的h1,而内容信息是在div中class='panel-body’里的p因此可以写出:

title="\n".join(tree.xpath("//div[@class='m-title col-md-12']/h1/text()")).replace("[]","")
body="\n".join(tree.xpath("//div[@class='panel-body']//p/text()")).replace("\u3000","")

爬取结果呈现

所创建的文件夹是在该爬虫文件同一路径下

在这里插入图片描述

在这里插入图片描述

源代码

如果有同学实在不想自己书写,那么可以直接复制到自己的编译器(pycharm3.11)运行来体验一下爬虫的乐趣,但还是希望大家可以动手自己写一写来提高自己的能力

import requests
import asyncio
import aiohttp
import aiofiles
import os
from lxml import etreeasync def get_page_source(url):while 1:try:async with aiohttp.ClientSession() as session:async with session.get(url) as resp:page_source=await resp.text()tree=etree.HTML(page_source)title="\n".join(tree.xpath("//div[@class='m-title col-md-12']/h1/text()")).replace("[]","")body="\n".join(tree.xpath("//div[@class='panel-body']//p/text()")).replace("\u3000","")if not os.path.exists("./藏海花"):os.mkdir("./藏海花")async with aiofiles.open(f"./藏海花/{title}.txt",mode="w",encoding="utf-8") as f:await f.write(body)breakexcept:print("报错了,重试一下",url)print("下载完毕",url)
async def download(href_list):tasks=[]for href in href_list:url="http://yk360.kekikc.xyz/"+hreft=asyncio.create_task(get_page_source(url))tasks.append(t)await asyncio.wait(tasks)def get_chapter_url():url="https://www.yekan360.com/canghaihua/"resp=requests.get(url).text.encode("utf-8")#print(resp)tree=etree.HTML(resp)href_list=tree.xpath("//div[@id='play_0']/ul/li[@class='line3']/a/@href")return href_listdef main():href_list=get_chapter_url()asyncio.run(download(href_list))if __name__ == '__main__':main()

总结

本次的爬虫案例并没有特别的复杂,每个函数部分的逻辑也是非常的清晰的,大家完全可以自己写出来,同时文章中若有错误和不完善的地方,可以私信给我,因为作者本身也是个小白,望谅解(❁´◡`❁)。最后如果文章对你有所帮助,或者想要和作者一起成长,可以给我点个关注,我们一起进步!

这篇关于Python爬虫案例入门教程(纯小白向)——夜读书屋小说的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1793

相关文章

Django开发时如何避免频繁发送短信验证码(python图文代码)

《Django开发时如何避免频繁发送短信验证码(python图文代码)》Django开发时,为防止频繁发送验证码,后端需用Redis限制请求频率,结合管道技术提升效率,通过生产者消费者模式解耦业务逻辑... 目录避免频繁发送 验证码1. www.chinasem.cn避免频繁发送 验证码逻辑分析2. 避免频繁

精选20个好玩又实用的的Python实战项目(有图文代码)

《精选20个好玩又实用的的Python实战项目(有图文代码)》文章介绍了20个实用Python项目,涵盖游戏开发、工具应用、图像处理、机器学习等,使用Tkinter、PIL、OpenCV、Kivy等库... 目录① 猜字游戏② 闹钟③ 骰子模拟器④ 二维码⑤ 语言检测⑥ 加密和解密⑦ URL缩短⑧ 音乐播放

python panda库从基础到高级操作分析

《pythonpanda库从基础到高级操作分析》本文介绍了Pandas库的核心功能,包括处理结构化数据的Series和DataFrame数据结构,数据读取、清洗、分组聚合、合并、时间序列分析及大数据... 目录1. Pandas 概述2. 基本操作:数据读取与查看3. 索引操作:精准定位数据4. Group

Python pandas库自学超详细教程

《Pythonpandas库自学超详细教程》文章介绍了Pandas库的基本功能、安装方法及核心操作,涵盖数据导入(CSV/Excel等)、数据结构(Series、DataFrame)、数据清洗、转换... 目录一、什么是Pandas库(1)、Pandas 应用(2)、Pandas 功能(3)、数据结构二、安

Python使用Tenacity一行代码实现自动重试详解

《Python使用Tenacity一行代码实现自动重试详解》tenacity是一个专为Python设计的通用重试库,它的核心理念就是用简单、清晰的方式,为任何可能失败的操作添加重试能力,下面我们就来看... 目录一切始于一个简单的 API 调用Tenacity 入门:一行代码实现优雅重试精细控制:让重试按我

Python安装Pandas库的两种方法

《Python安装Pandas库的两种方法》本文介绍了三种安装PythonPandas库的方法,通过cmd命令行安装并解决版本冲突,手动下载whl文件安装,更换国内镜像源加速下载,最后建议用pipli... 目录方法一:cmd命令行执行pip install pandas方法二:找到pandas下载库,然后

Python实现网格交易策略的过程

《Python实现网格交易策略的过程》本文讲解Python网格交易策略,利用ccxt获取加密货币数据及backtrader回测,通过设定网格节点,低买高卖获利,适合震荡行情,下面跟我一起看看我们的第一... 网格交易是一种经典的量化交易策略,其核心思想是在价格上下预设多个“网格”,当价格触发特定网格时执行买

Python标准库之数据压缩和存档的应用详解

《Python标准库之数据压缩和存档的应用详解》在数据处理与存储领域,压缩和存档是提升效率的关键技术,Python标准库提供了一套完整的工具链,下面小编就来和大家简单介绍一下吧... 目录一、核心模块架构与设计哲学二、关键模块深度解析1.tarfile:专业级归档工具2.zipfile:跨平台归档首选3.

使用Python构建智能BAT文件生成器的完美解决方案

《使用Python构建智能BAT文件生成器的完美解决方案》这篇文章主要为大家详细介绍了如何使用wxPython构建一个智能的BAT文件生成器,它不仅能够为Python脚本生成启动脚本,还提供了完整的文... 目录引言运行效果图项目背景与需求分析核心需求技术选型核心功能实现1. 数据库设计2. 界面布局设计3

Python进行JSON和Excel文件转换处理指南

《Python进行JSON和Excel文件转换处理指南》在数据交换与系统集成中,JSON与Excel是两种极为常见的数据格式,本文将介绍如何使用Python实现将JSON转换为格式化的Excel文件,... 目录将 jsON 导入为格式化 Excel将 Excel 导出为结构化 JSON处理嵌套 JSON: