Python爬虫案例入门教程(纯小白向)——夜读书屋小说

2023-10-04 09:26

本文主要是介绍Python爬虫案例入门教程(纯小白向)——夜读书屋小说,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

Python爬虫案例——夜读书屋小说

前言

如果你是python小白并且对爬虫有着浓厚的兴趣,但是面对网上错综复杂的实战案例看也看不懂,那么你可以尝试阅读我的文章,我也是从零基础python开始学习爬虫,非常清楚在过程中所遇到的困难,如果觉得我的文章对你的成长有所帮助,可以点上关注❤❤❤,我们一起进步!

文章目录

  • Python爬虫案例——夜读书屋小说
    • 前言
    • 实战案例
    • 爬取前的准备
    • 开始爬取
      • 函数讲解
      • 网页源代码的解析
      • 爬取结果呈现
      • 源代码
      • 总结

实战案例

我们今天所爬取的是一个小说网站,并且我们爬取的小说是南派三叔的藏海花(爬取的小说可以自行选择哈)
网站链接:https://www.yekan360.com/canghaihua/

在这里插入图片描述

我们的爬取目标是将这个网页里的全部章节爬取到我们的本地文件夹里,并且这次爬取我们将采用异步协程的方法来提高爬虫的效率

爬取前的准备

编译的环境是Pycharm,我们需要引入的头文件如下:

import requests
import asyncio
import aiohttp
import aiofiles
import os
from lxml import etree

如果你的Pycharm里没有安装aiohttp和aiofiles,那么可以参考一下Python中aiohttp和aiofiles模块的安装该篇文章

开始爬取

函数讲解

创建main()函数主入口

if __name__ == '__main__':main()

定义main函数,再里面定义一个获取小说章节网站的函数,再将返回值放入href_list变量中,最后利用asyncio中的run函数来运行,具体详细代码下面讲解

def main():href_list=get_chapter_url()asyncio.run(download(href_list))

定义get_chapter_url函数,在内部使用request模块中的get函数来获取到网站的resp(该网站不需要引入headers和cookie就能访问),之后我们应用xpath模块来爬取到我们想要的内容,最后将所需内容返回。
页面源代码的抓取下文细说哇(大家不要着急❤)

def get_chapter_url():url="https://www.yekan360.com/canghaihua/"resp=requests.get(url).text.encode("utf-8")#print(resp)tree=etree.HTML(resp)href_list=tree.xpath("//div[@id='play_0']/ul/li[@class='line3']/a/@href")return href_list

现在讲解在asyncio.run(download(href_list))中的download函数,其中download的前缀必须是async(将函数变为async对象,才能应用多任务),再应用for循环将href_list将href一一遍历出来,将拼接出完整的url,将url传入get_page_source函数(在下面讲解)来获取我们想要得到的信息,将每个获取网址内容的操作变为一个一个的任务,存放在我们所定义的tasks[ ]的列表中,再将tasks丢进asyncio.wait里让它们不断循环进行来大大提高效率

async def download(href_list):tasks=[]for href in href_list:url="http://yk360.kekikc.xyz/"+hreft=asyncio.create_task(get_page_source(url))tasks.append(t)await asyncio.wait(tasks)

定义get_page_source函数来获取子页面里小说信息,我们运用aiohttp模块来对页面url的处理来获取信息,得到的信息同样可以用xpath来筛选获取。然后运用os模块创建文件,最后运用aiofiles模块将内容下载到所创建的文件夹中

async def get_page_source(url):while 1:try:async with aiohttp.ClientSession() as session:async with session.get(url) as resp:page_source=await resp.text()tree=etree.HTML(page_source)title="\n".join(tree.xpath("//div[@class='m-title col-md-12']/h1/text()")).replace("[]","")body="\n".join(tree.xpath("//div[@class='panel-body']//p/text()")).replace("\u3000","")if not os.path.exists("./藏海花"):os.mkdir("./藏海花")async with aiofiles.open(f"./藏海花/{title}.txt",mode="w",encoding="utf-8") as f:await f.write(body)breakexcept:print("报错了,重试一下",url)print("下载完毕",url)

网页源代码的解析

  • 小说主页源代码解析
    在这里插入图片描述

可以由图看出,该源代码对于小白来说算相当友好的,每个章节的url全部都整齐的排列出来,但是获取的url只是一部分,是需要拼接操作的。我们可以用tree.xpath(“//div[@id=‘play_0’]/ul/li[@class=‘line3’]/a/@href”),对div的id定位,再对ul的深入,最后对li中的a的属性获取即可

tree.xpath("//div[@id='play_0']/ul/li[@class='line3']/a/@href")
  • 章节页面源代码解析

由于页面源代码不好看清楚其中的嵌套结构,因此我们采用对页面的检查来对信息的抓取

在这里插入图片描述

由图可见,我们需要的标题信息是div中的class='m-title col-md-12’里的h1,而内容信息是在div中class='panel-body’里的p因此可以写出:

title="\n".join(tree.xpath("//div[@class='m-title col-md-12']/h1/text()")).replace("[]","")
body="\n".join(tree.xpath("//div[@class='panel-body']//p/text()")).replace("\u3000","")

爬取结果呈现

所创建的文件夹是在该爬虫文件同一路径下

在这里插入图片描述

在这里插入图片描述

源代码

如果有同学实在不想自己书写,那么可以直接复制到自己的编译器(pycharm3.11)运行来体验一下爬虫的乐趣,但还是希望大家可以动手自己写一写来提高自己的能力

import requests
import asyncio
import aiohttp
import aiofiles
import os
from lxml import etreeasync def get_page_source(url):while 1:try:async with aiohttp.ClientSession() as session:async with session.get(url) as resp:page_source=await resp.text()tree=etree.HTML(page_source)title="\n".join(tree.xpath("//div[@class='m-title col-md-12']/h1/text()")).replace("[]","")body="\n".join(tree.xpath("//div[@class='panel-body']//p/text()")).replace("\u3000","")if not os.path.exists("./藏海花"):os.mkdir("./藏海花")async with aiofiles.open(f"./藏海花/{title}.txt",mode="w",encoding="utf-8") as f:await f.write(body)breakexcept:print("报错了,重试一下",url)print("下载完毕",url)
async def download(href_list):tasks=[]for href in href_list:url="http://yk360.kekikc.xyz/"+hreft=asyncio.create_task(get_page_source(url))tasks.append(t)await asyncio.wait(tasks)def get_chapter_url():url="https://www.yekan360.com/canghaihua/"resp=requests.get(url).text.encode("utf-8")#print(resp)tree=etree.HTML(resp)href_list=tree.xpath("//div[@id='play_0']/ul/li[@class='line3']/a/@href")return href_listdef main():href_list=get_chapter_url()asyncio.run(download(href_list))if __name__ == '__main__':main()

总结

本次的爬虫案例并没有特别的复杂,每个函数部分的逻辑也是非常的清晰的,大家完全可以自己写出来,同时文章中若有错误和不完善的地方,可以私信给我,因为作者本身也是个小白,望谅解(❁´◡`❁)。最后如果文章对你有所帮助,或者想要和作者一起成长,可以给我点个关注,我们一起进步!

这篇关于Python爬虫案例入门教程(纯小白向)——夜读书屋小说的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1793

相关文章

使用python生成固定格式序号的方法详解

《使用python生成固定格式序号的方法详解》这篇文章主要为大家详细介绍了如何使用python生成固定格式序号,文中的示例代码讲解详细,具有一定的借鉴价值,有需要的小伙伴可以参考一下... 目录生成结果验证完整生成代码扩展说明1. 保存到文本文件2. 转换为jsON格式3. 处理特殊序号格式(如带圈数字)4

Python版本信息获取方法详解与实战

《Python版本信息获取方法详解与实战》在Python开发中,获取Python版本号是调试、兼容性检查和版本控制的重要基础操作,本文详细介绍了如何使用sys和platform模块获取Python的主... 目录1. python版本号获取基础2. 使用sys模块获取版本信息2.1 sys模块概述2.1.1

一文详解Python如何开发游戏

《一文详解Python如何开发游戏》Python是一种非常流行的编程语言,也可以用来开发游戏模组,:本文主要介绍Python如何开发游戏的相关资料,文中通过代码介绍的非常详细,需要的朋友可以参考下... 目录一、python简介二、Python 开发 2D 游戏的优劣势优势缺点三、Python 开发 3D

Python函数作用域与闭包举例深度解析

《Python函数作用域与闭包举例深度解析》Python函数的作用域规则和闭包是编程中的关键概念,它们决定了变量的访问和生命周期,:本文主要介绍Python函数作用域与闭包的相关资料,文中通过代码... 目录1. 基础作用域访问示例1:访问全局变量示例2:访问外层函数变量2. 闭包基础示例3:简单闭包示例4

Python实现字典转字符串的五种方法

《Python实现字典转字符串的五种方法》本文介绍了在Python中如何将字典数据结构转换为字符串格式的多种方法,首先可以通过内置的str()函数进行简单转换;其次利用ison.dumps()函数能够... 目录1、使用json模块的dumps方法:2、使用str方法:3、使用循环和字符串拼接:4、使用字符

Python版本与package版本兼容性检查方法总结

《Python版本与package版本兼容性检查方法总结》:本文主要介绍Python版本与package版本兼容性检查方法的相关资料,文中提供四种检查方法,分别是pip查询、conda管理、PyP... 目录引言为什么会出现兼容性问题方法一:用 pip 官方命令查询可用版本方法二:conda 管理包环境方法

基于Python开发Windows自动更新控制工具

《基于Python开发Windows自动更新控制工具》在当今数字化时代,操作系统更新已成为计算机维护的重要组成部分,本文介绍一款基于Python和PyQt5的Windows自动更新控制工具,有需要的可... 目录设计原理与技术实现系统架构概述数学建模工具界面完整代码实现技术深度分析多层级控制理论服务层控制注

pycharm跑python项目易出错的问题总结

《pycharm跑python项目易出错的问题总结》:本文主要介绍pycharm跑python项目易出错问题的相关资料,当你在PyCharm中运行Python程序时遇到报错,可以按照以下步骤进行排... 1. 一定不要在pycharm终端里面创建环境安装别人的项目子模块等,有可能出现的问题就是你不报错都安装

Python打包成exe常用的四种方法小结

《Python打包成exe常用的四种方法小结》本文主要介绍了Python打包成exe常用的四种方法,包括PyInstaller、cx_Freeze、Py2exe、Nuitka,文中通过示例代码介绍的非... 目录一.PyInstaller11.安装:2. PyInstaller常用参数下面是pyinstal

Python爬虫HTTPS使用requests,httpx,aiohttp实战中的证书异步等问题

《Python爬虫HTTPS使用requests,httpx,aiohttp实战中的证书异步等问题》在爬虫工程里,“HTTPS”是绕不开的话题,HTTPS为传输加密提供保护,同时也给爬虫带来证书校验、... 目录一、核心问题与优先级检查(先问三件事)二、基础示例:requests 与证书处理三、高并发选型: