python爬虫学习之task1:request应用

2023-10-29 14:40

本文主要是介绍python爬虫学习之task1:request应用,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

python爬虫学习之task1

  • HTTP
  • 网页基础
    • 1.组成
    • 2.网页结构
  • Request
    • 1.安装
    • 2.七个方法
    • 4.豆瓣电影爬取练习

HTTP

HTTP是一个客户端(用户)和服务器端(网站)之间进行请求和应答的标准。

通过使用网页浏览器、网络爬虫或者其他工具,客户端可以向服务器上的指定端口(默认端口为80)发起一个HTTP请求。这个客户端成为客户代理(user agent)。应答服务器上存储着一些资源码,比如HTML文件和图像。这个应答服务器成为源服务器(origin server)。在用户代理和源服务器中间可能存在多个“中间层”,比如代理服务器、网关或者隧道(tunnel)。尽管TCP/IP是互联网最流行的协议,但HTTP中并没有规定必须使用它或它支持的层。

网页基础

1.组成

网页是由 HTML 、 CSS 、JavaScript 组成的。

HTML:整个网页的框架。

CSS:层叠样式表。样式表定义如何显示 HTML 元素,就像 HTML 中的字体标签和颜色属性所起的作用那样。样式通常保存在外部的 .css 文件中。“样式”指网页中文字大小、颜色、元素间距、排列等格式。

JavaScript :实现网页的数据动态交互、网页上的动画。

2.网页结构

创建一个简单的HTML页面,显示“hello python”。

<!DOCTYPE html> 
<!--整个文档是以 DOCTYPE 来开头的--><html lang="en"> 
<!--%整个文档最外层的标签是 <html>-->
<!--HTML 文档一般分为 head 和 body 两个部分--><head>
<!--在 head 头中,一般指定当前的编码格式为 UTF-8 ,并且使用 title 来定义网页的标题,显示在浏览器的标签上--><meta charset="UTF-8"><title>Title</title>
</head><body>
<!--body 中的内容一般为整个 html 文档的正文,html的标签由<h1>到<h6>六个标签构成,字体由大到小递减,
换行标签为<br>,链接使用<a>来创建,herf属性包含链接的URL地址,比如<a href="http://www.baidu.com">
一个指向百度的链接--><div id="container"> <!--id 属性为元素提供在全文档内的唯一标识--><div class="wrapper"> <!--class 属性提供了一种将类似元素分类的方式,常被用于语义化或格式化--><h1>Hello World</h1><div>Hello Python.</div></div></div>
</body>
</html> 
<!--结尾以 </html> 来表示闭和,不强制需要每个标签都一定要有闭和标签-->

在浏览器中打开,显示如下:

在这里插入图片描述

Request

一个网络爬虫程序最普遍的过程:

  1. 访问站点;
  2. 定位所需的信息;
  3. 得到并处理信息。

1.安装

pip install requests

2.七个方法

在这里插入图片描述request.get()用法:
在这里插入图片描述## 3.例子
分别用request.get()和python自带urllib爬取“python之禅”。

import requests
url = 'https://www.python.org/dev/peps/pep-0020/'
res = requests.get(url)
text = res.text
with open('zon_of_python.txt', 'w') as f:f.write(text[text.find('<pre')+28:text.find('</pre>')-1])
print(text[text.find('<pre')+28:text.find('</pre>')-1])
import urllib
url = 'https://www.python.org/dev/peps/pep-0020/'
res = urllib.request.urlopen(url).read().decode('utf-8')
print(res[res.find('<pre')+28:res.find('</pre>')-1])

输出:

Beautiful is better than ugly.
Explicit is better than implicit.
Simple is better than complex.
Complex is better than complicated.
Flat is better than nested.
Sparse is better than dense.
Readability counts.
Special cases aren't special enough to break the rules.
Although practicality beats purity.
Errors should never pass silently.
Unless explicitly silenced.
In the face of ambiguity, refuse the temptation to guess.
There should be one-- and preferably only one --obvious way to do it.
Although that way may not be obvious at first unless you're Dutch.
Now is better than never.
Although never is often better than *right* now.
If the implementation is hard to explain, it's a bad idea.
If the implementation is easy to explain, it may be a good idea.
Namespaces are one honking great idea -- let's do more of those!

用火狐浏览器打开金山词霸,翻译“python之禅”。打开开发者工具的network查看headers和data。

import requestsdef translate(word):url = "http://fy.iciba.com/ajax.php?a=fy"data = {'f': 'auto','t': 'auto','w': word,}headers = {'user-agent': 'Mozilla/5.0 (X11; Ubuntu; Linux x86_64; rv:75.0) Gecko/20100101 Firefox/75.0',}  # User-Agent会告诉网站服务器,访问者是通过什么工具来请求的,如果是爬虫请求,一般会拒绝,如果是用户浏览器,就会应答。response = requests.post(url, data=data, headers=headers)  # 发起请求json_data = response.json()  # 获取json数据# print(json_data)return json_datadef run(word):result = translate(word)['content']['out']print(result)return resultdef main():with open('zon_of_python.txt') as f:zh = [run(word) for word in f]with open('zon_of_python_zh-CN.txt', 'w') as g:for i in zh:g.write(i + '\n')if __name__ == '__main__':main()

结果:

美丽胜过丑陋。外显优于内隐..简单胜于复杂。复杂胜于复杂。平比嵌套好..疏而不密..可读性计数。特殊情况不足以打破规则。尽管实用性胜过纯度。错误永远不应该悄悄地过去。
除非有明确的沉默。面对暧昧,拒绝猜测的诱惑..应该有一种----最好只有一种----明显的办法来做到这一点。虽然这种方式一开始可能不明显,除非你是荷兰人。现在总比永远好。
虽然从来没有比现在更好。如果实施很难解释,那是个坏主意。如果实现很容易解释,这可能是个好主意。命名空间是一个伟大的想法-让我们做更多的这些!

4.豆瓣电影爬取练习

爬取豆瓣top250电影名字和海报。
注意:一开始res.status_code = 418,触发了反爬。解决方法:添加header。
代码:

import requests
import redef parase(text):para = re.compile('<img.*?alt.*?src.*?class="">')items = re.findall(para, text)for item in items:yield itemif __name__ == '__main__':headers = {'user-agent': 'Mozilla/5.0 (X11; Ubuntu; Linux x86_64; rv:75.0) Gecko/20100101 Firefox/75.0',}page = [0, 25, 50, 75, 100, 125, 150, 175, 200, 225]for num in page:url = 'https://movie.douban.com/top250?start=' + str(num) + '&fliter='print(url)res = requests.get(url,headers = headers)text = res.textprint(res.status_code)information = parase(text)for item in information:film_name = item[item.find('alt=')+4:item.find('src')-2]film_image = item[item.find('src=')+4:item.find('class')-2]print(film_name, film_image)

结果如下:

"肖申克的救赎 "https://img3.doubanio.com/view/photo/s_ratio_poster/public/p480747492.jpg
"霸王别姬 "https://img3.doubanio.com/view/photo/s_ratio_poster/public/p2561716440.jpg
"阿甘正传 "https://img9.doubanio.com/view/photo/s_ratio_poster/public/p1484728154.jpg
"这个杀手不太冷 "https://img3.doubanio.com/view/photo/s_ratio_poster/public/p511118051.jpg
"美丽人生 "https://img3.doubanio.com/view/photo/s_ratio_poster/public/p2578474613.jpg
"泰坦尼克号 "https://img9.doubanio.com/view/photo/s_ratio_poster/public/p457760035.jpg
"千与千寻 "https://img1.doubanio.com/view/photo/s_ratio_poster/public/p2557573348.jpg
"辛德勒的名单 "https://img3.doubanio.com/view/photo/s_ratio_poster/public/p492406163.jpg
"盗梦空间 "https://img9.doubanio.com/view/photo/s_ratio_poster/public/p513344864.jpg
"忠犬八公的故事 "https://img9.doubanio.com/view/photo/s_ratio_poster/public/p524964016.jpg
"海上钢琴师 "https://img9.doubanio.com/view/photo/s_ratio_poster/public/p2574551676.jpg
"楚门的世界 "https://img3.doubanio.com/view/photo/s_ratio_poster/public/p479682972.jpg
"三傻大闹宝莱坞 "https://img3.doubanio.com/view/photo/s_ratio_poster/public/p579729551.jpg
"机器人总动员 "https://img3.doubanio.com/view/photo/s_ratio_poster/public/p1461851991.jpg
"放牛班的春天 "https://img3.doubanio.com/view/photo/s_ratio_poster/public/p1910824951.jpg
"星际穿越 "https://img3.doubanio.com/view/photo/s_ratio_poster/public/p2206088801.jpg
"大话西游之大圣娶亲 "https://img9.doubanio.com/view/photo/s_ratio_poster/public/p2455050536.jpg
"熔炉 "https://img9.doubanio.com/view/photo/s_ratio_poster/public/p1363250216.jpg
"疯狂动物城 "https://img1.doubanio.com/view/photo/s_ratio_poster/public/p2315672647.jpg
"无间道 "https://img3.doubanio.com/view/photo/s_ratio_poster/public/p2564556863.jpg
"龙猫 "https://img9.doubanio.com/view/photo/s_ratio_poster/public/p2540924496.jpg
"教父 "https://img9.doubanio.com/view/photo/s_ratio_poster/public/p616779645.jpg
"当幸福来敲门 "https://img1.doubanio.com/view/photo/s_ratio_poster/public/p1312700628.jpg
"怦然心动 "https://img1.doubanio.com/view/photo/s_ratio_poster/public/p501177648.jpg
"触不可及 "https://img9.doubanio.com/view/photo/s_ratio_poster/public/p1454261925.jpg
https://movie.douban.com/top250?start=25&fliter=

后面的电影没列出来。注意一点,排行一共有10页,每页网址不同。

这篇关于python爬虫学习之task1:request应用的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/301335

相关文章

深入浅出Spring中的@Autowired自动注入的工作原理及实践应用

《深入浅出Spring中的@Autowired自动注入的工作原理及实践应用》在Spring框架的学习旅程中,@Autowired无疑是一个高频出现却又让初学者头疼的注解,它看似简单,却蕴含着Sprin... 目录深入浅出Spring中的@Autowired:自动注入的奥秘什么是依赖注入?@Autowired

Python中Json和其他类型相互转换的实现示例

《Python中Json和其他类型相互转换的实现示例》本文介绍了在Python中使用json模块实现json数据与dict、object之间的高效转换,包括loads(),load(),dumps()... 项目中经常会用到json格式转为object对象、dict字典格式等。在此做个记录,方便后续用到该方

从基础到高级详解Python数值格式化输出的完全指南

《从基础到高级详解Python数值格式化输出的完全指南》在数据分析、金融计算和科学报告领域,数值格式化是提升可读性和专业性的关键技术,本文将深入解析Python中数值格式化输出的相关方法,感兴趣的小伙... 目录引言:数值格式化的核心价值一、基础格式化方法1.1 三种核心格式化方式对比1.2 基础格式化示例

Python与MySQL实现数据库实时同步的详细步骤

《Python与MySQL实现数据库实时同步的详细步骤》在日常开发中,数据同步是一项常见的需求,本篇文章将使用Python和MySQL来实现数据库实时同步,我们将围绕数据变更捕获、数据处理和数据写入这... 目录前言摘要概述:数据同步方案1. 基本思路2. mysql Binlog 简介实现步骤与代码示例1

Python ORM神器之SQLAlchemy基本使用完全指南

《PythonORM神器之SQLAlchemy基本使用完全指南》SQLAlchemy是Python主流ORM框架,通过对象化方式简化数据库操作,支持多数据库,提供引擎、会话、模型等核心组件,实现事务... 目录一、什么是SQLAlchemy?二、安装SQLAlchemy三、核心概念1. Engine(引擎)

Ubuntu如何升级Python版本

《Ubuntu如何升级Python版本》Ubuntu22.04Docker中,安装Python3.11后,使用update-alternatives设置为默认版本,最后用python3-V验证... 目China编程录问题描述前提环境解决方法总结问题描述Ubuntu22.04系统自带python3.10,想升级

Python自动化处理PDF文档的操作完整指南

《Python自动化处理PDF文档的操作完整指南》在办公自动化中,PDF文档处理是一项常见需求,本文将介绍如何使用Python实现PDF文档的自动化处理,感兴趣的小伙伴可以跟随小编一起学习一下... 目录使用pymupdf读写PDF文件基本概念安装pymupdf提取文本内容提取图像添加水印使用pdfplum

Python 基于http.server模块实现简单http服务的代码举例

《Python基于http.server模块实现简单http服务的代码举例》Pythonhttp.server模块通过继承BaseHTTPRequestHandler处理HTTP请求,使用Threa... 目录测试环境代码实现相关介绍模块简介类及相关函数简介参考链接测试环境win11专业版python

Python从Word文档中提取图片并生成PPT的操作代码

《Python从Word文档中提取图片并生成PPT的操作代码》在日常办公场景中,我们经常需要从Word文档中提取图片,并将这些图片整理到PowerPoint幻灯片中,手动完成这一任务既耗时又容易出错,... 目录引言背景与需求解决方案概述代码解析代码核心逻辑说明总结引言在日常办公场景中,我们经常需要从 W

基于Python实现自动化邮件发送系统的完整指南

《基于Python实现自动化邮件发送系统的完整指南》在现代软件开发和自动化流程中,邮件通知是一个常见且实用的功能,无论是用于发送报告、告警信息还是用户提醒,通过Python实现自动化的邮件发送功能都能... 目录一、前言:二、项目概述三、配置文件 `.env` 解析四、代码结构解析1. 导入模块2. 加载环