python使用selenium,实现简单爬虫功能

2024-09-03 17:28

本文主要是介绍python使用selenium,实现简单爬虫功能,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

有个朋友想爬取一些数据,让我帮忙搞下,我也比较菜,不怎么用python就随便搜了点资料尝试下。

环境

idea,python3.1.0

edge浏览器(谷歌也可以),都需要在python的安装目录下存放驱动。

使用edge浏览器,当浏览器更新时,需要更新edgedriver驱动

https://developer.microsoft.com/en-us/microsoft-edge/tools/webdriver/#downloads

然后在页面搜索版本号,比如127.0.2651.98
下载x86的,放在C:\Python311(python的安装目录) 修改文件名为MicrosoftWebDriver.exe

代码

data_model类,主要做数据的导出用的
import xlwt
FORMULA = 1
NORMAL = 0class Cell:def __init__(self, sheet, value, type=0, row_index=0, column_index=0, merge_row=0, merge_column=0):self.sheet = sheetself.row_index = row_indexself.column_index = column_indexself.row_name = row_index + 1self.column_name = self.transfer_column(column_index + 1)self.merge_row = merge_rowself.merge_column = merge_column# type==0是写入值,1是写入公式self.type = typeself.value = valuedef get_cell_location(self):return self.format_cell_location(self.column_name, self.row_name)def format_cell_location(self, col, row):return "{col}{row}".format(col=col, row=row)def get_pre_cell_location(self):return self.format_cell_location(self.transfer_column(self.column_index), self.row_name)def write(self):if self.type == NORMAL:self.write_value(self.value)elif self.type == FORMULA:self.write_formula(self.value)def write_value(self, value):print("write_value cell:", self.row_index, "-", self.column_index, "_", self.value, self.row_name)if self.merge_row == 0 and self.merge_column == 0:self.sheet.write(self.row_index, self.column_index, str(value))else:merge_row_index = self.row_index + self.merge_rowmerge_column_index = self.column_index + self.merge_columnif self.merge_row > 0:merge_row_index = merge_row_index - 1if self.merge_column > 0:merge_column_index = merge_column_index - 1self.sheet.write_merge(self.row_index, merge_row_index, self.column_index, merge_column_index, str(value))def write_formula(self, formula):#print(" write_formula cell:", self.row_index, "-", self.column_index, "_", self.value, "_", self.row_name)if self.merge_row == 0 and self.merge_column == 0:self.sheet.write(self.row_index, self.column_index, xlwt.Formula(formula))else:merge_row_index = self.row_index + self.merge_rowmerge_column_index = self.column_index + self.merge_columnif self.merge_row > 0:merge_row_index = merge_row_index - 1if self.merge_column > 0:merge_column_index = merge_column_index - 1self.sheet.write_merge(self.row_index, merge_row_index, self.column_index, merge_column_index,xlwt.Formula(formula))def transfer_column(self, index):'''转换列名:param index::return:'''chars = ['A', 'B', 'C', 'D', 'E', 'F', 'G', 'H', 'I', 'J', 'K', 'L', 'M', 'N', 'O', 'P', 'Q', 'R', 'S', 'T','U','V', 'W', 'X', 'Y', 'Z']b = len(chars)result = ""while True:if index % b == 0:result = chars[25]index = int(index / b)-1if index == 1:breakelse:result = chars[index % b - 1] + resultindex = int(index / b)if index == 0:breakreturn resultclass ZhuanLiInfo:def __init__(self, sheet, data):self.data = dataself.rows = []self.init_title(sheet)self.init_rows(sheet)def init_title(self, sheet):self.rows.append(Cell(sheet, "公司名称", NORMAL, 0, 0))self.rows.append(Cell(sheet, "电子邮箱", NORMAL, 0, 1))self.rows.append(Cell(sheet, "联系电话", NORMAL, 0, 2))self.rows.append(Cell(sheet, "机构网址", NORMAL, 0, 3))self.rows.append(Cell(sheet, "邮政编码", NORMAL, 0, 4))self.rows.append(Cell(sheet, "法定代表人", NORMAL, 0, 5))self.rows.append(Cell(sheet, "机构类型", NORMAL, 0, 6))self.rows.append(Cell(sheet, "通讯地址", NORMAL, 0, 7))self.rows.append(Cell(sheet, "代理机构状态", NORMAL, 0, 8))self.rows.append(Cell(sheet, "代理机构成立年限", NORMAL, 0, 9))self.rows.append(Cell(sheet, "信用等级", NORMAL, 0, 10))def init_rows(self, sheet):row_index = 0for third_transport_monitor_data in self.data:row_index = row_index+1col_index = 0for val in third_transport_monitor_data:self.rows.append(Cell(sheet, val, NORMAL, row_index, col_index))col_index = col_index+1def write(self):for row in self.rows:row.write()

主类:

ddd.py 
from selenium import webdriver
from selenium.webdriver.common.by import By
import  time
import random
import xlwt
from datetime import datetime
from data_model import ZhuanLiInfodef getData(driver,detail_list):# 查找页面上的所有<a>标签all_a_tags = driver.find_elements(By.CSS_SELECTOR, 'a.name')# 遍历所有<a>标签,并打印它们的href属性(如果有的话)row = 0for a_tag in all_a_tags:try:a_tag.click()except Exception as e:#捕获try块中发生的任何其他异常print(f"查询详情发生了其他异常: {e}")break;row += 1print("row:"+str(row))time.sleep(random.randint(30, 50))# 切换到新窗口(假设新窗口是最后一个打开的)original_window = driver.current_window_handleall_handles = driver.window_handlesfor handle in all_handles:if handle != original_window:driver.switch_to.window(handle)break# 在新页面上执行操作# 使用XPath查找元素companyName = driver.find_element(By.XPATH, '//div[contains(@class, "box")]/h5[contains(@class, "name")]').textemail = driver.find_element(By.XPATH,"//dt[text()='电子邮箱:']/following-sibling::dd").textphone = driver.find_element(By.XPATH,"//dt[text()='联系电话:']/following-sibling::dd").textwebUrl = driver.find_element(By.XPATH,"//dt[text()='机构网址:']/following-sibling::dd").textpostCode = driver.find_element(By.XPATH,"//dt[text()='邮政编码:']/following-sibling::dd").textfaren_elements = driver.find_elements(By.XPATH,'//dt[contains(text(), "法定代表人:")]/following-sibling::dd')faren = ''if faren_elements:faren=faren_elements[0].text;faren_elements2 = driver.find_elements(By.XPATH,'//dt[contains(text(), "执行事务合伙人:")]/following-sibling::dd')if faren_elements2:faren=faren_elements2[0].text;type = driver.find_element(By.XPATH,"//dt[text()='机构类型:']/following-sibling::dd").textaddress = driver.find_element(By.XPATH,"//dt[text()='通讯地址:']/following-sibling::dd").textstatus = driver.find_element(By.XPATH,"//dt[text()='代理机构状态']/following-sibling::dd").textyears = driver.find_element(By.XPATH,"//dt[text()='代理机构成立年限']/following-sibling::dd").textlevel = driver.find_element(By.XPATH,"//dt[text()='信用等级']/following-sibling::dd").textdetail_list.append([companyName, email, phone, webUrl, postCode, faren, type,address,status,years,level])print(detail_list[-1])driver.close()  # 关闭当前窗口# (可选)切换回原始窗口driver.switch_to.window(original_window)return detail_list
def queryByProvince(driver):#只查询广东省的all_province_link = driver.find_elements(By.CSS_SELECTOR, '.localoffice a')for a_province in all_province_link:if a_province.text.strip() == '广东省':a_province.click()break#查询queryButton=driver.find_element(By.CSS_SELECTOR, '.button-btn')queryButton.click()# 初始化WebDriver
driver = webdriver.Edge()
# 打开网页
driver.get("http://XXXX")
#只查询广东省的
queryByProvince(driver)
#数据列表
detail_list = []
detail_list = getData(driver,detail_list);page = 1
while True:#下一页all_page_link = driver.find_elements(By.CSS_SELECTOR, '.incpage a')hasnext = 0for a_page in all_page_link:if a_page.text.strip() == '下一页':try:a_page.click()hasnext = 1except Exception as e:#捕获try块中发生的任何其他异常print(f"page发生了其他异常: {e}")finally:break;if hasnext:page += 1print("page:"+str(page))try:detail_list = getData(driver,detail_list)except Exception as e:#捕获try块中发生的任何其他异常print(f"getData发生了其他异常: {e}")finally:break;else:break# 获取当前时间
now = datetime.now()
# 格式化时间为年月日时分秒字符串,例如:"2023-04-01 14:30:45"
datetime_str = now.strftime("%Y%m%d%H%M%S")
week = datetime_str + "信息"
wb = xlwt.Workbook(encoding="utf-8")
zhuanlisheet=wb.add_sheet("信息")
zhuanliObj=ZhuanLiInfo(zhuanlisheet,detail_list)
zhuanliObj.write()
wb.save(f"res/data-{week}1.xls")
# 关闭WebDriver
driver.quit()

大多数网站都有防爬机制,最好是能换ip,不行就间隔时间久点查询,我这里间隔time.sleep(random.randint(30, 50)) 30-50s查询,还是会被识别需要验证码。大家学习为主,不要随便爬取网站信息哈

这篇关于python使用selenium,实现简单爬虫功能的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!


原文地址:
本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.chinasem.cn/article/1133575

相关文章

Java 枚举的基本使用方法及实际使用场景

《Java枚举的基本使用方法及实际使用场景》枚举是Java中一种特殊的类,用于定义一组固定的常量,枚举类型提供了更好的类型安全性和可读性,适用于需要定义一组有限且固定的值的场景,本文给大家介绍Jav... 目录一、什么是枚举?二、枚举的基本使用方法定义枚举三、实际使用场景代替常量状态机四、更多用法1.实现接

python获取cmd环境变量值的实现代码

《python获取cmd环境变量值的实现代码》:本文主要介绍在Python中获取命令行(cmd)环境变量的值,可以使用标准库中的os模块,需要的朋友可以参考下... 前言全局说明在执行py过程中,总要使用到系统环境变量一、说明1.1 环境:Windows 11 家庭版 24H2 26100.4061

springboot项目中使用JOSN解析库的方法

《springboot项目中使用JOSN解析库的方法》JSON,全程是JavaScriptObjectNotation,是一种轻量级的数据交换格式,本文给大家介绍springboot项目中使用JOSN... 目录一、jsON解析简介二、Spring Boot项目中使用JSON解析1、pom.XML文件引入依

Java中的record使用详解

《Java中的record使用详解》record是Java14引入的一种新语法(在Java16中成为正式功能),用于定义不可变的数据类,这篇文章给大家介绍Java中的record相关知识,感兴趣的朋友... 目录1. 什么是 record?2. 基本语法3. record 的核心特性4. 使用场景5. 自定

Python中文件读取操作漏洞深度解析与防护指南

《Python中文件读取操作漏洞深度解析与防护指南》在Web应用开发中,文件操作是最基础也最危险的功能之一,这篇文章将全面剖析Python环境中常见的文件读取漏洞类型,成因及防护方案,感兴趣的小伙伴可... 目录引言一、静态资源处理中的路径穿越漏洞1.1 典型漏洞场景1.2 os.path.join()的陷

Python数据分析与可视化的全面指南(从数据清洗到图表呈现)

《Python数据分析与可视化的全面指南(从数据清洗到图表呈现)》Python是数据分析与可视化领域中最受欢迎的编程语言之一,凭借其丰富的库和工具,Python能够帮助我们快速处理、分析数据并生成高质... 目录一、数据采集与初步探索二、数据清洗的七种武器1. 缺失值处理策略2. 异常值检测与修正3. 数据

Python中bisect_left 函数实现高效插入与有序列表管理

《Python中bisect_left函数实现高效插入与有序列表管理》Python的bisect_left函数通过二分查找高效定位有序列表插入位置,与bisect_right的区别在于处理重复元素时... 目录一、bisect_left 基本介绍1.1 函数定义1.2 核心功能二、bisect_left 与

Python使用Tkinter打造一个完整的桌面应用

《Python使用Tkinter打造一个完整的桌面应用》在Python生态中,Tkinter就像一把瑞士军刀,它没有花哨的特效,却能快速搭建出实用的图形界面,作为Python自带的标准库,无需安装即可... 目录一、界面搭建:像搭积木一样组合控件二、菜单系统:给应用装上“控制中枢”三、事件驱动:让界面“活”

VSCode设置python SDK路径的实现步骤

《VSCode设置pythonSDK路径的实现步骤》本文主要介绍了VSCode设置pythonSDK路径的实现步骤,包括命令面板切换、settings.json配置、环境变量及虚拟环境处理,具有一定... 目录一、通过命令面板快速切换(推荐方法)二、通过 settings.json 配置(项目级/全局)三、

pandas实现数据concat拼接的示例代码

《pandas实现数据concat拼接的示例代码》pandas.concat用于合并DataFrame或Series,本文主要介绍了pandas实现数据concat拼接的示例代码,具有一定的参考价值,... 目录语法示例:使用pandas.concat合并数据默认的concat:参数axis=0,join=