使用Jsoup包抓取豆瓣Top250电影信息

2023-11-26 09:40

本文主要是介绍使用Jsoup包抓取豆瓣Top250电影信息,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

Java制作爬虫程序主要用到的网页解析工具Jsoup,而在Python使用的是漂亮汤,Jsoup能向JS和JQuery一样获取网页文件的模型(dom),是解析网页文件的有力工具,使用方法见:Jsoup详解(一)——Jsoup详解

Jsoup的使用方法和JS基本相同,进入豆瓣Top250界面:


找到链接地址:

String[] url=new String[25];//进入Top250的界面,抓取单个电影的网址Document document=Jsoup.connect("https://movie.douban.com/top250?start="+j*25).get();Elements bd=document.select("div.hd");for(int i=0;i<bd.size();i++){Elements info=bd.get(i).select("a[href]");url[i]=info.attr("href");}return url;

节这我们需要一个函数,向这个函数传递URL后可以获得网页的全部信息。
如果文本在标签之内,选择这个标签后,text方法提取文本即可,如果不在,比如,在<br>之前,这样的内容属于文本节点,可找邻近的节点,然后使用nextSibling()等方法获得文本节点。需要注意的是:
1、Document:文件对象模型(dom)
2、Elements:元素对象集合
3、Node:节点对象
这三者从大到小排列,一般的节点对象没有text方法,用outhtml方法获取它的值,除了文本节点。

//抓取电影名String name=document.select("span[property=v:itemreviewed]").text();info[0]=name;//抓取导演名String director=document.select("a[rel='v:directedBy']").text();info[1]=director;//抓取编剧String pl=document.select("span.attrs").get(1).text();info[2]=pl;//抓取演员名String actor=document.select("span.attrs").get(2).text();info[3]=actor;//抓取电影类型String type=document.select("span[property='v:genre']").text();info[4]=type;//对是否含有官方网站进行讨论int i=4;if(document.select("span.pl").get(i).text().contains("官方网站")){i++;}//抓取产地国家,它的内容是国家标签的下一个节点String country=document.select("span.pl").get(i).nextSibling().outerHtml();info[5]=country;//抓取语言String lan=document.select("span.pl").get(i+1).nextSibling().outerHtml();info[6]=lan;//抓取时长String runTime=document.select("span[property='v:runtime']").text();info[7]=runTime;//抓取别名String otherName=document.select("span.pl").get(i+4).nextSibling().outerHtml();info[8]=otherName;//抓取评价人数String peoNum=document.select("span[property='v:votes']").text();info[9]=peoNum;//抓取介绍String intro=document.getElementById("link-report").text();info[10]=intro;

这里是抓取豆瓣电影信息的过程




抓取信息后,我们将其放入一个表格中,这里使用的是poi包,它抓门用来处理文档,docx,xlsx等。

private static void writeRow(int i ,String[] row,File file) throws InvalidFormatException, IOException{Workbook workBook=new XSSFWorkbook(new FileInputStream(file));//获得Top250Sheet,前提是有这个sheet,没有会报错Sheet sheet=workBook.getSheet("Top250");Row r=sheet.createRow(i);for(int k=0;k<row.length;k++){r.createCell(k).setCellValue(row[k]);}//将数据写进表格workBook.write(new FileOutputStream(file));}

对每一页遍历,即可获取所有电影的网址
总的代码如下

package spider;import java.io.File;
import java.io.FileInputStream;
import java.io.FileOutputStream;
import java.io.IOException;import org.apache.poi.openxml4j.exceptions.InvalidFormatException;
import org.apache.poi.ss.usermodel.Row;
import org.apache.poi.ss.usermodel.Sheet;
import org.apache.poi.ss.usermodel.Workbook;
import org.apache.poi.xssf.usermodel.XSSFWorkbook;
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.select.Elements;public class DoubanTop250 
{public static void main(String[] args) throws InterruptedException, IOException, InvalidFormatException {File file=new File("Top250.xlsx");//写好表格标题String[] title= {"电影名","导演","编剧","演员","类型","国家","语言","时长","别名","评价人数","简介"};writeRow(0,title,file);//遍历,抓取Top250电影信息for(int k=0	;k<10;k++) {//抓取每页所有电影的网址String[] url=getMovieUrl(k);
//		String item=url[0];
//		System.out.println(getInfos(item)[8]);for(int i=0;i<=24;i++){String[] list =getInfos(url[i]);//防止豆瓣把你IP禁了Thread.sleep(500);writeRow(i+1+k*25,list, file);}}}//抓取每个电影的链接的函数private static String[] getMovieUrl(int j) throws IOException{String[] url=new String[25];//进入Top250的界面,抓取单个电影的网址Document document=Jsoup.connect("https://movie.douban.com/top250?start="+j*25).header("user-agent", "Chrome").get();Elements bd=document.select("div.hd");for(int i=0;i<bd.size();i++){Elements info=bd.get(i).select("a[href]");url[i]=info.attr("href");}return url;}//获取每个电影的信息,使用的是Jsoup包private static String[] getInfos(String url) {//豆瓣电影这个界面十分复杂,情况很多try{Document document=Jsoup.connect(url).get();String info[]=new String[11];//抓取电影名String name=document.select("span[property=v:itemreviewed]").text();info[0]=name;//抓取导演名String director=document.select("a[rel='v:directedBy']").text();info[1]=director;//抓取编剧int j=1;if(document.select("span.attrs").size()>2) {String pl=document.select("span.attrs").get(j).text();info[2]=pl;//抓取演员名String actor=document.select("span.attrs").get(j+1).text();info[3]=actor;}else if(document.select("span.attrs").size()==2){info[2]=null;info[3]=document.select("span.attrs").get(j).text();}else{info[2]=null;info[3]=null;}//抓取电影类型String type=document.select("span[property='v:genre']").text();info[4]=type;//对是否含有官方网站进行讨论int i=4;if(document.select("span.pl").get(i).text().contains("官方网站")){i++;}//抓取产地国家,它的内容是国家标签的下一个节点String country=document.select("span.pl").get(i).nextSibling().outerHtml();info[5]=country;//抓取语言String lan=document.select("span.pl").get(i+1).nextSibling().outerHtml();info[6]=lan;//抓取时长String runTime=document.select("span[property='v:runtime']").text();info[7]=runTime;//抓取别名String otherName=document.select("span.pl").get(i+4).nextSibling().outerHtml();info[8]=otherName;//抓取评价人数String peoNum=document.select("span[property='v:votes']").text();info[9]=peoNum;//抓取介绍String intro=document.getElementById("link-report").text();info[10]=intro;return info;//出现异常,不要抛出,会导致程序中断}catch (IOException e) {// TODO: handle exceptionreturn null;}}//向表格中写数据,使用POI包private static void writeRow(int i ,String[] row,File file) throws InvalidFormatException, IOException{Workbook workBook=new XSSFWorkbook(new FileInputStream(file));//获得Top250Sheet,前提是有这个sheet,没有会报错Sheet sheet=workBook.getSheet("Top250");Row r=sheet.createRow(i);for(int k=0;k<row.length;k++){r.createCell(k).setCellValue(row[k]);}//将数据写进表格workBook.write(new FileOutputStream(file));}
}

效果图

这篇关于使用Jsoup包抓取豆瓣Top250电影信息的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/425462

相关文章

Python使用FastAPI实现大文件分片上传与断点续传功能

《Python使用FastAPI实现大文件分片上传与断点续传功能》大文件直传常遇到超时、网络抖动失败、失败后只能重传的问题,分片上传+断点续传可以把大文件拆成若干小块逐个上传,并在中断后从已完成分片继... 目录一、接口设计二、服务端实现(FastAPI)2.1 运行环境2.2 目录结构建议2.3 serv

Spring Security简介、使用与最佳实践

《SpringSecurity简介、使用与最佳实践》SpringSecurity是一个能够为基于Spring的企业应用系统提供声明式的安全访问控制解决方案的安全框架,本文给大家介绍SpringSec... 目录一、如何理解 Spring Security?—— 核心思想二、如何在 Java 项目中使用?——

springboot中使用okhttp3的小结

《springboot中使用okhttp3的小结》OkHttp3是一个JavaHTTP客户端,可以处理各种请求类型,比如GET、POST、PUT等,并且支持高效的HTTP连接池、请求和响应缓存、以及异... 在 Spring Boot 项目中使用 OkHttp3 进行 HTTP 请求是一个高效且流行的方式。

Java使用Javassist动态生成HelloWorld类

《Java使用Javassist动态生成HelloWorld类》Javassist是一个非常强大的字节码操作和定义库,它允许开发者在运行时创建新的类或者修改现有的类,本文将简单介绍如何使用Javass... 目录1. Javassist简介2. 环境准备3. 动态生成HelloWorld类3.1 创建CtC

使用Python批量将.ncm格式的音频文件转换为.mp3格式的实战详解

《使用Python批量将.ncm格式的音频文件转换为.mp3格式的实战详解》本文详细介绍了如何使用Python通过ncmdump工具批量将.ncm音频转换为.mp3的步骤,包括安装、配置ffmpeg环... 目录1. 前言2. 安装 ncmdump3. 实现 .ncm 转 .mp34. 执行过程5. 执行结

Java使用jar命令配置服务器端口的完整指南

《Java使用jar命令配置服务器端口的完整指南》本文将详细介绍如何使用java-jar命令启动应用,并重点讲解如何配置服务器端口,同时提供一个实用的Web工具来简化这一过程,希望对大家有所帮助... 目录1. Java Jar文件简介1.1 什么是Jar文件1.2 创建可执行Jar文件2. 使用java

C#使用Spire.Doc for .NET实现HTML转Word的高效方案

《C#使用Spire.Docfor.NET实现HTML转Word的高效方案》在Web开发中,HTML内容的生成与处理是高频需求,然而,当用户需要将HTML页面或动态生成的HTML字符串转换为Wor... 目录引言一、html转Word的典型场景与挑战二、用 Spire.Doc 实现 HTML 转 Word1

Java中的抽象类与abstract 关键字使用详解

《Java中的抽象类与abstract关键字使用详解》:本文主要介绍Java中的抽象类与abstract关键字使用详解,本文通过实例代码给大家介绍的非常详细,感兴趣的朋友跟随小编一起看看吧... 目录一、抽象类的概念二、使用 abstract2.1 修饰类 => 抽象类2.2 修饰方法 => 抽象方法,没有

MyBatis ParameterHandler的具体使用

《MyBatisParameterHandler的具体使用》本文主要介绍了MyBatisParameterHandler的具体使用,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参... 目录一、概述二、源码1 关键属性2.setParameters3.TypeHandler1.TypeHa

Spring 中的切面与事务结合使用完整示例

《Spring中的切面与事务结合使用完整示例》本文给大家介绍Spring中的切面与事务结合使用完整示例,本文通过实例代码给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考... 目录 一、前置知识:Spring AOP 与 事务的关系 事务本质上就是一个“切面”二、核心组件三、完