用Java抓取CSDN主页上的图片

2024-09-08 05:32
文章标签 java 抓取 图片 csdn 主页

本文主要是介绍用Java抓取CSDN主页上的图片,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

一,步骤一:获取网页源码

1,定义要爬取的页面的URL对象

//定义即将访问的链接
String url="http://www.csdn.net";
//获取CSDN的URL对象
URL realURL = new URL(url);

2,获得这个链接的一个连接对象

URLConnection connection = realURL.openConnection();

        3,开始连接

connection.connect();

4,将连接的输入流转化成BufferedReader输入流,通过BufferedReader对象存放到一个String对象中

in = new BufferedReader(new InputStreamReader(connection.getInputStream()));		
String line="";
while((line=in.readLine())!=null){result+=line+"\n";
}
二,步骤二:正则匹配,存储图片

1,找出正则表达式的样板

Pattern pattern = Pattern.compile("<img \\S+\\ssrc=\"(.+?)\"");

2,匹配对象

Matcher matcher = pattern.matcher(result);

3,实例化文件输出流

imgFile= new FileOutputStream("D:\\CSDN"+i+".png");

4,获得图片链接的缓冲流
URL imgURL = new URL(img);
URLConnection imgConnection = imgURL.openConnection();
imgConnection.connect();
bufferedImage = (BufferedInputStream) new BufferedInputStream(imgConnection.getInputStream());

5,将缓冲流写入文件中

while((size=bufferedImage.read(buf))!=-1){
<span style="white-space:pre">	</span>imgFile.write(buf, 0, size);
}

6,将输入输出流关闭

in.close();
imgFile.close();
bufferedImage.close();


程序的完整源码:

import java.io.*;
import java.net.MalformedURLException;
import java.net.URL;
import java.net.URLConnection;
import java.util.regex.Matcher;
import java.util.regex.Pattern;public class CrawOne {public static void main(String[] args) throws IOException {// TODO Auto-generated method stub//定义即将访问的链接String url="http://www.csdn.net";//定义一个用来存储的字符串String result="";//用于存储网页源代码BufferedReader in = null;//用于存储图片链接String img=null;int i=0;int size=0;//定义每一次读取缓冲区的最大值int BUFFER_SIZE = 1024;  byte[] buf = new byte[BUFFER_SIZE]; //图片文件输出流FileOutputStream imgFile=null;//缓冲输入流BufferedInputStream bufferedImage =null;try {//获取CSDN的URL对象URL realURL = new URL(url);//获得这个链接的一个连接对象URLConnection connection = realURL.openConnection();//开始连接connection.connect();//将连接的输入流转化成BufferedReader输入流in = new BufferedReader(new InputStreamReader(connection.getInputStream()));		String line="";while((line=in.readLine())!=null){result+=line+"\n";}//找出正则表达式的样板Pattern pattern = Pattern.compile("<img \\S+\\ssrc=\"(.+?)\"");//匹配对象Matcher matcher = pattern.matcher(result);while(matcher.find()){System.out.println("find one");//获得匹配的值,由于只定义了一个群组,即正则表达式中打括号的组数,所以是group(1),group(0)表示的是整个匹配img = matcher.group(1);//实例化文件输出流imgFile= new FileOutputStream("D:\\CSDN"+i+".png");i++;//获得图片链接的缓冲流URL imgURL = new URL(img);URLConnection imgConnection = imgURL.openConnection();imgConnection.connect();bufferedImage = (BufferedInputStream) new BufferedInputStream(imgConnection.getInputStream());//将缓冲流写入文件中while((size=bufferedImage.read(buf))!=-1){imgFile.write(buf, 0, size);}}} catch (MalformedURLException e) {// TODO Auto-generated catch blocke.printStackTrace();}finally {if (in!=null) {//将输入输出流关闭in.close();imgFile.close();bufferedImage.close();}}System.out.println("Get some picture.");}}



这篇关于用Java抓取CSDN主页上的图片的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1147252

相关文章

Spring WebClient从入门到精通

《SpringWebClient从入门到精通》本文详解SpringWebClient非阻塞响应式特性及优势,涵盖核心API、实战应用与性能优化,对比RestTemplate,为微服务通信提供高效解决... 目录一、WebClient 概述1.1 为什么选择 WebClient?1.2 WebClient 与

Java.lang.InterruptedException被中止异常的原因及解决方案

《Java.lang.InterruptedException被中止异常的原因及解决方案》Java.lang.InterruptedException是线程被中断时抛出的异常,用于协作停止执行,常见于... 目录报错问题报错原因解决方法Java.lang.InterruptedException 是 Jav

深入浅出SpringBoot WebSocket构建实时应用全面指南

《深入浅出SpringBootWebSocket构建实时应用全面指南》WebSocket是一种在单个TCP连接上进行全双工通信的协议,这篇文章主要为大家详细介绍了SpringBoot如何集成WebS... 目录前言为什么需要 WebSocketWebSocket 是什么Spring Boot 如何简化 We

java中pdf模版填充表单踩坑实战记录(itextPdf、openPdf、pdfbox)

《java中pdf模版填充表单踩坑实战记录(itextPdf、openPdf、pdfbox)》:本文主要介绍java中pdf模版填充表单踩坑的相关资料,OpenPDF、iText、PDFBox是三... 目录准备Pdf模版方法1:itextpdf7填充表单(1)加入依赖(2)代码(3)遇到的问题方法2:pd

Java Stream流之GroupBy的用法及应用场景

《JavaStream流之GroupBy的用法及应用场景》本教程将详细介绍如何在Java中使用Stream流的groupby方法,包括基本用法和一些常见的实际应用场景,感兴趣的朋友一起看看吧... 目录Java Stream流之GroupBy的用法1. 前言2. 基础概念什么是 GroupBy?Stream

SpringBoot监控API请求耗时的6中解决解决方案

《SpringBoot监控API请求耗时的6中解决解决方案》本文介绍SpringBoot中记录API请求耗时的6种方案,包括手动埋点、AOP切面、拦截器、Filter、事件监听、Micrometer+... 目录1. 简介2.实战案例2.1 手动记录2.2 自定义AOP记录2.3 拦截器技术2.4 使用Fi

最新Spring Security的基于内存用户认证方式

《最新SpringSecurity的基于内存用户认证方式》本文讲解SpringSecurity内存认证配置,适用于开发、测试等场景,通过代码创建用户及权限管理,支持密码加密,虽简单但不持久化,生产环... 目录1. 前言2. 因何选择内存认证?3. 基础配置实战❶ 创建Spring Security配置文件

Spring Security 单点登录与自动登录机制的实现原理

《SpringSecurity单点登录与自动登录机制的实现原理》本文探讨SpringSecurity实现单点登录(SSO)与自动登录机制,涵盖JWT跨系统认证、RememberMe持久化Token... 目录一、核心概念解析1.1 单点登录(SSO)1.2 自动登录(Remember Me)二、代码分析三、

springboot自定义注解RateLimiter限流注解技术文档详解

《springboot自定义注解RateLimiter限流注解技术文档详解》文章介绍了限流技术的概念、作用及实现方式,通过SpringAOP拦截方法、缓存存储计数器,结合注解、枚举、异常类等核心组件,... 目录什么是限流系统架构核心组件详解1. 限流注解 (@RateLimiter)2. 限流类型枚举 (

Java Thread中join方法使用举例详解

《JavaThread中join方法使用举例详解》JavaThread中join()方法主要是让调用改方法的thread完成run方法里面的东西后,在执行join()方法后面的代码,这篇文章主要介绍... 目录前言1.join()方法的定义和作用2.join()方法的三个重载版本3.join()方法的工作原