spider-java (Jsoup) (媒体信息的爬取)

2024-05-03 13:18
文章标签 java 媒体 信息 jsoup spider

本文主要是介绍spider-java (Jsoup) (媒体信息的爬取),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

媒体基础信息爬取实例

GetAppname.java (代码为hive的udf,静态页面的获取)
package com.hb.hive.utils;import java.util.Random;import org.apache.hadoop.hive.ql.exec.UDF;
import org.apache.hadoop.io.Text;
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.select.Elements;public class GetAppname extends UDF {/*** 各大应用市场获取app名称* * @param Str* @return*/public Text evaluate(Object... args) {if (args.length == 1) {return new Text(getAppName(args[0].toString()));} else {return new Text(getAppName(args[0].toString()));}}public static String getAppName(String app_id) {try {int t =new Random().nextInt(10)*3000;System.out.println(t);Thread.sleep( t);} catch (InterruptedException e) {// TODO Auto-generated catch blocke.printStackTrace();}String app_name = "";app_name = getAppNameByYingyongbao(app_id);if (app_name.equals("")) {app_name = getAppNameByXiaomi(app_id);if (app_name.equals("")) {app_name = getAppByWandoujia(app_id);if (app_name.equals("")&&app_id.matches("[0-9]+")) {app_name = getAppNameByAso100(app_id);}}}return app_name;}/*** from Yingyonggao* * @param app_id* @return*/public static String getAppNameByYingyongbao(String app_id) {try {Document doc = Jsoup.connect("http://android.myapp.com/myapp/detail.htm?apkName=" + app_id).get();Elements elementsByClass = doc.getElementsByClass("det-name-int");if (!elementsByClass.text().toString().equals("")) {return elementsByClass.text().toString();}} catch (Exception e) {System.out.println(e);return "";}return "";}/*** from Xiaomi* * @param app_id* @return*/public static String getAppNameByXiaomi(String app_id) {try {Document doc = Jsoup.connect("http://app.mi.com/details?id=" + app_id).get();Elements elementsByClass = doc.getElementsByClass("yellow-flower");if (!elementsByClass.attr("alt").equals("")) {return elementsByClass.attr("alt");}} catch (Exception e) {System.out.println(e);return "";}return "";}/*** from Aso100* * @param app_id* @return*/public static String getAppNameByAso100(String app_id) {try {Document doc = Jsoup.connect("https://aso100.com/app/rank/appid/" + app_id ).get();Elements elementsByClass = doc.getElementsByClass("name-str");if (!elementsByClass.text().toString().equals("")) {return elementsByClass.text().toString();}} catch (Exception e) {System.out.println(e);return "";}return "";}/*** from Wandoujia* * @param app_id* @return*/public static String getAppByWandoujia(String app_id) {try {Document doc = Jsoup.connect("http://www.wandoujia.com/apps/" + app_id).get();Elements elementsByClass = doc.getElementsByClass("app-name");if (!elementsByClass.text().toString().equals("")) {return elementsByClass.text().toString();}} catch (Exception e) {System.out.println(e);return "";}return "";}/*** from Itunes* * @param app_id* @return*/public static String getAppByItunes(String app_id) {try {Document doc = Jsoup.connect("https://itunes.apple.com/cn/app/id" + app_id).get();Elements elementsByClass = doc.getElementsByClass("artwork");if (!elementsByClass.attr("alt").equals("")) {return elementsByClass.attr("alt");}} catch (Exception e) {System.out.println(e);return "";}return "";}/*** from Googleplay 需要翻墙* * @param app_id* @return*/public static String getAppByGoogleplay(String app_id) {try {Document doc = Jsoup.connect("https://play.google.com/store/apps/details?id=" + app_id + "&hl=zh_CN").get();Elements elementsByClass = doc.getElementsByClass("id-app-title");if (!elementsByClass.text().toString().equals("")) {return elementsByClass.text().toString();}} catch (Exception e) {System.out.println(e);return "";}return "";}@SuppressWarnings("static-access")public static void main(String[] args) {
//		System.out.println(getAppByItunes("1000114190"));System.out.println(new GetAppname().getAppName("com.yr.mmpic"));
//		 System.out.println(new
//		 GetAppname().getAppByGoogleplay("com.mandongkeji.comiclover"));
//		 System.out.println(new
//		 GetAppname().getAppByWandoujia("com.mandongkeji.comiclover"));
//		 System.out.println(new
//		 GetAppname().getAppNameByAso100("com.mandongkeji.comiclover"));		}
}


结合phantomjs实现Jsoup动态页面的获取
phantomjs-2.1.1-macosx+java
具体的搭建方式请百度
参考: http://phantomjs.org/quick-start.html
在安装目录(/usr/local/share/phantomjs-2.1.1-macosx/code.js)下添加code.js用于获取动态页面
code.js
system = require('system')
address = system.args[1];
var page = require('webpage').create();
var url = address;
page.open(url, function (status) {//Page is loaded!if (status !== 'success') {console.log('Unable to post!');} else {window.setTimeout(function () {page.render("test1.png");  //截图console.log(page.content);phantom.exit();}, 5000);}});
执行命令获取动态页面:phantomjs ./phantomjs-2.1.1-macosx/code.js https://www.qimai.cn/andapp/baseinfo/appid/120023
具体结合方式参考
https://www.jianshu.com/p/96220e239c35

这篇关于spider-java (Jsoup) (媒体信息的爬取)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/956836

相关文章

SpringBoot多环境配置数据读取方式

《SpringBoot多环境配置数据读取方式》SpringBoot通过环境隔离机制,支持properties/yaml/yml多格式配置,结合@Value、Environment和@Configura... 目录一、多环境配置的核心思路二、3种配置文件格式详解2.1 properties格式(传统格式)1.

Apache Ignite 与 Spring Boot 集成详细指南

《ApacheIgnite与SpringBoot集成详细指南》ApacheIgnite官方指南详解如何通过SpringBootStarter扩展实现自动配置,支持厚/轻客户端模式,简化Ign... 目录 一、背景:为什么需要这个集成? 二、两种集成方式(对应两种客户端模型) 三、方式一:自动配置 Thick

SQL Server跟踪自动统计信息更新实战指南

《SQLServer跟踪自动统计信息更新实战指南》本文详解SQLServer自动统计信息更新的跟踪方法,推荐使用扩展事件实时捕获更新操作及详细信息,同时结合系统视图快速检查统计信息状态,重点强调修... 目录SQL Server 如何跟踪自动统计信息更新:深入解析与实战指南 核心跟踪方法1️⃣ 利用系统目录

Spring WebClient从入门到精通

《SpringWebClient从入门到精通》本文详解SpringWebClient非阻塞响应式特性及优势,涵盖核心API、实战应用与性能优化,对比RestTemplate,为微服务通信提供高效解决... 目录一、WebClient 概述1.1 为什么选择 WebClient?1.2 WebClient 与

Java.lang.InterruptedException被中止异常的原因及解决方案

《Java.lang.InterruptedException被中止异常的原因及解决方案》Java.lang.InterruptedException是线程被中断时抛出的异常,用于协作停止执行,常见于... 目录报错问题报错原因解决方法Java.lang.InterruptedException 是 Jav

深入浅出SpringBoot WebSocket构建实时应用全面指南

《深入浅出SpringBootWebSocket构建实时应用全面指南》WebSocket是一种在单个TCP连接上进行全双工通信的协议,这篇文章主要为大家详细介绍了SpringBoot如何集成WebS... 目录前言为什么需要 WebSocketWebSocket 是什么Spring Boot 如何简化 We

java中pdf模版填充表单踩坑实战记录(itextPdf、openPdf、pdfbox)

《java中pdf模版填充表单踩坑实战记录(itextPdf、openPdf、pdfbox)》:本文主要介绍java中pdf模版填充表单踩坑的相关资料,OpenPDF、iText、PDFBox是三... 目录准备Pdf模版方法1:itextpdf7填充表单(1)加入依赖(2)代码(3)遇到的问题方法2:pd

Java Stream流之GroupBy的用法及应用场景

《JavaStream流之GroupBy的用法及应用场景》本教程将详细介绍如何在Java中使用Stream流的groupby方法,包括基本用法和一些常见的实际应用场景,感兴趣的朋友一起看看吧... 目录Java Stream流之GroupBy的用法1. 前言2. 基础概念什么是 GroupBy?Stream

SpringBoot监控API请求耗时的6中解决解决方案

《SpringBoot监控API请求耗时的6中解决解决方案》本文介绍SpringBoot中记录API请求耗时的6种方案,包括手动埋点、AOP切面、拦截器、Filter、事件监听、Micrometer+... 目录1. 简介2.实战案例2.1 手动记录2.2 自定义AOP记录2.3 拦截器技术2.4 使用Fi

最新Spring Security的基于内存用户认证方式

《最新SpringSecurity的基于内存用户认证方式》本文讲解SpringSecurity内存认证配置,适用于开发、测试等场景,通过代码创建用户及权限管理,支持密码加密,虽简单但不持久化,生产环... 目录1. 前言2. 因何选择内存认证?3. 基础配置实战❶ 创建Spring Security配置文件