spider-java (Jsoup) (媒体信息的爬取)

2024-05-03 13:18
文章标签 java 媒体 信息 jsoup spider

本文主要是介绍spider-java (Jsoup) (媒体信息的爬取),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

媒体基础信息爬取实例

GetAppname.java (代码为hive的udf,静态页面的获取)
package com.hb.hive.utils;import java.util.Random;import org.apache.hadoop.hive.ql.exec.UDF;
import org.apache.hadoop.io.Text;
import org.jsoup.Jsoup;
import org.jsoup.nodes.Document;
import org.jsoup.select.Elements;public class GetAppname extends UDF {/*** 各大应用市场获取app名称* * @param Str* @return*/public Text evaluate(Object... args) {if (args.length == 1) {return new Text(getAppName(args[0].toString()));} else {return new Text(getAppName(args[0].toString()));}}public static String getAppName(String app_id) {try {int t =new Random().nextInt(10)*3000;System.out.println(t);Thread.sleep( t);} catch (InterruptedException e) {// TODO Auto-generated catch blocke.printStackTrace();}String app_name = "";app_name = getAppNameByYingyongbao(app_id);if (app_name.equals("")) {app_name = getAppNameByXiaomi(app_id);if (app_name.equals("")) {app_name = getAppByWandoujia(app_id);if (app_name.equals("")&&app_id.matches("[0-9]+")) {app_name = getAppNameByAso100(app_id);}}}return app_name;}/*** from Yingyonggao* * @param app_id* @return*/public static String getAppNameByYingyongbao(String app_id) {try {Document doc = Jsoup.connect("http://android.myapp.com/myapp/detail.htm?apkName=" + app_id).get();Elements elementsByClass = doc.getElementsByClass("det-name-int");if (!elementsByClass.text().toString().equals("")) {return elementsByClass.text().toString();}} catch (Exception e) {System.out.println(e);return "";}return "";}/*** from Xiaomi* * @param app_id* @return*/public static String getAppNameByXiaomi(String app_id) {try {Document doc = Jsoup.connect("http://app.mi.com/details?id=" + app_id).get();Elements elementsByClass = doc.getElementsByClass("yellow-flower");if (!elementsByClass.attr("alt").equals("")) {return elementsByClass.attr("alt");}} catch (Exception e) {System.out.println(e);return "";}return "";}/*** from Aso100* * @param app_id* @return*/public static String getAppNameByAso100(String app_id) {try {Document doc = Jsoup.connect("https://aso100.com/app/rank/appid/" + app_id ).get();Elements elementsByClass = doc.getElementsByClass("name-str");if (!elementsByClass.text().toString().equals("")) {return elementsByClass.text().toString();}} catch (Exception e) {System.out.println(e);return "";}return "";}/*** from Wandoujia* * @param app_id* @return*/public static String getAppByWandoujia(String app_id) {try {Document doc = Jsoup.connect("http://www.wandoujia.com/apps/" + app_id).get();Elements elementsByClass = doc.getElementsByClass("app-name");if (!elementsByClass.text().toString().equals("")) {return elementsByClass.text().toString();}} catch (Exception e) {System.out.println(e);return "";}return "";}/*** from Itunes* * @param app_id* @return*/public static String getAppByItunes(String app_id) {try {Document doc = Jsoup.connect("https://itunes.apple.com/cn/app/id" + app_id).get();Elements elementsByClass = doc.getElementsByClass("artwork");if (!elementsByClass.attr("alt").equals("")) {return elementsByClass.attr("alt");}} catch (Exception e) {System.out.println(e);return "";}return "";}/*** from Googleplay 需要翻墙* * @param app_id* @return*/public static String getAppByGoogleplay(String app_id) {try {Document doc = Jsoup.connect("https://play.google.com/store/apps/details?id=" + app_id + "&hl=zh_CN").get();Elements elementsByClass = doc.getElementsByClass("id-app-title");if (!elementsByClass.text().toString().equals("")) {return elementsByClass.text().toString();}} catch (Exception e) {System.out.println(e);return "";}return "";}@SuppressWarnings("static-access")public static void main(String[] args) {
//		System.out.println(getAppByItunes("1000114190"));System.out.println(new GetAppname().getAppName("com.yr.mmpic"));
//		 System.out.println(new
//		 GetAppname().getAppByGoogleplay("com.mandongkeji.comiclover"));
//		 System.out.println(new
//		 GetAppname().getAppByWandoujia("com.mandongkeji.comiclover"));
//		 System.out.println(new
//		 GetAppname().getAppNameByAso100("com.mandongkeji.comiclover"));		}
}


结合phantomjs实现Jsoup动态页面的获取
phantomjs-2.1.1-macosx+java
具体的搭建方式请百度
参考: http://phantomjs.org/quick-start.html
在安装目录(/usr/local/share/phantomjs-2.1.1-macosx/code.js)下添加code.js用于获取动态页面
code.js
system = require('system')
address = system.args[1];
var page = require('webpage').create();
var url = address;
page.open(url, function (status) {//Page is loaded!if (status !== 'success') {console.log('Unable to post!');} else {window.setTimeout(function () {page.render("test1.png");  //截图console.log(page.content);phantom.exit();}, 5000);}});
执行命令获取动态页面:phantomjs ./phantomjs-2.1.1-macosx/code.js https://www.qimai.cn/andapp/baseinfo/appid/120023
具体结合方式参考
https://www.jianshu.com/p/96220e239c35

这篇关于spider-java (Jsoup) (媒体信息的爬取)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/956836

相关文章

如何在 Spring Boot 中实现 FreeMarker 模板

《如何在SpringBoot中实现FreeMarker模板》FreeMarker是一种功能强大、轻量级的模板引擎,用于在Java应用中生成动态文本输出(如HTML、XML、邮件内容等),本文... 目录什么是 FreeMarker 模板?在 Spring Boot 中实现 FreeMarker 模板1. 环

SpringMVC 通过ajax 前后端数据交互的实现方法

《SpringMVC通过ajax前后端数据交互的实现方法》:本文主要介绍SpringMVC通过ajax前后端数据交互的实现方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价... 在前端的开发过程中,经常在html页面通过AJAX进行前后端数据的交互,SpringMVC的controll

Java中的工具类命名方法

《Java中的工具类命名方法》:本文主要介绍Java中的工具类究竟如何命名,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考下吧... 目录Java中的工具类究竟如何命名?先来几个例子几种命名方式的比较到底如何命名 ?总结Java中的工具类究竟如何命名?先来几个例子JD

Java Stream流使用案例深入详解

《JavaStream流使用案例深入详解》:本文主要介绍JavaStream流使用案例详解,本文通过实例代码给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考下吧... 目录前言1. Lambda1.1 语法1.2 没参数只有一条语句或者多条语句1.3 一个参数只有一条语句或者多

Spring Security自定义身份认证的实现方法

《SpringSecurity自定义身份认证的实现方法》:本文主要介绍SpringSecurity自定义身份认证的实现方法,下面对SpringSecurity的这三种自定义身份认证进行详细讲解,... 目录1.内存身份认证(1)创建配置类(2)验证内存身份认证2.JDBC身份认证(1)数据准备 (2)配置依

SpringBoot整合OpenFeign的完整指南

《SpringBoot整合OpenFeign的完整指南》OpenFeign是由Netflix开发的一个声明式Web服务客户端,它使得编写HTTP客户端变得更加简单,本文为大家介绍了SpringBoot... 目录什么是OpenFeign环境准备创建 Spring Boot 项目添加依赖启用 OpenFeig

Java Spring 中 @PostConstruct 注解使用原理及常见场景

《JavaSpring中@PostConstruct注解使用原理及常见场景》在JavaSpring中,@PostConstruct注解是一个非常实用的功能,它允许开发者在Spring容器完全初... 目录一、@PostConstruct 注解概述二、@PostConstruct 注解的基本使用2.1 基本代

springboot使用Scheduling实现动态增删启停定时任务教程

《springboot使用Scheduling实现动态增删启停定时任务教程》:本文主要介绍springboot使用Scheduling实现动态增删启停定时任务教程,具有很好的参考价值,希望对大家有... 目录1、配置定时任务需要的线程池2、创建ScheduledFuture的包装类3、注册定时任务,增加、删

SpringBoot整合mybatisPlus实现批量插入并获取ID详解

《SpringBoot整合mybatisPlus实现批量插入并获取ID详解》这篇文章主要为大家详细介绍了SpringBoot如何整合mybatisPlus实现批量插入并获取ID,文中的示例代码讲解详细... 目录【1】saveBATch(一万条数据总耗时:2478ms)【2】集合方式foreach(一万条数

IntelliJ IDEA 中配置 Spring MVC 环境的详细步骤及问题解决

《IntelliJIDEA中配置SpringMVC环境的详细步骤及问题解决》:本文主要介绍IntelliJIDEA中配置SpringMVC环境的详细步骤及问题解决,本文分步骤结合实例给大... 目录步骤 1:创建 Maven Web 项目步骤 2:添加 Spring MVC 依赖1、保存后执行2、将新的依赖