Nutch-2.2.1学习之七Nutch与Solr的集成

2024-01-08 04:32
文章标签 学习 2.2 集成 nutch 之七 solr

本文主要是介绍Nutch-2.2.1学习之七Nutch与Solr的集成,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

Nutch以开箱的方式支持Solr,这极大的简化了NutchSolr的集成。Nutch也移除了遗留的对Tomcat运行旧的Nutch web应用程序和Apache Lucene索引的依赖。Nutch1.x2.x关于Solr的区别在于1.x版本可以选择是否使用Solr索引,这需要一步一步地进行爬取工作,而2.x则提供了更为简洁的方式——crawl脚本,直接将爬取成功的页面与Solr集成在一起。当然通过阅读crawl脚本也可以将2.x中的一步到位方式分解为若干步骤,并且选择是否由Solr建立索引。在学习如何将NutchSolr结合在一起使用之前,先看一下Solr官网的介绍。

Solr是从apacheLucene项目发展而来的流行的,非常快速的开源企业级搜索平台。主要特征包括强大的全文检索,分面搜索,近乎实时索引,动态集群,与数据库的集成,丰富的文档处理(比如wordPDF),还有地理空间搜索。Solr是高可靠、可扩展和容错的,提供分布式索引,复制和负载均衡查询,自动化的故障转移和恢复,集中管理等。Solr强化了很多世界上最大网站的搜索和导航特性。

Solr是用Java开发的,在一个诸如Jettyservlet容器中以单机模式运行全文搜索服务。Solr使用LuceneJava搜索库作为全文索引和搜索的核心,通过使用REST-like HTTP/XML andJSON APIs,使得几乎任何编程语言都可以很容易的使用Solr。使用者可以通过基于HTTP协议的XML, JSON,CSV 或者二进制将文档放在Solr中(称为索引),使用HTTPGET方法查询并且收到XML,JSON, CSV 或者二进制结果。

根据官网的介绍,可以发现Solr提供了强大的关于索引的功能,并且几乎支持所有的编程语言,而不仅仅局限于JAVA。

现在开始将Nutch与Solr结合在一起。首先从官网下载Solr版本4.5.1版本,地址为http://lucene.apache.org/solr/,然后将下载的solr-4.5.1.tgz解压到相应的目录中,该目录在稍后将使用${SOLR_HOME}引用。进入${APACHE_SOLR_HOME}/example,执行java-jar start.jar,等到solr启动完毕后,在浏览器中输入http://localhost:8983/solr/#/,进入如下图片所示的页面:

在该页面中可以发现solr的版本信息、系统信息、JVM信息等。点击左侧导航栏中的下拉选择框,选择collection1,进入下图所示的页面。在该页面中又出现了一些链接,可以点击进行相应的操作,比如进行查询。

在简单介绍了Solr的启动以及页面后,现在来看看如何修改Solr的配置文件使得Nutch爬取的网页可以被Solr索引查询。首先备份${SOLR_HOME}/example/solr/conf/schema.xm文件,然后将Nutch目录中conf目录下的schema-solr4.xml复制到${SOLR_HOME}/example/solr/conf/中,并且重命名为schema.xm,若不修改则在启动Solr会报找不到schema.xm的错误而无法启动Solr。做完这些修改后运行java -jar start.jar 重新启动Solr,然后运行bin/crawl urls sina http://localhost: 8983/solr 2进行网页的爬取并在Solr上建立索引。在控制台中可以发现,当进行dedup作业时出现问题,该作业用于删除多余的副本确保被索引的urls的唯一性。如果有人也曾遇到过类似的问题,并成功的解决了,还请多多指教。该问题是在建立索引完成之后出现的,不会特别严重的影响查看索引结果,暂时略过,后续找到解决办法再更新文章。

SOLR dedup -> http://localhost:8983/solr
/home/hadoop/nutch-2.2.1/runtime/deploy/conf:/usr/java/jdk1.6.0_32/lib/tools.jar
13/12/20 20:23:28 INFO solr.SolrDeleteDuplicates: SolrDeleteDuplicates: starting...
13/12/20 20:23:28 INFO solr.SolrDeleteDuplicates: SolrDeleteDuplicates: Solr url: http://localhost:8983/solr
13/12/20 20:23:37 WARN mapred.JobClient: No job jar file set.  User classes may not be found. See JobConf(Class) or JobConf#setJar(String).
13/12/20 20:23:47 INFO mapred.JobClient: Running job: job_201312201956_0007
13/12/20 20:23:48 INFO mapred.JobClient:  map 0% reduce 0%
13/12/20 20:24:22 INFO mapred.JobClient: Task Id : attempt_201312201956_0007_m_000000_0, Status : FAILED
java.lang.RuntimeException: java.lang.ClassNotFoundException: org.apache.nutch.indexer.solr.SolrDeleteDuplicates$SolrInputFormatat org.apache.hadoop.conf.Configuration.getClass(Configuration.java:857)at org.apache.hadoop.mapreduce.JobContext.getInputFormatClass(JobContext.java:187)at org.apache.hadoop.mapred.MapTask.runNewMapper(MapTask.java:722)at org.apache.hadoop.mapred.MapTask.run(MapTask.java:364)at org.apache.hadoop.mapred.Child$4.run(Child.java:255)at java.security.AccessController.doPrivileged(Native Method)at javax.security.auth.Subject.doAs(Subject.java:396)at org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1190)at org.apache.hadoop.mapred.Child.main(Child.java:249)
Caused by: java.lang.ClassNotFoundException: org.apache.nutch.indexer.solr.SolrDeleteDuplicates$SolrInputFormatat java.net.URLClassLoader$1.run(URLClassLoader.java:202)at java.security.AccessController.doPrivileged(Native Method)at java.net.URLClassLoader.findClass(URLClassLoader.java:190)at java.lang.ClassLoader.loadClass(ClassLoader.java:306)at sun.misc.Launcher$AppClassLoader.loadClass(Launcher.java:301)at java.lang.ClassLoader.loadClass(ClassLoader.java:247)at java.lang.Class.forName0(Native Method)at java.lang.Class.forName(Class.java:247)at org.apache.hadoop.conf.Configuration.getClassByName(Configuration.java:810)at org.apache.hadoop.conf.Configuration.getClass(Configuration.java:855)... 8 more

作业完成后进入Solr的管理页面,现在可以查询已经爬取到的网页了。在上图中点击query链接,出现下图所示的页面,在该页面中不做任何修改,点击下方的查询按钮,以JSON方式显示索引的内容。

可以修改q中的参数查询包含特定内容的网页,也可以选择wt中的选项定制以JSON、XML、CSV等格式显示网页内容,是可以在fl中以逗号分隔的方式定制需要显示哪些字段。在q中设置title:hadoop查询title中包含hadoop的网页,执行结果如下图所示:

上面只介绍了Solr的相当简单的一部分功能,更多更强大的功能还需要进一步学习探索,并且solrdedup作业失败的问题也需要继续研究其根源并解决。

补充,solrdedup失败的解决办法可以通过在SolrDeleteDuplicates中的Job job = new Job(getConf(), "solrdedup");后添加下面的代码解决:

job.setJarByClass(SolrDeleteDuplicates.class);

这篇关于Nutch-2.2.1学习之七Nutch与Solr的集成的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/582331

相关文章

SpringBoot集成LiteFlow实现轻量级工作流引擎的详细过程

《SpringBoot集成LiteFlow实现轻量级工作流引擎的详细过程》LiteFlow是一款专注于逻辑驱动流程编排的轻量级框架,它以组件化方式快速构建和执行业务流程,有效解耦复杂业务逻辑,下面给大... 目录一、基础概念1.1 组件(Component)1.2 规则(Rule)1.3 上下文(Conte

Go学习记录之runtime包深入解析

《Go学习记录之runtime包深入解析》Go语言runtime包管理运行时环境,涵盖goroutine调度、内存分配、垃圾回收、类型信息等核心功能,:本文主要介绍Go学习记录之runtime包的... 目录前言:一、runtime包内容学习1、作用:① Goroutine和并发控制:② 垃圾回收:③ 栈和

Android学习总结之Java和kotlin区别超详细分析

《Android学习总结之Java和kotlin区别超详细分析》Java和Kotlin都是用于Android开发的编程语言,它们各自具有独特的特点和优势,:本文主要介绍Android学习总结之Ja... 目录一、空安全机制真题 1:Kotlin 如何解决 Java 的 NullPointerExceptio

使用vscode搭建pywebview集成vue项目实践

《使用vscode搭建pywebview集成vue项目实践》:本文主要介绍使用vscode搭建pywebview集成vue项目实践,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地... 目录环境准备项目源码下载项目说明调试与生成可执行文件核心代码说明总结本节我们使用pythonpywebv

Maven项目中集成数据库文档生成工具的操作步骤

《Maven项目中集成数据库文档生成工具的操作步骤》在Maven项目中,可以通过集成数据库文档生成工具来自动生成数据库文档,本文为大家整理了使用screw-maven-plugin(推荐)的完... 目录1. 添加插件配置到 pom.XML2. 配置数据库信息3. 执行生成命令4. 高级配置选项5. 注意事

Java集成Onlyoffice的示例代码及场景分析

《Java集成Onlyoffice的示例代码及场景分析》:本文主要介绍Java集成Onlyoffice的示例代码及场景分析,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要... 需求场景:实现文档的在线编辑,团队协作总结:两个接口 + 前端页面 + 配置项接口1:一个接口,将o

Swagger2与Springdoc集成与使用详解

《Swagger2与Springdoc集成与使用详解》:本文主要介绍Swagger2与Springdoc集成与使用方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐... 目录1. 依赖配置2. 基础配置2.1 启用 Springdoc2.2 自定义 OpenAPI 信息3.

Spring Boot 集成 Solr 的详细示例

《SpringBoot集成Solr的详细示例》:本文主要介绍SpringBoot集成Solr的详细示例,本文通过实例代码给大家介绍的非常详细,感兴趣的朋友一起看看吧... 目录环境准备添加依赖配置 Solr 连接定义实体类编写 Repository 接口创建 Service 与 Controller示例运行

Spring Boot集成SLF4j从基础到高级实践(最新推荐)

《SpringBoot集成SLF4j从基础到高级实践(最新推荐)》SLF4j(SimpleLoggingFacadeforJava)是一个日志门面(Facade),不是具体的日志实现,这篇文章主要介... 目录一、日志框架概述与SLF4j简介1.1 为什么需要日志框架1.2 主流日志框架对比1.3 SLF4

Spring Boot集成Logback终极指南之从基础到高级配置实战指南

《SpringBoot集成Logback终极指南之从基础到高级配置实战指南》Logback是一个可靠、通用且快速的Java日志框架,作为Log4j的继承者,由Log4j创始人设计,:本文主要介绍... 目录一、Logback简介与Spring Boot集成基础1.1 Logback是什么?1.2 Sprin