hadoop套件的安装与配置个人笔记

2024-06-17 00:08

本文主要是介绍hadoop套件的安装与配置个人笔记,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

hadoop的官网

hadoop官网

下载并安装hadoop(本人使用的是2.10.1)

  1. 下载:hadoop2.10.1
  2. 安装:tar -zxvf 解压文件
  3. 在linux 环境下也可以 直接用 wget http地址 的形式下载

配置hadoop及启动

  • 集群最好改动一下hadoop的java配置地址:准备启动 Hadoop 群集,解包下载的 Hadoop 分发。在分发中,编辑文件etc/hadoop/hadoop-env.sh以定义一些参数,如下所示

    # set to the root of your Java installation
    export JAVA_HOME=/usr/java/latest
    
  • 单个机子部署(使用伪分布式)配置:
    修改etc/hadoop/core-site.xml 文件

    <configuration>#配置成hdfs模式<property><name>fs.defaultFS</name><value>hdfs://localhost:9000</value></property>#将生产模式的运行日志生成到指定位置<property><name>hadoop.tmp.dir</name><value>/opt/hadoop/hadoop-2.10.1/data/tmp</value></property>
    </configuration>
    

    修改etc/hadoop/hdfs-site.xml 文件

    <configuration><property><name>dfs.replication</name><value>1</value></property>
    </configuration>
    
  • 第一次启动namenode 一定要格式化(只在第一次启动时需要格式化,其他情况不需要)

    bin/hdfs namenode -format
    
  • 启动namenode

    #启动
    sbin/hadoop-daemon.sh start namenode
    #停止
    sbin/hadoop-daemon.sh stop namenode
    
  • 启动datanode

    #启动
    sbin/hadoop-daemon.sh start datanode
    #停止
    sbin/hadoop-daemon.sh stop datanode
    
  • 启动好之后可以通过服务器ip:50070查看情况

  • 创建文件(需要配置使用hdfs才能用)

    bin/hdfs dfs -mkdir /user
    bin/hdfs dfs -mkdir /user/<username>
    #将输入文件复制到分布式文件系统中
    bin/hdfs dfs -mkdir input
    bin/hdfs dfs -put etc/hadoop/*.xml input
    #运行提供的一些示例
    bin/hadoop jar share/hadoop/mapreduce/hadoop-mapreduce-examples-3.2.1.jar grep input output 'dfs[a-z.]+'
    #检查输出文件:将输出文件从分布式文件系统复制到本地文件系统并检查它们
    bin/hdfs dfs -get output output
    cat output/*
    #或者
    bin/hdfs dfs -cat output/*
    

配置下hadoop的环境

vim /etc/profile#hadoop
export HADOOP_HOME=/home/wj/hadoop2.7.7
export PATH=$HADOOP_HOME/bin:$HADOOP_HOME/sbin:$PATHsource /etc/profile

安装hive

在这里插入图片描述
官网下载相应的包

配置环境(一定要先配置好 hadoop的环境)

vim /etc/profile#hive  
export HIVE_HOME=/usr/local/hive
export PATH=$PATH:$HIVE_HOME/binsource /etc/profile

在这里插入图片描述
建立Hive专用的元数据库

在Hive的conf目录下的文件“hive-site.xml”中增加如下配置
原目录没有,可以vim 创建一个hive-site.xml

<configuration>
<property><name>javax.jdo.option.ConnectionURL</name><value>jdbc:mysql://gz-cdb-73kggk47.sql.tencentcdb.com:63524/hive?createDatabaseIfNotExist=true</value>
</property>
<property><name>javax.jdo.option.ConnectionDriverName</name><value>com.mysql.jdbc.Driver</value>
</property>
<property><name>javax.jdo.option.ConnectionUserName</name><value>root</value>
</property>
<property><name>javax.jdo.option.ConnectionPassword</name><value>ccnfgame001</value>
</property>
</configuration>

把MySQL的JDBC驱动包复制到Hive的lib目录下(略,下载地址:https://dev.mysql.com/downloads/connector/j/)

(驱动包名为:mysql-connector-java-5.1.46-bin.jar)看自己数据库什么版本,就下载什么版本就行了

检查连接 在bin目录下运行以下代码

./schematool -initSchema -dbType mysql

在这里插入图片描述
hive 远程服务 (端口号10000) 启动方式 (Thrift服务)

bin/hive –service hiveserver2 &(&表示后台运行)
用java,python等程序实现通过jdbc等驱动的访问hive就用这种起动方式了,这个是程序员最需要的方式了

参考文章

安装spark

官网下载相应的包

scala

配置环境(一定要先配置好 hadoop的环境)

vim /etc/profile#scala
export SCALA_HOME=/home/ubuntu/ljq/hadoopAll/spark/scala-2.12.12
export PATH=$PATH:$SCALA_HOME/binsource /etc/profile

参考地址

这篇关于hadoop套件的安装与配置个人笔记的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!


原文地址:
本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.chinasem.cn/article/1067936

相关文章

SQL server数据库如何下载和安装

《SQLserver数据库如何下载和安装》本文指导如何下载安装SQLServer2022评估版及SSMS工具,涵盖安装配置、连接字符串设置、C#连接数据库方法和安全注意事项,如混合验证、参数化查... 目录第一步:打开官网下载对应文件第二步:程序安装配置第三部:安装工具SQL Server Manageme

Linux下进程的CPU配置与线程绑定过程

《Linux下进程的CPU配置与线程绑定过程》本文介绍Linux系统中基于进程和线程的CPU配置方法,通过taskset命令和pthread库调整亲和力,将进程/线程绑定到特定CPU核心以优化资源分配... 目录1 基于进程的CPU配置1.1 对CPU亲和力的配置1.2 绑定进程到指定CPU核上运行2 基于

Spring Boot spring-boot-maven-plugin 参数配置详解(最新推荐)

《SpringBootspring-boot-maven-plugin参数配置详解(最新推荐)》文章介绍了SpringBootMaven插件的5个核心目标(repackage、run、start... 目录一 spring-boot-maven-plugin 插件的5个Goals二 应用场景1 重新打包应用

Java中读取YAML文件配置信息常见问题及解决方法

《Java中读取YAML文件配置信息常见问题及解决方法》:本文主要介绍Java中读取YAML文件配置信息常见问题及解决方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要... 目录1 使用Spring Boot的@ConfigurationProperties2. 使用@Valu

Jenkins分布式集群配置方式

《Jenkins分布式集群配置方式》:本文主要介绍Jenkins分布式集群配置方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录1.安装jenkins2.配置集群总结Jenkins是一个开源项目,它提供了一个容易使用的持续集成系统,并且提供了大量的plugin满

SpringBoot线程池配置使用示例详解

《SpringBoot线程池配置使用示例详解》SpringBoot集成@Async注解,支持线程池参数配置(核心数、队列容量、拒绝策略等)及生命周期管理,结合监控与任务装饰器,提升异步处理效率与系统... 目录一、核心特性二、添加依赖三、参数详解四、配置线程池五、应用实践代码说明拒绝策略(Rejected

SQL Server配置管理器无法打开的四种解决方法

《SQLServer配置管理器无法打开的四种解决方法》本文总结了SQLServer配置管理器无法打开的四种解决方法,文中通过图文示例介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的... 目录方法一:桌面图标进入方法二:运行窗口进入检查版本号对照表php方法三:查找文件路径方法四:检查 S

Python中win32包的安装及常见用途介绍

《Python中win32包的安装及常见用途介绍》在Windows环境下,PythonWin32模块通常随Python安装包一起安装,:本文主要介绍Python中win32包的安装及常见用途的相关... 目录前言主要组件安装方法常见用途1. 操作Windows注册表2. 操作Windows服务3. 窗口操作

Linux中SSH服务配置的全面指南

《Linux中SSH服务配置的全面指南》作为网络安全工程师,SSH(SecureShell)服务的安全配置是我们日常工作中不可忽视的重要环节,本文将从基础配置到高级安全加固,全面解析SSH服务的各项参... 目录概述基础配置详解端口与监听设置主机密钥配置认证机制强化禁用密码认证禁止root直接登录实现双因素

嵌入式数据库SQLite 3配置使用讲解

《嵌入式数据库SQLite3配置使用讲解》本文强调嵌入式项目中SQLite3数据库的重要性,因其零配置、轻量级、跨平台及事务处理特性,可保障数据溯源与责任明确,详细讲解安装配置、基础语法及SQLit... 目录0、惨痛教训1、SQLite3环境配置(1)、下载安装SQLite库(2)、解压下载的文件(3)、