Azkaban官网文档1-概述-Overvie

2023-10-23 11:50

本文主要是介绍Azkaban官网文档1-概述-Overvie,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

Azkaban是在LinkedIn上实现的,用来解决Hadoop作业依赖的问题。我们的工作需要按顺序运行,从ETL工作到数据分析产品。

Azkaban最初是一个单一的服务器解决方案,随着多年来Hadoop用户数量的增加,它已经发展成为一个更健壮的解决方案。

Azkaban由三个关键部分组成:

  1. 关系型数据库(MySQL)
  2. AzkabanWebServer
  3. AzkabanExecutorServer

Relational Database (MySQL)

Azkaban使用MySQL来存储它的大部分状态。AzkabanWebServer和AzkabanExecutorServer都访问数据库。

AzkabanWebServer 是如何访问数据库的?

web服务器使用数据库的原因如下:

  1. 项目管理——项目、项目权限、上传文件。
  2. 执行工作流状态——跟踪执行工作流以及哪个执行器正在运行它们。
  3. 以前的工作流/作业——搜索以前执行的作业和工作流,并访问它们的日志文件。
  4. 调度程序——保持调度作业的状态。
  5. SLA——保持所有SLA规则

AzkabanExecutorServer 用数据库来干啥?

  1. 访问项目——从数据库中检索项目文件。
  2. 执行工作流/作业——检索和更新正在执行的工作流的数据
  3. 日志——将作业和工作流的输出日志存储到数据库中。
  4. 互流依赖——如果一个工作流在不同的执行程序上运行,它将从数据库获取状态。

选择MySQL的原因是它是一个广泛使用的数据库。我们希望实现与其他数据库的兼容性,尽管在历史上运行作业的搜索需求受益于关系数据存储。

 

AzkabanWebServer

AzkabanWebServer是阿兹卡班的主要管理器。它处理项目管理、身份验证、调度器和执行监视。它还充当web用户界面。

使用Azkaban很容易,Azkaban使用*.job键值属性文件定义工作流中的各个任务,_dependencies_属性定义作业的依赖链。这些作业文件和相关代码可以归档到一个*.zip文件中,并通过Azkaban UI或curl通过web服务器上传。

AzkabanExecutorServer

以前的Azkaban版本同时具有AzkabanWebServer和AzkabanExecutorServer的功能。后来,执行程序被分离到它自己的服务器中。拆分这些服务有几个原因:我们很快就可以扩展执行的数量,如果有一个失败,我们就可以使用操作执行器。同时,我们能够在对用户影响最小的情况下升级Azkaban。随着Azkaban的使用增加,我们发现升级Azkaban变得越来越困难,因为一天中的任何时候都变成了“高峰”。

Getting Started

在3.0版本中,我们提供了三种模式:独立的“单服务器”模式、较重的双服务器模式和分布式多执行器模式。下面将介绍这两种模式之间的区别。

在solo服务器模式下,DB嵌入H2, web服务器和executor服务器在同一个进程中运行。如果你只是想尝试一下,这应该是有用的。它也可以在小规模的用例中使用。

Download and Install Solo Server Package

Install Azkaban Plugins

两种服务器模式适用于更复杂的生产环境。它的DB应该由主-从设置的MySQL实例来支持。web服务器和executor服务器应该运行在不同的进程中,因此升级和维护不应该影响用户。

  1. Set up the database
  2. Download and install the Web Server
  3. Download and install the Executor Server
  4. Install Azkaban Plugins

多执行器模式适用于最正式的生产环境。它的DB应该由主-从设置的MySQL实例来支持。理想情况下,web服务器和执行服务器应该运行在不同的主机上,这样升级和维护就不会影响用户。这种多主机设置为azkaban带来了健壮和可伸缩的方面。

  1. Set up the database
  2. Download and install the Web Server
  3. Configure database to use multiple executors
  4. Download and install the Executor Server for each executor configured in database
  5. Install Azkaban Plugins

下面是如何设置azkaban的说明。

Azkaban构建使用Gradle(使用gradlew (Gradle包装器)自动下载),需要Java 8或更高版本。

下面的命令运行在*nix平台上,比如Linux, OS X。

 # Build Azkaban./gradlew build# Clean the build./gradlew clean# Build and install distributions./gradlew installDist# Run tests./gradlew test# Build without running tests./gradlew build -x test

这些都是标准的gradle指令。请查看Gradle文档获取更多信息。

Gradle在项目目录中创建.tar.gz文件。如。

./azkaban-solo-server/build/distributions/azkaban-solo-server-0.1.0-SNAPSHOT.tar.gz. 
Untar using 
tar -xvzf path/to/azkaban-*.tar.gz.

Getting started with the Solo Server

solo Server是azkaban的一个独立实例,也是最简单的入门工具。solo服务器有以下优点。

  1. 易于安装-不需要MySQL实例。它将H2打包为主要的持久性存储。
  2. 易于启动——web服务器和executor服务器运行在同一个进程中。
  3. 全功能-它包所有阿兹卡班功能。你可以用正常的方式使用它,并为它安装插件。

安装方法:

  1. Clone the repo: run git clone https://github.com/azkaban/azkaban.git
  2. Build Azkaban and create an installation: run cd azkaban; ./gradlew build installDist
  3. Start the server: run cd azkaban-solo-server/build/install/azkaban-solo-server; bin/azkaban-solo-start.sh
  4. Stop server: run bin/azkaban-solo-shutdown.sh from within the azkaban-solo-server installation directory

solo-server安装应该包含以下目录。

FolderDescription
binThe scripts to start/stop Azkaban jetty server
confThe configuration files for Azkaban solo server
libThe jar dependencies for Azkaban
extlibAdditional jars that are added to extlib will be added to Azkaban's classpath
pluginsthe directory where plugins can be installed
webThe web (css, javascript, image) files for Azkaban web server.

在conf目录中,应该有三个文件:

azkaban.private.properties - 运行时参数
azkaban.properties - 使用运行时参数
global.properties - 作为共享属性传递给每个工作流和作业的全局静态属性。
azkaban-users.xml - 用于为身份验证添加用户和角色。如果XmLUserManager没有设置为使用该文件,则不使用该文件。

azkaban.properties是最主要的配置文件

Getting KeyStore for SSL (Optional)

阿兹卡班solo服务器默认不使用SSL。但是您可以在独立的web服务器上以相同的方式进行设置。这里是:

Azkaban web服务器可以使用SSL套接字连接器,这意味着密钥库必须是可用的。您可以按照这个链接提供的步骤进行调用([http://docs.codehaus.org/display/JETTY/How+to+configure+SSL](http://docs.codehaus.org/display/JETTY/How+to+configure+SSL)) 创建一个。创建密钥存储库文件后,必须向azkaban提供其位置和密码。azkaban.properties,应重写下列属性。

jetty.keystore=keystore
jetty.password=password
jetty.keypassword=password
jetty.truststore=keystore
jetty.trustpassword=password

下面就不写了,大家自己看吧:

https://azkaban.readthedocs.io/en/latest/index.html#

 

这篇关于Azkaban官网文档1-概述-Overvie的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/267651

相关文章

Python Pillow 库详解文档(最新推荐)

《PythonPillow库详解文档(最新推荐)》Pillow是Python中最流行的图像处理库,它是PythonImagingLibrary(PIL)的现代分支和继承者,本文给大家介绍Pytho... 目录python Pillow 库详解文档简介安装核心模块架构Image 模块 - 核心图像处理基本导入

C#实现将Office文档(Word/Excel/PDF/PPT)转为Markdown格式

《C#实现将Office文档(Word/Excel/PDF/PPT)转为Markdown格式》Markdown凭借简洁的语法、优良的可读性,以及对版本控制系统的高度兼容性,逐渐成为最受欢迎的文档格式... 目录为什么要将文档转换为 Markdown 格式使用工具将 Word 文档转换为 Markdown(.

详解如何使用Python构建从数据到文档的自动化工作流

《详解如何使用Python构建从数据到文档的自动化工作流》这篇文章将通过真实工作场景拆解,为大家展示如何用Python构建自动化工作流,让工具代替人力完成这些数字苦力活,感兴趣的小伙伴可以跟随小编一起... 目录一、Excel处理:从数据搬运工到智能分析师二、PDF处理:文档工厂的智能生产线三、邮件自动化:

Python实现自动化Word文档样式复制与内容生成

《Python实现自动化Word文档样式复制与内容生成》在办公自动化领域,高效处理Word文档的样式和内容复制是一个常见需求,本文将展示如何利用Python的python-docx库实现... 目录一、为什么需要自动化 Word 文档处理二、核心功能实现:样式与表格的深度复制1. 表格复制(含样式与内容)2

Maven项目中集成数据库文档生成工具的操作步骤

《Maven项目中集成数据库文档生成工具的操作步骤》在Maven项目中,可以通过集成数据库文档生成工具来自动生成数据库文档,本文为大家整理了使用screw-maven-plugin(推荐)的完... 目录1. 添加插件配置到 pom.XML2. 配置数据库信息3. 执行生成命令4. 高级配置选项5. 注意事

Python使用python-docx实现自动化处理Word文档

《Python使用python-docx实现自动化处理Word文档》这篇文章主要为大家展示了Python如何通过代码实现段落样式复制,HTML表格转Word表格以及动态生成可定制化模板的功能,感兴趣的... 目录一、引言二、核心功能模块解析1. 段落样式与图片复制2. html表格转Word表格3. 模板生

浅谈Redis Key 命名规范文档

《浅谈RedisKey命名规范文档》本文介绍了Redis键名命名规范,包括命名格式、具体规范、数据类型扩展命名、时间敏感型键名、规范总结以及实际应用示例,感兴趣的可以了解一下... 目录1. 命名格式格式模板:示例:2. 具体规范2.1 小写命名2.2 使用冒号分隔层级2.3 标识符命名3. 数据类型扩展命

Python datetime 模块概述及应用场景

《Pythondatetime模块概述及应用场景》Python的datetime模块是标准库中用于处理日期和时间的核心模块,本文给大家介绍Pythondatetime模块概述及应用场景,感兴趣的朋... 目录一、python datetime 模块概述二、datetime 模块核心类解析三、日期时间格式化与

使用Python从PPT文档中提取图片和图片信息(如坐标、宽度和高度等)

《使用Python从PPT文档中提取图片和图片信息(如坐标、宽度和高度等)》PPT是一种高效的信息展示工具,广泛应用于教育、商务和设计等多个领域,PPT文档中常常包含丰富的图片内容,这些图片不仅提升了... 目录一、引言二、环境与工具三、python 提取PPT背景图片3.1 提取幻灯片背景图片3.2 提取

Android实现在线预览office文档的示例详解

《Android实现在线预览office文档的示例详解》在移动端展示在线Office文档(如Word、Excel、PPT)是一项常见需求,这篇文章为大家重点介绍了两种方案的实现方法,希望对大家有一定的... 目录一、项目概述二、相关技术知识三、实现思路3.1 方案一:WebView + Office Onl