Hadoop 新特性、改进、优化和Bug分析系列4：YARN-326, YARN-2-mysql教程-PHP中文網

首頁

資料庫

mysql教程

Hadoop 新特性、改进、优化和Bug分析系列4：YARN-326, YARN-2

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jun 07, 2016 pm 04:30 PM

bughadoop最佳化分析改進新特性特性系列

作者:Dong | 新浪微博：西成懂 | 可以转载, 但必须以超链接形式标明文章原始出处和作者信息及版权声明
网址:http://dongxicheng.org/mapreduce-nextgen/hadoop-jira-yarn-326-yarn-2/
本博客的文章集合:http://dongxicheng.org/recommend/

重大消息：我的Hadoop新书《Hadoop技术内幕：深入解析MapReduce架构设计与实现原理》已经开始在各大网站销售了，购书链接地址：当当购书网址，京东购书网址，卓越购书网址。新书官方宣传主页： http://hadoop123.com/。

Hadoop jira链接（【注】FS是“Fair Scheduler”的简称，CS是“Capacity Scheduler”的简称）：
https://issues.apache.org/jira/browse/YARN-187（让FS支持层级队列组织方式）
https://issues.apache.org/jira/browse/MAPREDUCE-824（让CS支持层级队列组织方式）
https://issues.apache.org/jira/browse/YARN-569（让CS支持抢占）
https://issues.apache.org/jira/browse/YARN-326 （让FS支持多类别资源调度）
https://issues.apache.org/jira/browse/YARN-2 （让CS支持多类别资源调度）
所属范围（新特性、改进、优化或Bug）：新特性
修复版本：2.1.0-beta及以上版本
所属分支（Common、HDFS、YARN或MapReduce）：YARN、MapReduce
涉及模块：resourcescheduler

本篇文章涉及到的jira链接比较多，主要是Hadoop调度器新特性方面的增加。Capacity Scheduler和Fair Scheduler是Hadoop中最著名的两个多用户资源调度器，最初诞生于不同的公司，有着不同的设计理念的特色，但随着时间的迁移，这两个调度器已经变得非常的类似，截至目前为止，个人认为，框架方面基本一致，但支持的调度策略方面，Fair Scheduler要多于Capacity Scheduler，由于Fair Schduler每个队列可独立选择自己的调度模式，包括fifo、fair和drf，因此可以说，Fair Schduler包含了Capacity Scheduler（Fair Scheduler中将所有队列的调度模式调为fifo即可）。下面就这两个调度器的几个重大特性进行介绍（支持层次队列组织方式、支持资源抢占和支持多类别资源调度）：

（1）支持层次（树状）队列组织方式

在Hadoop 0.20.x版本或者更早的版本，Hadoop采用了平级队列组织方式，在这种组织方式中，管理员可将用户分到若干个扁平队列中，在每个队列中，可指定一个或几个队列管理员管理这些用户，比如杀死任意用户的作业，修改任意用户作业的优先级。然而，从资源管理角度看，仅仅按照队列组织用户是不够的，还需要将资源划分到这几个队列中，并按照一定的策略完成资源分配，这就需要Hadoop作业调度器的支持。总之，在Hadoop中，队列的组织是队列管理和资源分配的基础。

随着Hadoop应用越来越广泛，有用户提出需支持层级队列组织方式。典型的应用场景如下：在一个Hadoop集群中，管理员将所有计算资源划分给了若干个队列，每个队列对应了一个“组织”，其中有一个组织“Org1”，它分到了60%的资源，它内部包含3中类型的作业：

（1）产品线作业

（2）实验性作业—分属于三个不用的项目：Proj1，Proj2和Proj3

（3）其他类型作业

Org1管理员想更有效地控制这60%资源，比如将大部分资源分配给产品线作业的同时，能够让实验性作业和其他类型作业有最少资源保证。考虑到产品线作业提交频率很低，当有产品线作业提交时，必须第一时间得到资源，剩下的资源才给其他类型的作业，然而，一旦产品线作业运行结束，实验性作业和其他类型作业必须马上获取未使用的资源，一个可能的配置方式如下：

grid {

Org1 min=60% {

priority min=90% {

production min=82%

proj1 min=6% max=10%

proj2 min=6%

proj3 min=6%

}

miscellaneous min=10%

}

Org2 min=40%

}

这就引出来层级队列组织方式（更详细的介绍，可阅读我的这篇文章：Hadoop层级队列组织方式，http://dongxicheng.org/mapreduce/hadoop-hierarchy-queues/）。目前为止，Hadoop 2.0完全支持层次队列组织方式，且Fair Scheduler和Capacity Schduler均由很好的支持（具体查看：YARN-187，MAPREDUCE-824）。

（2）支持资源抢占

YARN作为一个资源管理系统，对资源的分配和回收是其最基本的功能之一。资源抢占功能使得YARN能够根据集群资源分布和应用程序优先级动态调整资源分配量。最开始时，只有Fair Schduler支持资源抢占，随着资源抢占功能的需求急迫性，Capacity也正在企图加入资源抢占功能（具体查看YARN-569）。

（3）支持多类别资源调度

在MRv1中，为了简化调度器设计，Hadoop将多维度资源简化为一维度资源slot，进而将对CPU、内存等具体资源的调度问题转化为slot这种抽象资源的调度（参考我的Hadoop书籍《Hadoop技术内幕：深入理解MapReduce基本架构和设计与原理》6.7节“Hadoop资源管理”）。基于slot的调度存在各种各样的问题，比如粗粒度调度导致资源分配模糊、资源浪费严重（存在资源内碎片）等，而YARN则从根本上解决了该问题，YARN不再对资源进行简化，而是直接对具体资源，比如内存、CPU等，进行调度。在YARN最早版本中，仅支持内存一种资源的调度，后来在YARN-2（https://issues.apache.org/jira/browse/YARN-2）中引入了对CPU资源的调度。由于调度与资源隔离是同时使用的，缺一不可，而资源隔离采用了cgroup，而cgroup对CPU和内存之外的资源隔离并不是十分成熟（需要使用更高更新的linux内核，这个对很多公司来说不容易），因此，Hadoop要等待一段时间才会增加对其他资源的调度和隔离。对于多类别资源的调度，目前而言，使用最广泛的仍然是源自mesos的DRF调度机制（参考我的这篇文章：Apache Mesos调度机制，http://dongxicheng.org/apache-mesos/mesos-scheduler/），该机制是从传统的Max-min调度策略基础上扩展而来的，非常适合多用户多队列共享资源池的场景。关于Fair Scheduler和CapacityScheduler的DRF实现，可参考：YARN-326和YARN-2。

原创文章，转载请注明： 转载自董的博客

本文链接地址: http://dongxicheng.org/mapreduce-nextgen/hadoop-jira-yarn-326-yarn-2/

作者：Dong，作者介绍：http://dongxicheng.org/about/

本博客的文章集合:http://dongxicheng.org/recommend/

Copyright © 2013
This feed is for personal, non-commercial use only.
The use of this feed on other websites breaches copyright. If this content is not in your news reader, it makes the page you are viewing an infringement of the copyright. (Digital Fingerprint:
)

陳述

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

Java错误：Hadoop错误，如何处理和避免Jun 24, 2023 pm 01:06 PM

Java错误：Hadoop错误，如何处理和避免当使用Hadoop处理大数据时，常常会遇到一些Java异常错误，这些错误可能会影响任务的执行，导致数据处理失败。本文将介绍一些常见的Hadoop错误，并提供处理和避免这些错误的方法。Java.lang.OutOfMemoryErrorOutOfMemoryError是Java虚拟机内存不足的错误。当Hadoop任

在Beego中使用Hadoop和HBase进行大数据存储和查询Jun 22, 2023 am 10:21 AM

随着大数据时代的到来，数据处理和存储变得越来越重要，如何高效地管理和分析大量的数据也成为企业面临的挑战。Hadoop和HBase作为Apache基金会的两个项目，为大数据存储和分析提供了一种解决方案。本文将介绍如何在Beego中使用Hadoop和HBase进行大数据存储和查询。一、Hadoop和HBase简介Hadoop是一个开源的分布式存储和计算系统，它可

如何使用PHP和Hadoop进行大数据处理Jun 19, 2023 pm 02:24 PM

随着数据量的不断增大，传统的数据处理方式已经无法处理大数据时代带来的挑战。Hadoop是开源的分布式计算框架，它通过分布式存储和处理大量的数据，解决了单节点服务器在大数据处理中带来的性能瓶颈问题。PHP是一种脚本语言，广泛应用于Web开发，而且具有快速开发、易于维护等优点。本文将介绍如何使用PHP和Hadoop进行大数据处理。什么是HadoopHadoop是

探索Java在大数据领域的应用：Hadoop、Spark、Kafka等技术栈的了解Dec 26, 2023 pm 02:57 PM

Java大数据技术栈：了解Java在大数据领域的应用，如Hadoop、Spark、Kafka等随着数据量不断增加，大数据技术成为了当今互联网时代的热门话题。在大数据领域，我们常常听到Hadoop、Spark、Kafka等技术的名字。这些技术起到了至关重要的作用，而Java作为一门广泛应用的编程语言，也在大数据领域发挥着巨大的作用。本文将重点介绍Java在大

PHP8.1引入的新的Redis扩展Jul 07, 2023 pm 09:41 PM

PHP8.1引入的新的Redis扩展随着互联网的快速发展，大量的数据需要进行存储和处理。为了提高数据处理的效率和性能，缓存成为了一个不可或缺的部分。而在PHP开发中，Redis作为一种高性能的键值对存储系统，被广泛应用于缓存和数据存储的场景。为了进一步提升Redis在PHP中的使用体验，PHP8.1引入了新的Redis扩展，本文将介绍这一扩展的新增功能，并给

CSS3的新特性一览：如何使用CSS3实现过渡效果Sep 09, 2023 am 11:27 AM

CSS3的新特性一览：如何使用CSS3实现过渡效果CSS3作为CSS的最新版本，在众多新特性中，最有趣和实用的应该是过渡效果（transition）。过渡效果可以让我们的页面在交互时更加平滑、漂亮，给用户带来良好的视觉体验。本文将介绍CSS3过渡效果的基本用法，并附带相应的代码示例。transition-property属性：指定需要过渡的CSS属性过渡效果

linux下安装Hadoop的方法是什么May 18, 2023 pm 08:19 PM

一：安装JDK1.执行以下命令，下载JDK1.8安装包。wget--no-check-certificatehttps://repo.huaweicloud.com/java/jdk/8u151-b12/jdk-8u151-linux-x64.tar.gz2.执行以下命令，解压下载的JDK1.8安装包。tar-zxvfjdk-8u151-linux-x64.tar.gz3.移动并重命名JDK包。mvjdk1.8.0_151//usr/java84.配置Java环境变量。echo'

PHP中的数据处理引擎(Spark, Hadoop等)Jun 23, 2023 am 09:43 AM

在当前的互联网时代，海量数据的处理是各个企业和机构都需要面对的问题。作为一种广泛应用的编程语言，PHP同样需要在数据处理方面跟上时代的步伐。为了更加高效地处理海量数据，PHP开发引入了一些大数据处理工具，如Spark和Hadoop等。Spark是一款开源的数据处理引擎，可以用于大型数据集的分布式处理。Spark的最大特点是具有快速的数据处理速度和高效的数据存

See all articles