分享

Apache Twill—YARN上应用程序开发包

问题导读
1、如何相对简单的开发一个YARN应用程序?
2、如何使用Apache Twill开发一个运行在YARN上的程序?
3、will有哪些大量通用模块和特性?






尽管YARN自带的编程API已经得到了极大的简化,但从头开发一个YARN应用程序仍是一件非常困难的事情。在YARN上编写一个应用程序,你需要开发Client和ApplicationMaster两个模块,并了解涉及到的几个协议的若干API和参数列表,其中ApplicationMaster还要负责资源申请,任务调度、容错等,总之,整个过程非常复杂。

Apache Twill(官方首页:Apache Twill)这个项目则是为简化YARN上应用程序开发而成立的项目,该项目把与YARN相关的重复性的工作封装成库,使得用户可以专注于自己的应用程序逻辑。
下面代码示例是使用Apache Twill开发一个运行在YARN上的helloworld程序:

  1. public class HelloWorld {
  2. static Logger LOG = LoggerFactory.getLogger(HelloWorld.class);
  3. static class HelloWorldRunnable extends AbstractTwillRunnable {
  4. @Override
  5. public void run() {
  6. LOG.info("Hello World");
  7. }
  8. }
  9. public static void main(String[] args) throws Exception {
  10. YarnConfiguration conf = new YarnConfiguration();
  11. TwillRunnerService runner = new YarnTwillRunnerService(conf, "localhost:2181");
  12. runner.startAndWait();
  13. TwillController controller = runner.prepare(new HelloWorldRunnable())
.start();
  14. Services.getCompletionFuture(controller).get();
  15. }
复制代码



Twill所做的事情是开发了一个通用的Client和ApplicationMaster实现,并提供了一套编程API,使得用户可直接实现这套API便可以编写运行在YARN上的分布式程序。Twill应用程序运行在YARN上的流程跟普通程序一样,流程图下:
1.png


为极大地方便用户编写运行在YARN上的分布式应用程序,Twill做了大量通用模块和特性,包括:
(1)实时日志收集
基于kafka实现了日志收集功能,可将应用程序产生的日志实时收集起来,便于集中化分析和展示。
(2)资源汇报
可实时收集任务占用的各类资源,包括cpu利用率,物理内存等。
(3)资源弹性扩展
可动态改变应用程序占用的资源,比如将container数目在线由5个增长为10个。
(4)状态恢复
当客户端失去与应用程序链接后,可通过API重构一个新的客户端,重新获取状态。
(5)服务发现
应用程序可向zookeeper注册一些信息,便于其他服务或者客户端发现该应用程序的位置,以便与之通信。
随着YARN越来越成熟,它必将成为一个基础核心系统,届时与Apache Twill类似的项目显得尤为重要。



本文转载自:http://dongxicheng.org/mapreduce-nextgen/apache-twill-for-yarn/

已有(1)人评论

跳转到指定楼层
linhai1023 发表于 2014-9-10 20:47:17
谢谢楼主的分享
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关闭

推荐上一条 /2 下一条