起航学习网

- 让每个人都能学到最前沿新知识、新技能!
起航学习网
当前位置: 起航学习网 > 职业教育 > 达内大数据培训课程:Hadoop的作业提交流程

达内大数据培训课程:Hadoop的作业提交流程

时间:2018-08-17 17:03:00来源:IT培训网 作者:IT培训网 已有: 名学员访问该课程

前言:根据appmaster告知的待处理的数据位置,从若干的maptask所在的机器上获取若干的maptask输出结果,并在本地进行一个归并排序,然后,再按照相同的key的kv为一组,调用客户自定义的reduce方法,并收集输出结果kv,然后按照用户指定的outputFormat将结果存储到外部设备。

达内大数据培训课程:Hadoop的作业提交流程,学习大数据知识,你一定要掌握的技能!

大数据时代,无论你深处哪个行业,做着哪份工作,多多少少都会接触到一些数据信息,数据决策已经成为很多公司的发展战略。掌握”大数据技术”,变得越来越重要。今天”达内大数据培训”老师给大家分享的技术知识是:Hadoop的作业提交流程。

hadoop任务的提交常用的两种,一种是测试常用的IDE远程提交,另一种就是生产上用的客户端命令行提交。

通用的任务程序提交步骤为:

1.客户端向resourceManager发送job请求

2.resourceManager返回存储路径,jobId给客户端

3.客户端创建路径把jobId,分片信息,配置文件信息,jar文件拷贝到返回的存储路径上

4.客户端向resourceManager报告提交完成

5.resourceManager在nodeManager上启动一个容器(container),在container中执行mrappmaster进程(主管mr任务执行)

6.mrappmaster取得分片信息,任务的相关配置,计算job所需资源

7.mrappmaster向resourceManager申请资源

8.resourceManager准备资源,mrappmaster启动container运行mapTask

9.maptask进程启动之后,根据给定的数据切片范围进行数据处理,处理流程:

1)利用客户指定的inputformat来获取recordReader读取数据,形成kv键值对。

2)将kv传递给客户定义的mapper类的map方法,做逻辑运算,并将map方法的输出kv收集到缓存。

10.mrappmaster监控所有的maptask进程完成之后,会根据用户指定的参数来启动相应的reduceTask进程,并告知reduceTask需要处理的数据范围

11.reducetask启动之后,根据appmaster告知的待处理的数据位置,从若干的maptask所在的机器上获取若干的maptask输出结果,并在本地进行一个归并排序,然后,再按照相同的key的kv为一组,调用客户自定义的reduce方法,并收集输出结果kv,然后按照用户指定的outputFormat将结果存储到外部设备。

12.所有任务定期向mrappmaster报告任务进度,所有任务完成后,mrappmaster报告resourceManager释放资源

如果你想要成为高端实用的技术精英,如果你想要成为就业实力派,那就不要错过达内。学习大数据开发,可以参考达内提供的”大数据学习路线”,提供完整的大数据开发知识体系,内容包含Linux&&Hadoop生态体系、大数据计算框架体系、云计算体系、机器学习&&深度学习。根据达内提供的大数据学习路线图可以让你对学习大数据需要掌握的知识有个清晰的了解,并快速入门大数据开发。

文章出自:http://qh.itpxw.cn/qgtk/201842840.html

文章标题:达内大数据培训课程:Hadoop的作业提交流程



免责声明:本站文章均由入驻起航学习网的会员所发或者网络转载,所述观点仅代表作者本人,不代表起航学习网立场。如有侵权或者其他问题,请联系举报,必删。侵权投诉

(责任编辑:IT培训网)
顶一下
(0)
0%
踩一下
(0)
0%
------分隔线----------------------------
培训学校
IT培训网 访问该机构站点 报名留言 加为好友 用户等级:注册会员 用户级别:10 机构名称:IT培训网 联 系 人:罗老师 联系电话:13783581536 联系手机:13783581536 在线客服:起航学习网客服 在 线 QQ:起航学习网客服 电子邮件: 网站域名:http://www.itpxw.cn 注册时间:2016-07-18 11:07 最后登录:2024-02-20 13:02