Hadoop生态圈
什么是Hadoop?
The Apache™ Hadoop® project develops open-source software for reliable, scalable, distributed computing.
特点:
- 扩容能力(Scalable):能可靠地(reliably)存储和处理千兆字节(PB)数据。
- 成本低(Economical):可以通过普通机器组成的服务器群来分发以及处理数据。这些服务器群总计可达数千个节点。
- 高效率(Efficient):通过分发数据,hadoop可以在数据所在的节点上并行地(parallel)处理它们,这使得处理非常的快速。
- 可靠性(Reliable):hadoop能自动地维护数据的多份副本,并且在任务失败后能自动地重新部署(redeploy)计算任务。
主要解决:
- 海量数据的存储(HDFS)
- 海量数据的分析(MapReduce)
- 资源管理调度(YARN)
Hadoop生态系统
Hadoop生态圈
Hadoop1.0和Hadoop2.0的对比
YARN(Yet Another Resource Negotiator,另一种资源协调者)产生背景:
直接源于MRv1在几方面的无能:
1.扩展受限
2.单点故障
3.难以支持MR之外的计算
多框架各自为战,数据共享困难
1.MR离线计算框架
2.Storm实时计算框架
3.Spark内存计算框架