Hadoop生态圈

什么是Hadoop?

The Apache™ Hadoop® project develops open-source software for reliable, scalable, distributed computing.

 

特点:

  • 扩容能力(Scalable):能可靠地(reliably)存储和处理千兆字节(PB)数据。
  • 成本低(Economical):可以通过普通机器组成的服务器群来分发以及处理数据。这些服务器群总计可达数千个节点。
  • 高效率(Efficient):通过分发数据,hadoop可以在数据所在的节点上并行地(parallel)处理它们,这使得处理非常的快速。
  • 可靠性(Reliable):hadoop能自动地维护数据的多份副本,并且在任务失败后能自动地重新部署(redeploy)计算任务。

主要解决:

  • 海量数据的存储(HDFS)
  • 海量数据的分析(MapReduce)
  • 资源管理调度(YARN)

Hadoop生态系统

Hadoop生态圈
 

Hadoop生态圈

Hadoop生态圈

 

Hadoop1.0和Hadoop2.0的对比

Hadoop生态圈
 

YARN(Yet Another Resource Negotiator,另一种资源协调者)产生背景:

直接源于MRv1在几方面的无能:

1.扩展受限

2.单点故障

3.难以支持MR之外的计算

多框架各自为战,数据共享困难

1.MR离线计算框架

2.Storm实时计算框架

3.Spark内存计算框架