Hadoop和Spark的相同点和不同点？_第2页回答_第2页回答_Hadoop

19条回答

kitidog2016

2楼 · 2021-04-08 09:50

1、hadoop

1）hadoop简介

Hadoop是一个由Apache基金会所开发的分布式系统基础架构。 Hadoop实现了一个分布式文件系统HDFS。HDFS有高容错性的特点，并且设计用来部署在低廉的硬件上；而且它提供高吞吐量来访问应用程序的数据，适合那些有着超大数据集的应用程序。Hadoop的框架最核心的设计就是：HDFS和MapReduce。HDFS为海量的数据提供了存储，而MapReduce则为海量的数据提供了计算

2）hadoop优点

Hadoop 以一种可靠、高效、可伸缩的方式进行数据处理。

可靠性: Hadoop将数据存储在多个备份，Hadoop提供高吞吐量来访问应用程序的数据。

高扩展性： Hadoop是在可用的计算机集簇间分配数据并完成计算任务的，这些集簇可以方便地扩展到数以千计的节点中。

高效性： Hadoop以并行的方式工作，通过并行处理加快处理速度。

高容错性： Hadoop能够自动保存数据的多个副本，并且能够自动将失败的任务重新分配。

低成本： Hadoop能够部署在低廉的（low-cost）硬件上。

2、spark

1）spark简介

Spark 是专为大规模数据处理而设计的快速通用的计算引擎。Spark拥有Hadoop MapReduce所具有的优点，Spark在Job中间输出结果可以保存在内存中，从而不再需要读写HDFS，因此Spark性能以及运算速度高于MapReduce。

2）spark优点

计算速度快: 因为spark从磁盘中读取数据，把中间数据放到内存中，，完成所有必须的分析处理，将结果写回集群，所以spark更快。

Spark 提供了大量的库: 包括Spark Core、Spark SQL、Spark Streaming、MLlib、GraphX。

支持多种资源管理器: Spark 支持 Hadoop YARN，及其自带的独立集群管理器

操作简单: 高级 API 剥离了对集群本身的关注，Spark 应用开发者可以专注于应用所要做的计算本身

3、spark与hadoop的不同点

1）应用场景不同

Hadoop和Spark两者都是大数据框架，但是各自应用场景是不同的。Hadoop是一个分布式数据存储架构，它将巨大的数据集分派到一个由普通计算机组成的集群中的多个节点进行存储，降低了硬件的成本。Spark是那么一个专门用来对那些分布式存储的大数据进行处理的工具，它要借助hdfs的数据存储。

2）处理速度不同

hadoop的MapReduce是分步对数据进行处理的，从磁盘中读取数据，进行一次处理，将结果写到磁盘，然后在从磁盘中读取更新后的数据，再次进行的处理，最后再将结果存入磁盘，这存取磁盘的过程会影响处理速度。spark从磁盘中读取数据，把中间数据放到内存中，，完成所有必须的分析处理，将结果写回集群，所以spark更快。

3）容错性不同

Hadoop将每次处理后的数据都写入到磁盘上，基本谈不上断电或者出错数据丢失的情况。Spark的数据对象存储在弹性分布式数据集 RDD，RDD是分布在一组节点中的只读对象集合，如果数据集一部分丢失，则可以根据于数据衍生过程对它们进行重建。而且RDD 计算时可以通过 CheckPoint 来实现容错。

4、spark与hadoop的联系

Hadoop提供分布式数据存储功能HDFS，还提供了用于数据处理的MapReduce。 MapReduce是可以不依靠spark数据的处理的。当然spark也可以不依靠HDFS进行运作，它可以依靠其它的分布式文件系统。但是两者完全可以结合在一起，hadoop提供分布式集群和分布式文件系统，spark可以依附在hadoop的HDFS代替MapReduce弥补MapReduce计算能力不足的问题。

总结一句话：spark在hadoop肩膀上可以让大数据跑的更快

樱田妮妮NiNi

3楼 · 2021-04-08 11:03

Spark和MR两者之间的详细对比分析（重点）

3.1 速度

（1）spark把运算的中间数据存放在内存，迭代计算效率更高；

（2）mapreduce的中间结果需要保存到磁盘，这样必然会有磁盘io操做，影响性能。

3.2 容错性

（1）spark容错性高，它通过弹性分布式数据集RDD来实现高效容错，RDD是一组分布式的存储在节点内存中的只读性质的数据集，这些集合是弹性的，某一部分丢失或者出错，可以通过整个数据集的计算流程的血缘关系来实现重建；

（2）mapreduce的容错可能只能重新计算了，成本较高。

3.3 适用性

（1）spark更加通用，spark提供了transformation和action这两大类的多个功能API，另外还有流式处理 sparkstreaming模块、图计算GraphX等等；

（2）mapreduce只提供了map和reduce两种操作，流计算以及其他模块的支持比较缺乏。

3.4 框架和生态

（1）Spark框架和生态更为复杂适用范围更广，首先由RDD、血缘lineage、执行时的有向无环图DAG、stage划分等等，很多时候spark作业都需要根据不同的业务场景的需要进行调优，以达到性能要求。

（2）MR框架及其生态相对较为简单，对性能的要求也相对较弱，但是运行较为稳定，适合长期后台运行以及离线海量数据挖掘计算。

3.5 运行环境

（1）spark大致有四种运行模式：

local：本地运行

standalone：使用Spark自带的资源管理框架，运行spark的应用（常用）

yarn：将spark应用类似mr一样，提交到yarn上运行（常用）

mesos：类似yarn的一种资源管理框架

（2）MR运行在YARN上

猿小猿

4楼 · 2021-04-08 11:31

解决问题的层面不一样
首先，Hadoop和Apache Spark两者都是大数据框架，但是各自存在的目的不尽相同。Hadoop实质上更多是一个分布式数据基础设施: 它将巨大的数据集分派到一个由普通计算机组成的集群中的多个节点进行存储，意味着您不需要购买和维护昂贵的服务器硬件，Hadoop还会索引和跟踪这些数据，让大数据处理和分析效率达到前所未有的高度；Spark，则是那么一个专门用来对那些分布式存储的大数据进行处理的工具，它并不会进行分布式数据的存储。
两者可合可分
Hadoop除了提供了一个为大家所共识的HDFS分布式数据存储功能之外，还提供了叫做MapReduce的数据处理功能，所以我们完全可以抛开Spark，使用Hadoop自身的MapReduce来完成数据的处理；Spark也不是非要依附在Hadoop身上才能生存，但如上所述，毕竟它没有提供文件管理系统，所以它必须和其他的分布式文件系统进行集成才能运作，这里我们可以选择Hadoop的HDFS,也可以选择其他的基于云的数据系统平台，但Spark默认来说还是被用在Hadoop上面的，毕竟大家都认为它们的结合是最好的。
Spark数据处理速度秒杀MapReduce
Spark因为其处理数据的方式不一样，会比MapReduce快上很多，MapReduce是分步对数据进行处理的: “从集群中读取数据，进行一次处理，将结果写到集群，从集群中读取更新后的数据，进行下一次的处理，将结果写到集群，等等” Booz Allen Hamilton的数据科学家Kirk Borne如此解析；反观Spark，它会在内存中以接近“实时”的时间完成所有的数据分析：“从集群中读取数据，完成所有必须的分析处理，将结果写回集群，最终完成” ，Spark的批处理速度比MapReduce快近10倍，内存中的数据分析速度则快近100倍，如果需要处理的数据和结果需求大部分情况下是静态的，且你也有耐心等待批处理的完成的话，MapReduce的处理方式也是完全可以接受的，但如果你需要对流数据进行分析，比如那些来自于工厂的传感器收集回来的数据，又或者说你的应用是需要多重数据处理的，那么你也许更应该使用Spark进行处理，大部分机器学习算法都是需要多重数据处理的，此外，通常会用到Spark的应用场景有以下方面：实时的市场活动，在线产品推荐，网络安全分析，机器日记监控等。
4
灾难恢复
两者的灾难恢复方式迥异，但是都很不错。因为Hadoop将每次处理后的数据都写入到磁盘上，所以其天生就能很有弹性的对系统错误进行处理;Spark的数据对象存储在分布于数据集群中的叫做弹性分布式数据集(RDD: Resilient Distributed Dataset)中,这些数据对象既可以放在内存，也可以放在磁盘，所以RDD同样也可以提供完成的灾难恢复功能。
END

经验内容仅供参考，如果您需解决具体问题(尤其法律、医学等领域)，建议您详细咨询相关领域专业人士

yuixan

5楼 · 2021-04-08 14:47

1
解决问题的层面不一样
首先，Hadoop和Apache Spark两者都是大数据框架，但是各自存在的目的不尽相同。Hadoop实质上更多是一个分布式数据基础设施: 它将巨大的数据集分派到一个由普通计算机组成的集群中的多个节点进行存储，意味着您不需要购买和维护昂贵的服务器硬件，Hadoop还会索引和跟踪这些数据，让大数据处理和分析效率达到前所未有的高度；Spark，则是那么一个专门用来对那些分布式存储的大数据进行处理的工具，它并不会进行分布式数据的存储。
2
两者可合可分
Hadoop除了提供了一个为大家所共识的HDFS分布式数据存储功能之外，还提供了叫做MapReduce的数据处理功能，所以我们完全可以抛开Spark，使用Hadoop自身的MapReduce来完成数据的处理；Spark也不是非要依附在Hadoop身上才能生存，但如上所述，毕竟它没有提供文件管理系统，所以它必须和其他的分布式文件系统进行集成才能运作，这里我们可以选择Hadoop的HDFS,也可以选择其他的基于云的数据系统平台，但Spark默认来说还是被用在Hadoop上面的，毕竟大家都认为它们的结合是最好的。
3
Spark数据处理速度秒杀MapReduce
Spark因为其处理数据的方式不一样，会比MapReduce快上很多，MapReduce是分步对数据进行处理的: “从集群中读取数据，进行一次处理，将结果写到集群，从集群中读取更新后的数据，进行下一次的处理，将结果写到集群，等等” Booz Allen Hamilton的数据科学家Kirk Borne如此解析；反观Spark，它会在内存中以接近“实时”的时间完成所有的数据分析：“从集群中读取数据，完成所有必须的分析处理，将结果写回集群，最终完成” ，Spark的批处理速度比MapReduce快近10倍，内存中的数据分析速度则快近100倍，如果需要处理的数据和结果需求大部分情况下是静态的，且你也有耐心等待批处理的完成的话，MapReduce的处理方式也是完全可以接受的，但如果你需要对流数据进行分析，比如那些来自于工厂的传感器收集回来的数据，又或者说你的应用是需要多重数据处理的，那么你也许更应该使用Spark进行处理，大部分机器学习算法都是需要多重数据处理的，此外，通常会用到Spark的应用场景有以下方面：实时的市场活动，在线产品推荐，网络安全分析，机器日记监控等。
4
灾难恢复
两者的灾难恢复方式迥异，但是都很不错。因为Hadoop将每次处理后的数据都写入到磁盘上，所以其天生就能很有弹性的对系统错误进行处理;Spark的数据对象存储在分布于数据集群中的叫做弹性分布式数据集(RDD: Resilient Distributed Dataset)中,这些数据对象既可以放在内存，也可以放在磁盘，所以RDD同样也可以提供完成的灾难恢复功能。

瑶瑶吖 - 已所不欲，勿施于人

6楼 · 2021-04-09 09:17

1、Hadoop和Spark都是并行计算，两者都是用MR模型进行计算。Hadoop一个作业称为一个Job，Job里面分为Map Task和Reduce Task阶段，每个Task都在自己的进程中运行，当Task结束时，进程也会随之结束。

2、Spark用户提交的任务称为application，一个application对应一个SparkContext，app中存在多个job，每触发一次action操作就会产生一个job。这些job可以并行或串行执行，每个job中有多个stage，stage是shuffle过程中DAGScheduler通过RDD之间的依赖关系划分job而来的，每个stage里面有多个task，组成taskset，由TaskScheduler分发到各个executor中执行；executor的生命周期是和app一样的，即使没有job运行也是存在的，所以task可以快速启动读取内存进行计算。

py大白

7楼 · 2021-04-09 11:57

解决问题的层面不一样

首先，Hadoop和Apache Spark两者都是大数据框架，但是各自存在的目的不尽相同。Hadoop实质上更多是一个分布式数据基础设施: 它将巨大的数据集分派到一个由普通计算机组成的集群中的多个节点进行存储，意味着您不需要购买和维护昂贵的服务器硬件，Hadoop还会索引和跟踪这些数据，让大数据处理和分析效率达到前所未有的高度；Spark，则是那么一个专门用来对那些分布式存储的大数据进行处理的工具，它并不会进行分布式数据的存储。

两者可合可分

Hadoop除了提供了一个为大家所共识的HDFS分布式数据存储功能之外，还提供了叫做MapReduce的数据处理功能，所以我们完全可以抛开Spark，使用Hadoop自身的MapReduce来完成数据的处理；Spark也不是非要依附在Hadoop身上才能生存，但如上所述，毕竟它没有提供文件管理系统，所以它必须和其他的分布式文件系统进行集成才能运作，这里我们可以选择Hadoop的HDFS,也可以选择其他的基于云的数据系统平台，但Spark默认来说还是被用在Hadoop上面的，毕竟大家都认为它们的结合是最好的。

Spark数据处理速度秒杀MapReduce

Spark因为其处理数据的方式不一样，会比MapReduce快上很多，MapReduce是分步对数据进行处理的: “从集群中读取数据，进行一次处理，将结果写到集群，从集群中读取更新后的数据，进行下一次的处理，将结果写到集群，等等” Booz Allen Hamilton的数据科学家Kirk Borne如此解析；反观Spark，它会在内存中以接近“实时”的时间完成所有的数据分析：“从集群中读取数据，完成所有必须的分析处理，将结果写回集群，最终完成” ，Spark的批处理速度比MapReduce快近10倍，内存中的数据分析速度则快近100倍，如果需要处理的数据和结果需求大部分情况下是静态的，且你也有耐心等待批处理的完成的话，MapReduce的处理方式也是完全可以接受的，但如果你需要对流数据进行分析，比如那些来自于工厂的传感器收集回来的数据，又或者说你的应用是需要多重数据处理的，那么你也许更应该使用Spark进行处理，大部分机器学习算法都是需要多重数据处理的，此外，通常会用到Spark的应用场景有以下方面：实时的市场活动，在线产品推荐，网络安全分析，机器日记监控等。

爱学习的小巴

8楼 · 2021-04-09 15:54

是年糕麻麻啊

9楼 · 2021-04-14 09:41

Spark：专为大规模数据处理而设计的快速通用的计算引擎，是一种与 Hadoop 相似的开源集群计算环境，拥有Hadoop MapReduce所具有的优点，Spark是MapReduce的替代方案，而且兼容HDFS、Hive，可融入Hadoop的生态系统，以弥补MapReduce的不足。

Spark主要用于大数据的计算，而Hadoop以后主要用于大数据的存储（比如HDFS、Hive、HBase等），以及资源调度（Yarn）。Spark+Hadoop，是目前大数据领域最热门的组合。