Hadoop和spark之间有什么不同点呀？

想知道

2024-12-25 22:50:12

推荐回答（2个）

回答1：

诞生的先后顺序，hadoop属于第一代开源大数据处理平台，而spark属于第二代
属于下一代的spark肯定在综合评价上要优于第一代的hadoop
spark和hadoop在分布式计算的底层思路上，其实是极为相似的，即mapreduce分布式运算模型：将运算分成两个阶段，阶段1-map，负责从上游拉取数据后各自运算，然后将运算结果shuffle给下游的reduce，reduce再各自对通过shuffle读取来的数据进行聚合运算
spark和hadoop在分布式计算的具体实现上，又有区别;hadoop中的mapreduce运算框架，一个运算job，进行一次map-reduce的过程;而spark的一个job中，可以将多个map-reduce过程级联进行
spark和hadoop的另一个区别是，spark是一个运算平台，而hadoop是一个复合平台(包含运算引擎，还包含分布式文件存储系统，还包含分布式运算的资源调度系统)，所以，spark跟hadoop来比较的话，主要是比运算这一块
大数据技术发展到目前这个阶段，hadoop(主要是说它的运算部分)日渐式微，而spark目前如日中天，相关技术需求量大，offer好拿，薪资相对更高

回答2：

hadoop:是分布式存储系统，同时提供分布式计算环境，存储称为hdfs，计算称为mapreduce 简称MR。
spark：是一个分布式计算框架，类似于hadoop的运算环境，但是比mapreduce提供了更多支持，与其他系统的对接，一些高级算法等，可以独立运行，也可以使用hdfs上的数据，调度任务也可以基于hadoop的yarn来管理。由于整个计算都可以在内存中完成，所以速度自然比传统的MR计算的快。除此之外spark运行时占用的系统资源也比MR小得多，相比较属于轻量级运行。最核心的也是它提供的分析学习算法，这个大部分分布式架构不具有的。