大数据中的Spark指的是什么？_Spark

4条回答

玄月 - 坐看风云起

2楼 · 2020-05-29 09:02

Spark，是一种“One Stack to rule them all”的大数据计算框架，是一种基于内存计算的框架，是一种通用的大数据快速处理引擎。

这一站式的计算框架，包含了Spark RDD(这也是Spark Core用于离线批处理)、Spark SQL(交互式查询)、Spark Streaming(实时流计算)、MLlib(机器学习)、GraphX(图计算)等重要处理组件。

记忆里的东关

3楼 · 2020-05-29 11:23

Spark的中文释义是火花，旨为快的含义

Spark的内置项目很丰富，有Spark SQL,Spark Streaming,MLlib,GraphX

Spark是对Hadoop性能缺陷的一个补充

就是快！！！

十一郎

4楼 · 2020-06-04 16:19

是一个基于内存的并行计算框架，类似于hadoop中的mapreduce。

猫的想法不敢猜

5楼 · 2021-03-12 15:34

park是一种通用的大数据计算框架，和传统的大数据技术MapReduce有本质区别。前者是基于内存并行计算的框架，而mapreduce侧重磁盘计算。Spark是加州大学伯克利分校AMP实验室开发的通用内存并行计算框架，用于构建大型的、低延迟的数据分析应用程序。
Spark同样支持离线计算和实时计算两种模式。Spark离线计算速度要比Mapreduce快10-100倍。而实时计算方面，则依赖于SparkStreaming的批处理能力，吞吐量大。不过相比Storm，SparkStreaming并不能做到真正的实时。
Spark使用强大的函数式语言Scala开发，方便简单。同时，它还提供了对Python、Java和R语言的支持。
作为大数据计算框架MapReduce的继任者，Spark具备以下优势特性。
1，高效性
不同于MapReduce将中间计算结果放入磁盘中，Spark采用内存存储中间计算结果，减少了迭代运算的磁盘IO，并通过并行计算DAG图的优化，减少了不同任务之间的依赖，降低了延迟等待时间。内存计算下，Spark 比 MapReduce 快100倍。
2，易用性
不同于MapReduce仅支持Map和Reduce两种编程算子，Spark提供了超过80种不同的Transformation和Action算子，如map,reduce,filter,groupByKey,sortByKey,foreach等，并且采用函数式编程风格，实现相同的功能需要的代码量极大缩小。
3，通用性
Spark提供了统一的解决方案。Spark可以用于批处理、交互式查询（Spark SQL）、实时流处理（Spark Streaming）、机器学习（Spark MLlib）和图计算（GraphX）。
4，兼容性
Spark能够跟很多开源工程兼容使用。如Spark可以使用Hadoop的YARN和Apache Mesos作为它的资源管理和调度器，并且Spark可以读取多种数据源，如HDFS、HBase、MySQL等。

来源于网络仅供参考

相关问题推荐

spark的优点有哪些？2021-07-05 16:55

回答 20

首先， Spark 非常好用。由于高级 API 剥离了对集群本身的关注，你可以专注于你所要做的计算本身，只需在自己的笔记本电脑上就可以开发 Spark 应用。其次， Spark 很快，支持交互式使用和复杂算法。最后， Spark 是一个通用引擎，可用它来完成各种各样的运算...
Scala使用哪个版本比较合适2020-04-24 17:24

回答 5

现在企业中多数用的是相对稳定的Spark2.2.0版本。
常见的rdd算子有哪些？2021-04-14 18:51

回答 10

常用RDD算子（1）Action RDDforeach：遍历每个元素，无返回值，一般用在将结果存储到数据库中使用saveAsTextFile存储到hdfs，RDD每个partition存到hdfs的一个block块saveAsObjectFile：存储到hdfs，将每个partition的数据序列化后，以sequenceFile（序列化）...
spark中worker 的主要工作是什么？2020-08-18 09:23

回答 6

主要功能：管理当前节点内存，CPU的使用状况，接收master分配过来的资源指令，通过ExecutorRunner启动程序分配任务，worker就类似于包工头，管理分配新进程，做计算的服务，相当于process服务。需要注意的是：1）worker会不会汇报当前信息给master，worker心...
RDD五大属性2020-07-15 13:45

回答 3

1、RDD是一个分片的数据集合;2、RDD的函数针对每个分片进行计算;3、RDD之间是个依赖的集合;4、可选：key-value型RDD是根据哈希来分区的；5、可选：数据本地性优先计算。
spark怎么杀死已经提交的任务？2021-04-28 20:11

回答 3

在hadoop/bin目录下有yarn命令yarn application -kill
spark的核心组件有哪些？2020-04-26 10:16

回答 3

已采纳

1.Spark SQLSpark SQL是Spark用来操作结构化数据的组件。通过Spark SQL，用户可以使用SQL或者Apache Hive版本的SQL方言（HQL）来查询数据。Spark SQL支持多种数据源类型，例如Hive表、Parquet以及JSON等。Spark SQL不仅为Spark提供了一个SQL接口，还支持开发...
sparksql 和 sparkstreamin2021-04-29 20:33

回答 4

Spark SQL 在 Spark1.x 中和传统 SQL 不完全一致。但是在 Spark2.x 版本中遵循的美国的ANSI的SQL2003完全标准sql 。oracle和mysql都有自己的语法规则，平时所使用的 SQL 语句都不是标准 SQL 。平时用的 mysql 和 oracle 以及 hive，都是部分遵循标准SQL 。...
提交spark 任务可以设置哪些参数？2021-04-28 20:11

回答 3

#!/bin/bash #队列名根据yarn的队列提交 realtime_queue=root #提交的任务名 my_job_name=OrderQZspark-shell --master yarn --deploy-mode client \--queue $realtime_queue \ #总的executors数根据数据量与自己的集群资源来分配--num-executors...
什么是Spark？Spark的特点和结构？2021-04-26 19:55

回答 2

Spark是一种快速、通用、可扩展的大数据分析引擎，于2009年诞生于加州大学伯克利分校AMPLab，2010年开源，2013年6月成为Apache孵化项目，2014年2月成为Apache顶级项目。项目是用Scala进行编写。Spark的结构：Spark生态系统已经发展成为一个包含多个子项目的集...
Spark分组后为什么会在某个分组下出现其他组的 Spark 2021-02-25 19:18

回答 1

自己随意编写一份测试数据，所用的测试数据如下，需求是按照第一列的字母分组，然后按照第二列数据取出每一组内前N个数据，后面我分别列出了我使用的三种方案来实现该需求，不同方案在不同的场景下会有各自的优势 a 25b 36c 24d 45e 60a 33b 26c 47d 43e 62a...
Spark Streaming 怎么实时读取 Re2020-09-17 11:25

回答 1

把数据从redis读出来放到kafka里呗，然后用spark-streaming去读kafka的数据，或者写个程序从redis把数据读出来用socket或文件的形式传给spark-streaming，spark-streaming支持很多种源的方式

没有解决我的问题，去提问

大数据中的Spark指的是什么？

相关问题推荐

等你来答

热门问答

相关文章

大数据中的Spark指的是什么？

相关问题推荐

等你来答

热门问答

相关文章

采纳回答

编辑标签

举报内容

检举类型

检举原因

检举说明(必填)

打开微信“扫一扫”，打开网页后点击屏幕右上角分享按钮

付费偷看金额在0.1-10元之间