RDD特性包含如下哪些?()A、一组分片(Partition),即数据集的基本组成单位B、一个计算每个分区的函数C、RDD之间的依赖关系D、一个列表,存储存取每个Partition的优先位置(preferredlocation)

RDD特性包含如下哪些?()

  • A、一组分片(Partition),即数据集的基本组成单位
  • B、一个计算每个分区的函数
  • C、RDD之间的依赖关系
  • D、一个列表,存储存取每个Partition的优先位置(preferredlocation)

相关考题:

RDD的flatMap操作是将函数应用于RDD之中的每一个元素,将返回的迭代器数组、列表等中的所有元素构成新的RDD。() 此题为判断题(对,错)。

SparkStreming中()函数可以通过对源DStream的每RDD应用RDD-to-RDD函数返回一个新的DStream,这可以用来在DStream做任意RDD操作。 A.transB.reduceC.joinD.cogroup

以下哪种方法可以让Spark不自定义分区也能对任何类型RDD简单重分区()。 A.resetpartitionB.repartitonC.coalesceD.Partition

Spark中的每个RDD一般情况下是由()个分区组成的。 A.无数B.多C.1D.0

以下属于spark启动后进程的是()A、rdd是由一系列的partition组成的B、原子性C、算子作用在partition上D、每个rdd都会提供一批最优的计算位置

mapPartitions算子类似于map,但独立地在RDD的每一个分片上运行,因此在类型为T的RDD上运行时,func的函数类型必须是Iterator[T]=Iterator[U]

spark中的rdd是一个()数据集A、弹性分布式B、弹性计算C、运送数据D、心跳

spark中以下哪些特性是rdd的特性()A、计算移动B、数据不移动C、数据移动D、计算不移动

创建rdd可以有如下几种?()A、由外部存储系统的数据集创建,包括本地的文件系统B、由一个已经存在的Scala集合创建C、比如所有Hadoop支持的数据集,比如HDFS、Cassandra、HbaseD、以上说法都不对

map算子返回一个新的RDD,该RDD由每一个输入元素经过func函数转换后组成

union算子对源RDD和参数RDD求并集后返回一个新的RDD

spark在进行数据切分的时候,决定了partition的哪些属性()A、冗余性B、一致性C、rdd之间具有依赖性D、每个rdd都会提供一批最优的计算位置

以下关于rdd的特性说法错误的是()A、rdd是仅仅由一组partition够成的B、rdd之间都是独立的,没有依赖C、算子作用在partition上D、每个rdd都会提供一批最优的计算位置

以下关于rdd的说法中,正确的是哪些()A、rdd是由一系列partition够成的B、rdd之间都是独立的,没有依赖C、算子作用在partition上D、每个rdd都会提供一批最优的计算位置

以下选项属于rdd特性的是()A、冗余性B、一致性C、rdd之间具有依赖性D、每个rdd都会提供一批最优的计算位置

spring中关于bean的说法正确的是()A、rdd是由一组partition够成的B、rdd之间都是独立的,没有依赖C、算子作用在partition上D、每个rdd都会提供一批最优的计算位置

Spark中,以下哪些是rdd的特性()A、partition大小B、partition个数C、partiton的所有者D、parrtition的一切

DStream是一系列连续的RDD来表示。每个RDD含有一段时间间隔内的数据

RDD之间宽窄依赖关系的主要依据哪个的对应关系来划分的()A、partitionB、workerC、masterD、数据

以下选项中是persist算子在源码中具有哪些参数的是()A、rdd是由一系列partition够成的B、rdd之间都是独立的,没有依赖C、算子作用在partition上D、每个rdd都会提供一批最优的计算位置

RDD(ResilientDistributedDataset)叫做分布式数据集,是Spark中最基本的数据抽象,它代表一个不可变、可分区、里面的元素可并行计算的集合

filter算子返回一个新的RDD,该RDD由经过函数计算后返回值为true的输入元素组成

以下哪些不属于rdd特性()A、冗余性B、一致性C、rdd之间具有依赖性D、每个rdd都会提供一批最优的计算位置

在使用Ghost时,下列菜单中叙述错误的是:()。A、Partition To Partition表示将一个分区的数据复制到另一个分区B、Partition To Image表示将一个分区的数据复制到一个磁盘文件C、Partition From Image表示将一个Image文件的数据恢复到一个分区上D、Disk To Disk表示将一个磁盘的数据移动到另一个磁盘上

单选题下列有关RDD的说法中错误的是()。ARDD是一个只读的,可分区的分布式数据集。BRDD默认存储在磁盘,当磁盘不足时,溢写到内存。CRDD数据以分区的形式在集群中存储。DRDD具有血统机制,发生数据丢失时,可快速进行数据恢复。

问答题试述如下Spark的几个主要概念:RDD、DAG、阶段、分区、窄依赖、宽依赖。

( 难度:中等)关于spark中RDD说法错误的是:A.宽依赖指的是多个子RDD的分区会依赖同一个父RDD的分区,关系是一对多B.窄依赖指的是每一个父RDD的分区最多被子RDD的一个分区使用,是一对一的C.宽依赖中会有shuffle的产生D.窄依赖中会有shuffle的产生