上传者: weixin_38648396
|
上传时间:2023/6/4 19:35:56
|
文件大小:306KB
|
文件类型:PDF
Spark:一个高效的分布式计算系统
Spark是UCBerkeleyAMPlab所开源的类HadoopMapReduce的通用的并行计算框架,Spark基于mapreduce算法实现的分布式计算,拥有HadoopMapReduce所具有的优点;
但不同于MapReduce的是Job中间输出和结果可以保存在内存中,从而不再需要读写HDFS,因此Spark能更好地适用于数据挖掘与机器学习等需要迭代的mapreduce的算法。
其架构如下图所示:Spark的中间数据放到内存中,对于迭代运算效率更高。
Spark更适合于迭代运算比较多的ML和DM运算。
因为在Spark里面,有RDD的抽象概念。
Spark比Hadoop更通用。
Spark提供的数
本软件ID:15482488