【SparkAPI JAVA版】JavaPairRDD——cartesian(三)

2023-11-09 13:39

本文主要是介绍【SparkAPI JAVA版】JavaPairRDD——cartesian(三),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

JavaPairRDD的cartesian方法讲解
官方文档说明
Return the Cartesian product of this RDD and another one, that is, the RDD of all pairs of elements (a, b) where a is in `this` and b is in `other`.
中文含义

该函数返回的是Pair类型的RDD,计算结果是当前RDD和other RDD中每个元素进行笛卡儿计算的结果。最后返回的是CartesianRDD。

方法原型
//scala
def cartesian[U: ClassTag](other: RDD[U]): RDD[(T, U)]
//java
public static <U> JavaPairRDD<T,U> cartesian(JavaRDDLike<U,?> other)
实例
public class Cartesian {public static void main(String[] args) {System.setProperty("hadoop.home.dir","F:\\hadoop-2.7.1");SparkConf conf = new SparkConf().setMaster("local").setAppName("TestSpark");JavaSparkContext sc = new JavaSparkContext(conf);//JavaPairRDD cartesian示例JavaPairRDD<Integer,Integer> javaPairRDD1 = sc.parallelizePairs(Lists.newArrayList(new Tuple2<Integer, Integer>(1,11),new Tuple2<Integer, Integer>(2,22),new Tuple2<Integer, Integer>(3,33)));JavaPairRDD<Integer,Integer> javaPairRDD2 = sc.parallelizePairs(Lists.newArrayList(new Tuple2<Integer, Integer>(7,71),new Tuple2<Integer, Integer>(8,82),new Tuple2<Integer, Integer>(9,93)));JavaPairRDD<Tuple2<Integer, Integer>, Tuple2<Integer, Integer>> javaPairRDD3 = javaPairRDD1.cartesian(javaPairRDD2);javaPairRDD3.foreach(new VoidFunction<Tuple2<Tuple2<Integer, Integer>, Tuple2<Integer, Integer>>>() {public void call(Tuple2<Tuple2<Integer, Integer>, Tuple2<Integer, Integer>> tuple2Tuple2Tuple2) throws Exception {System.out.println(tuple2Tuple2Tuple2);/*System.out.print("key:"+tuple2Tuple2Tuple2._1+",");System.out.println("value:"+tuple2Tuple2Tuple2._2);*/}});//JavaRDD cartesian示例JavaRDD<Integer> javaRDD1 = sc.parallelize(Lists.newArrayList(1,2,3));JavaRDD<Integer> javaRDD2 = sc.parallelize(Lists.newArrayList(7,8,9));JavaPairRDD<Integer,Integer> javaPairRDD = javaRDD1.cartesian(javaRDD2);javaPairRDD.foreach(new VoidFunction<Tuple2<Integer, Integer>>() {public void call(Tuple2<Integer, Integer> integerIntegerTuple2) throws Exception {System.out.println(integerIntegerTuple2);}});}
}
结果
//JavaPairRDD cartesian示例
((1,11),(7,71))
((1,11),(8,82))
((1,11),(9,93))
((2,22),(7,71))
((2,22),(8,82))
((2,22),(9,93))
((3,33),(7,71))
((3,33),(8,82))
((3,33),(9,93))
19/03/03 23:37:52 INFO Executor: Finished task 0.0 in stage 0.0 (TID 0). 751 bytes result sent to driver
//JavaRDD cartesian示例
(1,7)
(1,8)
(1,9)
(2,7)
(2,8)
(2,9)
(3,7)
(3,8)
(3,9)

注意:计算笛卡尔积很消耗内存,不要在大量数据的时候随便使用。

这篇关于【SparkAPI JAVA版】JavaPairRDD——cartesian(三)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/376447

相关文章

Spring事务传播机制最佳实践

《Spring事务传播机制最佳实践》Spring的事务传播机制为我们提供了优雅的解决方案,本文将带您深入理解这一机制,掌握不同场景下的最佳实践,感兴趣的朋友一起看看吧... 目录1. 什么是事务传播行为2. Spring支持的七种事务传播行为2.1 REQUIRED(默认)2.2 SUPPORTS2

怎样通过分析GC日志来定位Java进程的内存问题

《怎样通过分析GC日志来定位Java进程的内存问题》:本文主要介绍怎样通过分析GC日志来定位Java进程的内存问题,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、GC 日志基础配置1. 启用详细 GC 日志2. 不同收集器的日志格式二、关键指标与分析维度1.

Java进程异常故障定位及排查过程

《Java进程异常故障定位及排查过程》:本文主要介绍Java进程异常故障定位及排查过程,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、故障发现与初步判断1. 监控系统告警2. 日志初步分析二、核心排查工具与步骤1. 进程状态检查2. CPU 飙升问题3. 内存

java中新生代和老生代的关系说明

《java中新生代和老生代的关系说明》:本文主要介绍java中新生代和老生代的关系说明,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、内存区域划分新生代老年代二、对象生命周期与晋升流程三、新生代与老年代的协作机制1. 跨代引用处理2. 动态年龄判定3. 空间分

Java设计模式---迭代器模式(Iterator)解读

《Java设计模式---迭代器模式(Iterator)解读》:本文主要介绍Java设计模式---迭代器模式(Iterator),具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,... 目录1、迭代器(Iterator)1.1、结构1.2、常用方法1.3、本质1、解耦集合与遍历逻辑2、统一

Java内存分配与JVM参数详解(推荐)

《Java内存分配与JVM参数详解(推荐)》本文详解JVM内存结构与参数调整,涵盖堆分代、元空间、GC选择及优化策略,帮助开发者提升性能、避免内存泄漏,本文给大家介绍Java内存分配与JVM参数详解,... 目录引言JVM内存结构JVM参数概述堆内存分配年轻代与老年代调整堆内存大小调整年轻代与老年代比例元空

深度解析Java DTO(最新推荐)

《深度解析JavaDTO(最新推荐)》DTO(DataTransferObject)是一种用于在不同层(如Controller层、Service层)之间传输数据的对象设计模式,其核心目的是封装数据,... 目录一、什么是DTO?DTO的核心特点:二、为什么需要DTO?(对比Entity)三、实际应用场景解析

Java 线程安全与 volatile与单例模式问题及解决方案

《Java线程安全与volatile与单例模式问题及解决方案》文章主要讲解线程安全问题的五个成因(调度随机、变量修改、非原子操作、内存可见性、指令重排序)及解决方案,强调使用volatile关键字... 目录什么是线程安全线程安全问题的产生与解决方案线程的调度是随机的多个线程对同一个变量进行修改线程的修改操

从原理到实战深入理解Java 断言assert

《从原理到实战深入理解Java断言assert》本文深入解析Java断言机制,涵盖语法、工作原理、启用方式及与异常的区别,推荐用于开发阶段的条件检查与状态验证,并强调生产环境应使用参数验证工具类替代... 目录深入理解 Java 断言(assert):从原理到实战引言:为什么需要断言?一、断言基础1.1 语

深度解析Java项目中包和包之间的联系

《深度解析Java项目中包和包之间的联系》文章浏览阅读850次,点赞13次,收藏8次。本文详细介绍了Java分层架构中的几个关键包:DTO、Controller、Service和Mapper。_jav... 目录前言一、各大包1.DTO1.1、DTO的核心用途1.2. DTO与实体类(Entity)的区别1