java-spark广播变量

2024-08-31 15:58
文章标签 java 广播 变量 spark

本文主要是介绍java-spark广播变量,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

文章目录

    • 1. java spark使用广播变量方式
    • 2. 运行时spark任务报错
      • 1. 原因
      • 2. 解决方案

1. java spark使用广播变量方式

在java spark中如果想要使用广播变量需要使用JavaSparkContext.broadcast()方法
代码如下

SparkSession sparkSession = SparkSession.builder().config(sparkConf).getOrCreate();JavaSparkContext javaSparkContext = JavaSparkContext.fromSparkContext(sparkSession.sparkContext());Dataset<Row> labelDimensionTable = sparkSession.read().parquet(labelDimPath);Map<String, Long> labelNameToId = getNameToId(labelDimensionTable);Broadcast<Map<String, Long>> labelNameIdBroadcast = javaSparkContext.broadcast(labelNameToId);Map<String, Long> getNameToId(Dataset<Row> labelDimTable) {return  labelDimTable.javaRDD().mapToPair(new PairFunction() {@Overridepublic Tuple2 call(Object object) throws Exception {Row curRow = (Row) object;Long labelId = curRow.getAs("label_id");String labelTitle = curRow.getAs("label_title");return Tuple2.apply(labelTitle, labelId);}}).collectAsMap();}

2. 运行时spark任务报错


20/09/09 18:23:00 INFO scheduler.TaskSetManager: Starting task 0.0 in stage 5.0 (TID 4008, node-hadoop67.com, executor 3, partition 0, RACK_LOCAL, 8608 bytes)
20/09/09 18:23:00 INFO storage.BlockManagerInfo: Added broadcast_9_piece0 in memory on node-hadoop67.com:23191 (size: 41.1 KB, free: 2.5 GB)
20/09/09 18:23:01 INFO storage.BlockManagerInfo: Added broadcast_8_piece0 in memory on node-hadoop67.com:23191 (size: 33.5 KB, free: 2.5 GB)
20/09/09 18:23:02 INFO storage.BlockManagerInfo: Added broadcast_5_piece1 in memory on node-hadoop67.com:23191 (size: 698.1 KB, free: 2.5 GB)
20/09/09 18:23:02 INFO storage.BlockManagerInfo: Added broadcast_5_piece0 in memory on node-hadoop67.com:23191 (size: 4.0 MB, free: 2.5 GB)
20/09/09 18:23:02 WARN scheduler.TaskSetManager: Lost task 0.0 in stage 5.0 (TID 4008, node-hadoop67.com, executor 3): java.io.IOException: java.lang.UnsupportedOperationExceptionat org.apache.spark.util.Utils$.tryOrIOException(Utils.scala:1367)at org.apache.spark.broadcast.TorrentBroadcast.readBroadcastBlock(TorrentBroadcast.scala:207)at org.apache.spark.broadcast.TorrentBroadcast._value$lzycompute(TorrentBroadcast.scala:66)at org.apache.spark.broadcast.TorrentBroadcast._value(TorrentBroadcast.scala:66)at org.apache.spark.broadcast.TorrentBroadcast.getValue(TorrentBroadcast.scala:96)at com.kk.search.user_profile.task.user_profile.UserLabelProfile$1.call(UserLabelProfile.java:157)at org.apache.spark.sql.Dataset$$anonfun$44.apply(Dataset.scala:2605)at org.apache.spark.sql.Dataset$$anonfun$44.apply(Dataset.scala:2605)at org.apache.spark.sql.execution.MapPartitionsExec$$anonfun$5.apply(objects.scala:188)at org.apache.spark.sql.execution.MapPartitionsExec$$anonfun$5.apply(objects.scala:185)at org.apache.spark.rdd.RDD$$anonfun$mapPartitionsInternal$1$$anonfun$apply$25.apply(RDD.scala:836)at org.apache.spark.rdd.RDD$$anonfun$mapPartitionsInternal$1$$anonfun$apply$25.apply(RDD.scala:836)at org.apache.spark.rdd.MapPartitionsRDD.compute(MapPartitionsRDD.scala:49)at org.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:324)at org.apache.spark.rdd.RDD.iterator(RDD.scala:288)at org.apache.spark.rdd.MapPartitionsRDD.compute(MapPartitionsRDD.scala:49)at org.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:324)at org.apache.spark.rdd.RDD.iterator(RDD.scala:288)at org.apache.spark.rdd.MapPartitionsRDD.compute(MapPartitionsRDD.scala:49)at org.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:324)at org.apache.spark.rdd.RDD.iterator(RDD.scala:288)at org.apache.spark.rdd.MapPartitionsRDD.compute(MapPartitionsRDD.scala:49)at org.apache.spark.rdd.RDD.computeOrReadCheckpoint(RDD.scala:324)at org.apache.spark.rdd.RDD.iterator(RDD.scala:288)at org.apache.spark.scheduler.ResultTask.runTask(ResultTask.scala:87)at org.apache.spark.scheduler.Task.run(Task.scala:109)at org.apache.spark.executor.Executor$TaskRunner.run(Executor.scala:381)at java.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1149)at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:624)at java.lang.Thread.run(Thread.java:748)
Caused by: java.lang.UnsupportedOperationExceptionat java.util.AbstractMap.put(AbstractMap.java:209)at com.esotericsoftware.kryo.serializers.MapSerializer.read(MapSerializer.java:162)at com.esotericsoftware.kryo.serializers.MapSerializer.read(MapSerializer.java:39)at com.esotericsoftware.kryo.Kryo.readClassAndObject(Kryo.java:790)at org.apache.spark.serializer.KryoDeserializationStream.readObject(KryoSerializer.scala:278)at org.apache.spark.broadcast.TorrentBroadcast$$anonfun$8.apply(TorrentBroadcast.scala:308)at org.apache.spark.util.Utils$.tryWithSafeFinally(Utils.scala:1394)at org.apache.spark.broadcast.TorrentBroadcast$.unBlockifyObject(TorrentBroadcast.scala:309)at org.apache.spark.broadcast.TorrentBroadcast$$anonfun$readBroadcastBlock$1$$anonfun$apply$2.apply(TorrentBroadcast.scala:235)at scala.Option.getOrElse(Option.scala:121)at org.apache.spark.broadcast.TorrentBroadcast$$anonfun$readBroadcastBlock$1.apply(TorrentBroadcast.scala:211)at org.apache.spark.util.Utils$.tryOrIOException(Utils.scala:1360)... 29 more20/09/09 18:23:02 INFO scheduler.TaskSetManager: Starting task 0.1 in stage 5.0 (TID 4009, node-hadoop64.com, executor 7, partition 0, RACK_LOCAL, 8608 bytes)

关注一下具体的cause

Caused by: java.lang.UnsupportedOperationExceptionat java.util.AbstractMap.put(AbstractMap.java:209)

1. 原因

原来是因为序列化的问题,在使用java api的时候,如果broadcast的变量是使用line_RDD_2.collectAsMap()的方式产生的,那么被广播的类型就是Map, kryo 不知道真实的对象类型,所以就会采用AbstractMap来进行解析。

2. 解决方案

所以我们要新建一个map,将line_RDD_2.collectAsMap()放入新建的map即可。

原来的代码为

    Map<String, Long> getNameToId(Dataset<Row> labelDimTable) {return  labelDimTable.javaRDD().mapToPair(new PairFunction() {@Overridepublic Tuple2 call(Object object) throws Exception {Row curRow = (Row) object;Long labelId = curRow.getAs("label_id");String labelTitle = curRow.getAs("label_title");return Tuple2.apply(labelTitle, labelId);}}).collectAsMap();}

修改为

Map<String, Long> getNameToId(Dataset<Row> labelDimTable) {Map<String, Long> res = new HashMap<>();Map<String, Long> apiMap=  labelDimTable.javaRDD().mapToPair(new PairFunction() {@Overridepublic Tuple2 call(Object object) throws Exception {Row curRow = (Row) object;Long labelId = curRow.getAs("label_id");String labelTitle = curRow.getAs("label_title");return Tuple2.apply(labelTitle, labelId);}}).collectAsMap();res.putAll(apiMap);return res;}

参考
https://www.jianshu.com/p/f478376bdbb9
https://stackoverflow.com/questions/43023961/spark-kryo-serializers-and-broadcastmapobject-iterablegowalladatalocation

这篇关于java-spark广播变量的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1124346

相关文章

Java实现字节字符转bcd编码

《Java实现字节字符转bcd编码》BCD是一种将十进制数字编码为二进制的表示方式,常用于数字显示和存储,本文将介绍如何在Java中实现字节字符转BCD码的过程,需要的小伙伴可以了解下... 目录前言BCD码是什么Java实现字节转bcd编码方法补充总结前言BCD码(Binary-Coded Decima

SpringBoot全局域名替换的实现

《SpringBoot全局域名替换的实现》本文主要介绍了SpringBoot全局域名替换的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一... 目录 项目结构⚙️ 配置文件application.yml️ 配置类AppProperties.Ja

Java使用Javassist动态生成HelloWorld类

《Java使用Javassist动态生成HelloWorld类》Javassist是一个非常强大的字节码操作和定义库,它允许开发者在运行时创建新的类或者修改现有的类,本文将简单介绍如何使用Javass... 目录1. Javassist简介2. 环境准备3. 动态生成HelloWorld类3.1 创建CtC

JavaScript中的高级调试方法全攻略指南

《JavaScript中的高级调试方法全攻略指南》什么是高级JavaScript调试技巧,它比console.log有何优势,如何使用断点调试定位问题,通过本文,我们将深入解答这些问题,带您从理论到实... 目录观点与案例结合观点1观点2观点3观点4观点5高级调试技巧详解实战案例断点调试:定位变量错误性能分

Java实现将HTML文件与字符串转换为图片

《Java实现将HTML文件与字符串转换为图片》在Java开发中,我们经常会遇到将HTML内容转换为图片的需求,本文小编就来和大家详细讲讲如何使用FreeSpire.DocforJava库来实现这一功... 目录前言核心实现:html 转图片完整代码场景 1:转换本地 HTML 文件为图片场景 2:转换 H

Java使用jar命令配置服务器端口的完整指南

《Java使用jar命令配置服务器端口的完整指南》本文将详细介绍如何使用java-jar命令启动应用,并重点讲解如何配置服务器端口,同时提供一个实用的Web工具来简化这一过程,希望对大家有所帮助... 目录1. Java Jar文件简介1.1 什么是Jar文件1.2 创建可执行Jar文件2. 使用java

SpringBoot实现不同接口指定上传文件大小的具体步骤

《SpringBoot实现不同接口指定上传文件大小的具体步骤》:本文主要介绍在SpringBoot中通过自定义注解、AOP拦截和配置文件实现不同接口上传文件大小限制的方法,强调需设置全局阈值远大于... 目录一  springboot实现不同接口指定文件大小1.1 思路说明1.2 工程启动说明二 具体实施2

Java实现在Word文档中添加文本水印和图片水印的操作指南

《Java实现在Word文档中添加文本水印和图片水印的操作指南》在当今数字时代,文档的自动化处理与安全防护变得尤为重要,无论是为了保护版权、推广品牌,还是为了在文档中加入特定的标识,为Word文档添加... 目录引言Spire.Doc for Java:高效Word文档处理的利器代码实战:使用Java为Wo

SpringBoot日志级别与日志分组详解

《SpringBoot日志级别与日志分组详解》文章介绍了日志级别(ALL至OFF)及其作用,说明SpringBoot默认日志级别为INFO,可通过application.properties调整全局或... 目录日志级别1、级别内容2、调整日志级别调整默认日志级别调整指定类的日志级别项目开发过程中,利用日志

Java中的抽象类与abstract 关键字使用详解

《Java中的抽象类与abstract关键字使用详解》:本文主要介绍Java中的抽象类与abstract关键字使用详解,本文通过实例代码给大家介绍的非常详细,感兴趣的朋友跟随小编一起看看吧... 目录一、抽象类的概念二、使用 abstract2.1 修饰类 => 抽象类2.2 修饰方法 => 抽象方法,没有