Caused by: java.lang.IllegalArgumentException: Cannot grow BufferHolder by size 1752 because the siz

本文主要是介绍Caused by: java.lang.IllegalArgumentException: Cannot grow BufferHolder by size 1752 because the siz,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

报错如下:

Caused by: java.lang.IllegalArgumentException: Cannot grow BufferHolder by size 9384 because the size after growing exceeds size limitation 2147483632

在这里插入图片描述

不能按大小9384增加BufferHolder,因为增长后的大小超过了大小限制2147483632

参考链接:

https://docs.microsoft.com/zh-cn/azure/databricks/kb/sql/cannot-grow-bufferholder-exceeds-size

定位到出错位置:
我的需求是根据唯一键分组统计,有点击的保留所有点击,没点击的保留所有曝光,所以用到了collect_list,在数据起量之后,整个groupby之后转的df会非常大,collect_list传到udf的的行向量也会非常的长,所以超出缓存大小。

问题关键代码如下:

schema_getdataCols = ['newid'] + data_origin_columns1
df_HDFS_gp = df_HDFS_A.groupBy('newid').agg(fn.collect_list('suuid').alias('suuid'),fn.collect_list('aid').alias('aid'),fn.collect_list('slotid').alias('slotid'),fn.collect_list('adfrom').alias('adfrom'),fn.collect_list('appkey').alias('appkey'),fn.collect_list('appname').alias('appname'),fn.collect_list('battery').alias('battery'),fn.collect_list('brand').alias('brand'),fn.collect_list('channel').alias('channel'),fn.collect_list('hardware').alias('hardware'),fn.collect_list('product').alias('product'),fn.collect_list('screensize').alias('screensize'),fn.collect_list('manufacturer').alias('manufacturer'),fn.collect_list('model').alias('model'),fn.collect_list('nettype').alias('nettype'),fn.collect_list('operator').alias('operator'),fn.collect_list('os').alias('os'),fn.collect_list('city').alias('city'),fn.collect_list('actname').alias('actname'),
).rdd.map(row_dataID_druid_ad_behavior).toDF(schema=schema_getdataCols)

尝试过的方法:

  • 提高BufferHolder缓存大小
    • .config('spark.kryoserializer.buffer.max', 5120) \
  • 将df分割成多个数据帧进行后续的处理

最终解决的方法:

思路固化了,谈到分组处理就死盯着groupby不放了。根据需求有点击保留所有点击,没点击保留所有曝光,所有关键代码如下:

'''三元组拼接,划分label'''
# 先筛除有点击的数
df_have_click = df.filter(df['actname'] == 'ckads')# 保留有点击的三元组id
click_ids = df_have_click.select('newid').collect()
click_ids = [i[0] for i in click_ids]
click_ids = list(set(click_ids))# 筛除有曝光的数,排除有点击的三元组id
df_have_display = df.filter(df['actname'] == 'exads').filter(~df['newid'].isin(click_ids))# 拼接
df_HDFS_res = df_have_click.unionAll(df_have_display)

问题解决.

这篇关于Caused by: java.lang.IllegalArgumentException: Cannot grow BufferHolder by size 1752 because the siz的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/788302

相关文章

SpringBoot整合Flowable实现工作流的详细流程

《SpringBoot整合Flowable实现工作流的详细流程》Flowable是一个使用Java编写的轻量级业务流程引擎,Flowable流程引擎可用于部署BPMN2.0流程定义,创建这些流程定义的... 目录1、流程引擎介绍2、创建项目3、画流程图4、开发接口4.1 Java 类梳理4.2 查看流程图4

一文详解如何在idea中快速搭建一个Spring Boot项目

《一文详解如何在idea中快速搭建一个SpringBoot项目》IntelliJIDEA作为Java开发者的‌首选IDE‌,深度集成SpringBoot支持,可一键生成项目骨架、智能配置依赖,这篇文... 目录前言1、创建项目名称2、勾选需要的依赖3、在setting中检查maven4、编写数据源5、开启热

Java对异常的认识与异常的处理小结

《Java对异常的认识与异常的处理小结》Java程序在运行时可能出现的错误或非正常情况称为异常,下面给大家介绍Java对异常的认识与异常的处理,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参... 目录一、认识异常与异常类型。二、异常的处理三、总结 一、认识异常与异常类型。(1)简单定义-什么是

SpringBoot项目配置logback-spring.xml屏蔽特定路径的日志

《SpringBoot项目配置logback-spring.xml屏蔽特定路径的日志》在SpringBoot项目中,使用logback-spring.xml配置屏蔽特定路径的日志有两种常用方式,文中的... 目录方案一:基础配置(直接关闭目标路径日志)方案二:结合 Spring Profile 按环境屏蔽关

Java使用HttpClient实现图片下载与本地保存功能

《Java使用HttpClient实现图片下载与本地保存功能》在当今数字化时代,网络资源的获取与处理已成为软件开发中的常见需求,其中,图片作为网络上最常见的资源之一,其下载与保存功能在许多应用场景中都... 目录引言一、Apache HttpClient简介二、技术栈与环境准备三、实现图片下载与保存功能1.

SpringBoot排查和解决JSON解析错误(400 Bad Request)的方法

《SpringBoot排查和解决JSON解析错误(400BadRequest)的方法》在开发SpringBootRESTfulAPI时,客户端与服务端的数据交互通常使用JSON格式,然而,JSON... 目录问题背景1. 问题描述2. 错误分析解决方案1. 手动重新输入jsON2. 使用工具清理JSON3.

java中long的一些常见用法

《java中long的一些常见用法》在Java中,long是一种基本数据类型,用于表示长整型数值,接下来通过本文给大家介绍java中long的一些常见用法,感兴趣的朋友一起看看吧... 在Java中,long是一种基本数据类型,用于表示长整型数值。它的取值范围比int更大,从-922337203685477

java Long 与long之间的转换流程

《javaLong与long之间的转换流程》Long类提供了一些方法,用于在long和其他数据类型(如String)之间进行转换,本文将详细介绍如何在Java中实现Long和long之间的转换,感... 目录概述流程步骤1:将long转换为Long对象步骤2:将Longhttp://www.cppcns.c

SpringBoot集成LiteFlow实现轻量级工作流引擎的详细过程

《SpringBoot集成LiteFlow实现轻量级工作流引擎的详细过程》LiteFlow是一款专注于逻辑驱动流程编排的轻量级框架,它以组件化方式快速构建和执行业务流程,有效解耦复杂业务逻辑,下面给大... 目录一、基础概念1.1 组件(Component)1.2 规则(Rule)1.3 上下文(Conte

SpringBoot服务获取Pod当前IP的两种方案

《SpringBoot服务获取Pod当前IP的两种方案》在Kubernetes集群中,SpringBoot服务获取Pod当前IP的方案主要有两种,通过环境变量注入或通过Java代码动态获取网络接口IP... 目录方案一:通过 Kubernetes Downward API 注入环境变量原理步骤方案二:通过