记一次多线程写入文件出现IOException:Stream Closed的问题

2024-03-12 18:28

本文主要是介绍记一次多线程写入文件出现IOException:Stream Closed的问题,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

背景

        网关在解析1000个05文件(txt)写入到SFTP文件时,是每次读取1000 * 5条数据,然后每1000笔数据创建一个线程逐条数据进行字段数值映射转换,一共创建5个线程扔到线程池进行处理。每条数据解析完都会将数据写入到SFTP的DAT文件,并且累加条数写入到CTL文件。

原来是1000笔数据才进行解析,每个文件造数据10条,导入没问题。为了方便测试,把条数调小到每次读取5 * 2 条数据,每个文件有10条数据,方便验证多线程读取有无问题。

问题来了:预期是DAT文件会写入10笔数据,CTL文件记录的条数增加10,但是每次解析写到几条就抛异常了:IOException:Stream Closed,有时候能写2条,有时候能写4条,有时候能写8条.......

分析

  • 怀疑是不是因为改了网关的代码导致的,因为原来代码写死的1000,导入是没问题的,分析一波发现,原来每个文件只有10条数据,达不到1000,所以每次导入只会创建一个线程就处理完了,回检了一遍代码应该不是调小引发的问题;
  • 改成每次只读取5 * 2条,一次读取就把文件10条数据读完了,但是还是出现报错;改成每次只读取1 * 2条数据,要读取10 / 2 = 5次,才能读完,也还是会报错;
  • 是不是数据有问题呢?应该也不是,因为在配置1000的时候是能够把这10条数据正常写入的,打了断点也没发现write的时候写入的数据有啥问题 为什么会出现有时候能够写入2条就挂了,有时候写到4条呢.....发现是由于debug断点打的位置导致多个线程执行的快慢不一致导致的,如果不是debug的话正常postman触发是每次写了2条就报错了。补充一下:读取到数据并不是马上就写入到文件中,而是将数据加到一个dataList中存放,达到1000笔才写入;还有一个写入时机,那就是执行完每个线程会调用flush()方法,将dataList中的数据写入到txt
  • 原来每个线程处理完只返回boolean,主线程使用Future<Boolean>接收,看不到具体报错信息,在线程run()里面加了日志打印,也只能看到catch中的stream closed异常,看不到其他什么有效信息......
  • 试试其他思路:百度了一下Stream Closed这个报错原因,如果一个文件流对象已经关闭过了在finally再重复关闭一次的话会报这个错,由此猜测是不是因为我在write的时候文件流对象就被关闭了呢? debug断点打在写入前文件流对象那里,发现抛异常之前这个文件流对象一直都是正常的不为null,那为啥写入的时候会抛stream closed异常呢(有个误区:我一直以为closed了对象就会为null,后面才发现只是关闭只是跟句柄断开联系对象还不是null的)
  • 为啥其他文件的导入也是调用的ConvertIn这个通用的文件解析没有问题,我调用这个就有问题了呢。查看了一下其他文件的导入代码,发现其他文件的导入每次读取完1000条数据之后,并不是写入到文件,而是调用了作业条进行发送就返回了,不存在我这种写入文件的场景,自然就不会出现stream Closed的问题
  • 我这种场景跟导出的时候ConvertOut类似,读取文件数据之后再写入到txt中,对比了一个多线程里面的run()方法,发现我每次处理完一批数据就调用数据源的close()方法对文件流对象进行释放了,而导出的ConvertOut的话里面并没有closed文件对象,而是在处理完所有数据在finally才关闭文件流对象。每次创建线程的时候都将这个文件流对象传进去,导致有些线程在执行的时候将这个对象close了,其他线程在写的时候发现已经被关闭了,所以就报Stream Closed异常了
  • 至此,终于发现问题所在了,修改一下代码每个线程处理完不马上关闭这个文件流对象,而是在主线程外面的finally统一关闭一次,这样就不会出现多线程写入的时候报Stream Closed异常了

结论

  1. 调用别人的代码要认真阅读每行的逻辑,仔细斟酌有没有什么问题,是否适用,不能看都没看就放心使用,不然出了问题也不知道是什么原因.......
  2. 多线程进行文件写入时要注意及时关闭IO流对象防止内存泄漏

这篇关于记一次多线程写入文件出现IOException:Stream Closed的问题的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/802178

相关文章

IDEA和GIT关于文件中LF和CRLF问题及解决

《IDEA和GIT关于文件中LF和CRLF问题及解决》文章总结:因IDEA默认使用CRLF换行符导致Shell脚本在Linux运行报错,需在编辑器和Git中统一为LF,通过调整Git的core.aut... 目录问题描述问题思考解决过程总结问题描述项目软件安装shell脚本上git仓库管理,但拉取后,上l

idea npm install很慢问题及解决(nodejs)

《ideanpminstall很慢问题及解决(nodejs)》npm安装速度慢可通过配置国内镜像源(如淘宝)、清理缓存及切换工具解决,建议设置全局镜像(npmconfigsetregistryht... 目录idea npm install很慢(nodejs)配置国内镜像源清理缓存总结idea npm in

pycharm跑python项目易出错的问题总结

《pycharm跑python项目易出错的问题总结》:本文主要介绍pycharm跑python项目易出错问题的相关资料,当你在PyCharm中运行Python程序时遇到报错,可以按照以下步骤进行排... 1. 一定不要在pycharm终端里面创建环境安装别人的项目子模块等,有可能出现的问题就是你不报错都安装

idea突然报错Malformed \uxxxx encoding问题及解决

《idea突然报错Malformeduxxxxencoding问题及解决》Maven项目在切换Git分支时报错,提示project元素为描述符根元素,解决方法:删除Maven仓库中的resolv... 目www.chinasem.cn录问题解决方式总结问题idea 上的 maven China编程项目突然报错,是

Python爬虫HTTPS使用requests,httpx,aiohttp实战中的证书异步等问题

《Python爬虫HTTPS使用requests,httpx,aiohttp实战中的证书异步等问题》在爬虫工程里,“HTTPS”是绕不开的话题,HTTPS为传输加密提供保护,同时也给爬虫带来证书校验、... 目录一、核心问题与优先级检查(先问三件事)二、基础示例:requests 与证书处理三、高并发选型:

前端导出Excel文件出现乱码或文件损坏问题的解决办法

《前端导出Excel文件出现乱码或文件损坏问题的解决办法》在现代网页应用程序中,前端有时需要与后端进行数据交互,包括下载文件,:本文主要介绍前端导出Excel文件出现乱码或文件损坏问题的解决办法,... 目录1. 检查后端返回的数据格式2. 前端正确处理二进制数据方案 1:直接下载(推荐)方案 2:手动构造

分析 Java Stream 的 peek使用实践与副作用处理方案

《分析JavaStream的peek使用实践与副作用处理方案》StreamAPI的peek操作是中间操作,用于观察元素但不终止流,其副作用风险包括线程安全、顺序混乱及性能问题,合理使用场景有限... 目录一、peek 操作的本质:有状态的中间操作二、副作用的定义与风险场景1. 并行流下的线程安全问题2. 顺

Python绘制TSP、VRP问题求解结果图全过程

《Python绘制TSP、VRP问题求解结果图全过程》本文介绍用Python绘制TSP和VRP问题的静态与动态结果图,静态图展示路径,动态图通过matplotlib.animation模块实现动画效果... 目录一、静态图二、动态图总结【代码】python绘制TSP、VRP问题求解结果图(包含静态图与动态图

MyBatis/MyBatis-Plus同事务循环调用存储过程获取主键重复问题分析及解决

《MyBatis/MyBatis-Plus同事务循环调用存储过程获取主键重复问题分析及解决》MyBatis默认开启一级缓存,同一事务中循环调用查询方法时会重复使用缓存数据,导致获取的序列主键值均为1,... 目录问题原因解决办法如果是存储过程总结问题myBATis有如下代码获取序列作为主键IdMappe

k8s容器放开锁内存限制问题

《k8s容器放开锁内存限制问题》nccl-test容器运行mpirun时因NCCL_BUFFSIZE过大导致OOM,需通过修改docker服务配置文件,将LimitMEMLOCK设为infinity并... 目录问题问题确认放开容器max locked memory限制总结参考:https://Access