pytorch中的使用dataset, dataloader读取超大h5py数据文件

2023-12-26 13:38

本文主要是介绍pytorch中的使用dataset, dataloader读取超大h5py数据文件,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

pytorch中的使用dataset, dataloader读取超大h5py数据文件

    • 问题描述
    • 解决方案

问题描述

训练网络时需要load一个10G左右的h5数据文件,并且包含有image多类别mask数据…

由于h5文件中的mask并未进行任何预处理,若将mask一张张取出再进行处理是非常占内存的,因此无法使用这种简单的DataLoader方式:

import h5py
from torch.utils.data import TensorDatasetf = h5py.File("xxxx.h5", 'r') 
x_data = f['image']
y_data = f['mask']
train_data= TensorDataset(x_data, y_data)
training_data_loader = DataLoader(dataset=train_data,num_workers=0,batch_size=8,drop_last=True,shuffle=True)

解决方案

继承 Dataset类 ,重新定义一个可以将数据处理成DataLoader的类

在继承 Dataset类之后,我们需要重写其中的len 方法和getitem 方法,具体可以参考这里

修改如下:

class MyDataset(data.Dataset):def __init__(self, archive,image='image',mask='mask'):self.archive = h5py.File(archive, 'r')self.data = self.archive[image]self.labels = self.archive[mask]def __getitem__(self, index):image = self.data[index]mask = self.get_multi_class_labels(self.labels[index])return image, maskdef __len__(self):return len(self.labels)def get_multi_class_labels(self,truth, n_labels=3, labels=(0, 1, 2)):new_shape =  [n_labels, ]+list(truth.shape[1:])y = np.zeros(new_shape, np.int8)for label_index in range(n_labels):if labels is not None:y[label_index, :, :][truth[0, :, :] == labels[label_index]] = 1else:y[label_index, :, :][truth[0, :, :] == label_index] = 1return ydef close(self):self.archive.close()

然后调用该类即可:

train_data = MyDataset('xxxx.h5',image='image',mask='mask')
train_loader = DataLoader(dataset=train_data,num_workers=0,batch_size=8,shuffle=True)

这篇关于pytorch中的使用dataset, dataloader读取超大h5py数据文件的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/539614

相关文章

Python中注释使用方法举例详解

《Python中注释使用方法举例详解》在Python编程语言中注释是必不可少的一部分,它有助于提高代码的可读性和维护性,:本文主要介绍Python中注释使用方法的相关资料,需要的朋友可以参考下... 目录一、前言二、什么是注释?示例:三、单行注释语法:以 China编程# 开头,后面的内容为注释内容示例:示例:四

Go语言数据库编程GORM 的基本使用详解

《Go语言数据库编程GORM的基本使用详解》GORM是Go语言流行的ORM框架,封装database/sql,支持自动迁移、关联、事务等,提供CRUD、条件查询、钩子函数、日志等功能,简化数据库操作... 目录一、安装与初始化1. 安装 GORM 及数据库驱动2. 建立数据库连接二、定义模型结构体三、自动迁

ModelMapper基本使用和常见场景示例详解

《ModelMapper基本使用和常见场景示例详解》ModelMapper是Java对象映射库,支持自动映射、自定义规则、集合转换及高级配置(如匹配策略、转换器),可集成SpringBoot,减少样板... 目录1. 添加依赖2. 基本用法示例:简单对象映射3. 自定义映射规则4. 集合映射5. 高级配置匹

Spring 框架之Springfox使用详解

《Spring框架之Springfox使用详解》Springfox是Spring框架的API文档工具,集成Swagger规范,自动生成文档并支持多语言/版本,模块化设计便于扩展,但存在版本兼容性、性... 目录核心功能工作原理模块化设计使用示例注意事项优缺点优点缺点总结适用场景建议总结Springfox 是

嵌入式数据库SQLite 3配置使用讲解

《嵌入式数据库SQLite3配置使用讲解》本文强调嵌入式项目中SQLite3数据库的重要性,因其零配置、轻量级、跨平台及事务处理特性,可保障数据溯源与责任明确,详细讲解安装配置、基础语法及SQLit... 目录0、惨痛教训1、SQLite3环境配置(1)、下载安装SQLite库(2)、解压下载的文件(3)、

使用Python绘制3D堆叠条形图全解析

《使用Python绘制3D堆叠条形图全解析》在数据可视化的工具箱里,3D图表总能带来眼前一亮的效果,本文就来和大家聊聊如何使用Python实现绘制3D堆叠条形图,感兴趣的小伙伴可以了解下... 目录为什么选择 3D 堆叠条形图代码实现:从数据到 3D 世界的搭建核心代码逐行解析细节优化应用场景:3D 堆叠图

Springboot如何正确使用AOP问题

《Springboot如何正确使用AOP问题》:本文主要介绍Springboot如何正确使用AOP问题,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录​一、AOP概念二、切点表达式​execution表达式案例三、AOP通知四、springboot中使用AOP导出

Navicat数据表的数据添加,删除及使用sql完成数据的添加过程

《Navicat数据表的数据添加,删除及使用sql完成数据的添加过程》:本文主要介绍Navicat数据表的数据添加,删除及使用sql完成数据的添加过程,具有很好的参考价值,希望对大家有所帮助,如有... 目录Navicat数据表数据添加,删除及使用sql完成数据添加选中操作的表则出现如下界面,查看左下角从左

python 常见数学公式函数使用详解(最新推荐)

《python常见数学公式函数使用详解(最新推荐)》文章介绍了Python的数学计算工具,涵盖内置函数、math/cmath标准库及numpy/scipy/sympy第三方库,支持从基础算术到复杂数... 目录python 数学公式与函数大全1. 基本数学运算1.1 算术运算1.2 分数与小数2. 数学函数

python中Hash使用场景分析

《python中Hash使用场景分析》Python的hash()函数用于获取对象哈希值,常用于字典和集合,不可变类型可哈希,可变类型不可,常见算法包括除法、乘法、平方取中和随机数哈希,各有优缺点,需根... 目录python中的 Hash除法哈希算法乘法哈希算法平方取中法随机数哈希算法小结在Python中,