R语言随机抽取数据,并作两组数据间t检验,并保存抽取的数据,并绘制boxplot

2024-03-27 12:44

本文主要是介绍R语言随机抽取数据,并作两组数据间t检验,并保存抽取的数据,并绘制boxplot,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

前提:接着上述R脚本输出的seed结果来选择应该使用哪个seed比较合理,上个R脚本名字:
“5utr_计算ABD中Ge1和Lt1的个数和均值以及按照TE个数小的进行随机100次抽样.R”
1.输入数据:“5utr-5d做ABD中有RG4和没有RG4的TE之间的T检验.csv”
在这里插入图片描述

2.代码:“5utr_5d_ABD中有RG4和无RG4的TE之间的T检验函数+保存符合要求的seed+保存符合要求的数据框+绘制boxplot.R”

setwd("E:\\R\\Rscripts\\5UTR_extended_TE")
# 载入必要的库
library(tidyverse)
library(dplyr)
library(openxlsx)# 读取数据
data <- read.csv("5utr-5d做ABD中有RG4和没有RG4的TE之间的T检验.csv", na.strings = "#N/A")# 将所有的NA值转换为0
data <- data %>% mutate_all(~ifelse(is.na(.), 0, .))############################################################  
# 调整后的process_scores函数1,适用于le1的个数小于ge1的个数且ave-le1大于ave-ge1的情况
############################################################process_scores <- function(df, score_name, TE_name) {successful_seeds <- list() # 初始化一个列表来保存成功的seed值combined_samples_list <- list() # 新增:初始化一个列表来保存符合条件的组合数据框for (seed_val in 1) {set.seed(seed_val)ge1 <- df %>% filter(!!sym(score_name) >= 1) %>% select(!!sym(TE_name)) %>% mutate(Source = "ge1")le1 <- df %>% filter(!!sym(score_name) < 1) %>% select(!!sym(TE_name)) %>% mutate(Source = "sample_le1")sample_le1 <- sample_n(le1, nrow(ge1)) # 取单一样本进行比较t_test <- t.test(ge1[[1]], sample_le1[[1]])mean1 <- mean(ge1[[1]])mean2 <- mean(sample_le1[[1]])if (mean2 < mean1 && t_test$p.value <= 0.09) {successful_seeds[[paste0(seed_val, "_", score_name)]] <- list(seed = seed_val,mean1 = mean1,mean2 = mean2,pvalue = t_test$p.value)# 新增:将符合条件的ge1和sample_le1合并到一个数据框中,并保存到列表中combined_samples <- bind_rows(ge1, sample_le1)combined_samples_list[[paste0(seed_val, "_", score_name)]] <- combined_samples}}# 将成功的seeds信息转换为数据框if (length(successful_seeds) > 0) {successful_seeds_df <- bind_rows(successful_seeds, .id = "seed_score") %>% mutate(Comparison = seed_score)} else {successful_seeds_df <- tibble(Comparison = character(), mean1 = numeric(), mean2 = numeric(), pvalue = numeric())}# 新增:将combined_samples_list中的数据框合并或以其他形式输出combined_samples_output <- if (length(combined_samples_list) > 0) {# 例如,这里我们简单地将所有符合条件的数据框合并bind_rows(combined_samples_list)} else {# 如果没有符合条件的,则返回空数据框tibble()}return(list(successful_seeds = successful_seeds_df, combined_samples = combined_samples_output))
}# 对AScore5d进行处理示例
results_AScore5d <- process_scores(data, "AScore5d", "ATe5d")
results_BScore5d <- process_scores(data, "BScore5d", "BTe5d")
results_DScore5d <- process_scores(data, "DScore5d", "DTe5d")
# 打印出符合条件的successful_seeds结果进行检查
bind_results_AScore5d_successful_seeds<-rbind(results_AScore5d$successful_seeds,results_BScore5d$successful_seeds,results_DScore5d$successful_seeds)
write.xlsx(bind_results_AScore5d_successful_seeds, file = "5utr_bind_results_ABDScore5d_successful_seeds_seed1.xlsx")# 将符合条件的组合数据框写入文件
write.table(results_AScore5d$combined_samples, "combined_samples_seed1_5utr5dAScored.csv", quote = FALSE, row.names = FALSE, sep = ",")
write.table(results_BScore5d$combined_samples, "combined_samples_seed1_5utr5dBScored.csv", quote = FALSE, row.names = FALSE, sep = ",")
write.table(results_DScore5d$combined_samples, "combined_samples_seed1_5utr5dDScored.csv", quote = FALSE, row.names = FALSE, sep = ",")####################################################################
##
##
#接着上面的结果绘制boxplot
##
##
####################################################################
library(tidyverse)
library(ggplot2)
library(patchwork)results_AScore5d$combined_samples$Source<-factor(results_AScore5d$combined_samples$Source,levels=c("ge1","sample_le1"),labels=c("A with rG4","A without rG4"),ordered=TRUE)
p1<-ggplot(results_AScore5d$combined_samples, aes(x=Source,y=ATe5d,fill=Source))+#根据Type进行填充,fill=Typestat_boxplot(geom = "errorbar",width=0.1)+  #添加误差线geom_boxplot(outlier.size = -1,width=0.25)+theme_classic()+#背景设置为白色scale_fill_manual(values = c( "#8DD3C7", "#FC8D62"))+labs(y="TE")+scale_y_continuous(limits = c(0,5),breaks=seq(0,5,1))+theme(strip.background = element_rect(colour="black", fill="#FFFFFF"),plot.title=element_text (hjust = 0.5,vjust =1,lineheight=1,color="black"),panel.background=element_rect(fill="white",colour="black",linewidth =0.5),axis.title.y=element_text(size=25,face="plain",color="black"),axis.title.x=element_blank(),axis.text = element_text(size=20,face="plain",color="black"),#axis.tex用来调整描述x轴的文本,比如图中的conserved等panel.border = element_blank(),panel.grid.major = element_blank(),panel.grid.minor = element_blank(),axis.ticks.x=element_line(colour="black"),axis.ticks.length.x=grid::unit(0.2, "cm"))+guides(fill="none")results_BScore5d$combined_samples$Source<-factor(results_BScore5d$combined_samples$Source,levels=c("ge1","sample_le1"),labels=c("B with rG4","B without rG4"),ordered=TRUE)
p2<-ggplot(results_BScore5d$combined_samples, aes(x=Source,y=BTe5d,fill=Source))+#根据Type进行填充,fill=Typestat_boxplot(geom = "errorbar",width=0.1)+  #添加误差线geom_boxplot(outlier.size = -1,width=0.25)+theme_classic()+#背景设置为白色scale_fill_manual(values = c( "#8DD3C7", "#FC8D62"))+labs(y="TE")+scale_y_continuous(limits = c(0,5),breaks=seq(0,5,1))+theme(strip.background = element_rect(colour="black", fill="#FFFFFF"),plot.title=element_text (hjust = 0.5,vjust =1,lineheight=1,color="black"),panel.background=element_rect(fill="white",colour="black",linewidth =0.5),axis.title.y=element_text(size=25,face="plain",color="black"),axis.title.x=element_blank(),axis.text = element_text(size=20,face="plain",color="black"),#axis.tex用来调整描述x轴的文本,比如图中的conserved等panel.border = element_blank(),panel.grid.major = element_blank(),panel.grid.minor = element_blank(),axis.ticks.x=element_line(colour="black"),axis.ticks.length.x=grid::unit(0.2, "cm"))+guides(fill="none")results_DScore5d$combined_samples$Source<-factor(results_DScore5d$combined_samples$Source,levels=c("ge1","sample_le1"),labels=c("D with rG4","D without rG4"),ordered=TRUE)
p3<-ggplot(results_DScore5d$combined_samples, aes(x=Source,y=DTe5d,fill=Source))+#根据Type进行填充,fill=Typestat_boxplot(geom = "errorbar",width=0.1)+  #添加误差线geom_boxplot(outlier.size = -1,width=0.25)+theme_classic()+#背景设置为白色scale_fill_manual(values = c( "#8DD3C7", "#FC8D62"))+labs(y="TE")+scale_y_continuous(limits = c(0,5),breaks=seq(0,5,1))+theme(strip.background = element_rect(colour="black", fill="#FFFFFF"),plot.title=element_text (hjust = 0.5,vjust =1,lineheight=1,color="black"),panel.background=element_rect(fill="white",colour="black",linewidth =0.5),axis.title.y=element_text(size=25,face="plain",color="black"),axis.title.x=element_blank(),axis.text = element_text(size=20,face="plain",color="black"),#axis.tex用来调整描述x轴的文本,比如图中的conserved等panel.border = element_blank(),panel.grid.major = element_blank(),panel.grid.minor = element_blank(),axis.ticks.x=element_line(colour="black"),axis.ticks.length.x=grid::unit(0.2, "cm"))+guides(fill="none")
p4<-p1+p2+p3+plot_layout(widths = c(1,1,1))
ggsave("boxplot-5utr-5d做ABD中有RG4和没有RG4的TE之间的T检验.pdf",plot=p4,width=24,height=10)

3.输出数据:“5utr_bind_results_ABDScore5d_successful_seeds_seed1.xlsx”
在这里插入图片描述

4.输出boxplot:“boxplot-5utr-5d做ABD中有RG4和没有RG4的TE之间的T检验.pdf”
在这里插入图片描述

这篇关于R语言随机抽取数据,并作两组数据间t检验,并保存抽取的数据,并绘制boxplot的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/852137

相关文章

Java整合Protocol Buffers实现高效数据序列化实践

《Java整合ProtocolBuffers实现高效数据序列化实践》ProtocolBuffers是Google开发的一种语言中立、平台中立、可扩展的结构化数据序列化机制,类似于XML但更小、更快... 目录一、Protocol Buffers简介1.1 什么是Protocol Buffers1.2 Pro

Go语言使用Gin处理路由参数和查询参数

《Go语言使用Gin处理路由参数和查询参数》在WebAPI开发中,处理路由参数(PathParameter)和查询参数(QueryParameter)是非常常见的需求,下面我们就来看看Go语言... 目录一、路由参数 vs 查询参数二、Gin 获取路由参数和查询参数三、示例代码四、运行与测试1. 测试编程路

Go语言使用net/http构建一个RESTful API的示例代码

《Go语言使用net/http构建一个RESTfulAPI的示例代码》Go的标准库net/http提供了构建Web服务所需的强大功能,虽然众多第三方框架(如Gin、Echo)已经封装了很多功能,但... 目录引言一、什么是 RESTful API?二、实战目标:用户信息管理 API三、代码实现1. 用户数据

Python实现数据可视化图表生成(适合新手入门)

《Python实现数据可视化图表生成(适合新手入门)》在数据科学和数据分析的新时代,高效、直观的数据可视化工具显得尤为重要,下面:本文主要介绍Python实现数据可视化图表生成的相关资料,文中通过... 目录前言为什么需要数据可视化准备工作基本图表绘制折线图柱状图散点图使用Seaborn创建高级图表箱线图热

MySQL数据脱敏的实现方法

《MySQL数据脱敏的实现方法》本文主要介绍了MySQL数据脱敏的实现方法,包括字符替换、加密等方法,通过工具类和数据库服务整合,确保敏感信息在查询结果中被掩码处理,感兴趣的可以了解一下... 目录一. 数据脱敏的方法二. 字符替换脱敏1. 创建数据脱敏工具类三. 整合到数据库操作1. 创建服务类进行数据库

MySQL中处理数据的并发一致性的实现示例

《MySQL中处理数据的并发一致性的实现示例》在MySQL中处理数据的并发一致性是确保多个用户或应用程序同时访问和修改数据库时,不会导致数据冲突、数据丢失或数据不一致,MySQL通过事务和锁机制来管理... 目录一、事务(Transactions)1. 事务控制语句二、锁(Locks)1. 锁类型2. 锁粒

Go语言网络故障诊断与调试技巧

《Go语言网络故障诊断与调试技巧》在分布式系统和微服务架构的浪潮中,网络编程成为系统性能和可靠性的核心支柱,从高并发的API服务到实时通信应用,网络的稳定性直接影响用户体验,本文面向熟悉Go基本语法和... 目录1. 引言2. Go 语言网络编程的优势与特色2.1 简洁高效的标准库2.2 强大的并发模型2.

Qt中实现多线程导出数据功能的四种方式小结

《Qt中实现多线程导出数据功能的四种方式小结》在以往的项目开发中,在很多地方用到了多线程,本文将记录下在Qt开发中用到的多线程技术实现方法,以导出指定范围的数字到txt文件为例,展示多线程不同的实现方... 目录前言导出文件的示例工具类QThreadQObject的moveToThread方法实现多线程QC

Go语言使用sync.Mutex实现资源加锁

《Go语言使用sync.Mutex实现资源加锁》数据共享是一把双刃剑,Go语言为我们提供了sync.Mutex,一种最基础也是最常用的加锁方式,用于保证在任意时刻只有一个goroutine能访问共享... 目录一、什么是 Mutex二、为什么需要加锁三、实战案例:并发安全的计数器1. 未加锁示例(存在竞态)

C语言自定义类型之联合和枚举解读

《C语言自定义类型之联合和枚举解读》联合体共享内存,大小由最大成员决定,遵循对齐规则;枚举类型列举可能值,提升可读性和类型安全性,两者在C语言中用于优化内存和程序效率... 目录一、联合体1.1 联合体类型的声明1.2 联合体的特点1.2.1 特点11.2.2 特点21.2.3 特点31.3 联合体的大小1