因果推断--双重差分法(DID)的原理和实际应用(一)

2023-10-07 17:59

本文主要是介绍因果推断--双重差分法(DID)的原理和实际应用(一),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

目录

一、应用场景

二、DID知识介绍

2.1 理论知识介绍

2.2 DID图形化解释

三、应用案例:

3.1 构造对照组

3.2 平行趋势检验

3.3 因果效应评估

四、优缺点总结


一、应用场景

在精细化运营场景中,常常会面临如下问题,不方便或者不允许进行常规的实验设计(AB实验)来考察策略的效果,只能采用全量上线的方式进行,但仍需分析策略的效果,以进行优化和推广。在如下场景中:上线了某付费产品活动,用户可付费开通xx卡,该卡可绑定一名亲友,亲友和自己都能使用该卡进行支付。这种场景很难通过实验的方式进行变量控制,我们不能简单的对某一类用户进行限制,限制其不可进行购买或被绑定,这样对用户体验的伤害很大,也会让用户感到奇怪甚至被歧视。对于这种无法进行实验设计但又必须知道策略是否给业务带来收益的场景,因果推断中的双重差分法就可解决以上问题。

二、DID知识介绍

2.1 理论知识介绍

双重差分法(Differences-in-Differences,DID)主要应用于评价某一事件或政策的影响程度。该方法基于反事实理论框架评估策略发生和不发生两种情况下待解释变量的变化。反事实理论框架是指通过分析策略干预后,实验组待解释变量的变化和假设实验组未被策略干预下,待解释变量变化之间的差异,从而评价策略的影响。策略干预后,实验组待解释变量的变化,我们是可以观测到的,但同一时期内,若实验组未被策略干预,待解释变量呈什么样的数据变化,我们是无法观测到的。于是,我们需要引入对照组,这个对照组的待解释变量随时间的变化趋势等同于实验组待解释变量随时间的变化趋势,才可以用双重差分法进行分析,也就是要满足如下两个假设:

1、个体处理稳定性假设: 实验中每个实验参与单元的行为是相互独立的,独立是指一个用户的行为不受其他用户影响。

2、平行趋势假设:在没有策略干预的情况下,对照组和实验组待解释变量之间的差异不随时间变化。

2.2 DID图形化解释

如下图所示:策略干预前实验组和对照组待解释变量的差异是a_{1},当对实验组施加干预后,实验组和对照组待解释变量的差异变成了a_{1}+a_{3},那么a_{3}即为策略干预效果。

三、应用案例:

在上述应用场景中,该付费产品上线了一段时间后,我们需要评估该活动带来的单量及收益提升情况,辅助进行活动推广和优化。假设在2022年10月的开卡用户共20w,这些用户就是实验组用户,是需要进行评估的对象。根据双重差分法,我们需要构造一个相似的用户群体,让其历史的下单和开卡用户的历史下单满足平行趋势,且这个相似用户群体,历史未曾开通过该卡。如下是DID进行因果效应评估的关键步骤:

3.1 构造对照组

在10月的用户中,按照开卡用户历史下单频次分布进行分层抽样,同样抽取20w未曾开通过该卡的用户作为对照组。

3.2 平行趋势检验

验证实验组(开卡用户)和对照组(抽样用户)的历史单量是否满足平行趋势,我们分别取这些用户在2022年4月至2022年10月的单量进行检验。如果满足平行趋势,我们需考察其在2022年10月以后的单量差异。下图是实验组、对照组用户在2022年10月前后的人均单量趋势:

 从图中可以看出,在2022年10月及以前,构造的虚拟对照组用户的人均单量基本和实验组-开卡用户保持一致,因此满足平行趋势假设,可用双重差分法对策略效果进行评估。

3.3 因果效应评估

从图中可以看出,在2022年10月开卡以后,实验组用户的人均单量较对照组有明显的提升,人均单量提升在0.96-3.11,由此可计算开卡后,实验组用户在每个月的单量提升以及收入的提升情况。

2022年10月之前实验组与对照组人单量差异均值为0.13,10月之后实验组较对照组人均单量提升差异需减去开通之前人均单量差异的均值0.13,下表为开卡后按照DID模型测算的实际人均单量、总单量以及收入的提升情况: 

 由上表可以看出,实验组开卡用户在11月实际人均单量提升为2.98,总量提升为59.6w,收入提升为893.3w,在后续每个月中,实际人均单量差异逐渐缩小到0.83,总单量较对照组提升缩小至16.6w,收入提升为248.5w。

四、优缺点总结

优点:

通过以上案例可以看到,在没有AB实验数据的情况下,如果我们有实验前后的时间序列数据,并能构造一个和实验组待解释变量满足平行趋势的对照组的话,我们就可以用DID进行因果效应评估。使用DID时不需要考虑实验组和对照组之间的差异,在构造虚拟的对照组时,不需要和实验组完全一样,这个操作相对来说较为简单,因果效应的测算过程也较简单

局限性:

首先需要有实验前后的时间序列数据,其次是平行趋势假设,这个是一个很强的假设,我们需要构造一个和实验组用户在待解释指标上满足平行趋势假设的虚拟对照组才能进行接下来的效果评估,而这有时候并不好构造。

这篇关于因果推断--双重差分法(DID)的原理和实际应用(一)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/159470

相关文章

PHP应用中处理限流和API节流的最佳实践

《PHP应用中处理限流和API节流的最佳实践》限流和API节流对于确保Web应用程序的可靠性、安全性和可扩展性至关重要,本文将详细介绍PHP应用中处理限流和API节流的最佳实践,下面就来和小编一起学习... 目录限流的重要性在 php 中实施限流的最佳实践使用集中式存储进行状态管理(如 Redis)采用滑动

ShardingProxy读写分离之原理、配置与实践过程

《ShardingProxy读写分离之原理、配置与实践过程》ShardingProxy是ApacheShardingSphere的数据库中间件,通过三层架构实现读写分离,解决高并发场景下数据库性能瓶... 目录一、ShardingProxy技术定位与读写分离核心价值1.1 技术定位1.2 读写分离核心价值二

深度解析Python中递归下降解析器的原理与实现

《深度解析Python中递归下降解析器的原理与实现》在编译器设计、配置文件处理和数据转换领域,递归下降解析器是最常用且最直观的解析技术,本文将详细介绍递归下降解析器的原理与实现,感兴趣的小伙伴可以跟随... 目录引言:解析器的核心价值一、递归下降解析器基础1.1 核心概念解析1.2 基本架构二、简单算术表达

深入浅出Spring中的@Autowired自动注入的工作原理及实践应用

《深入浅出Spring中的@Autowired自动注入的工作原理及实践应用》在Spring框架的学习旅程中,@Autowired无疑是一个高频出现却又让初学者头疼的注解,它看似简单,却蕴含着Sprin... 目录深入浅出Spring中的@Autowired:自动注入的奥秘什么是依赖注入?@Autowired

从原理到实战解析Java Stream 的并行流性能优化

《从原理到实战解析JavaStream的并行流性能优化》本文给大家介绍JavaStream的并行流性能优化:从原理到实战的全攻略,本文通过实例代码给大家介绍的非常详细,对大家的学习或工作具有一定的... 目录一、并行流的核心原理与适用场景二、性能优化的核心策略1. 合理设置并行度:打破默认阈值2. 避免装箱

PostgreSQL简介及实战应用

《PostgreSQL简介及实战应用》PostgreSQL是一种功能强大的开源关系型数据库管理系统,以其稳定性、高性能、扩展性和复杂查询能力在众多项目中得到广泛应用,本文将从基础概念讲起,逐步深入到高... 目录前言1. PostgreSQL基础1.1 PostgreSQL简介1.2 基础语法1.3 数据库

Python中的filter() 函数的工作原理及应用技巧

《Python中的filter()函数的工作原理及应用技巧》Python的filter()函数用于筛选序列元素,返回迭代器,适合函数式编程,相比列表推导式,内存更优,尤其适用于大数据集,结合lamb... 目录前言一、基本概念基本语法二、使用方式1. 使用 lambda 函数2. 使用普通函数3. 使用 N

Python中yield的用法和实际应用示例

《Python中yield的用法和实际应用示例》在Python中,yield关键字主要用于生成器函数(generatorfunctions)中,其目的是使函数能够像迭代器一样工作,即可以被遍历,但不会... 目录python中yield的用法详解一、引言二、yield的基本用法1、yield与生成器2、yi

Python多线程应用中的卡死问题优化方案指南

《Python多线程应用中的卡死问题优化方案指南》在利用Python语言开发某查询软件时,遇到了点击搜索按钮后软件卡死的问题,本文将简单分析一下出现的原因以及对应的优化方案,希望对大家有所帮助... 目录问题描述优化方案1. 网络请求优化2. 多线程架构优化3. 全局异常处理4. 配置管理优化优化效果1.

MyBatis-Plus 与 Spring Boot 集成原理实战示例

《MyBatis-Plus与SpringBoot集成原理实战示例》MyBatis-Plus通过自动配置与核心组件集成SpringBoot实现零配置,提供分页、逻辑删除等插件化功能,增强MyBa... 目录 一、MyBATis-Plus 简介 二、集成方式(Spring Boot)1. 引入依赖 三、核心机制