时间序列|change point detection

2024-09-08 09:32

本文主要是介绍时间序列|change point detection,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

change point detection 被称为变点检测,其基本定义是在一个序列或过程中,当某个统计特性(分布类型、分布参数)在某时间点受系统性因素而非偶然因素影响发生变化,我们就称该时间点为变点。变点识别即利用统计量或统计方法或机器学习方法将该变点位置估计出来。

Change Point Detection的类型

  • online
    指连续观察某一随机过程,监测到变点时停止检验,不运用到未来数据,主要用于事件预警。
  • offline
    从已经获得的时序数列中检测过去的变点位置,主要用作历史检验。

1. 控制图方法CUSUM

#####原画与介绍
根据累计数据微小的偏差,来探测数据分布是否发生了变化。这也是最古老最原始的,被业界广泛应用于工业质量检测、自动监测、金融方面。比如被阿里用于全景业务平台的监控解决方案。

基本模型流程

param: threshold
input:time series
for 0---->n:计算累计偏差量
如果累计偏差量大于阈值threshold,则视为这段time series与前段time series有明显不同,分割出两个区间windows,从开始出现偏差的点,可以推出change point
output:windows, change points

优缺点

  • 缺点:需要调参threshold,太小模型太敏感,太大模型太粗糙。
    解决方案:动态阈值预测:样本选择---->异常样本筛除—>样本截取—>预测基准值(一阶导数的状态值)。

  • 优点:比较简单,比较容易实施。业界研究与应用比较多,可以找到很相关材料与优化方法。

2. Probability Density Estimation

#####想法与原理
对于一组时间序列,出现change point前与出现change point后的概率密度分布会不同。

基本模型流程

  1. 用前n个点,probability density models—》estimate probability density function
  2. 然后用score来衡量,加入这个点后,概率密度分布的差异(加入这个点后,概率密度分布的变化大小 )
  3. score越高,这个点是change point的概率越高。

优缺点

  • 缺点:概率密度估计模型的确立,带参数。并且,probability density function很难做的准确,需要很大的数据量。

3. Direct Compute

想法

因为概率密度分布很难做的准确,因此衍生出了不计算评估概率密度分布,而是直接一个point前后的概率目的分布的差异,对于一个点前的数据和之后的数据,用一些模型/算法可以衡量他前后分布的差异。

可以比较多种差异:

  • 均值
  • 方差
  • 均值与方差

相关的模型:量化两种概率分布P和Q之间差异

  • Kernel Mean
  • non-parametric Gaussian kernel model
  • Kulback-Leibler Importance Estimation Procedure
  • Kernel FDA

如何分割time series?

  • BinSegment
  • bottom-up
  • Window-based
  • Segment Neighbourhood

优缺点
该方法很容易受data noise的影响,高维度可能效果很差。

4. Probability Method

对比change point前后分布的不同,这部分侧重于直接预测某个点是否是change point.

(1)Gaussian Process

想法:用t之前的N点构建一个time series prediction 的模型(这里就是GP模型),如果t点的值和预测的值偏差很大,就记一个potential Alarm,当连续几个值偏差很大,potential Alarm超过某个阈值时,就Raise Alarm,说明出现新的分布。

优缺点

这个方法对one-day-event不敏感。

###(2)Bayesian
一开始和GP差不多。

想法:对于一个点,给定他在上一个change point之后的信息,估计这个点是change point的概率。

优缺点
先验函数很难定义,定的不好,结果不准 。

一般来说offline的方法比online的更准确,然后GP会比Bayesian更准确。

5. Clustering Method

把change point detection看成,将time series分成很多的clusters。

  • (1)层次聚类:将许多time series进行聚类,在同一类中,如果有一个time series的行为与同聚类内其它成员差异较大,则视作发生了change。
  • (2)图形聚类:
  • (3)基于局部图形聚类与分割

6. 其它

基于图论、基于控制论、系统辩识方法等。

参考文献

[1]. Aminikhanghahi, Samaneh and Diane J. Cook. “A survey of methods for time series change point detection.” Knowledge and Information Systems 51 (2016): 339-367.

[2]. Liu, Song, Makoto Yamada, Nigel Collier and Masashi Sugiyama. “Change-Point Detection in Time-Series Data by Relative Density-Ratio Estimation.” Neural networks : the official journal of the International Neural Network Society 43 (2012): 72-83.

[3]. Itoh, Naoki and Juergen Kurths. “Change-Point Detection of Climate Time Series by Nonparametric Method.” (2010).

[4]. Cho, Haeran and Piotr Fryzlewicz. “Multiple change-point detection for high-dimensional time series via Sparsified Binary Segmentation.” (2013).

[5]. Saatci, Yunus, Ryan D. Turner and Carl E. Rasmussen. “Gaussian Process Change Point Models.” ICML (2010).

[6]. Lacasa, Lucas, Bartolo Luque, Fernando J Ballesteros, Jordi Luque and Juan Carlos Nuño. “From time series to complex networks: the visibility graph.” Proceedings of the National Academy of Sciences of the United States of America 105 13 (2008): 4972-5.

[7]. Harchaoui, Zaïd, Francis R. Bach and Eric Moulines. “Kernel Change-point Analysis.” NIPS (2008).

[8]. Jeske, Daniel R., Veronica Montes De Oca, Wolfgang Bischoff and Mazda Marvasti. “Cusum techniques for timeslot sequences with applications to network surveillance.” Computational Statistics & Data Analysis 53 (2009): 4332-4344.

[9]. Chib, Siddhartha and John M. Olin. “Estimation and comparison of multiple change-point models.” (1997).

这篇关于时间序列|change point detection的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1147738

相关文章

java时区时间转为UTC的代码示例和详细解释

《java时区时间转为UTC的代码示例和详细解释》作为一名经验丰富的开发者,我经常被问到如何将Java中的时间转换为UTC时间,:本文主要介绍java时区时间转为UTC的代码示例和详细解释,文中通... 目录前言步骤一:导入必要的Java包步骤二:获取指定时区的时间步骤三:将指定时区的时间转换为UTC时间步

Python的Darts库实现时间序列预测

《Python的Darts库实现时间序列预测》Darts一个集统计、机器学习与深度学习模型于一体的Python时间序列预测库,本文主要介绍了Python的Darts库实现时间序列预测,感兴趣的可以了解... 目录目录一、什么是 Darts?二、安装与基本配置安装 Darts导入基础模块三、时间序列数据结构与

MyBatis Plus实现时间字段自动填充的完整方案

《MyBatisPlus实现时间字段自动填充的完整方案》在日常开发中,我们经常需要记录数据的创建时间和更新时间,传统的做法是在每次插入或更新操作时手动设置这些时间字段,这种方式不仅繁琐,还容易遗漏,... 目录前言解决目标技术栈实现步骤1. 实体类注解配置2. 创建元数据处理器3. 服务层代码优化填充机制详

C++统计函数执行时间的最佳实践

《C++统计函数执行时间的最佳实践》在软件开发过程中,性能分析是优化程序的重要环节,了解函数的执行时间分布对于识别性能瓶颈至关重要,本文将分享一个C++函数执行时间统计工具,希望对大家有所帮助... 目录前言工具特性核心设计1. 数据结构设计2. 单例模式管理器3. RAII自动计时使用方法基本用法高级用法

C# LiteDB处理时间序列数据的高性能解决方案

《C#LiteDB处理时间序列数据的高性能解决方案》LiteDB作为.NET生态下的轻量级嵌入式NoSQL数据库,一直是时间序列处理的优选方案,本文将为大家大家简单介绍一下LiteDB处理时间序列数... 目录为什么选择LiteDB处理时间序列数据第一章:LiteDB时间序列数据模型设计1.1 核心设计原则

MySQL按时间维度对亿级数据表进行平滑分表

《MySQL按时间维度对亿级数据表进行平滑分表》本文将以一个真实的4亿数据表分表案例为基础,详细介绍如何在不影响线上业务的情况下,完成按时间维度分表的完整过程,感兴趣的小伙伴可以了解一下... 目录引言一、为什么我们需要分表1.1 单表数据量过大的问题1.2 分表方案选型二、分表前的准备工作2.1 数据评估

MySQL中DATE_FORMAT时间函数的使用小结

《MySQL中DATE_FORMAT时间函数的使用小结》本文主要介绍了MySQL中DATE_FORMAT时间函数的使用小结,用于格式化日期/时间字段,可提取年月、统计月份数据、精确到天,对大家的学习或... 目录前言DATE_FORMAT时间函数总结前言mysql可以使用DATE_FORMAT获取日期字段

Linux中的自定义协议+序列反序列化用法

《Linux中的自定义协议+序列反序列化用法》文章探讨网络程序在应用层的实现,涉及TCP协议的数据传输机制、结构化数据的序列化与反序列化方法,以及通过JSON和自定义协议构建网络计算器的思路,强调分层... 目录一,再次理解协议二,序列化和反序列化三,实现网络计算器3.1 日志文件3.2Socket.hpp

Python标准库datetime模块日期和时间数据类型解读

《Python标准库datetime模块日期和时间数据类型解读》文章介绍Python中datetime模块的date、time、datetime类,用于处理日期、时间及日期时间结合体,通过属性获取时间... 目录Datetime常用类日期date类型使用时间 time 类型使用日期和时间的结合体–日期时间(

Java获取当前时间String类型和Date类型方式

《Java获取当前时间String类型和Date类型方式》:本文主要介绍Java获取当前时间String类型和Date类型方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,... 目录Java获取当前时间String和Date类型String类型和Date类型输出结果总结Java获取