未来数据科学家必备的【核心算法】与【常用模型】

2024-04-28 13:38

本文主要是介绍未来数据科学家必备的【核心算法】与【常用模型】,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

未来数据科学家必备的
核心算法与常用模型




机器学习和统计学是数据科学的两个主要理论基础。本文为您盘点数据科学家必备的核心机器学习算法和常用统计模型。


640?wx_fmt=jpeg&wxfrom=5&wx_lazy=1


1Machine Learning 核心算法

1)回归/分类树

2)降维(PCA、MDS、tSNE等)

3)经典的前馈神经网络

4)Bagging ensembles方法(随机森林、KN N回归集成)

5)Boostingensembles方法(梯度提升、XGBoost算法)

6)参数调整或设计方案的优化算法(遗传算法,量子启发式演化算法,模拟退火/simulated annealing,粒子群优化/ particle-swarm optimization)

7)拓扑数据分析工具,特别适用于小样本量的无监督学习(持续同调/persistent homology,Morse-Smale聚类,Mapper ...)

8)深度学习架构(通用深度学习架构)

9)用于局部建模的KNN方法(回归,分类)

10)基于梯度的优化方法/Gradient-based optimization methods

11)网络度量/Network metrics和算法(中心度量,跳数,多样性,熵,拉普拉斯算子,疫情传播/epidemic spread,谱聚类/spectral clustering)

12)深层架构中的卷积和池化层/pooling layers(特别适用于计算机视觉和图像分类模型)

13)分层聚类(与k均值聚类和拓扑数据分析工具相关)

14)贝叶斯网络(路径挖掘/pathway mining)

15)复杂性和动态系统(与微分方程有关)

此外,部分领域还可能需要与自然语言处理、计算机视觉相关算法。


640?wx_fmt=jpeg


2  Statistical Models 常用模型

1)广义线性模型(是多数监督机器学习方法的基础,如逻辑回归和Tweedie回归)

2)时间序列方法(ARIMA,SSA,基于机器学习的方法)

3)结构方程建模(针对潜变量之间关系进行建模)

4)因子分析(调查设计和验证的探索型分析)

5)功效分析/试验设计(特别是基于仿真的试验设计,以避免分析过度)

6)非参数检验(MCMC)

7)K均值聚类

8)贝叶斯方法(朴素贝叶斯,贝叶斯模型平均/Bayesian model averaging,贝叶斯适应性试验/Bayesian adaptive trials等)

9)惩罚性回归模型(弹性网络/Elastic Net,LASSO,LARS ...)以及对通用模型(SVM,XGBoost ...)加罚分,这对于预测变量多于观测值的数据集很有用,在基因组学和社会科学研究中较为常用)

10)样条模型/Spline-based models(MARS等):主要用于流程建模

11)马尔可夫链和随机过程(时间序列建模和预测建模的替代方法)

12)缺失数据插补方法及其假设(missForest,MICE ...)

13)生存分析/Survival analysis(主要特点是考虑了每个观测出现某一结局的时间长短)

14)混合建模/Mixture modeling

15)统计推断和组群测试(A/B测试以及用于营销活动的更复杂的方法)


备  注 :1.本文原作者:Colleen M. Farrelly,源文URL: https://www.kdnuggets.com/2018/04/ key-algorithms-statistical-models-aspiring-data-scientists.html

2.由朝乐门负责翻译与编辑。本文已获 数据科学DataScience 授权转发!

END

如果你对人工智能与机器学习感兴趣,请加交流群:群号:139482724 ;

版权声明:本号内容部分来自互联网,转载请注明原文链接和作者,如有侵权或出处有误请和我们联系。


关联阅读:

原创系列文章:

1:从0开始搭建自己的数据运营指标体系(概括篇)

2 :从0开始搭建自己的数据运营指标体系(定位篇)

3 :从0开始搭建自己的数据运营体系(业务理解篇)

4 :数据指标的构建流程与逻辑

5 :系列 :从数据指标到数据运营指标体系

6:   实战 :为自己的公号搭建一个数据运营指标体系

7:  从0开始搭建自己的数据运营指标体系(运营活动分析)

数据运营 关联文章阅读:  

运营入门,从0到1搭建数据分析知识体系    

推荐 :数据分析师与运营协作的9个好习惯

干货 :手把手教你搭建数据化用户运营体系

推荐 :最用心的运营数据指标解读

干货 : 如何构建数据运营指标体系

从零开始,构建数据化运营体系

干货 :解读产品、运营和数据三个基友关系

干货 :从0到1搭建数据运营体系

数据分析、数据产品 关联文章阅读:

干货 :数据分析团队的搭建和思考

关于用户画像那些事,看这一文章就够了

数据分析师必需具备的10种分析思维。

如何构建大数据层级体系,看这一文章就够了

干货 : 聚焦于用户行为分析的数据产品

如何构建大数据层级体系,看这一文章就够了

80%的运营注定了打杂?因为你没有搭建出一套有效的用户运营体系

从底层到应用,那些数据人的必备技能

读懂用户运营体系:用户分层和分群

做运营必须掌握的数据分析思维,你还敢说不会做数据分析

这篇关于未来数据科学家必备的【核心算法】与【常用模型】的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/943397

相关文章

Java注解之超越Javadoc的元数据利器详解

《Java注解之超越Javadoc的元数据利器详解》本文将深入探讨Java注解的定义、类型、内置注解、自定义注解、保留策略、实际应用场景及最佳实践,无论是初学者还是资深开发者,都能通过本文了解如何利用... 目录什么是注解?注解的类型内置注编程解自定义注解注解的保留策略实际用例最佳实践总结在 Java 编程

一文教你Python如何快速精准抓取网页数据

《一文教你Python如何快速精准抓取网页数据》这篇文章主要为大家详细介绍了如何利用Python实现快速精准抓取网页数据,文中的示例代码简洁易懂,具有一定的借鉴价值,有需要的小伙伴可以了解下... 目录1. 准备工作2. 基础爬虫实现3. 高级功能扩展3.1 抓取文章详情3.2 保存数据到文件4. 完整示例

使用Java将各种数据写入Excel表格的操作示例

《使用Java将各种数据写入Excel表格的操作示例》在数据处理与管理领域,Excel凭借其强大的功能和广泛的应用,成为了数据存储与展示的重要工具,在Java开发过程中,常常需要将不同类型的数据,本文... 目录前言安装免费Java库1. 写入文本、或数值到 Excel单元格2. 写入数组到 Excel表格

Python中pywin32 常用窗口操作的实现

《Python中pywin32常用窗口操作的实现》本文主要介绍了Python中pywin32常用窗口操作的实现,pywin32主要的作用是供Python开发者快速调用WindowsAPI的一个... 目录获取窗口句柄获取最前端窗口句柄获取指定坐标处的窗口根据窗口的完整标题匹配获取句柄根据窗口的类别匹配获取句

python处理带有时区的日期和时间数据

《python处理带有时区的日期和时间数据》这篇文章主要为大家详细介绍了如何在Python中使用pytz库处理时区信息,包括获取当前UTC时间,转换为特定时区等,有需要的小伙伴可以参考一下... 目录时区基本信息python datetime使用timezonepandas处理时区数据知识延展时区基本信息

Qt实现网络数据解析的方法总结

《Qt实现网络数据解析的方法总结》在Qt中解析网络数据通常涉及接收原始字节流,并将其转换为有意义的应用层数据,这篇文章为大家介绍了详细步骤和示例,感兴趣的小伙伴可以了解下... 目录1. 网络数据接收2. 缓冲区管理(处理粘包/拆包)3. 常见数据格式解析3.1 jsON解析3.2 XML解析3.3 自定义

SpringMVC 通过ajax 前后端数据交互的实现方法

《SpringMVC通过ajax前后端数据交互的实现方法》:本文主要介绍SpringMVC通过ajax前后端数据交互的实现方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价... 在前端的开发过程中,经常在html页面通过AJAX进行前后端数据的交互,SpringMVC的controll

Pandas统计每行数据中的空值的方法示例

《Pandas统计每行数据中的空值的方法示例》处理缺失数据(NaN值)是一个非常常见的问题,本文主要介绍了Pandas统计每行数据中的空值的方法示例,具有一定的参考价值,感兴趣的可以了解一下... 目录什么是空值?为什么要统计空值?准备工作创建示例数据统计每行空值数量进一步分析www.chinasem.cn处

如何使用 Python 读取 Excel 数据

《如何使用Python读取Excel数据》:本文主要介绍使用Python读取Excel数据的详细教程,通过pandas和openpyxl,你可以轻松读取Excel文件,并进行各种数据处理操... 目录使用 python 读取 Excel 数据的详细教程1. 安装必要的依赖2. 读取 Excel 文件3. 读

Python的time模块一些常用功能(各种与时间相关的函数)

《Python的time模块一些常用功能(各种与时间相关的函数)》Python的time模块提供了各种与时间相关的函数,包括获取当前时间、处理时间间隔、执行时间测量等,:本文主要介绍Python的... 目录1. 获取当前时间2. 时间格式化3. 延时执行4. 时间戳运算5. 计算代码执行时间6. 转换为指