云端大数据分布式文件系统成本优化秘笈

本文主要是介绍云端大数据分布式文件系统成本优化秘笈，希望对大家解决编程问题提供一定的参考价值，需要的开发者们随着小编来一起学习吧！

一、CHDFS 介绍

CHDFS（云 HDFS^[1]）是腾讯云一种提供标准 HDFS 访问协议和分层命名空间的高性能分布式文件系统，主要解决大数据场景下海量数据存储和数据分析，为实现计算与存储分离提供解决方案。

CHDFS 着重于分布式元数据服务，数据存储依赖对象存储 COS^[2]。COS 作为云端基础存储服务，为 CHDFS 提供了坚实的数据底座，不仅支持海量数据存储和超大带宽，还支持多 AZ 模式，且默认 EC 编码，成本更低，同时通过冷热数据智能分层，进一步降低存储成本。

二、生命周期管理

随着时间推移，CHDFS 上数据不断累积，但只有小部分是用户最近使用的，大部分是历史数据，访问频次逐渐减少，如日志文件，数据备份等。

如果用户不去管理这些数据，那么存储费用逐渐增大，对用户自身业务发展也不友好，但主动管理需要投入人力和时间成本，费时费力，因此 CHDFS 对齐 COS 数据分层能力，推出生命周期功能，帮助用户更加便捷地管理冷热数据。

用户可以通过配置 CHDFS 生命周期规则，定期将数据文件从标准存储降为归档存储或者直接删除，整个沉降和删除过程由 CHDFS 生命周期功能自动化完成，保障及时准确，且不产生任何附加费用，同时支持回热操作，用于对已经降为归档存储类型的数据文件重新发起访问。

三、生命周期规则

生命周期规则即生命周期策略，需要用户指定以下参数：

Path：生命周期规则目标路径。
- 指定目录：规则作用于目录下的所有文件，包括递归子目录下的文件。
- 指定文件：规则只作用于具体文件。
Type：生命周期规则类型。
- 沉降：定期将文件存储类型从标准存储降为归档存储，节省成本。
- 删除：定期将文件直接删除。
Days：指定生命周期规则在文件最后访问时间的多少天后触发相应的操作。

说明：与 COS 对象最后修改时间 mtime 不同，CHDFS 满足文件系统语义，不仅支持文件最后修改时间 mtime、元数据最后修改时间 ctime，还能够支持以文件最后访问时间 atime 作为分层条件，这种策略更能满足用户需求。

四、回热任务

回热的目的是为了对已经沉降的文件重新发起访问，它会复制一份标准存储的文件副本供用户读取，副本到期后会自动删除，在此期间归档存储的文件一直存在，创建回热任务需要用户指定参数：

FilePath：回热文件路径。
Type：回热类型。根据回热时间长短，回热分为三类。
- 极速模式：回热任务在 1 - 5 分钟内可完成。
- 标准模式：回热任务在 3 - 5 小时内完成。
- 批量模式：回热任务在 5 - 12 小时内完成。
Days：回热完成后，标准存储的文件副本的保留天数。

说明：CHDFS 对于数据沉降、删除和回热，需要依赖 COS 对外提供的标准接口，所以生命周期在使用方式上与 COS 相似。

五、使用方式

用户可以通过控制台和云 API 来配置生命周期规则，创建回热任务仅支持云 API。

1、控制台

进入 CHDFS 控制台^[3]，选择具体文件系统，进入生命周期配置页，添加规则，完成生命周期配置，如下图所示：

说明：同时指定沉降和删除规则表示对目标文件先沉降后删除，删除时间必须要大于沉降时间。

2、云 API

通过云 API 创建生命周期规则^[4]示例：

https://chdfs.tencentcloudapi.com/?Action=CreateLifeCycleRules
&FileSystemId=f4mhaqkciq0
&LifeCycleRules.0.LifeCycleRuleName=test
&LifeCycleRules.0.Path=/test
&LifeCycleRules.0.Transitions.0.Days=90
&LifeCycleRules.0.Transitions.0.Type=1
&LifeCycleRules.0.Transitions.1.Days=180
&LifeCycleRules.0.Transitions.1.Type=2
&LifeCycleRules.0.Status=1
&<公共请求参数>

创建回热任务^[5]示例：

https://chdfs.tencentcloudapi.com/?Action=CreateRestoreTasks
&FileSystemId=f4mhaqkciq0
&RestoreTasks.0.FilePath=/test/file0
&RestoreTasks.0.Type=1
&RestoreTasks.0.Days=7
&RestoreTasks.1.FilePath=/test/file1
&RestoreTasks.1.Type=2
&RestoreTasks.1.Days=7
&<公共请求参数>

说明：支持批量创建回热任务，回热任务需要指定具体文件路径。