26

译文|Apache Pulsar 的分层存储

 3 years ago
source link: http://mp.weixin.qq.com/s?__biz=MzUxOTc4NDc2MQ%3D%3D&%3Bmid=2247486023&%3Bidx=1&%3Bsn=f01327b53428dd23f691d30ef4292fdc
Go to the source link to view the article. You can view the picture content, updated content and better typesetting reading experience. If the link is broken, please click the button below to view the snapshot at that time.

BrMRnu6.png!mobile

️ 阅读本文需要大约 5 分钟

点击文末「阅读原文」可查看英文原版

在一些流数据用例场景中,用户希望将数据长时间存储在流中。虽然 Apache Pulsar 对 topic backlog 的大小没有限制,但将所有数据存储在 Pulsar 中较长时间,存储成本比较大。

本文介绍了 Apache Pulsar 的分层存储特性(在 2.1 及之后的版本可用),分层存储支持在不影响终端用户的条件下,将较旧的数据移动到长期存储中。

在推荐服务中,开发者不希望限制 backlog 的大小。以音乐服务为例,终端用户每听一首歌,就向 topic 中添加一条消息。使用这一 topic 训练推荐算法,根据终端用户听过的音乐推荐用户可能喜欢的音乐。然后,将计算结果推荐给用户,再循环这个过程。

zMzYfui.png!mobile

推荐算法并非一成不变。音乐服务的数据科学家一直在不断优化推荐算法,以更好地预测用户喜欢的音乐,从而提高用户对推荐服务的满意度和参与度。

但是,如果每次修改算法时,都只运行修改时间点之后的用户数据,不仅预测的准确度会受到影响,判断算法的修改效果也会需要一段较长的时间。为了解决这一问题,算法需要尽可能多地运行用户历史数据。

Pulsar 允许用户存储任意大小的 topic backlog。当集群将要耗尽空间时,用户只需添加新的存储节点,系统将会自动重新平衡数据。但是,这样的操作运行一段时间后,运维成本十分昂贵。

Pulsar 通过提供分层存储(Apache Pulsar 2.1 起新增的特性)减少了成本/大小的损失。分层存储为用户提供大小不受限制的 backlog,且无需添加存储节点;卸载较旧的 topic 数据到长期存储中,长期存储的成本比在 Pulsar 集群中存储的成本低一个数量级。对于终端用户来说,消费存储在 Pulsar 集群或分层存储中的 topic 数据没有明显差别。位于 Pulsar 集群和分层存储中的 topic 生产和消费消息的方式也完全相同。

Pulsar 通过分片架构实现了分层存储。Pulsar topic 的消息日志由一系列分片组成。序列中的最后一个分片是 Pulsar 当前写入的分片。当前序列之前的所有分片都已封装,也就是说,这些分片中的数据不可变。由于数据不可变,因此可以轻易地将数据复制到另一个存储系统,而不必担心一致性的问题。复制完成后,可以立即更新消息日志元数据中的数据指针,并且可以删除 Pulsar 在 Apache BookKeeper 中存储的数据副本。

mqaUruB.png!mobile

在 Pulsar 中使用分层存储

Pulsar 目前支持通过 Amazon S3、GCS(Google Cloud Storage)、Filesystem 进行长期存储。 要使用 S3 进行分层存储,管理员需要先在 S3 中创建一个存储桶(bucket); 然后,用存储桶和创建存储桶的区域配置 broker。

<span style="font-size: 15px;letter-spacing: 0.5px;">managedLedgerOffloadDriver=S3</span>

<span style="font-size: 15px;letter-spacing: 0.5px;">s3ManagedLedgerOffloadRegion=eu-west-3</span>

<span style="font-size: 15px;letter-spacing: 0.5px;">s3ManagedLedgerOffloadBucket=pulsar-topic-offload</span>

用户不直接在 Pulsar 中配置身份验证。Pulsar 使用的 `DefaultAWSCredentialsProviderChain` 可以在多个位置查找验证信息。

配置验证信息最简单的方式是在 pulsar-env.sh  中设置环境变量。

关于配置身份验证方法的更多信息,参阅分层存储文档:

http://pulsar.apache.org/docs/en/concepts-tiered-storage/

配置好所有 broker 后,就可以开始使用分层存储了。 可以配置分层存储的数据卸载为自动运行,也可以手动触发。

自动迁移数据到长期存储

管理员可以为命名空间设置大小阈值策略。配置大小阈值策略后,如果命名空间中的任一 topic 在 Pulsar 集群上的数据大小超过了阈值,topic 就会卸载分片到长期存储中,直到 Pulsar 集群上的数据大小在阈值之内。

例如,当 Pulsar 集群上的数据大小超过 1 GB 时,指定命名空间中的 topic 卸载分片,可以使用以下命令:

pulsar-admin namespaces set-offload-threshold --size 1G my-tenant/my-namespace

当命名空间中的任一 topic 超过阈值时,topic 将会移动数据至长期存储,释放 Pulsar 集群上的存储空间。

手动卸载

除了配置自动卸载数据外,还可以通过 REST 接口或命令行界面在单个 topic 上手动触发卸载操作。要通过命令行界面触发,用户必须指定在 Pulsar 集群上为 topic 保留的最大数据量。如果 Pulsar 集群上的 topic 数据大小超过了设置的阈值,则将此 topic 上的分片移动到长期存储中,直到 Pulsar 集群上的数据大小在阈值之内。移动数据时,先移动较旧的分片。

pulsar-admin topics offload --size-threshold 10M my-tenant/my-namespace/topic1

更多关于配置和使用分层存储的信息,参阅分层存储文档:

https://pulsar.apache.org/docs/en/cookbooks-tiered-storage/

Apache Pulsar 2.1 及之后的版本支持分层存储。

UJ3EjqM.png!mobile


About Joyk


Aggregate valuable and interesting links.
Joyk means Joy of geeK