English

大数据保护再落一子:鼎甲迪备实现 Apache Doris 备份与恢复

01 Apache Doris:大数据时代的实时分析引擎

Apache Doris 是一款基于 MPP 架构的高性能、实时分析型数据库,以亚秒级的查询响应速度,在海量数据场景下游刃有余。它既能支持高并发的点查询,也能胜任高吞吐的复杂分析,已成为企业构建大数据实时分析能力的首选之一。

典型使用场景:

1实时数据分析:

实时报表、仪表盘大屏、用户行为分析、AB 实验平台、日志检索分析,直接面向终端用户提供亚秒级交互体验

2湖仓融合分析:

统一数仓构建、数据湖联邦查询加速(直查 Iceberg、Delta Lake、Hudi 等开放湖格式),一套引擎同时支撑实时与离线分析

3混合检索分析(AI 数据栈):

融合文本搜索、向量搜索与结构化分析,支撑 RAG 应用、语义搜索、Agent 实时决策等 AI 场景
从互联网到实体经济,Doris 的用户阵容覆盖了百度、小米、比亚迪、福特、京东、快手、美团、瑞幸咖啡、米哈游等各行业头部企业。随着业务的高速发展,Doris 集群承载的数据量从 TB 级飙升至 PB 级别,这正是典型的大数据场景特征。数据的增值与站点故障的频发,促使用户更加关注数据的安全性和业务连续性。

然而,传统数据库备份方案往往难以适配大数据平台的技术架构:分布式存储节点众多、数据体量巨大、备份窗口紧迫、存储成本高昂。作为数据安全的最后一道防线,备份系统必须能够无缝融入 Doris 的分布式架构,提供快速、精准、可靠的备份与恢复能力。

鼎甲迪备此前已覆盖 Hadoop 生态(含 Hive、HBase)及独立 OLAP 引擎 ClickHouse 的数据保护,如今再落一子,将保护版图延伸至 Doris,进一步覆盖大数据实时分析场景。


02 Doris 原生备份与恢复的局限与挑战

Doris 官方提供了基于快照机制的 BACKUP/RESTORE 命令,支持将数据库、表或分区的数据备份到远程存储系统。然而,在 Doris 主要应用的大数据场景下,数据体量巨大、节点众多、业务连续性要求极高,原生命令的局限性被进一步放大:

01单并发限制,效率受限

Doris 规定一个数据库下同时只能运行一个备份或恢复任务。在大规模数据场景下,这一限制使得备份恢复串行执行,无法充分利用集群的并发能力,进一步拉长了备份和恢复时间。

02存储选项有限,成本难控

原生方案将备份数据上传至远程对象存储(如 S3、OSS 等),长期累积的备份数据占用大量存储空间,存储成本持续攀升,且缺乏重删压缩等数据缩减手段。

03管理手段原始,自动化不足

原生命令缺少作业调度、周期执行、告警通知等管理能力。DBA 需要手动编写脚本、配置定时任务、跟踪执行状态,不仅效率低下,还容易因人为疏忽导致备份遗漏或失败未被及时发现。

04异集群恢复复杂,容灾能力弱

原生方案虽然支持异集群恢复,但整个流程涉及 Repository 配置、快照选择、副本数设定等繁琐步骤,缺乏统一的管理界面和自动化的恢复编排,在实际容灾演练或故障切换中,难以做到快速、准确地恢复业务。

03 鼎甲迪备 Doris 备份与恢复方案:重删降本,多通道提效


鼎甲迪备基于 Doris 快照机制,深度集成原生 BACKUP/RESTORE 命令,为企业级 Doris 大数据平台提供全方位的备份与恢复保护。方案采用无代理轻量部署,无需在生产节点逐一安装代理,即可覆盖整个集群;备份数据灵活存入对象存储池或重删存储池(EOBS),兼顾弹性扩展与成本优化。

01版本全面覆盖

鼎甲迪备 Doris 备份恢复方案全面适配 Apache Doris 2.0、2.1、3.0、3.1、4.0、4.1 等主要版本,覆盖从早期稳定版到最新版本的主流部署,无论企业处于哪个 Doris 版本阶段,均可无缝接入保护。

02重删存储,降本增效

除支持第三方对象存储外,鼎甲迪备还提供自研的重删存储池,兼容标准 S3 协议。备份数据在写入时自动压缩和重删,大幅消除冗余数据、降低存储成本。同时,重删池还支持分布式部署,采用分布式集群架构,数据分散存储于多台独立节点,通过负载均衡分散 IO 压力,支持多副本与纠删码保护,节点异常自动切换,兼具高性能与高可靠,为大数据备份提供坚实的后端存储支撑。

03精细粒度备份,按需保护

支持数据库、表、分区三个级别的备份与恢复粒度。用户可以针对热点分区进行高频备份以模拟增量效果,也可以对整个数据库执行全量保护。恢复时同样支持按需选择粒度,显著减少数据备份、恢复时间与资源占用。

04多通道加速,提升性能

鼎甲迪备支持多通道技术,在备份和恢复过程中并行传输数据,大幅提升备份恢复效率。结合 Doris 原生的 Tablet 级并行快照机制,各 BE 节点同时上传/下载各自负责的数据分片,实现真正意义上的分布式并行备份恢复,在规定时间内完成大规模数据保护。

05自动化调度,省心运维

支持从立即执行到周期调度的全自动备份计划,包括一次、手动、每小时、每天、每周、每月等多种策略。备份作业自动触发、自动执行、自动记录,减少人工干预。运维人员通过统一管理控制台即可监控所有备份恢复作业状态,大幅降低运维复杂度。

06异集群恢复,快速容灾

支持将备份数据恢复至原集群或异集群。在硬件故障、版本升级、数据迁移等场景下,可快速从备份集恢复业务数据,缩短业务中断时间。恢复时,备份主机根据可用备份集信息(快照名称和时间戳),自动选择合适的恢复点并提交 RESTORE 命令,FE 节点精准分配恢复任务至对应 BE 节点,各节点并行下载快照文件并加载到本地,高效完成数据恢复。

07池复制冗余,多重保障

支持池复制技术,实现备份数据的跨池冗余保护。备份数据可自动复制至异地存储池,为数据安全建立多重保障,有效抵御单一站点灾难性故障,提升数据安全性。


Apache Doris 凭借亚秒级查询性能和统一的实时分析能力,正在成为越来越多企业大数据架构的核心引擎。然而,PB 级数据体量、分布式多节点架构、高并发实时写入等大数据场景的典型特征,使得传统数据库备份手段难以胜任,专业级的大数据备份恢复保护不可或缺。

鼎甲迪备实现 Doris 备份恢复,是在 Hive、HBase、HDFS、ClickHouse 保护基础上,大数据版图的又一关键补齐。 大数据平台的数据体量、架构复杂度和运维要求远超传统关系型数据库,而鼎甲迪备凭借无代理轻量部署、EOBS 重删降本、多通道加速提效、精细粒度按需保护、自动化调度省心、异集群恢复快速容灾六大核心能力,已证明自身能够从容应对大数据场景的备份恢复挑战。

从 Hadoop 生态到 ClickHouse、Doris,鼎甲迪备持续拓展大数据领域的适配版图,为更多大数据平台提供专业级的数据保护,让企业在大数据时代能够安心发展,无惧数据丢失风险。

联系我们