要点速览
- 层级 A:桌面演练。文件内容是否仍然准确?耗时两到三小时,不涉及任何技术操作。
- 层级 B:隔离恢复。备用环境能否启动、应用程序能否打开,且不中断生产?
- 层级 C:真实切换。唯一能够测量 RTO 并检验回切的层级。
- 自动启动检查很有用,但并不能证明业务人员可以正常工作。
- 每次测试都应形成一份注明日期的记录:时间、偏差、决定。
权威框架怎么说
法国国防与国家安全总秘书处(SGDSN)建议采用三种相互补充的方法:审核文件,最好由可信第三方进行;测试各项措施的实施,例如将部分功能切换到备用站点;最后通过演练确认各项流程为人所知、被正确理解,并能在规定时限内执行。法国国家信息系统安全局(ANSSI)在其备份指南中要求编写信息系统恢复流程,并定期付诸实施。
美国标准化机构 NIST 区分了两种演练形式。桌面演练是一种讨论,每位参与者针对某一场景说明自己的职责。功能演练则要求在模拟环境中执行真实操作。下文的三个层级正是遵循这一递进思路。
层级 A:桌面演练
计划中指定的人员手握电话,逐一大声过一遍各个步骤。检查各个号码是否有人接听、密钥能否找到、服务器的启动顺序是否仍然正确。耗时:对于网络安全危机桌面演练,ANSSI 估计需要两到三小时(含简报和复盘),并需约六周的准备;NIST 则根据目标给出两到八小时不等。最低频率:每当有关键人员离职后进行一次。这一层级无法证明任何技术问题,它证明的是文件内容仍然准确。
层级 B:隔离环境中的技术恢复
在不中断生产的前提下,恢复或启动备用环境。登录系统,打开应用程序,记录从作出决定到出现业务界面所用的时间。真实用户不进行切换。这项测试能够暴露缺失的磁盘、许可证、密码或被封闭的网络等问题。
局限:由于生产并未中断,切换操作(DNS、IP、代理程序)和回切都未得到验证。
层级 C:在提前公布的时间窗口内真实切换
在某个晚上或周日,停止生产,或将流量导向备用环境。几位用户执行一项真实的业务操作:编辑一份单据、核对一笔订单、查阅一份档案。然后进行回切,并确认在备用环境上录入的数据没有丢失。
这是唯一能够测量 RTO 并检验回切的层级。它需要事先规划、事先通知,并设有中止标准(“如果到 23:00 备用环境仍未就绪,就取消”)。
| 层级 | 能证明什么 | 不能证明什么 | 对生产的影响 |
|---|---|---|---|
| A. 桌面演练 | 文件、联系人、职责分工 | 技术是否可行 | 无 |
| B. 隔离恢复 | 备用环境能够启动、应用程序能够打开 | 网络切换与回切 | 无 |
| C. 真实切换 | 实际 RTO、业务操作、回切 | — | 提前公布的时间窗口 |
层级 C 之前的检查清单
- 日期和时间窗口已获管理层批准,并已通知用户。
- 已确认最近一次备份成功,加密密钥已就位。
- 中止标准已书面确定,包括截止时间和决策人。
- 每个受测应用程序配备一名业务用户,并明确其需执行的具体操作。
- 回切流程已复核,并在测试前对生产环境做了备份。
- 指定一人实时记录各个时间点和偏差。
测试记录应包含哪些内容
日期、层级、参与人员、开始时间、业务操作成功的时间、偏差、决定。“测试通过”这样一句话,六个月后毫无用处。NIST 将这份文件称为演练后报告:它记录观察结果和改进计划的建议。ANSSI 则把经验总结视为每次演练中不可或缺的独立环节。
自动启动测试能证明什么,不能证明什么
有些服务每月启动一次副本,检查其能否启动。这很有用:无法再启动的镜像可以被及时发现,且不会干扰生产。但这并不等于层级 C。应用程序可能已损坏,数据库可能不一致,切换网络未经测试,回切方式也无从知晓。把这种检查说成“DRP 已经过测试”是不准确的。准确的说法应是:“镜像的启动已经过检查;业务切换尚未验证。”
WeDoBack 的做法
灾难恢复计划(DRP)方案所含的每月测试即属于后一类:自动流程会启动所存储的实例并读取其启动画面,不触及生产环境。真实条件下的测试对应层级 C 或深入的层级 B,最长可达十小时,需申请报价。两者各有作用,不能互相替代。人工技术支持的服务时间为 9:00–13:00 和 14:00–17:30(巴黎时间),电话 +33 9 72 50 78 28:实战演练可安排在这些时段内,也可明确约定在服务时间之外进行。
常见问题
能否在不停止生产的情况下测试 DRP?
可以,层级 A 和层级 B 均不影响生产:桌面演练和在隔离环境中的恢复都不会触及生产环境。只有真实切换(层级 C)需要提前公布的时间窗口,通常安排在晚上或周末,并事先确定中止标准。
哪些人员应参与测试?
计划中指定的人员:决定切换的人、负责系统管理的人、持有加密密钥的人,以及至少一名能够确认自己确实可以开展工作的业务用户。没有业务用户参与,测试的只是 IT 系统,而不是业务恢复能力。
测试失败怎么办?
这正是测试的意义所在:在灾难发生之前发现问题。记录偏差、加以纠正,并针对该问题安排新一轮测试。NIST 和 ANSSI 都强调经验总结,它能把失败转化为对计划的改进。
参考来源
以下文件查阅于 2026 年 10 月。
- SP 800-84,IT 计划与能力的测试、培训和演练项目指南(Guide to Test, Training, and Exercise Programs for IT Plans and Capabilities,2006 年 9 月) — NIST
- SP 800-34 Rev. 1,联邦信息系统应急规划指南(Contingency Planning Guide for Federal Information Systems) — NIST
- 组织网络安全危机管理演练(法语) — ANSSI
- 业务连续性计划编制指南(2013 年版,法语) — SGDSN
- 信息系统备份基础(ANSSI-BP-100,v1.1,2025 年 11 月 27 日,法语) — ANSSI
- 灾难恢复计划(DRP)方案:灾后业务恢复 — WeDoBack
