Резервное копирование и восстановление после сбоя (DR)

Делаем резервные копии по схеме 3-2-1: три копии данных, два типа носителей, одна — за пределами офиса. Проверяем копии на наличие, возраст и целостность и проектируем понятный план восстановления (DR) с целевыми RTO/RPO — потому что копия, из которой ни разу не восстанавливались, это ещё не резервная копия, а надежда. Вход — через аудит инфраструктуры, без оценки «на глаз».

Проблема

«Бэкап, которого нет»: зелёная галочка — это ещё не восстановление

Зелёная галочка в панели означает ровно одно: файл копии записался. Она ничего не говорит о том, удастся ли из этой копии восстановиться. По-настоящему бэкап проверяется один-единственный раз — в день аварии, и это худший момент для сюрпризов. Ниже — пять способов остаться без данных, когда копии вроде бы есть.

«Бэкап, которого нет» — наш собственный тезис. Копия без проверки восстановления не считается копией. Мы разбираем эти пять способов подробно в отдельном материале блога «Бэкап, которого нет» — и на проекте закрываем каждый из них не декларацией, а проверкой.
Что делаем

Не «поставить бэкап», а построить проверяемую схему восстановления

Результат

Что вы получаете на выходе

Чем доказываем

Построили это себе — построим и вам

Схема 3-2-1 — на своей инфраструктуре, не на словах

Три копии данных, два разных типа носителей, одна — за пределами офиса. Это не декларация из презентации: так устроено резервное копирование нашего собственного кластера виртуализации, который мы эксплуатируем каждый день. Мы одновременно заказчик, архитектор и служба эксплуатации — все грабли прошли на себе.

ZFS против «тихой» порчи данных

Кластер виртуализации работает на файловой системе ZFS с контрольными суммами: она замечает и лечит незаметное повреждение данных (bit rot), которое обычная файловая система молча пропустит — в том числе в резервную копию. Данные защищены от искажения ещё до того, как попадут в архив.

Offsite-копия на отдельном хранилище

Внешняя копия важных данных лежит вне основной площадки, на отдельном хранилище нашей защищённой инфраструктуры, — тот же offsite-бэкап мы предлагаем и как услугу по подписке. Зависимость от одного поставщика мы проходили на собственной инфраструктуре и с тех пор считаем вынос копии за пределы площадки обязательным пунктом, а не пожеланием.

Проверяем копии, а не зелёную галочку

На своей инфраструктуре мы проверили 13 резервных копий на целостность; одну базу восстановили в отдельную БД и сверили с боевой построчно — полное совпадение; образ машины развернули на изолированном стенде и проверили монтированием корня только на чтение. Это контрольный прогон, а не ежедневная рутина, — но именно он отличает рабочую копию от надежды на неё.

Честно про эти доказательства. Контрольный прогон восстановления — это проверка, а не ежедневная рутина. Целевые RTO/RPO — это цель проектируемого плана, а не измеренный по каждому клиенту факт. А неизменяемые (immutable) копии и air-gap мы закладываем как проектные решения, а не выдаём за «у нас именно так уже стоит».
Честно о границах

Что мы делаем, а что — пока нет

Границы мы подаём как принцип, а не как мелкий шрифт внизу договора. «Бэкап, которого нет» — наш же тезис: копия без проверки восстановления не считается, и надёжность, которую мы не проверяли, мы не обещаем.

Сертифицированные средства защиты информации мы не устанавливаем. Для этого нужна лицензия ФСТЭК, которой у STABOS пока нет (она в дорожной карте, Фаза 2). Требования 152-ФЗ, приказа ФСТЭК № 21 и меры обеспечения доступности (ОДТ.3, ОДТ.5) мы упоминаем только своими словами, как ориентир, — без дословного цитирования и без выдачи себя за лицензированного исполнителя.
Регулярные боевые учения с полным восстановлением мы не продаём как рутинную услугу. Такой регулярный прогон восстановления — «шаг дозревания» направления отказоустойчивости, ещё не поставленный на поток. Заявляем то, что делаем сегодня: проверяемость копий (наличие, возраст, целостность) и проектирование плана восстановления (DR, RTO/RPO). Проверку готовности к аварии по факту ведём отдельно — на странице проверки готовности к аварии.
Частые вопросы

Снимаем сомнения

У нас же бэкапы настроены — зачем ещё что-то?

«Настроено» и «восстановимо» — разные утверждения. Зелёная галочка означает, что файл копии записался, а не что из него удастся подняться. Мы проверяем копии на наличие, возраст и целостность и находим то, что не копируется или хранится недостаточно долго, — до того, как это выяснит авария.

Проверяете ли вы восстановление?

Проверяем целостность копий и проектируем план восстановления с целевыми RTO/RPO. Контрольный прогон — разворот базы или образа на изолированном стенде — делаем как проверку, а не как ежедневную рутину. Регулярные боевые учения с полным восстановлением — отдельный, ещё дозревающий шаг направления отказоустойчивости, и мы не выдаём его за готовую услугу.

Где хранится offsite-копия?

Внешняя копия важных данных лежит вне основной площадки, на отдельном хранилище. Такой offsite-бэкап по подписке мы предлагаем отдельной услугой — см. облачные сервисы. Конкретную площадку и носитель подбираем под ваши требования к доступности и срокам восстановления.

Сколько стоит?

Цена проектная и зависит от объёма данных, числа систем и целевых RTO/RPO. Публичного прайса нет намеренно: называть сумму «на глаз», не увидев инфраструктуру, — значит промахнуться. Точную стоимость определяем по итогам аудита.

Обязательно начинать с аудита?

Да. Вход в проект — через аудит инфраструктуры: он показывает, что реально копируется, чего не хватает и какие RTO/RPO достижимы. По его итогам определяем объём и цену — без оценки «на глаз».

Смежное

Читать дальше

Начнём с аудита инфраструктуры

По итогам аудита определим, что копируется и что реально нужно бизнесу, какие RTO/RPO достижимы, — и назовём объём и цену без оценки «на глаз».

Или позвоните: 8 (804) 333-33-35 — бесплатно по России