Backup y Disaster Recovery (BCP/DRP)

Fundamentos de Backup y Recovery

El backup y el disaster recovery son componentes críticos de cualquier estrategia de ciberseguridad. Con el aumento de los ataques de ransomware y los desastres (naturales o tecnológicos), contar con planes sólidos de BCP (Business Continuity Planning) y DRP (Disaster Recovery Planning) es esencial.

RTO y RPO: Conceptos Fundamentales

RTO (Recovery Time Objective)

Definición: Tiempo máximo aceptable de indisponibilidad tras un desastre

Ejemplo: Un RTO de 4 horas significa que los sistemas deben estar restaurados en un plazo de 4h

Impacto: Define la urgencia y la inversión necesaria en soluciones

RPO (Recovery Point Objective)

Definición: Cantidad máxima de datos que se puede perder, medida en tiempo

Ejemplo: Un RPO de 1 hora significa que los backups deben realizarse cada hora

Impacto: Define la frecuencia de los backups y las tecnologías de replicación

Nivel de Criticidad:

  • Tier 1 (Crítico): RTO < 1h, RPO < 15min - Replicación síncrona
  • Tier 2 (Importante): RTO 4-8h, RPO 1h - Backup incremental frecuente
  • Tier 3 (Normal): RTO 24h, RPO 24h - Backup diario

Regla 3-2-1 de Backup

Estrategia de oro para la protección de datos:

  • 3 Tres copias de los datos: producción + 2 backups
  • 2 Dos tipos de medios diferentes: disco, cinta, cloud
  • 1 Una copia off-site: separada geográficamente

Evolución moderna: 3-2-1-1-0
+ 1 copia inmutable (a prueba de ransomware)
+ 0 errores en la restauración (pruebas periódicas)

Tipos de Backup

1. Backup Completo (Full)

  • Ventaja: Restauración simple y rápida
  • Desventaja: Lento, consume mucho espacio
  • Uso: Semanal o mensual como baseline

2. Backup Incremental

  • Ventaja: Rápido, ahorra espacio
  • Desventaja: La restauración requiere el full + todos los incrementales
  • Uso: Diario u horario entre fulls

3. Backup Diferencial

  • Ventaja: Restauración más simple que el incremental
  • Desventaja: Crece hasta el siguiente full
  • Uso: Diario cuando la simplicidad del restore es crítica

4. Snapshot y Replicación

  • Snapshots: Copias point-in-time, restauración instantánea
  • Replicación Síncrona: Cero pérdida de datos (RPO=0)
  • Replicación Asíncrona: Distribuida geográficamente

Tecnologías y Soluciones

On-Premises

  • Veeam Backup & Replication: Líder para entornos virtualizados
  • Commvault, Veritas NetBackup: Enterprise backup platforms
  • Acronis Cyber Protect: Backup + antimalware integrado
  • Dell EMC Data Domain: Deduplicated backup appliances

Cloud-Based

  • AWS Backup: Backup centralizado para servicios AWS
  • Azure Backup: Integrado con servicios de Azure
  • Google Cloud Backup: Backups automatizados de GCP
  • Druva, Backblaze B2: Cloud-native backup solutions

Bases de Datos

  • MySQL/PostgreSQL: pg_dump, mysqldump + point-in-time recovery
  • MongoDB: mongodump, Ops Manager backup
  • SQL Server: Native backup + Always On Availability Groups
  • Oracle RMAN: Recovery Manager para entornos Oracle

Protección contra Ransomware

Backups a prueba de ransomware:

  • Inmutabilidad: Object lock (S3), WORM storage, immutable backups
  • Air-gapping: Backups offline desconectados de la red
  • Separación de Credenciales: Backup admins ≠ domain admins
  • MFA: Autenticación multifactor para el acceso a los backups
  • Versionado: Múltiples versiones para recovery pre-infección
  • Scanning: Antimalware en los backups antes de la restauración
  • Alertas: Detección de modificaciones masivas (posible cifrado)

Disaster Recovery Planning

  • DR Site: Datacenter secundario o región cloud
  • Failover Automation: Scripts u orquestación automática
  • Runbooks: Documentación paso a paso del recovery
  • Priorización: Orden de recovery basado en la criticidad
  • Dependencias: Mapa de interdependencias entre sistemas
  • Network Configuration: DNS, VPN, firewall rules para DR
  • Communication Plan: Stakeholders, clientes, equipo

Pruebas de Recuperación

Tipos de pruebas (realizar como mínimo anualmente):

  • Tabletop Exercise: Discusión teórica del plan sin ejecución
  • Restore Testing: Restauración de samples en un entorno aislado
  • Partial Failover: Failover de sistemas no críticos
  • Full DR Test: Failover completo (normalmente en una maintenance window)
  • Chaos Engineering: Fallos inyectados intencionadamente

Importante: Un backup no probado no es un backup. Los fallos se descubren en el momento de la necesidad si no hay pruebas periódicas.

Mejores Prácticas

  • [OK] Implementar la regla 3-2-1-1-0
  • [OK] Definir RTO/RPO claros por sistema
  • [OK] Backups inmutables para protección contra ransomware
  • [OK] Pruebas trimestrales de restauración
  • [OK] Monitorización y alertas de fallos de backup
  • [OK] Cifrado de backups (at rest e in transit)
  • [OK] Documentación actualizada de runbooks
  • [OK] Separación de privilegios (backup admin ≠ domain admin)
  • [OK] Retención conforme a compliance (LGPD, SOX, etc.)
  • [OK] DR site distribuido geográficamente