Backup y Disaster Recovery (BCP/DRP)
Fundamentos de Backup y Recovery
El backup y el disaster recovery son componentes críticos de cualquier estrategia de ciberseguridad. Con el aumento de los ataques de ransomware y los desastres (naturales o tecnológicos), contar con planes sólidos de BCP (Business Continuity Planning) y DRP (Disaster Recovery Planning) es esencial.
RTO y RPO: Conceptos Fundamentales
RTO (Recovery Time Objective)
Definición: Tiempo máximo aceptable de indisponibilidad tras un desastre
Ejemplo: Un RTO de 4 horas significa que los sistemas deben estar restaurados en un plazo de 4h
Impacto: Define la urgencia y la inversión necesaria en soluciones
RPO (Recovery Point Objective)
Definición: Cantidad máxima de datos que se puede perder, medida en tiempo
Ejemplo: Un RPO de 1 hora significa que los backups deben realizarse cada hora
Impacto: Define la frecuencia de los backups y las tecnologías de replicación
Nivel de Criticidad:
- Tier 1 (Crítico): RTO < 1h, RPO < 15min - Replicación síncrona
- Tier 2 (Importante): RTO 4-8h, RPO 1h - Backup incremental frecuente
- Tier 3 (Normal): RTO 24h, RPO 24h - Backup diario
Regla 3-2-1 de Backup
Estrategia de oro para la protección de datos:
- 3 Tres copias de los datos: producción + 2 backups
- 2 Dos tipos de medios diferentes: disco, cinta, cloud
- 1 Una copia off-site: separada geográficamente
Evolución moderna: 3-2-1-1-0
+ 1 copia inmutable (a prueba de ransomware)
+ 0 errores en la restauración (pruebas periódicas)
Tipos de Backup
1. Backup Completo (Full)
- Ventaja: Restauración simple y rápida
- Desventaja: Lento, consume mucho espacio
- Uso: Semanal o mensual como baseline
2. Backup Incremental
- Ventaja: Rápido, ahorra espacio
- Desventaja: La restauración requiere el full + todos los incrementales
- Uso: Diario u horario entre fulls
3. Backup Diferencial
- Ventaja: Restauración más simple que el incremental
- Desventaja: Crece hasta el siguiente full
- Uso: Diario cuando la simplicidad del restore es crítica
4. Snapshot y Replicación
- Snapshots: Copias point-in-time, restauración instantánea
- Replicación Síncrona: Cero pérdida de datos (RPO=0)
- Replicación Asíncrona: Distribuida geográficamente
Tecnologías y Soluciones
On-Premises
- Veeam Backup & Replication: Líder para entornos virtualizados
- Commvault, Veritas NetBackup: Enterprise backup platforms
- Acronis Cyber Protect: Backup + antimalware integrado
- Dell EMC Data Domain: Deduplicated backup appliances
Cloud-Based
- AWS Backup: Backup centralizado para servicios AWS
- Azure Backup: Integrado con servicios de Azure
- Google Cloud Backup: Backups automatizados de GCP
- Druva, Backblaze B2: Cloud-native backup solutions
Bases de Datos
- MySQL/PostgreSQL: pg_dump, mysqldump + point-in-time recovery
- MongoDB: mongodump, Ops Manager backup
- SQL Server: Native backup + Always On Availability Groups
- Oracle RMAN: Recovery Manager para entornos Oracle
Protección contra Ransomware
Backups a prueba de ransomware:
- Inmutabilidad: Object lock (S3), WORM storage, immutable backups
- Air-gapping: Backups offline desconectados de la red
- Separación de Credenciales: Backup admins ≠ domain admins
- MFA: Autenticación multifactor para el acceso a los backups
- Versionado: Múltiples versiones para recovery pre-infección
- Scanning: Antimalware en los backups antes de la restauración
- Alertas: Detección de modificaciones masivas (posible cifrado)
Disaster Recovery Planning
- DR Site: Datacenter secundario o región cloud
- Failover Automation: Scripts u orquestación automática
- Runbooks: Documentación paso a paso del recovery
- Priorización: Orden de recovery basado en la criticidad
- Dependencias: Mapa de interdependencias entre sistemas
- Network Configuration: DNS, VPN, firewall rules para DR
- Communication Plan: Stakeholders, clientes, equipo
Pruebas de Recuperación
Tipos de pruebas (realizar como mínimo anualmente):
- Tabletop Exercise: Discusión teórica del plan sin ejecución
- Restore Testing: Restauración de samples en un entorno aislado
- Partial Failover: Failover de sistemas no críticos
- Full DR Test: Failover completo (normalmente en una maintenance window)
- Chaos Engineering: Fallos inyectados intencionadamente
Importante: Un backup no probado no es un backup. Los fallos se descubren en el momento de la necesidad si no hay pruebas periódicas.
Mejores Prácticas
- [OK] Implementar la regla 3-2-1-1-0
- [OK] Definir RTO/RPO claros por sistema
- [OK] Backups inmutables para protección contra ransomware
- [OK] Pruebas trimestrales de restauración
- [OK] Monitorización y alertas de fallos de backup
- [OK] Cifrado de backups (at rest e in transit)
- [OK] Documentación actualizada de runbooks
- [OK] Separación de privilegios (backup admin ≠ domain admin)
- [OK] Retención conforme a compliance (LGPD, SOX, etc.)
- [OK] DR site distribuido geográficamente
