
Senior Cloud Resilience Architect
Blink Health3 months ago
Delhi, IndiaSenior
Responsibilities
- Evaluate and mature disaster recovery posture, including recovery objectives, dependency mapping, and failure domain analysis.
- Define and establish disaster recovery standards and best practices across cloud infrastructure, platforms, and application architectures.
- Design and implement resilient, fault-tolerant systems progressing toward multi-region and active-active architectures.
- Lead the disaster recovery roadmap while balancing technical feasibility, cost, risk, and business priorities.
- Design reference architectures for pilot-light, warm standby, hot standby, and active-active recovery patterns.
- Drive active-active disaster recovery adoption, including traffic management, data replication, consistency models, and automated failover.
- Define and operationalize DR testing strategies, including game days, chaos testing, and recovery exercises.
- Establish documentation, runbooks, and escalation paths for reliable recovery operations.
- Evaluate and recommend platform upgrades, cloud services, and tooling that improve resilience and recovery speed.
- Serve as a technical authority and advisor on disaster recovery and resilience.
- Provide architectural guidance, design reviews, and mentorship to engineers implementing DR changes.
- Partner with security and compliance teams to meet regulatory, audit, and data protection requirements.
- Automate recovery workflows, failover testing, and environment provisioning to reduce manual recovery steps and time to recovery.
Requirements
- Bachelor’s or Master’s degree in Computer Science or equivalent practical experience.
- 8+ years of experience in cloud infrastructure, platform engineering, SRE, or reliability-focused architecture roles.
- Deep understanding of disaster recovery concepts including RTO/RPO, blast radius reduction, failure domains, and dependency isolation.
- Proven experience designing and implementing multi-region and multi-availability-zone architectures, including active-active or highly available systems.
- Strong understanding of data replication strategies, consistency tradeoffs, and recovery patterns for databases and stateful systems.
- Extensive experience with major cloud providers; AWS is preferred, with GCP or Azure acceptable.
- Experience with Kubernetes-based platforms, regional failover, workload portability, and cluster recovery strategies.
- Familiarity with global traffic management, DNS, load balancing, and service mesh patterns.
- Experience designing and maintaining Infrastructure as Code using Terraform, Pulumi, CloudFormation, or Ansible.
- Experience defining and running disaster recovery tests, game days, and failure simulations.
- Strong documentation, communication, and cross-organizational influencing skills.
Tech Stack
Categories
DevOpsSite Reliability