Blink Health

Senior Cloud Resilience Architect

Blink Health
Apply
3 months ago
Delhi, IndiaSenior

Responsibilities

  • Evaluate and mature disaster recovery posture, including recovery objectives, dependency mapping, and failure domain analysis.
  • Define and establish disaster recovery standards and best practices across cloud infrastructure, platforms, and application architectures.
  • Design and implement resilient, fault-tolerant systems progressing toward multi-region and active-active architectures.
  • Lead the disaster recovery roadmap while balancing technical feasibility, cost, risk, and business priorities.
  • Design reference architectures for pilot-light, warm standby, hot standby, and active-active recovery patterns.
  • Drive active-active disaster recovery adoption, including traffic management, data replication, consistency models, and automated failover.
  • Define and operationalize DR testing strategies, including game days, chaos testing, and recovery exercises.
  • Establish documentation, runbooks, and escalation paths for reliable recovery operations.
  • Evaluate and recommend platform upgrades, cloud services, and tooling that improve resilience and recovery speed.
  • Serve as a technical authority and advisor on disaster recovery and resilience.
  • Provide architectural guidance, design reviews, and mentorship to engineers implementing DR changes.
  • Partner with security and compliance teams to meet regulatory, audit, and data protection requirements.
  • Automate recovery workflows, failover testing, and environment provisioning to reduce manual recovery steps and time to recovery.

Requirements

  • Bachelor’s or Master’s degree in Computer Science or equivalent practical experience.
  • 8+ years of experience in cloud infrastructure, platform engineering, SRE, or reliability-focused architecture roles.
  • Deep understanding of disaster recovery concepts including RTO/RPO, blast radius reduction, failure domains, and dependency isolation.
  • Proven experience designing and implementing multi-region and multi-availability-zone architectures, including active-active or highly available systems.
  • Strong understanding of data replication strategies, consistency tradeoffs, and recovery patterns for databases and stateful systems.
  • Extensive experience with major cloud providers; AWS is preferred, with GCP or Azure acceptable.
  • Experience with Kubernetes-based platforms, regional failover, workload portability, and cluster recovery strategies.
  • Familiarity with global traffic management, DNS, load balancing, and service mesh patterns.
  • Experience designing and maintaining Infrastructure as Code using Terraform, Pulumi, CloudFormation, or Ansible.
  • Experience defining and running disaster recovery tests, game days, and failure simulations.
  • Strong documentation, communication, and cross-organizational influencing skills.

Categories

DevOpsSite Reliability
Contact me