🎁 Before you apply, rehearse this interview. Create your free WorkMundi account and get an Interview Training on HelpsYouSpeak — no cost, no card. I want my training →
Job Title: Resiliency & Continuity Specialist (Cloud Technology Resilience) Experience: 6+ Years Location: Hyderabad Employment Type: Full-Time About the Role We are looking for an experienced Resiliency & Continuity Specialist to join our Enterprise Technology Resilience team. In this role, you will serve as a subject matter expert responsible for planning, coordinating, governing, and validating cloud resilience exercises to ensure enterprise applications and platforms are recoverable, highly available, and compliant with organizational resilience standards. You will partner with Engineering, SRE, Infrastructure, Cloud, Risk, and Governance teams to ensure cloud-hosted systems are resilient through comprehensive System Recovery Plans (SRPs), Disaster Recovery (DR) testing, Chaos Engineering exercises, audit-ready documentation, and continuous improvement initiatives. The ideal candidate should have strong knowledge of cloud resilience, disaster recovery, operational resilience, cloud architecture, governance, and technology risk management in enterprise environments. Key Responsibilities Cloud Technology Resilience Lead and coordinate enterprise cloud resilience initiatives across critical applications and infrastructure.Plan, execute, and govern in-region and cross-region cloud resilience exercises.Validate that applications meet Recovery Time Objectives (RTO) and Recovery Point Objectives (RPO).Ensure cloud-hosted systems are resilient, recoverable, and aligned with enterprise resilience standards.Collaborate with Engineering, Infrastructure, Cloud Operations, and SRE teams to strengthen platform resilience.Resilience Exercise Planning & Execution Coordinate end-to-end resilience testing activities for cloud applications.Prepare resilience test plans, execution schedules, roles, dependencies, and success criteria.Validate readiness before resilience testing begins.Support execution of:Disaster Recovery (DR) TestingChaos Engineering ExercisesRegional Failover TestingCross-Region Recovery TestingBackup & Restore ValidationBusiness Continuity ExercisesEnsure testing is executed according to enterprise governance standards.System Recovery Plan (SRP) Governance Review and validate System Recovery Plans (SRPs) for completeness and operational readiness.Verify recovery procedures, ownership, sequencing, dependencies, and execution timelines.Ensure SRPs follow approved enterprise templates and governance standards.Identify gaps and drive remediation with application owners.Maintain version control and governance for recovery documentation.Evidence Validation & Audit Readiness Review resilience exercise evidence packages to ensure:End-to-end documentationTimestamped execution evidenceRecovery metricsPass/Fail criteriaRecovery durationValidation of business objectivesEnsure evidence aligns with enterprise audit requirements.Maintain audit-ready documentation supporting compliance and regulatory reviews.Identify missing artifacts and enforce quality standards.Operational Resilience & Disaster Recovery Support enterprise Disaster Recovery (DR) planning and execution.Validate backup and restore procedures.Assess application recoverability and business continuity readiness.Ensure recovery capabilities align with organizational resilience objectives.Support annual and quarterly resilience testing cycles.Chaos Engineering Support design and execution of Chaos Engineering scenarios.Validate resilience against:Infrastructure failuresNetwork failuresService outagesCloud region failuresDependency failuresCollaborate with engineering teams to improve system fault tolerance.Recommend improvements based on resilience testing outcomes.Cloud Architecture & Availability Evaluate cloud architectures to ensure high availability and resilience.Review application deployment models for resilience best practices.Validate:Multi-Availability Zone deploymentsCross-region replicationLoad balancingAuto ScalingInfrastructure as Code (IaC)Backup strategiesService dependenciesRecommend architectural improvements to reduce outage risks.Monitoring & Observability Support implementation of monitoring and observability standards.Review dashboards and monitoring configurations.Validate application health metrics and recovery indicators.Collaborate with SRE teams to improve operational visibility.Support incident analysis and post-incident reviews.Governance & Risk Management Ensure technology resilience activities comply with enterprise governance policies.Support technology risk assessments related to resilience.Collaborate with Governance, Risk, and Compliance (GRC) teams.Maintain resilience assessment workbooks and governance documentation.Track remediation activities until closure.Stakeholder Collaboration Partner with:Cloud Engineering TeamsSite Reliability Engineering (SRE)Infrastructure TeamsEnterprise ArchitectureRisk & ComplianceApplication Development TeamsBusiness Continuity TeamsSecurity TeamsProvide guidance on .