🎁 Antes de se candidatar, treine esta entrevista. Crie sua conta grátis no WorkMundi e ganhe um Treinamento de Entrevista no HelpsYouSpeak — sem custo, sem cartão. Quero meu treinamento →
A Mazzatech busca um Engenheiro de Infraestrutura Sênior com sólida experiência em AWS e Kubernetes para atuar na administração e evolução de ambientes de desenvolvimento, homologação e produção. O profissional será responsável por manter e otimizar recursos de computação, rede, armazenamento, banco de dados, cache, filas e segurança, além de liderar tecnicamente a implementação e evolução do Kubernetes. Responsabilidades Administrar ambientes de desenvolvimento, homologação e produção na AWS. Manter e evoluir recursos de computação, rede, armazenamento, banco de dados, cache, filas e segurança. Avaliar arquiteturas existentes e propor melhorias de disponibilidade, escalabilidade, segurança e custo. Identificar recursos ociosos, superdimensionados, mal configurados ou sem monitoramento. Planejar mudanças de infraestrutura com análise de impacto e estratégia de rollback. Garantir a padronização dos ambientes. Apoiar a criação e evolução de arquiteturas para novas aplicações e microsserviços. Documentar topologias, dependências, configurações e procedimentos operacionais. Atuar na sustentação de ambientes críticos e na resolução de incidentes. Liderar tecnicamente a implementação e evolução do Kubernetes. Participar do desenho, implantação e operação de clusters Amazon EKS. Planejar a migração gradual de aplicações executadas em ECS e Fargate para Kubernetes. Definir padrões para deployments, services, ingress, secrets, config maps, jobs e cron jobs. Criar e revisar manifestos Kubernetes e charts Helm. Definir padrões de namespaces, permissões, isolamento e organização dos clusters. Configurar requests, limits, autoscaling, readiness probes e liveness probes. Definir estratégias de rolling update, rollback, blue-green e canary deployment. Investigar pods com falhas, reinícios, problemas de memória, CPU, rede, DNS ou dependências. Gerenciar imagens Docker e repositórios no Amazon ECR. Revisar Dockerfiles quanto a segurança, tamanho, desempenho e boas práticas. Apoiar desenvolvedores na adequação de aplicações para execução em containers. Administrar VPCs, subnets públicas e privadas, tabelas de rotas, gateways e NAT Gateways. Criar e revisar Security Groups e Network ACLs. Configurar conectividade segura entre aplicações, bancos, caches e serviços internos. Implementar restrições e liberações de acesso por IP. Administrar acessos por VPN e redes privadas. Apoiar integrações que exijam IP fixo de saída ou inclusão em listas de IP permitidos. Diagnosticar problemas de rede, DNS, rotas, portas, latência e resolução de nomes. Administrar Route 53, certificados digitais e AWS Certificate Manager. Configurar e revisar Application Load Balancers e Network Load Balancers. Garantir que bancos de dados, caches e serviços internos não sejam expostos desnecessariamente à internet. Avaliar conectividade entre regiões, contas e redes externas. Aplicar o princípio do menor privilégio em usuários, grupos, roles e policies do IAM. Revisar acessos humanos, acessos de aplicações e permissões concedidas a pipelines. Estruturar e revisar políticas de acesso aos ambientes de produção. Gerenciar segredos por meio do AWS Secrets Manager. Administrar chaves e criptografia utilizando AWS KMS. Garantir criptografia de dados em trânsito e em repouso. Configurar e revisar regras no AWS WAF. Analisar trilhas de auditoria no AWS CloudTrail. Identificar recursos públicos, portas abertas e configurações inseguras. Apoiar a rotação de credenciais, chaves, tokens e certificados. Participar da investigação de incidentes de segurança. Implementar controles para evitar alterações manuais não rastreadas. Apoiar requisitos relacionados à LGPD, governança e proteção de dados. Manter sistemas operacionais, imagens e componentes de infraestrutura atualizados. Criar e manter infraestrutura utilizando Terraform ou CloudFormation. Priorizar o Terraform como ferramenta de padronização e evolução do ambiente. Estruturar módulos reutilizáveis. Organizar estados, ambientes e variáveis de forma segura. Implementar validações, revisões e planos antes da aplicação de mudanças. Evitar criação manual de recursos sem rastreabilidade. Manter a infraestrutura versionada em Git. Criar padrões para desenvolvimento, homologação e produção. Documentar procedimentos de execução, rollback e recuperação do estado. Apoiar a implementação de políticas e controles automatizados sobre a infraestrutura. Configurar e evoluir o Amazon CloudWatch. Criar dashboards técnicos e operacionais. Configurar métricas, logs, alarms e filters. Centralizar logs de aplicações, containers, load balancers e serviços AWS. Criar alertas para indisponibilidade, erros, latência e saturação. Monitorar CPU, memória, storage, rede, conexões, filas e health checks. Definir retenção adequada de logs, equilibrando necessidade operacional e custo. Criar alertas que sejam acionáveis e possuam responsáveis definidos. Apoiar a definição de indicadores de disponibilidade e desempenho. Investigar aumentos inesperados no volume de logs ou nos custos de observabilidade. Desenvolver runbooks para resposta a alertas e incidentes recorrentes. Avaliar a adoção de Prometheus, Grafana e OpenTelemetry quando necessário. Analisar continuamente os custos da infraestrutura. Identificar anomalias de consumo e aumentos inesperados. Avaliar custos de EC2, ECS, EKS, RDS, ElastiCache, Load Balancers, VPC, CloudWatch e Data Transfer. Realizar rightsizing de instâncias, bancos e containers. Analisar a adoção de Savings Plans e Reserved Instances. Revisar custos de NAT Gateway, transferência de dados e tráfego entre regiões. Revisar retenção de logs, snapshots, volumes, imagens e arquivos. Criar rotinas de desligamento de ambientes não produtivos quando aplicável. Identificar recursos sem utilização ou sem proprietário definido. Criar dashboards, alertas e relatórios de custos. Avaliar o impacto financeiro antes da implantação de novas arquiteturas. Recomendar ações de redução de custos sem comprometer disponibilidade, segurança ou desempenho. Apoiar a criação de uma cultura de FinOps. Monitorar ambientes Amazon RDS. Analisar CPU, memória, storage, IOPS, conexões e latência. Apoiar o dimensionamento de instâncias MySQL e PostgreSQL. Analisar gargalos de infraestrutura que afetem o banco de dados. Apoiar configurações de backup, snapshots, read replicas e failover. Participar de testes de restore. Monitorar e administrar Amazon ElastiCache e Redis. Investigar consumo de memória, conexões, eviction e indisponibilidade do cache. Apoiar a análise de queries lentas e excesso de conexões em conjunto com desenvolvimento e DBA. Planejar manutenções e mudanças com menor impacto para as aplicações. Participar da definição de RTO e RPO para bancos e caches. Criar e manter pipelines utilizando AWS CodePipeline e CodeBuild. Automatizar build, criação de imagens, publicação no ECR e deploy. Integrar pipelines com ECS, EKS e infraestrutura como código. Criar processos seguros de promoção entre desenvolvimento, homologação e produção. Implementar validações antes de alterações de infraestrutura. Criar scripts em Python ou Bash para automação de atividades operacionais. Utilizar Python e boto3 para inventário, monitoramento, segurança, custos e rotinas administrativas. Reduzir tarefas manuais e repetitivas. Apoiar a implementação de estratégias de rollback. Garantir rastreabilidade das mudanças executadas. Definir e revisar políticas de backup. Garantir que recursos críticos estejam incluídos nas rotinas de backup. Realizar testes periódicos de restauração. Documentar procedimentos de recuperação. Apoiar a definição de RTO e RPO por sistema. Avaliar a necessidade de redundância entre zonas e regiões. Planejar a recuperação de aplicações, bancos, arquivos, configurações e segredos. Criar runbooks de disaster recovery. Participar de simulações de falha e indisponibilidade. Identificar pontos únicos de falha e propor correções. Atuar diretamente na investigação de incidentes de infraestrutura. Identificar rapidamente se a origem está em rede, container, cluster, banco, cache, pipeline ou serviço AWS. Participar de salas de crise quando necessário. Comunicar impacto, diagnóstico e ações de maneira objetiva. Executar correções emergenciais com controle de risco. Registrar as mudanças realizadas durante o incidente. Conduzir ou participar de análises de causa raiz. Criar ações preventivas para evitar recorrência. Apoiar equipes de desenvolvimento durante incidentes relacionados às aplicações. Criar automações e documentação para problemas recorrentes.