20 days ago
Remote, BrazilMid Level
Responsibilities
- Construir e evoluir a observabilidade e o monitoramento de ambientes de produção, reduzindo ruído e falsos positivos e mantendo dashboards para decisões técnicas.
- Definir e instrumentar indicadores relacionados à experiência real de uso e criar métricas e regras de alerta.
- Automatizar provisionamento, configuração e rotinas operacionais usando Terraform, Helm, Python e Shell.
- Converter procedimentos não documentados em runbooks executáveis e reduzir trabalho manual repetitivo.
- Realizar triagem, mitigação e resolução de incidentes de produção, além de apoiar post-mortems com foco em causa raiz e prevenção.
- Sustentar os ambientes com o time de engenharia e acompanhar consumo e custos de infraestrutura.
Requirements
- Experiência prática operando Kubernetes em produção, incluindo debug de pods, análise de consumo de recursos e investigação de modos de falha em ambientes cloud, preferencialmente AWS.
- Experiência escrevendo e mantendo infraestrutura como código com Terraform e Helm, incluindo revisão de mudanças de outras pessoas.
- Experiência construindo monitoramento com Prometheus e Grafana, incluindo criação de métricas e regras de alerta.
- Autonomia em troubleshooting de Linux envolvendo serviços, processos, rede, disco e análise de logs.
- Experiência desenvolvendo automações em Python ou Shell utilizadas por outras pessoas.
- Participação em respostas a incidentes de produção, sabendo quando resolver e quando escalar.
- Conhecimento de redes para investigar segmentação, DNS, TLS, VPN e problemas com ferramentas de debug.
- Experiência em ambiente regulado, como financeiro ou seguros, é diferencial.
- Vivência com APIs, REST e gateway de API é diferencial.
- Experiência com gerenciamento de logs em escala usando Elasticsearch, OpenSearch, Loki ou equivalente é diferencial.
- Experiência com construção e manutenção de pipelines de CI/CD é diferencial.
- Prática de definição de SLI e SLO e uso de error budget para orientar decisões é diferencial.
- Experiência com configuração como código, como Ansible ou equivalente, é diferencial.
- Inglês para leitura de documentação técnica é diferencial.
Benefits
- Vale-refeição ou vale-alimentação pelo cartão Flash, plano de saúde, plano odontológico, seguro de vida, PPR, TotalPass e auxílio-creche.
- Programa Well-Being para saúde física e mental e Universidade Corporativa com trilhas de desenvolvimento.
- Parcerias culturais e educacionais com descontos especiais.
- Licenças-maternidade e paternidade estendidas por meio do programa Empresa Cidadã.
- Modelo de trabalho 100% remoto e flexível, conforme a proposta #WorkWhereYouBelong.
- A oportunidade também está aberta a pessoas com deficiência.
Tech Stack
Categories
DevOpsSite Reliability