4 months ago
Remote, BrazilSenior
Responsibilities
- Atuar junto a áreas de produto críticas, compreendendo seus riscos, dores e arquiteturas e realizando entregas de alto impacto.
- Implementar práticas de SRE, incluindo definição de SLOs, estruturação de on-call, runbooks, gestão de incidentes e post-mortems.
- Criar e evoluir matrizes de maturidade de SRE para as áreas de produto.
- Identificar e eliminar proativamente pontos únicos de falha, serviços sem dono, alertas ruidosos e outros riscos operacionais.
- Promover a adoção de Golden Paths, canary deployments, feature flags, dashboards automatizados e outros recursos da Agentic Engineering Platform.
- Desenvolver soluções de monitoramento, observabilidade e alertas integradas à plataforma de engenharia.
- Apoiar a definição e o acompanhamento de SLIs, SLOs e error budgets.
- Colaborar com a Engineering Platform e contribuir para sua evolução com feedback dos times de produto.
- Gerar insights sobre disponibilidade, latência, toil e uso de infraestrutura para orientar decisões.
- Apoiar migrações de sistemas críticos, segregação de ambientes e deprecation de tecnologias legadas.
Requirements
- Experiência com ambientes em nuvem, preferencialmente GCP.
- Proficiência em Prometheus, Grafana, Loki, Thanos, Elasticsearch, AlertManager ou ferramentas semelhantes de observabilidade.
- Sólido conhecimento de Kubernetes e arquitetura distribuída.
- Sólido conhecimento de infraestrutura como código e Terraform.
- Experiência prática com gestão de incidentes, on-call e post-mortems.
- Experiência com definição e acompanhamento de SLOs e error budgets.
- Capacidade de analisar logs e desempenho de sistemas distribuídos.
- Forte comunicação e influência para vender soluções técnicas a engenheiros, PMs e lideranças.
- Visão orientada a dados para mapear riscos, priorizar ações e demonstrar impacto.
- Experiência em ambientes multi-cloud ou de grande volume de acesso é diferencial.
- Experiência em desenvolvimento de software, SRE embedded em times de produto e projetos de observabilidade, redução de toil ou automação de operações é diferencial.
- Familiaridade com plataformas de engenharia, Internal Developer Platforms, Golden Paths e Developer Experience é diferencial.
- Experiência com incident.io ou Grafana IRM é diferencial.
Benefits
- Modelo de trabalho totalmente remoto, com liberdade para escolher onde viver sem perder a vaga.
- Vaga afirmativa destinada a pessoas com deficiência (PCDs), com ambiente acessível, respeitoso e oportunidades de desenvolvimento.
Tech Stack
Categories
DevOpsSite Reliability
