24 hours ago
Remote, BrazilMid Level
Responsibilities
- Projetar, operar e manter plataformas cloud-native altamente disponíveis, escaláveis e seguras na AWS.
- Construir e manter infraestrutura baseada em Kubernetes para aplicações, dados e workloads de IA.
- Automatizar operações por meio de Infraestrutura como Código, recursos de self-service e pipelines de CI/CD.
- Implementar observabilidade com Datadog, incluindo monitoramento, logs, tracing, alertas, dashboards e gestão de SLOs.
- Suportar e otimizar plataformas de processamento de dados utilizando Airflow, Amazon EMR, Spark, S3 e serviços de dados da AWS.
- Apoiar plataformas de Machine Learning e Inteligência Artificial, melhorando confiabilidade, escalabilidade e maturidade operacional.
- Liderar resposta a incidentes, análises de causa raiz e revisões pós-incidente.
- Definir e medir SLIs, SLOs e error budgets.
- Otimizar utilização, desempenho e custos da infraestrutura em nuvem.
- Mentorar membros da equipe e promover boas práticas de SRE na organização de engenharia.
Requirements
- Ensino superior cursando ou completo.
- Experiência sólida em Site Reliability Engineering, Platform Engineering, Cloud Engineering ou funções de DevOps.
- Forte experiência prática com serviços AWS e arquiteturas cloud-native.
- Conhecimento profundo de Kubernetes e workloads conteinerizadas em produção.
- Experiência com sistemas distribuídos de grande escala e resolução de problemas.
- Experiência com plataformas de observabilidade, preferencialmente Datadog.
- Experiência com plataformas e fluxos de dados utilizando Airflow, EMR, Spark e S3.
- Expertise em Infraestrutura como Código utilizando Terraform ou ferramentas similares.
- Experiência na construção e manutenção de pipelines de CI/CD e automação de plataformas.
- Conhecimentos sólidos de Linux, redes e troubleshooting de desempenho de sistemas.
- Proficiência em scripts e automação usando Python, Bash ou linguagens similares.
- Experiência com operações de plataformas Kubernetes e gerenciamento do ciclo de vida de clusters.
- Conhecimento de SLOs, SLIs, error budgets e práticas de excelência operacional.
- Experiência com Datadog, Prometheus, Grafana, OpenTelemetry ou tecnologias similares.
- Certificações AWS, Kubernetes, Terraform ou Datadog são desejáveis.
- Experiência em ambientes corporativos de grande escala, altamente disponíveis ou de missão crítica é desejável.
- Inglês técnico intermediário.
Tech Stack
Categories
Site Reliability
About Experian
Experian builds credit reporting, identity and fraud prevention, and data analytics software that help lenders, insurers, healthcare providers, and marketers make decisions; it also offers consumer credit monitoring and scores. The company earns via data licensing, decisioning software, and subscription services, operates in 30+ countries, is headquartered in Costa Mesa, California, and is a FTSE 100 public company listed on the London Stock Exchange (EXPN); it is one of the three major U.S. credit bureaus.
