
Site Reliability Engineer
Capital Markets Gateway3 months ago
London, United KingdomMid Level
Responsibilities
- Design, implement, and maintain monitoring and observability solutions using Prometheus, Grafana Stack, Datadog, and OpenTelemetry.
- Define and implement SLOs, SLIs, and error budgets and develop dashboards, alerts, and reports.
- Design actionable alerting strategies, integrate alerting with Jira, and establish runbooks for on-call teams.
- Analyze performance metrics, identify bottlenecks, and support load testing and capacity planning.
- Develop automation and tooling for failover, configuration management, monitoring, and proactive issue resolution.
- Collaborate with software engineering, operations, infrastructure, and cross-functional teams to improve reliability and incident response.
- Promote SRE principles and practices across the company.
Requirements
- Proven experience as a Site Reliability Engineer or in a similar role.
- Proficiency with logging, metrics, and tracing frameworks including Datadog, Loki, Prometheus, and OpenTelemetry.
- Experience with cloud platforms, preferably Azure, and infrastructure-as-code tools such as Terraform.
- Strong programming and scripting skills in Python and Bash.
- Proficiency with Docker, Kubernetes, Linux-based systems, networking, and security principles for containerized applications.
- Strong troubleshooting and problem-solving skills, along with effective communication and collaboration abilities.
- Experience with PostgreSQL monitoring and optimization is optional or nice to have.
Benefits
- Equity.
- Unlimited PTO, with 28 days including bank holidays plus unlimited additional paid leave.
- Comprehensive benefits, premium life and income protection, private medical and dental insurance, and an Employee Assistance Program.
- Pension contributions.
- Hybrid work environment, initially remote until the office setup is complete.
- Education reimbursement and continuous learning opportunities.
- Employee referral bonus and parental leave.
Tech Stack
AzureBashDatadogDockerElasticsearchGrafanaGraphQLHarnessIstioKubernetesLinux.NETPostgreSQLPrometheusPythonReactRedisTerraformTypeScript
Categories
DevOpsSite Reliability