Davion Labs

高级运维 / SRE 工程师 Senior Cloud Infrastructure & SRE Engineer

Davion Labs
Apply
27 days ago
Remote, WorldwideSenior

Responsibilities

  • 负责 7×24 小时核心交易业务的生产稳定性,覆盖交易链路、行情服务和基础设施。
  • 参与重大生产故障的应急响应、问题定位、风险控制、服务恢复和故障复盘。
  • 建设和优化 AWS 及 EKS/Kubernetes 生产基础设施,包括云架构、网络、高可用、容量规划、容灾、集群升级、节点生命周期、调度、Ingress、负载均衡、DNS、存储和弹性伸缩。
  • 建设可观测性与生产稳定性体系,包括 Metrics、Logs、Tracing、Alerting、SLI/SLO、Incident Response 和 Postmortem。
  • 推动 Terraform/Terragrunt、GitHub Actions、Ansible 等 IaC、CI/CD 和自动化运维体系建设,完善变更、发布、验证和回滚机制。
  • 负责或协同维护 MySQL、Redis、Kafka 等核心数据及中间件服务,包括高可用、监控、容量规划、备份恢复、性能优化和故障处理。
  • 推动 AWS、Kubernetes 及生产环境的 IAM/RBAC、网络隔离、容器与镜像安全、Secrets/KMS、漏洞治理和安全审计。
  • 与研发及相关团队协作解决系统瓶颈、单点风险和长期架构稳定性问题。

Requirements

  • 计算机或相关专业统招本科及以上学历。
  • 5 年以上 DevOps、SRE、云基础设施或相关工作经验。
  • 具备中大型生产环境一线运维、变更管理、复杂故障处理、基础设施架构设计和落地经验。
  • 具备 Linux、网络和容器技术基础,以及生产级 Kubernetes/EKS 集群建设、升级、调优和复杂故障排查经验。
  • 了解 Java、Go 等应用运行环境和基本排障方法。
  • 具备 AWS 生产环境建设和运维经验,熟悉 IAM、VPC、EC2、EKS、ALB/NLB、Route 53、S3、CloudWatch 等服务。
  • 具备 Terraform/Terragrunt、GitHub Actions、Ansible 等 IaC、CI/CD 和自动化工具使用经验,并熟练使用 Bash、Python 等脚本语言。
  • 具备 Prometheus、Grafana、ELK/Loki、OpenTelemetry 等生产级可观测性和稳定性治理经验。
  • 熟悉 MySQL、Redis、Kafka 等服务的生产运维,并具备 AWS IAM、Kubernetes RBAC、网络安全、主机及容器安全、Secrets/KMS、漏洞治理或安全审计经验。
  • 具备 Web3/Crypto 生产环境运维经验,并理解区块链及链上业务基本运行机制。
  • 有数字资产交易所、证券、金融交易或支付等高可用实时系统经验者优先。
  • 有大规模 Kubernetes/EKS、AWS 多账号治理、跨 Region 容灾、灾备演练、云原生、云安全或成本治理经验者优先。

Tech Stack

AnsibleApache KafkaArgo CDAWSBashGitHub ActionsGoGrafanaJavaKubernetesLinuxMySQLPrometheusPythonRedisTerraform

Categories

DevOpsSite Reliability
Davion Labs

About Davion Labs

11-50 employees
Contact me