
Senior AI Platform Operations Engineer
EQ Bank | Canada2 months ago
Toronto, CanadaSenior
Responsibilities
- Administer and operate AI platform services to maintain availability, performance, resilience, and production readiness.
- Monitor platform health through dashboards, logs, metrics, alerts, and traces, and coordinate incident triage, escalation, and service restoration.
- Lead post-incident reviews and track service reliability indicators, incident trends, and operational performance.
- Validate environment readiness, dependencies, operational checklists, service transitions, releases, changes, maintenance, and capacity planning.
- Implement observability and AIOps capabilities for alert correlation, anomaly detection, root-cause support, forecasting, and repetitive-task automation.
- Execute AI governance controls covering access, privacy, auditability, traceability, human oversight, security, risk, and compliance.
- Maintain audit evidence, operational documentation, production-readiness records, control validation materials, and support playbooks.
- Maintain visibility into AI assets, ownership, relationships, lifecycle status, monitoring, support, and cost attribution.
- Administer Microsoft Power Platform and Copilot Studio environments, including security roles, solution deployments, agent lifecycle management, monitoring, analytics, knowledge sources, and governance controls.
Requirements
- University degree in Computer Science, Engineering, Information Technology, or a related field, or equivalent practical experience.
- 5–7 years of experience in platform operations, site reliability engineering, DevOps, cloud operations, or enterprise IT operations.
- Strong production-platform experience with monitoring, incident response, problem management, service restoration, and operational reporting.
- Experience with Azure Automation runbooks using PowerShell or Python, Azure AI, Copilot integrations, AKS, hub-and-spoke virtual networks, and App Service.
- Experience with Azure Monitor, Application Insights, Grafana, Microsoft Power Platform, Copilot Studio, Microsoft 365 administration, RBAC, Entra ID, and tenant administration.
- Experience implementing security, compliance, and DLP policies using least-privilege access and operational governance practices.
- Knowledge of Bicep, Terraform, Azure Policy, Key Vault, API Management, Service Bus, Event Grid, Apache Kafka, Elastic, Azure AI Search, and Cosmos DB.
- Knowledge of enterprise networking and edge-security platforms such as DNA, Fortinet, and Akamai is an asset.
- Working knowledge of AI/ML operations, model lifecycle support, telemetry, governance controls, human-in-the-loop practices, production monitoring, and ITIL/ITSM processes.
- Strong troubleshooting, root-cause analysis, prioritization, documentation, collaboration, service orientation, and continuous-improvement skills.
Tech Stack
Categories
DevOpsSite Reliability