Site Reliability Expert
2 дн. назад
CanadaWorldwideSeniorC1
site reliability engineeringobservabilitycloud-nativeautomation
Experienced Site Reliability Engineer to lead observability, reliability, and operational excellence initiatives in complex cloud-native environments.
Другое
- À , vous trouverez un environnement propice à l’apprentissage continu, à l’impact concret et à la croissance professionnelle. Que vous développiez de nouvelles solutions digitales, remettiez en question les idées reçues ou construisiez la prochaine génération d’expériences client, votre travail contribuera à transformer les secteurs d'activité.
- Nous sommes fiers de:
- Notre travail et l'innovation que nous encourageons
- Nos valeurs : « share, dare, care »
- Une culture d'entreprise qui favorise la créativité , la diversité et l'autonomie
- Notre structure mondiale sans frontières , qui permet une collaboration fluide
- La maîtrise de l'anglais est requise, car le rôle implique des communications régulières avec des clients et des collègues situés à l'extérieur du Québec.
- Définir et mettre en œuvre la stratégie d'observabilité ainsi que les standards et modèles de gouvernance associés.
- Concevoir, déployer et maintenir les solutions de surveillance, d'alerte et de visualisation à l'aide de Dynatrace ou d'outils équivalents.
- Mettre en place et promouvoir les meilleures pratiques SRE, notamment les SLI , SLO , Error Budgets et les mécanismes d'alerte basés sur les symptômes.
- Collaborer avec les équipes de développement et de produit afin d'améliorer la fiabilité, la performance et la résilience des systèmes.
- Définir les standards liés au tagging, à la gouvernance, à l'attribution des responsabilités, aux tableaux de bord et à la gestion des alertes.
- Accompagner et former les équipes n'ayant pas d'expertise spécifique en observabilité.
- Piloter des chantiers techniques, gérer les priorités et assurer la livraison des travaux dans les délais et budgets définis.
- Analyser et résoudre des incidents complexes dans des architectures distribuées basées sur des microservices.
- Promouvoir une culture d'amélioration continue, de documentation et d'excellence opérationnelle.
- Collaborer efficacement avec des équipes distribuées dans un contexte international.
- Expérience significative en Site Reliability Engineering (SRE) dans des environnements de production complexes.
- Solide maîtrise des concepts suivants : Service Level Indicators (SLI)
- Service Level Objectives (SLO)
- Error Budgets
- Alerting basé sur les symptômes
- Expertise démontrée avec une plateforme d'observabilité telle que : Dynatrace
- Datadog
- New Relic
- AppDynamics
- Expérience pratique avec : Application Performance Monitoring (APM)
- Real User Monitoring (RUM)
- Instrumentation et agents de monitoring
- Gestion des alertes
- Contrôle d'accès basé sur les rôles (RBAC)
- Gestion des SLO
- Gouvernance et standards de tagging
- Bonne connaissance d' OpenTelemetry (OTEL) et du traçage distribué.
- Expérience dans des architectures composables basées sur des microservices.
- Expérience pratique en environnement de production avec : AWS
- Kubernetes
- Expérience en automatisation d'infrastructure et d'opérations.
- Maîtrise de : Terraform
- Bash
- Python
- Expérience avec GitLab CI ou tout autre outil de gestion de pipelines et workflows CI/CD.
- Capacité démontrée à diriger un chantier technique de bout en bout.
- Expérience dans des environnements opérationnels et Agile complexes.
- Excellentes compétences en communication en français et en anglais , à l'oral comme à l'écrit.
- Forte capacité de transmission des connaissances et d'accompagnement des équipes.
- Rigueur, autonomie et sens élevé de la documentation.
- Excellentes compétences en organisation, collaboration et gestion des priorités.
- Expérience dans la surveillance et l'exploitation d'applications Java Spring Boot .
- Expérience au sein d'une plateforme ou d'un environnement e-commerce .
- Expérience dans la définition et le déploiement de standards d'observabilité à l'échelle de l'entreprise.
- Expérience de consultation ou d'accompagnement de multiples équipes de développement.
- Si vous ne possédez pas toutes les qualifications mentionnées ou si vous avez des lacunes dans votre parcours, nous vous encourageons à postuler. À , nous reconnaissons la richesse des talents et valorisons la pluralité des perspectives ainsi que la soif d’apprendre.
-
- Nous concevons des expériences qui conviennent à toutes les personnes — et cela commence par nos équipes. À , nous avons à cœur de bâtir une culture inclusive où chaque individu se sent soutenu pour grandir, s'épanouir et atteindre ses objectifs. Quel que soit votre parcours, vous avez votre place. Explorez notre site Diversité et Inclusion pour en savoir plus sur nos actions en faveur d’un plus équitable.
-
- Il s’agit d’un poste en Temps Plain basé à Quebec, Montreal . La fourchette salariale proposée est de 100,000 CAD - 150,000 CAD bruts par an, selon l’expérience et la localisation.
- offre un programme d’avantages sociaux complet, en vigueur après trois mois de service continu :
- Un régime d’assurance complet , avec la possibilité de choisir le module qui répond le mieux à vos besoins — Or, Argent ou Bronze. Selon le module sélectionné, l’employeur peut contribuer jusqu’à 80 % de votre couverture. Ce régime comprend des assurances invalidité de courte et de longue durée .
- Dialogue via Sun Life vous donne accès à des services de soins de santé virtuels, vous permettant de consulter un professionnel de la santé pour des urgences, des renouvellements d’ordonnance, et plus encore. Vous avez également accès au Programme d’aide aux employés et à leur famill e, ainsi qu’à un programme complet de soutien en santé mentale.