Компания не указана
Senior DevOps Observability Engineer
4 дн. назад
SeniorHybrid
kubernetesobservabilityvictoriametricsgrafanalokitempomimirelk
Ищем Senior DevOps Observability Engineer в международную продуктовую компанию из сферы iGaming.
О компании
- международная продуктовая компания из сферы iGaming
Обязанности
- обеспечивать надежную работу приложений в Kubernetes в production
- диагностировать инциденты и проблемы в Kubernetes-кластерах и распределенных системах
- развивать Observability-платформу для metrics, logs и traces
- работать с VictoriaMetrics, Grafana, Loki, Tempo, Mimir, ELK, OpenTelemetry и другими инструментами observability
- развивать мониторинг, алертинг и дашборды с учетом архитектуры сервисов
- поддерживать и развивать Observability-стратегию, стандартизировать подходы для инженерных команд
- участвовать в полном цикле работы с production-инцидентами - от OnCall и восстановления сервисов до RCA/Post-Mortem
- внедрять reliability improvements по итогам инцидентов и снижать вероятность их повторения
- взаимодействовать с development/backend и другими инженерными командами
Требования
- от 3 лет опыта в роли DevOps Engineer
- сильный недавний практический опыт Kubernetes в production
- опыт troubleshooting и устранения инцидентов в Kubernetes-кластерах
- опыт самостоятельной разработки и поддержки Helm charts - шаблонизация, функции, собственные charts разного уровня сложности
- практический опыт построения и развития monitoring/observability
- опыт с Grafana, VictoriaMetrics/Prometheus, Loki, ELK, OpenTelemetry или сопоставимым стеком
- опыт работы с production-инцидентами, RCA/Post-Mortem и последующими reliability improvements
- опыт CI/CD и GitOps - GitLab CI/CD, Argo CD или сопоставимые инструменты
- уверенная работа с Git
- опыт с Docker и инструментами сборки контейнеров
- умение самостоятельно разбираться в сложных проблемах production-систем и находить root cause
- опыт взаимодействия с кросс-функциональными инженерными командами
Будет плюсом
- опыт OnCall и работы с PagerDuty
- опыт с Sentry, Vector, Tempo, Mimir
- опыт с AWS/CloudWatch
- Terraform/Ansible и другой Infrastructure as Code
- опыт работы с SLA/SLO и reliability engineering
Условия
- работу с масштабной production-инфраструктурой и современным observability-стеком
- задачи, в которых можно влиять на подходы к observability и reliability, а не только поддерживать существующие решения
- международную продуктовую компанию и сильную инженерную команду, которая давно работает вместе
- офисный формат 5/2 (также возможен гибрид)
- 8-часовой рабочий день + 30 минут на обед
- гибкое начало рабочего дня с 8:00 до 10:00
- завтраки и обеды в офисе за счет компании
- внутреннее и внешнее обучение
- компенсацию занятий спортом
- программы по изучению английского и греческого языков
- регулярные корпоративные мероприятия для сотрудников и их детей