Компания не указана
Senior/Senior+/Lead
1 мес. назад
USASeniorRemote
linuxubuntuproxmox vehaproxyopenrestynginxkeepalivedvrrp
Основная задача - разобраться в причинах текущих сбоев, устранить единичные точки отказа и построить предсказуемую, наблюдаемую и отказоустойчивую инфраструктуру. Работа по часовому поясу Нью-Йорк, США.
Обязанности
- Провести аудит текущей production-инфраструктуры и сетевой архитектуры.
- Проанализировать причины существующих сбоев и найти узкие места.
- Выявить и устранить единичные точки отказа.
- Разработать и реализовать план повышения доступности инфраструктуры.
- Администрировать и развивать инфраструктуру на базе Proxmox VE: кластеры, quorum и Corosync; Proxmox HA;
- Настраивать floating IP/VIP и автоматическое переключение между узлами.
- Регулярно тестировать сценарии failover и восстановления после сбоев.
- Настраивать и сопровождать сетевую инфраструктуру, маршрутизацию, NAT и firewall.
- Развивать мониторинг, централизованное логирование и систему оповещений.
- Участвовать в устранении production-инцидентов, проводить RCA и предотвращать повторные сбои.
- Автоматизировать инфраструктурные и эксплуатационные задачи.
- Создавать и поддерживать техническую документацию, схемы инфраструктуры и runbooks.
Требования
- Сильные знания Linux, Ubuntu.
- Практический опыт эксплуатации production-инфраструктуры.
- Уверенный опыт работы с Proxmox VE.
- Понимание принципов построения отказоустойчивых систем.
- Практический опыт настройки HAProxy.
- Опыт настройки OpenResty или Nginx.
- Опыт работы с Keepalived и протоколом VRRP.
- Глубокое понимание TCP/IP, DNS, routing, NAT и VLAN.
- Опыт настройки firewall и ACL, включая iptables или nftables.
- Умение диагностировать сетевые проблемы с помощью tcpdump, ss, traceroute и других инструментов.
- Практический опыт настройки мониторинга и alerting.
- Навыки расследования сложных production-инцидентов и проведения Root Cause Analysis.
- Опыт автоматизации с помощью Bash или Python.
- Способность самостоятельно принимать технические решения и отвечать за результат.
Будет плюсом
- Опыт работы с Prometheus, Grafana, VictoriaMetrics или Zabbix.
- Опыт централизованного логирования с ELK или Loki.
- Опыт работы с Docker, Docker Compose или Docker Swarm.
- Знание Ansible или Puppet.
- Опыт создания CI/CD-пайплайнов в GitLab CI или Jenkins.
- Опыт администрирования, оптимизации и масштабирования MySQL.
- Знание Lua и опыт расширенной конфигурации OpenResty.
- Опыт построения backup- и disaster recovery-процессов.
- Опыт работы с высоконагруженными или business-critical системами.
Условия
- Интересные уникальные задачи
- Работа по времени США - Нью Йорк
- Комфортные условия труда
- Высокая и официальная заработная плата
- Высококлассная техника для работы
- Бонусы по результатам работы
- Профессиональный рост
- Карьерный рост
- Удаленная работа
- Заработная плата по итогам собеседования