Обязанности:
На этой позиции тебе предстоит: Отвечать за production Проектировать, разрабатывать, внедрять и поддерживать SLO/SLI, метрики, алерты, ранбуки и дашборды для продукта Повышать наблюдаемость и надежность продукта Участвовать в устранении аварий и последующей стабилизации продукта Участвовать в заполнении и разборе постмортемов Разрабатывать и выполнять меры, направленные на предотвращение повторных инцидентов Автоматизировать рутинную работу Разрабатывать DRP Участвовать в разработке процессов, используемых в работе Что мы ждем от кандидата: Свободно и на экспертном уровне работаете с Linux-системами и занимались их промышленной эксплуатацией Понимаете, что такое load balancing, circuit breakers, disaster recovery и т.п. Понимаете, что такое SLO и SLI и умеете применять их на практике Имеете опыт работы с Grafana, Prometheus, k8s Понимаете принципы IaC-подхода к описанию инфраструктуры; понимаете, как работают сети и умеете диагностировать и решать проблемы в их работе Дополнительно пишете на Go / Python / bash и т.п. в объеме, достаточном для автоматизации повседневной работы; имеете практический опыт работы SRE; знаете, как сделать отказоустойчивый масштабируемый сервис; умеете работать с системами управленияПохожие вакансии
Site Reliability Engineer (SRE)
Договорная
Москва. Станции метро: Беговая, Краснопресненская, Улица 1905 года
SberTech
Site Reliability Engineer (SRE)
Договорная
Москва. Станции метро: Беговая, Краснопресненская, Улица 1905 года
SberTech
Договорная
Москва. Станции метро: Беговая, Краснопресненская, Улица 1905 года
Xsolla
Senior Site Reliability Engineer (SRE)/DevOps Engineer
Договорная
Москва. Станции метро: Беговая, Краснопресненская, Улица 1905 года
EYES OF WONDER SOFTWARE LLC
Site reliability engineer / SRE (ML Infra)
Договорная
Москва. Станции метро: Беговая, Краснопресненская, Улица 1905 года
USETECH
Senior Site Reliability Engineer
Договорная
Москва. Станции метро: Беговая, Краснопресненская, Улица 1905 года
VK