Обязанности:
Что нужно будет делать: обеспечивать высокую доступность, отказоустойчивость и надежность сервисов компании; внедрять единые SRE-практики и разрабатывать рекомендации по повышению производительности и отказоустойчивости систем; ведение проектов повышения надежности систем; участие в принятии архитектурных решений; анализ и разбор происходящих сбоев систем; развитие observability; инцидент-менеджмент: анализ инцидентов, планирование работ по их недопущению, реагирование на возникновение критических инцидентов. Что мы ожидаем: опыт внедрения и развития SRE-практик; опыт внедрения метрик SLO/SLI/SLA/ и применение их в рабочем процессе; есть уверенные знания и навыки администрирования ОС семейства Linux; понимание принципов работы Docker, Kubernetes, Terraform, Ansible; понимание принципов мониторинга и логирования (grafana stack, graylog); понимание работы кластерных баз данных. Что мы предлагаем: официальное оформление по ТК РФ, стабильную белую заработную плату и премию; мы не ограничиваем себя работой только из офиса, для нас главное - результат; после успешного прохождения испытательного срока: ДМС со стоматологией, "Добросервис" с неограниченной юридической и психологической консультацией, фитнес; оплату профильных курсов, участия в конференциях; веселые и запоминающиеся корпоративы на природе и в офисе: играем в настолки, xbox и настольный теннис прямо в офисе. Заказываем пиццу каждую последнюю пятницу месяца; ежедневное погружение в мир книг и неограниченный доступ ко всем электронным и аудиокнигам :)Похожие вакансии