other

Site Reliability Engineer (SRE)

7 октября 2026

З/П не указана

Город: Москва

SberTech

Тип занятости: Полная занятость

Требуемый опыт: Опыт от 3 лет

Обязанности:

AI-платформа корпоративного уровня — аналог AI Hub. Реализован чат-интерфейс (аналог ChatGPT) и сценарии сбора аналитики по собственным базам знаний (RAG на базе Qdrant) и по открытым источникам в интернете. В качестве LLM используются современные модели, задействован LLM-шлюз с маршрутизацией запросов. Проект введён в промышленную эксплуатацию: работают реальные пользователи, нагрузка стабилизирована, требования к доступности согласованы. Технологический стек: · PostgreSQL — основное хранилище данных · Kubernetes — оркестрация · Kafka — обмен событиями · Redis — кэширование · S3 (совместимое объектное хранилище) — данные и бэкапы · Qdrant — векторная база знаний · Prometheus + Grafana — мониторинг · OpenSearch — логи Твои задачи: обеспечение доступности и отказоустойчивости платформы в проде: определение и контроль SLO/SLI, дежурства, разбор инцидентов, проведение postmortem разработка и сопровождение CI/CD-конвейеров, инфраструктуры как кода (IaC) управление Kubernetes: кластеры и версии, admission-контроллеры, network policies, resource limits/requests, HPA, автоскейлинг диагностика и оптимизация производительности (CPU / memory / I/O), профилирование нагрузки LLM-инференса настройка и развитие наблюдаемости: метрики, логи, трассировки, алертинг, дашборды управление секретами и доступом, выполнение требований безопасности работа с Kafka, Redis, PostgreSQL и S3: настройка, тюнинг, резервное копирование и восстановление, DR-планы участие в архитектурных решениях для новых сервисов платформы. Мы ожидаем, что у тебя есть: 3+ года опыта в SRE / DevOps / платформенной инфраструктуре глубокий опыт работы с Kubernetes в промышленной эксплуатации PostgreSQL: планирование запросов, индексы, репликация, бэкапы и восстановление Kafka, Redis, S3-совместимые объектные хранилища CI/CD, Linux, Bash мониторинг и логирование: Prometheus / Grafana, OpenSearch, алертинг понимание принципов SLO / SLI / Error Budgets опыт работы с облачной и on-premise инфраструктурой, сетевой уровень, TLS опыт создания AI-агентов и использования их в работе будет преимуществом. Будет плюсом: опыт эксплуатации ML/LLM-инференса (vLLM, Triton, KServe), понимание нагрузочных профилей GPU опыт работы с векторными БД (Qdrant, Milvus, pgvector) знание IaC (Terraform, Ansible) опыт участия в RAG / AI-платформенных проектах навыки написания postmortem и улучшения процессов эксплуатации. Работа в СберТехе - это: гибридный формат работы годовой бонус и ежегодный пересмотр зарплаты статус аккредитованной ИТ-компании расширенный ДМС с первого дня и льготное страхование для семьи корпоративный университет Сбера, внутренняя образовательная платформа, участие в IT-конференциях 90 дней удаленной работы из любого региона РФ льготная ипотека в Сбере бесплатная подписка СберПрайм, которой можно поделиться с 3 близкими.

Показать контакты

Имя не указано

Пожаловаться ID: 159640291

Похожие вакансии

SRE/Site Reliability Engineer

Договорная

Москва

Cloud.ru

Site Reliability Engineer (SRE)

Договорная

Москва

SberTech

Site Reliability Engineer

Договорная

Москва

Xsolla

Senior Site Reliability Engineer (SRE)/DevOps Engineer

Договорная

Москва

EYES OF WONDER SOFTWARE LLC

Site reliability engineer / SRE (ML Infra)

Договорная

Москва

USETECH

Senior Site Reliability Engineer

Договорная

Москва

VK