other

MLOps-инженер

7 сентября 2026

З/П не указана

Город: Москва

Miractal

Тип занятости: Удаленная работа

Требуемый опыт: Опыт от 6 лет

Обязанности Развернуть и настроить сервер инференса (vLLM, при необходимости SGLang) на GPU-узле; Подобрать режим работы под нагрузку: квантизация, размер батча, длина контекста, распределение моделей по картам, реплики под конкурентность; Снять реальные показатели: пропускная способность, задержка, поведение под пиковой нагрузкой, давление кэша контекста; Поднять единый шлюз (LiteLLM): вход через корпоративную аутентификацию, разграничение прав по командам, квоты, журналирование, защитные фильтры (вырезание секретов и персональных данных); Обеспечить единственную точку входа: сервер инференса не виден клиентам напрямую, доступ только из корпоративной сети; Мониторинг и оповещения: загрузка карт, память, очереди, задержки, ошибки (Prometheus, Grafana); Процедура обновления моделей в закрытом контуре: подготовка в отдельной зоне, проверка подписей и контрольных сумм, перенос, внутренний реестр, выкатка с возможностью отката; Дежурство по сервису, разбор инцидентов, ёмкостное планирование; Отбор и проверка открытых моделей под наши задачи: чат и агент, автодополнение, работа с кодом. Сравнение кандидатов на нашем стенде, а не по публичным таблицам; Проверка лицензий на право коммерческого использования внутри компании; Замер полезности: доля принятых подсказок, время на правки, обратная связь команд; Настройка клиентов в средах разработки (Continue, Cline, Tabby, терминальные инструменты) и браузерного интерфейса для ролей, работающих без среды разработки: тестирование, аналитика, управление проектами; Подбор моделей и настроек под сценарии разных ролей, инструкции, помощь командам на старте; Обучающие материалы и кооткие занятия при выходе на все команды; Слой извлечения над репозиториями кода, затем над внутренней документацией и трекером задач; Конвейер загрузки: разбор документов, разбиение, локальная модель эмбеддингов, векторное хранилище, инкрементальное обновление; Соблюдение прав доступа при выдаче: человек не должен получить через ассистента документ, который ему не положено видеть. Вырезание секретов и персональных данных при загрузке. Требования Опыт вывода моделей в промышленную эксплуатацию: не «запускал на ноутбуке», а работающий сервис с пользователями и дежурством; Практика с современными серверами инференса (vLLM, SGLang, TensorRT-LLM или аналоги), понимание непрерывного батчинга, работы с кэшем контекста, квантизации; Уверенный Linux, Docker, работа с GPU NVIDIA (драйверы, CUDA, распределение ресурсов, диагностика); Инфраструктура как код и автоматизация выкаток, работа с внутренними реестрами артефактов; Мониторинг и разбор проблем производительности: умение находить узкое место и подтверждать выводы измерениями; Python на уровне уверенной автоматизации и работы с библиотеками инференса; Готовность работать в закрытом контуре: без внешних сервисов, с процедурами переноса и проверкой целостности; Опыт построения слоя извлечения знаний с учётом прав доступа будет преимуществом; Понимание экономики железа: расчёт ёмкости, обоснование закупки, выбор между наращиванием реплик и более крупным узлом; Опыт эксплуатации в регулируемой среде (финансы, платежи): аудит, разграничение доступа, требования к журналированию; Знакомство с инструментами разработчика на стороне клиента и умение объяснить их коллегам. Условия Конкурентная заработная плата — обсудим по итогам интервью; Удаленный формат работы; График 5/2: с 09:00 до 18:00 или с 10:00 до 19:00; Предоставляем мощный рабочий ноутбук; 100% компенсация больничных; Скидка на изучение английского языка в Skyeng.

Показать контакты

Имя не указано

Пожаловаться ID: 158402160

Похожие вакансии

MLOps инженер

От 250 000 до 280 000 руб.

Москва

IT-Implant

MLOps-инженер

Договорная

Москва

СПБ Биржа

MLOps

Договорная

Москва

СОГАЗ

MLops

Договорная

Москва

Страховая компания Сбербанк страхование

MLops инженер (финтех)

Договорная

Москва

WMT

Старший MLOps инженер

Договорная

Москва

RUTUBE