Вакансия Системный аналитик (MLS Jobs)
🟢Удаленно🟢Полная занятость
🟢ЗП обсуждается на собеседовании
🟢В компанию Cloudru
🟦Задачи
– Анализировать загрузку GPU-кластера: находить причины простоя ресурсов, фрагментации нод, длительного ожидания задач и частых вытеснений нагрузки;
– Собирать и формализовывать требования пользователей к аллокациям, очередям, приоритетам, гарантиям ресурсов и размещению задач;
– Проектировать сценарии совместного использования ресурсов: закреплённые и эластичные аллокации, shared-нагрузка, заимствование свободной ёмкости и возврат ресурсов владельцу;
– Исследовать и сравнивать подходы Kubernetes-, batch- и GPU-планировщиков, включая Volcano, Kueue, NVIDIA KAI Scheduler и Slurm;
– Определять метрики эффективности планирования: утилизация, время ожидания, количество вытеснений, потерянные вычисления, доля заимствованных ресурсов и успешность запуска gang jobs;
– Проверять предлагаемые алгоритмы на исторических данных, моделировать граничные сценарии и оценивать влияние изменений до запуска в production;
– Готовить функциональные и нефункциональные требования, схемы процессов, RFC и постановки для команды разработки;
– Сопровождать реализацию на всех этапах: от проработки решения и тестирования до поэтапного запуска и анализа результатов;
– Работать с обратной связью пользователей, разбирать спорные сценарии распределения ресурсов и превращать их в прозрачные правила работы платформы.
🟦Требования
– Опыт работы системным или продуктовым аналитиком в инфраструктурных, облачных либо платформенных командах;
– Обладаете системным мышлением и умеете формализовывать сложные процессы с большим количеством ограничений и участников;
– Понимаете основные принципы работы Kubernetes: nodes, pods, requests и limits, affinity, taints, priorities, queues и preemption;
– Понимаете принципы планирования ресурсов: квоты, приоритеты, fairness, gang scheduling, bin packing и resource borrowing;
– Умеете отделять физическое размещение нагрузки от её логического владельца, гарантированной квоты и временно заимствованных ресурсов;
– Имеете опыт анализа метрик, событий и логов распределённых систем;
– Умеете работать с SQL и одним из инструментов анализа данных, например Python;
– Знакомы с Prometheus, Grafana и PromQL либо аналогичными инструментами мониторинга;
– Умеете готовить техническую документацию и переводить пользовательские проблемы в требования, метрики и проверяемые гипотезы;
– Способны аргументированно защищать предложения и эффективно взаимодействовать с разработчиками, архитекторами, владельцами платформы и пользовательскими командами;
– Владеете английским языком на уровне чтения технической документации.