Мы ищем Senior to Staff Infrastructure Engineer для руководства проектированием и развитием крупномасштабных многопроцессорных вычислительных инфраструктур, используемых для обучения моделей робототехники и ИИ следующего поколения. Эта роль находится на стыке DevOps, MLOps и распределенных систем — отвечающий за архитектуру, надежность и производительность в масштабе в быстро меняющейся, передовой среде.
Обязанности
- Руководство архитектурой и долгосрочным техническим направлением мульти-GPU, кросс-облачных платформ для обучения.
- Создание и развитие инфраструктуры как кода для выделения ресурсов, оркестрации и управления жизненным циклом.
- Проектирование и улучшение систем CI/CD для инфраструктуры и рабочих процессов обучения ML.
- Оптимизация распределенных рабочих процессов обучения — планирование, использование ресурсов, наблюдаемость.
- Партнерство с ML-инженерами и исследователями для обеспечения эффективного экспериментирования и продакшинизации.
- Менторство инженеров и обеспечение операционного совершенства во всей организации.
- Документирование архитектуры, систем и ключевых технических решений.
Требования
- Опыт работы с Kubernetes производственного уровня (предпочтительно CKA).
- Практический опыт работы с Terraform (инфраструктура как код).
- Управление пакетами и релизами Kubernetes с помощью Helm.
- Опыт работы с облачной инфраструктурой AWS.
- Опыт работы с конвейерами CI/CD, включая собственные раннеры (GitHub Actions).
- Мониторинг и оповещение с помощью Prometheus/Grafana.
- Администрирование Linux, контейнеризация, скриптинг (Python и Bash).
- Готовность к дежурствам по ротации.
Желательно
- Кластеры Kubernetes с ускорением GPU (NVIDIA).
- Автомасштабирование кластеров (Karpenter).
- Оркестрация рабочих процессов (Prefect).
- Gang scheduling, справедливое распределение ресурсов.
- Высокопроизводительные хранилища (FSx for Lustre, EFS).
Мы предлагаем
- Возможность работать над передовыми проектами.
- Работа в высокомотивированной и преданной команде.
- Конкурентная заработная плата.
- Гибкий график.
- Пакет льгот — медицинская страховка, спорт.
- Корпоративные социальные мероприятия.
- Возможности для профессионального развития.
- Хорошо оборудованный офис.
О нас
Grid Dynamics (NASDAQ: GDYN) — ведущий поставщик услуг в области технологического консалтинга, инжиниринга платформ и продуктов, искусственного интеллекта и передовой аналитики. Сочетая техническое видение с деловой хваткой, мы решаем самые насущные технические проблемы и обеспечиваем положительные бизнес-результаты для корпоративных компаний, проходящих трансформацию бизнеса. Ключевым отличием Grid Dynamics является наш 8-летний опыт и лидерство в области корпоративного ИИ, подкрепленные глубокой экспертизой и постоянными инвестициями в данные, аналитику, облачные технологии и DevOps, модернизацию приложений и клиентский опыт. Основанная в 2006 году, Grid Dynamics имеет штаб-квартиру в Кремниевой долине и офисы по всей Америке, Европе и Индии.