Инженер по обучению с подкреплением
£126,000–£210,000/год (£10,500–£17,500/месяц) — По договорённости
Описание вакансии
Разрабатывайте методы обучения с подкреплением и оптимизации по предпочтениям, которые помогают улучшать поведение моделей. Вы будете работать с моделями вознаграждения, конвейерами PPO и DPO, диагностикой обучения и воспроизводимыми экспериментами.
Требования
- Практический опыт обучения с подкреплением, оптимизации по предпочтениям или методов RLHF.
- Уверенное владение Python и опыт работы с фреймворками глубокого обучения.
- Знание моделей вознаграждения, PPO и DPO, а также методов диагностики и оценки моделей.
- Умение оценивать качество данных, изменения поведения модели и устойчивость процесса обучения.
- Уверенное владение Python и опыт работы с фреймворками глубокого обучения.
- Знание моделей вознаграждения, PPO и DPO, а также методов диагностики и оценки моделей.
- Умение оценивать качество данных, изменения поведения модели и устойчивость процесса обучения.
Обязанности
- Разрабатывать и поддерживать процессы обучения с подкреплением и оптимизации по предпочтениям.
- Анализировать диагностические показатели обучения и находить причины нестабильности и ухудшения результатов.
- Проводить воспроизводимые эксперименты совместно с исследовательскими и инфраструктурными командами.
- Документировать изменения поведения моделей и их влияние на выпуск.
- Анализировать диагностические показатели обучения и находить причины нестабильности и ухудшения результатов.
- Проводить воспроизводимые эксперименты совместно с исследовательскими и инфраструктурными командами.
- Документировать изменения поведения моделей и их влияние на выпуск.
Преимущества
- Улучшать прикладные методы обучения моделей при поддержке инфраструктурной команды.
- Сотрудничать с командами исследований, безопасности и платформы машинного обучения.
- Участвовать в разработке стандартов качества данных о предпочтениях и надёжности обучения.
- Сотрудничать с командами исследований, безопасности и платформы машинного обучения.
- Участвовать в разработке стандартов качества данных о предпочтениях и надёжности обучения.