Reinforcement-Learning-Ingenieur
£126,000–£210,000/Jahr (£10,500–£17,500/Monat) — Verhandelbar
Stellenbeschreibung
Sie verbessern das Verhalten von Modellen mithilfe von Reinforcement Learning und präferenzbasierter Optimierung. Dazu entwickeln und untersuchen Sie Belohnungsmodelle und PPO- oder DPO-Trainingsabläufe und werten Trainingsdiagnosen sowie reproduzierbare Experimente aus.
Anforderungen
- Praxiserfahrung mit Reinforcement Learning, präferenzbasierter Optimierung oder Verfahren nach dem RLHF-Prinzip
- Sehr gute Python-Kenntnisse und Erfahrung mit Frameworks für Deep Learning
- Kenntnisse in Belohnungsmodellierung, PPO und DPO, Trainingsdiagnostik oder Evaluationsmethoden
- Fähigkeit, Datenqualität, Veränderungen im Modellverhalten und Trainingsstabilität zu beurteilen
- Sehr gute Python-Kenntnisse und Erfahrung mit Frameworks für Deep Learning
- Kenntnisse in Belohnungsmodellierung, PPO und DPO, Trainingsdiagnostik oder Evaluationsmethoden
- Fähigkeit, Datenqualität, Veränderungen im Modellverhalten und Trainingsstabilität zu beurteilen
Verantwortlichkeiten
- Trainingsabläufe für Reinforcement Learning und präferenzbasierte Optimierung entwickeln und pflegen
- Trainingsdiagnosen auswerten und Ursachen für Instabilität oder Leistungseinbußen untersuchen
- Gemeinsam mit den Forschungs- und Infrastrukturteams reproduzierbare Experimente durchführen
- Änderungen am Modellverhalten und ihre Folgen für die Veröffentlichung dokumentieren
- Trainingsdiagnosen auswerten und Ursachen für Instabilität oder Leistungseinbußen untersuchen
- Gemeinsam mit den Forschungs- und Infrastrukturteams reproduzierbare Experimente durchführen
- Änderungen am Modellverhalten und ihre Folgen für die Veröffentlichung dokumentieren
Vorteile
- Modelle mit Unterstützung des Infrastrukturteams gezielt weiterentwickeln
- Mit den Teams für Forschung, Sicherheit und ML-Plattform zusammenarbeiten
- Qualitätsmaßstäbe für Präferenzdaten und zuverlässige Trainingsverfahren mitgestalten
- Mit den Teams für Forschung, Sicherheit und ML-Plattform zusammenarbeiten
- Qualitätsmaßstäbe für Präferenzdaten und zuverlässige Trainingsverfahren mitgestalten