Zum Hauptinhalt springen

Reinforcement-Learning-Ingenieur

KI und maschinelles Lernen Vollzeit Berufserfahren London, England, Vereinigtes Königreich
£126,000–£210,000/Jahr (£10,500–£17,500/Monat) — Verhandelbar

Stellenbeschreibung

Sie verbessern das Verhalten von Modellen mithilfe von Reinforcement Learning und präferenzbasierter Optimierung. Dazu entwickeln und untersuchen Sie Belohnungsmodelle und PPO- oder DPO-Trainingsabläufe und werten Trainingsdiagnosen sowie reproduzierbare Experimente aus.

Anforderungen

- Praxiserfahrung mit Reinforcement Learning, präferenzbasierter Optimierung oder Verfahren nach dem RLHF-Prinzip
- Sehr gute Python-Kenntnisse und Erfahrung mit Frameworks für Deep Learning
- Kenntnisse in Belohnungsmodellierung, PPO und DPO, Trainingsdiagnostik oder Evaluationsmethoden
- Fähigkeit, Datenqualität, Veränderungen im Modellverhalten und Trainingsstabilität zu beurteilen

Verantwortlichkeiten

- Trainingsabläufe für Reinforcement Learning und präferenzbasierte Optimierung entwickeln und pflegen
- Trainingsdiagnosen auswerten und Ursachen für Instabilität oder Leistungseinbußen untersuchen
- Gemeinsam mit den Forschungs- und Infrastrukturteams reproduzierbare Experimente durchführen
- Änderungen am Modellverhalten und ihre Folgen für die Veröffentlichung dokumentieren

Vorteile

- Modelle mit Unterstützung des Infrastrukturteams gezielt weiterentwickeln
- Mit den Teams für Forschung, Sicherheit und ML-Plattform zusammenarbeiten
- Qualitätsmaßstäbe für Präferenzdaten und zuverlässige Trainingsverfahren mitgestalten

Stellenübersicht

Beschäftigungsart Vollzeit
Erfahrungsstufe Berufserfahren
Standort London, England, Vereinigtes Königreich
Offene Stellen 2

Jetzt bewerben