مهندس تعلم معزز
£126,000–£210,000/سنة (£10,500–£17,500/شهر) — قابل للتفاوض
الوصف الوظيفي
تحسين سلوك النماذج باستخدام التعلّم بالتعزيز وأساليب التحسين القائمة على التفضيلات. تشمل المهام نمذجة المكافآت، وتطوير مسارات تدريب PPO أو DPO، وتحليل مؤشرات التدريب، وإجراء تجارب قابلة لإعادة التنفيذ.
المتطلبات
- خبرة عملية في التعلّم بالتعزيز أو التحسين القائم على التفضيلات أو أساليب RLHF
- إتقان Python وخبرة في استخدام أطر التعلّم العميق
- معرفة بنمذجة المكافآت وPPO وDPO، وتشخيص التدريب أو تصميم التقييمات
- القدرة على تقييم جودة البيانات وتغيّر سياسات النموذج واستقرار التدريب
- إتقان Python وخبرة في استخدام أطر التعلّم العميق
- معرفة بنمذجة المكافآت وPPO وDPO، وتشخيص التدريب أو تصميم التقييمات
- القدرة على تقييم جودة البيانات وتغيّر سياسات النموذج واستقرار التدريب
المسؤوليات
- تطوير مسارات تدريب للتعلّم بالتعزيز والتحسين القائم على التفضيلات وصيانتها
- تحليل مؤشرات التدريب والتحقيق في أسباب عدم الاستقرار أو تراجع الأداء
- إجراء تجارب قابلة لإعادة التنفيذ بالتعاون مع فريقي البحث والبنية التحتية
- توثيق التغيّرات في سلوك النماذج وأثرها في الإصدارات
- تحليل مؤشرات التدريب والتحقيق في أسباب عدم الاستقرار أو تراجع الأداء
- إجراء تجارب قابلة لإعادة التنفيذ بالتعاون مع فريقي البحث والبنية التحتية
- توثيق التغيّرات في سلوك النماذج وأثرها في الإصدارات
المزايا
- المساهمة في تحسين النماذج للاستخدام العملي بدعم من فريق البنية التحتية
- التعاون مع فرق البحث والسلامة ومنصة التعلّم الآلي
- المشاركة في وضع معايير لجودة بيانات التفضيلات وموثوقية التدريب
- التعاون مع فرق البحث والسلامة ومنصة التعلّم الآلي
- المشاركة في وضع معايير لجودة بيانات التفضيلات وموثوقية التدريب