الانتقال إلى المحتوى الرئيسي

مهندس تعلم معزز

الذكاء الاصطناعي وتعلم الآلة دوام كامل متوسط لندن, إنجلترا, المملكة المتحدة
£126,000–£210,000/سنة (£10,500–£17,500/شهر) — قابل للتفاوض

الوصف الوظيفي

تحسين سلوك النماذج باستخدام التعلّم بالتعزيز وأساليب التحسين القائمة على التفضيلات. تشمل المهام نمذجة المكافآت، وتطوير مسارات تدريب PPO أو DPO، وتحليل مؤشرات التدريب، وإجراء تجارب قابلة لإعادة التنفيذ.

المتطلبات

- خبرة عملية في التعلّم بالتعزيز أو التحسين القائم على التفضيلات أو أساليب RLHF
- إتقان Python وخبرة في استخدام أطر التعلّم العميق
- معرفة بنمذجة المكافآت وPPO وDPO، وتشخيص التدريب أو تصميم التقييمات
- القدرة على تقييم جودة البيانات وتغيّر سياسات النموذج واستقرار التدريب

المسؤوليات

- تطوير مسارات تدريب للتعلّم بالتعزيز والتحسين القائم على التفضيلات وصيانتها
- تحليل مؤشرات التدريب والتحقيق في أسباب عدم الاستقرار أو تراجع الأداء
- إجراء تجارب قابلة لإعادة التنفيذ بالتعاون مع فريقي البحث والبنية التحتية
- توثيق التغيّرات في سلوك النماذج وأثرها في الإصدارات

المزايا

- المساهمة في تحسين النماذج للاستخدام العملي بدعم من فريق البنية التحتية
- التعاون مع فرق البحث والسلامة ومنصة التعلّم الآلي
- المشاركة في وضع معايير لجودة بيانات التفضيلات وموثوقية التدريب

نظرة عامة على الوظيفة

نوع التوظيف دوام كامل
مستوى الخبرة متوسط
الموقع لندن, إنجلترا, المملكة المتحدة
الشواغر 2

تقدم الآن