عن الوظيفة
تدير شركة سلة أنظمة إنتاج متعددة الوكلاء تنفذ أعمالًا فعلية لقاعدة كبيرة من المستخدمين. ومع توسع هذه الأنظمة، يتمثل التحدي الأهم في بناء الثقة بأدائها؛ إذ تحتاج الشركة إلى معرفة مدى جودة عمل الوكلاء، واكتشاف التراجعات قبل إطلاقها، والحفاظ على مستوى ثابت من الجودة مع استمرار الإصدارات. يتولى هذا الدور مسؤولية تحقيق ذلك.
سيعمل شاغل الوظيفة على بناء أنظمة التقييم التي تقف خلف الوكلاء، بما في ذلك أدوات التحكيم، وأطر الاختبار، والمحاكيات التي تحدد مدى أداء الوكيل وتكشف مواضع إخفاقه. ويتمثل الهدف في تمكين الشركة من إطلاق الوكلاء بوتيرة أسرع، اعتمادًا على تقييمات موثوقة.
يركز الدور على التقييم، لكنه لا يقتصر عليه؛ ففهم أنماط إخفاق الوكلاء سيتيح أيضًا فرصًا للمساهمة في تطويرهم وتحسينهم، إلى جانب بناء الأنظمة التي تقيم أداءهم.
المسؤوليات
- تولي مسؤولية منظومة التقييم، وتصميم وبناء أنظمة تستخدم نماذج اللغة الكبيرة بوصفها أدوات تحكيم، ومعايرتها بالاستناد إلى تقييمات بشرية، وجعل جودة الوكلاء قابلة للقياس لكل وكيل ولكل نمط من أنماط الإخفاق.
- تحويل بوابة الإطلاق إلى آلية فعلية؛ من خلال بناء أطر تقييم لكل طلب دمج برمجي وربط اكتشاف التراجعات بالتكامل المستمر، بحيث تُفرض الجودة تلقائيًا بدلًا من الاعتماد على المراجعات اليدوية.
- بناء محاكيات للمستخدمين لتوفير تغطية اختبارية وإنشاء حالات خصمية قبل أن يواجهها المستخدمون الفعليون.
- تحويل إشارات الإنتاج إلى تحسينات، عبر إدراج حالات الإخفاق الفعلية في مجموعات التقييم حتى تتطور المنظومة بمرور الوقت.
- التعاون مع فريق المنتج لتحويل مفهوم «الأداء الجيد» إلى معايير واضحة وقابلة للقياس.
- التوسع في تطوير الوكلاء، والمساهمة في بنائهم وتعزيز متانتهم، بدءًا من المكونات التي يمتلك شاغل الوظيفة أعمق معرفة بها نتيجة عمله في تقييمها.
المتطلبات
- امتلاك أساس قوي في هندسة البرمجيات، وخبرة عملية في Python أو TypeScript أو لغة مشابهة ضمن بيئات الإنتاج، إلى جانب تصميم واجهات برمجية وأنظمة نظيفة، والاختبار، والتكامل والتسليم المستمران. يجب أن يكون المتقدم قادرًا على كتابة شيفرة يعتمد عليها الآخرون، لأن البنية التحتية للتقييم تُعد هندسة برمجيات فعلية.
- خبرة عملية في نماذج اللغة الكبيرة والوكلاء؛ مثل بناء الوكلاء، أو أنظمة الاسترجاع المعزز بالتوليد (RAG)، أو استدعاء الأدوات والوظائف، أو استخدام أطر التنسيق مثل LangGraph وLangChain أو ما يعادلها، مع فهم طريقة عمل هذه الأنظمة وأنماط تعطلها.
- امتلاك عقلية تركز على القياس، والقدرة على التفكير في المقاييس والمعايرة والتجارب، والرغبة في تحديد مدى نجاح أي شيء كميًا بدلًا من الاكتفاء بإطلاقه.
- خبرة في بيئات الإنتاج، بما يشمل تشغيل أنظمة نماذج اللغة الكبيرة والتعامل مع الاعتمادية وزمن الاستجابة والتكلفة وقابلية الرصد.
- خبرة لا تقل عن 5 سنوات في هندسة البرمجيات، مع خبرة عملية حديثة في نماذج اللغة الكبيرة أو الوكلاء.
المزايا الإضافية
- خبرة مباشرة في تقييم أنظمة نماذج اللغة الكبيرة أو الوكلاء، بما في ذلك التقييمات غير المتصلة والمتصلة، واستخدام نماذج اللغة الكبيرة بوصفها أدوات تحكيم، والاختبار المنهجي للتراجعات.
- خبرة في أدوات قابلية الرصد مثل Arize أو LangSmith أو ما يماثلها.
- خبرة في اللغة العربية أو معالجة اللغات الطبيعية.
- خبرة في التجارة الإلكترونية أو المنتجات الموجهة للتجار.