الوصف
تبحث شركة سلة عن مهندس أول لهندسة موثوقية المواقع (MLOps) للعمل ضمن فريق الذكاء الاصطناعي. يركز الدور على تشغيل أنظمة الذكاء الاصطناعي وتعلّم الآلة باعتبارها أنظمة إنتاج فعلية، وليس تجارب جانبية، مع تولي الطبقة التشغيلية المحيطة بالنماذج والمطالبات والوكلاء وخدمات الاستدلال وأنظمة الاسترجاع.
يتولى شاغل الدور تمكين ميزات الذكاء الاصطناعي الوكيلي والذكاء الاصطناعي التوليدي من العمل بموثوقية وأمان وكفاءة من حيث التكلفة على نطاق واسع ضمن منظومة شركة سلة. ويركز الدور، من منظور هندسة موثوقية المواقع وهندسة المنصات، على الموثوقية والرصد والإصدارات الآمنة والتكلفة والحوكمة، مع التعاون الوثيق مع فرق الهندسة والبيانات والذكاء الاصطناعي لتوفير مسار سريع وآمن لكل فريق نحو الإنتاج. وتنبع أهمية الدور من اختلاف طرق تعطل أنظمة الذكاء الاصطناعي عن الخدمات التقليدية؛ إذ قد يتصرف تغيير المطالبة مثل تغيير في الشيفرة، ويحتاج الوكيل الذي يستدعي الأدوات إلى قابلية التدقيق، كما قد تتحرك مؤشرات زمن الاستجابة والجودة والتكلفة معًا بطرق معقدة.
المسؤوليات الرئيسية
- تولي موثوقية خدمات تعلّم الآلة والذكاء الاصطناعي الوكيلي في بيئات الإنتاج، بما يشمل أهداف مستوى الخدمة، ولوحات المعلومات، والتنبيهات، وأدلة التشغيل، ومتابعة الحوادث.
- بناء منظومة للرصد عبر مكونات الذكاء الاصطناعي، تشمل زمن الاستجابة والأخطاء وآثار التتبع واستدعاءات الأدوات والتكلفة وأثر الخدمة على المستخدم.
- تصميم أنماط آمنة لإصدار النماذج والمطالبات والوكلاء والأدوات والإعدادات، بما في ذلك استراتيجيات الإطلاق التدريجي، والتراجع عن الإصدار، وأعلام الميزات، وبوابات التقييم.
- تقديم الدعم التشغيلي لواجهات برمجة تطبيقات الاستدلال والطوابير وطبقات الاسترجاع وسير عمل الذكاء الاصطناعي العاملة على Kubernetes/EKS.
- إرساء الملكية وقابلية التتبع والضوابط الوقائية حول ما يُسمح للأنظمة الوكيلية بفعله، بما في ذلك طريقة استدعائها للأدوات الداخلية.
- حماية استدعاء الوكلاء للأدوات من حقن المطالبات ومخاطر البيانات غير الموثوقة، وإنشاء حدود للثقة بالبيانات وفرضها، بحيث لا تتمكن محتويات المتاجر أو التجار غير الموثوقة من التلاعب بقرارات الوكلاء أو استدعاءات الأدوات أو الإجراءات.
- قيادة حوكمة تكلفة الذكاء الاصطناعي، بما يشمل وضوح الإنفاق لكل نموذج ولكل فريق، وتتبع تكلفة الرموز، والتنبيه إلى الحالات غير المعتادة.
- بناء الأتمتة ومسارات الخدمة الذاتية كي تمتلك فرق المنتجات مسارًا آمنًا ومعروفًا إلى الإنتاج بدلًا من إعادة بنائه في كل مرة.
- تحويل المشكلات التشغيلية المتكررة إلى معايير بسيطة وقابلة لإعادة الاستخدام للمنصة، تعتمدها الفرق الأخرى.
- المشاركة في مناقشات البنية، ومراجعات الشيفرة، واتخاذ القرارات التقنية.
المتطلبات
- خبرة لا تقل عن 4 سنوات في هندسة موثوقية المواقع أو هندسة المنصات أو DevOps أو البنية التحتية للإنتاج، مع تشغيل أنظمة موزعة في بيئات الإنتاج، وليس في العروض التجريبية فقط.
- خبرة عملية في Kubernetes والأنظمة السحابية الأصلية ضمن بيئات الإنتاج.
- إلمام بنشر مشاريع تعلّم الآلة.
- إتقان CI/CD وGitOps والرصد والاستجابة للحوادث.
- خبرة قوية في البنية التحتية بوصفها شيفرة، وإدارة الأسرار، والشبكات.
- القدرة على كتابة الأتمتة أو أدوات المنصات باستخدام Python أو لغة مشابهة.
- امتلاك حس عملي في بيئات الإنتاج، بما يشمل معرفة كيفية جعل الأنظمة قابلة للقياس والتصحيح والتكرار وآمنة التغيير، مع عدم الحاجة إلى أن يكون المتقدم باحثًا في تعلّم الآلة.
- القدرة على العمل عبر الفرق، وشرح المفاضلات بوضوح، وتحويل المشكلات التشغيلية إلى معايير سيستخدمها المهندسون فعليًا.
المؤهلات الإضافية المفضلة
- خبرة في عمليات تعلّم الآلة أو منصات تعلّم الآلة، مثل تقديم النماذج، وسجلات النماذج، والتقييم، وتبعيات الميزات والبيانات، ومراقبة الانحراف، أو مسارات تعلّم الآلة.
- إلمام بتطبيقات النماذج اللغوية الكبيرة أو الأنظمة الوكيلية، مثل RAG وقواعد البيانات المتجهية واستدعاء الأدوات وتنسيق سير العمل والذاكرة وآثار التتبع والضوابط الوقائية أو مسارات التقييم.
- خبرة أو اطلاع على أدوات مثل OpenTelemetry وPrometheus وGrafana وMLflow وKServe وRay وLiteLLM وvLLM وLangGraph وArize Phoenix أو LangSmith.
- خبرة في مستهلكي Kafka أو أحمال عمل وحدات معالجة الرسومات أو تحسين الاستدلال أو توجيه النماذج أو حوكمة تكلفة الذكاء الاصطناعي.
- خبرة في العمل ضمن فرق منتجات متعددة الوظائف تضم مهندسي الذكاء الاصطناعي والواجهات الخلفية والواجهات الأمامية.