الوصف
تبحث شركة سلة عن مهندس أول لهندسة موثوقية المواقع (MLOps) للعمل ضمن فريق الذكاء الاصطناعي. يركز الدور على تشغيل أنظمة الذكاء الاصطناعي وتعلم الآلة باعتبارها أنظمة إنتاج فعلية، وليس تجارب جانبية، مع تولي الطبقة التشغيلية المحيطة بالنماذج والمطالبات والوكلاء وخدمات الاستدلال وأنظمة الاسترجاع. ويتحمل شاغل الدور مسؤولية تمكين خصائص الذكاء الاصطناعي الوكيلي والذكاء الاصطناعي التوليدي من العمل بصورة موثوقة وآمنة وفعالة من حيث التكلفة وعلى نطاق واسع ضمن منظومة شركة سلة.
يرتكز الدور على هندسة موثوقية المواقع وهندسة المنصات، مع تركيز قوي على الموثوقية وقابلية الرصد والإصدارات الآمنة والتكلفة والحوكمة، إلى جانب التعاون الوثيق مع فرق الهندسة والبيانات والذكاء الاصطناعي لتوفير مسار سريع وآمن إلى الإنتاج لكل فريق. وتنبع أهمية الدور من أن أنظمة الذكاء الاصطناعي تتعطل بطرق تختلف عن الخدمات المعتادة؛ فتغيير المطالبة قد يتصرف كتغيير في الشيفرة، كما أن استدعاء الوكيل للأدوات يتطلب قابلية التدقيق، وقد تتحرك عوامل زمن الاستجابة والجودة والتكلفة معًا بصورة معقدة.
المسؤوليات الرئيسية
- تولي موثوقية خدمات تعلم الآلة والذكاء الاصطناعي الوكيلي في بيئة الإنتاج، بما يشمل أهداف مستوى الخدمة، ولوحات المعلومات، والتنبيهات، وأدلة التشغيل، ومتابعة الحوادث.
- بناء قابلية الرصد عبر منظومة الذكاء الاصطناعي، بما يشمل زمن الاستجابة والأخطاء والتتبعات واستدعاءات الأدوات والتكلفة وتأثير الخدمة على المستخدمين.
- تصميم أنماط إصدارات آمنة للنماذج والمطالبات والوكلاء والأدوات والإعدادات، بما في ذلك استراتيجيات الإطلاق التدريجي، والتراجع عن الإصدار، وأعلام الميزات، وبوابات التقييم.
- تقديم الدعم التشغيلي لواجهات برمجة تطبيقات الاستدلال وقوائم الانتظار وطبقات الاسترجاع وسير عمل الذكاء الاصطناعي العاملة على Kubernetes/EKS.
- إرساء الملكية وقابلية التتبع والضوابط الوقائية حول ما يُسمح للأنظمة الوكيلية بفعله، بما في ذلك كيفية استدعائها للأدوات الداخلية.
- حماية استدعاء الوكلاء للأدوات من مخاطر حقن المطالبات والبيانات غير الموثوقة، وإنشاء حدود الثقة بالبيانات وتطبيقها بحيث لا تتمكن محتويات المتاجر أو التجار غير الموثوقة من التلاعب بقرارات الوكلاء أو استدعاءات الأدوات أو الإجراءات.
- قيادة حوكمة تكاليف الذكاء الاصطناعي، بما يشمل إتاحة رؤية الإنفاق حسب النموذج والفريق، وتتبع تكلفة الرموز، وإطلاق تنبيهات الحالات الشاذة.
- بناء الأتمتة ومسارات الخدمة الذاتية لتوفير مسار آمن ومعروف إلى الإنتاج لفرق المنتجات بدلًا من إعادة بنائه في كل مرة.
- تحويل المشكلات التشغيلية المتكررة إلى معايير بسيطة وقابلة لإعادة الاستخدام للمنصة، تتبناها الفرق الأخرى.
- المشاركة في مناقشات البنية التقنية ومراجعات الشيفرة واتخاذ القرارات التقنية.
المتطلبات
- خبرة لا تقل عن 4 سنوات في هندسة موثوقية المواقع أو هندسة المنصات أو DevOps أو البنية التحتية للإنتاج، مع تشغيل أنظمة موزعة في بيئة الإنتاج، وليس في العروض التجريبية فقط.
- خبرة عملية في Kubernetes والأنظمة السحابية الأصلية ضمن بيئة الإنتاج.
- إلمام بنشر مشاريع تعلم الآلة.
- إتقان قوي للتكامل المستمر والتسليم المستمر وGitOps وقابلية الرصد والاستجابة للحوادث.
- خبرة متينة في البنية التحتية بوصفها شيفرة، وإدارة الأسرار، والشبكات.
- القدرة على كتابة الأتمتة أو أدوات المنصات باستخدام Python أو لغة مشابهة.
- حكم إنتاجي جيد، أي معرفة كيفية جعل الأنظمة قابلة للقياس والتصحيح والتكرار وآمنة التغيير، ولا يشترط أن يكون المتقدم باحثًا في تعلم الآلة.
- القدرة على العمل بين الفرق، وشرح المفاضلات بوضوح، وتحويل المشكلات التشغيلية إلى معايير سيستخدمها المهندسون فعليًا.
ميزة إضافية
- خبرة في عمليات تعلم الآلة أو منصات تعلم الآلة، مثل تقديم النماذج، ومستودعات النماذج، والتقييم، واعتماديات الخصائص والبيانات، ومراقبة الانحراف، أو مسارات تعلم الآلة.
- إلمام بتطبيقات النماذج اللغوية الكبيرة أو الأنظمة الوكيلية، مثل RAG وقواعد البيانات المتجهية واستدعاء الأدوات وتنسيق سير العمل والذاكرة والتتبعات والضوابط الوقائية أو مسارات التقييم.
- اطلاع على أدوات مثل OpenTelemetry وPrometheus وGrafana وMLflow وKServe وRay وLiteLLM وvLLM وLangGraph وArize Phoenix أو LangSmith.
- خبرة في مستهلكي Kafka أو أعباء عمل وحدات معالجة الرسومات أو تحسين الاستدلال أو توجيه النماذج أو حوكمة تكاليف الذكاء الاصطناعي.
- خبرة في العمل ضمن فرق منتجات متعددة التخصصات تضم مهندسي الذكاء الاصطناعي والواجهات الخلفية والواجهات الأمامية.
نوع مكان العمل
هجين.
