تُحسم معظم عمليات تقييم مورّدي الذكاء الاصطناعي بعرض تجريبي (demo)، وهو يكاد يكون أسوأ مؤشر متاح. العرض التجريبي يثبت أن النموذج يستطيع أداء المهمة مرة واحدة، في ظروف اختارها المورّد. أما أنتم فتشترون ما يؤديها عشرة آلاف مرة، في ظروف لم يخترها. هذه هي الأسئلة التسعة التي تفرّق فعلًا بين الأمرين، وما الذي يختبره كل سؤال في العمق، وكيف تبدو الإجابة المراوغة.
وهي مهمة لأن نسب النجاح ضعيفة أصلًا: 95% من النماذج التجريبية للذكاء الاصطناعي التوليدي في المؤسسات لا تحقق أي أثر قابل للقياس في الأرباح والخسائر (MIT Project NANDA, 2025). ووجدت الدراسة نفسها ما ينجح في المقابل: الشراء من مورّدين متخصصين أو الشراكة معهم نجح في نحو 67% من الحالات، أي نحو ثلاثة أضعاف نسبة نجاح البناء الداخلي. الشراكة تنجح. أما الشراكة السيئة فتفسّر معظم نسبة 95% تلك.
1. ما الذي وضعتموه في بيئة الإنتاج، وماذا يفعل اليوم؟
ليس ما بنوه، بل ما يعمل اليوم ويعتمد عليه مستخدمون. اطلبوا وصف سير العمل، وحجم الاستخدام، ومنذ متى يعمل.
إجابة سيئة: قائمة بنماذج تجريبية ونماذج أولية وتجارب إثبات المفهوم تُروى بصيغة الماضي. أي جهة تستطيع تقديم عرض تجريبي. المهارة كلها في التسليم ثم إبقاء النظام يعمل، ومن فعل ذلك تكون لديه تفاصيل محددة. تفاصيلنا في صفحة دراسات الحالة، مع الاستثمار والعائد في كل دراسة.
2. من سينفّذ العمل بالتحديد، وهل سنلتقي بهم قبل التوقيع؟
الفجوة بين من يحضرون العرض التجاري ومن يكتبون الشيفرة هي الموضع الذي تتعثر فيه معظم المشاريع. اطلبوا الأسماء، ومستوى الخبرة، وهل يعملون لعملاء آخرين في الوقت نفسه.
إجابة سيئة: «فريقنا»، أو هيكل تنظيمي، أو شريك «سيبقى قريبًا من المشروع». إذا لم يكن من يحدّدون نطاق العمل هم من يبنونه، فكل معلومة تنقلونها ستُنقل مرة ثانية. وهذه هي الحجة كلها لصالح نموذج المهندسين العاملين داخل فريق العميل (بالإنجليزية).
3. ما السعر الإجمالي، ومن يتحمّل تجاوز الميزانية؟
رقم واحد، مكتوب، ومعه جواب عمّا يحدث حين يطول المشروع. هذا أسرع سؤال في القائمة للتمييز بين نماذج التعاقد.
إجابة سيئة: قائمة بأسعار الساعات، أو نطاق سعري، أو «يعتمد على نطاق العمل». هو يعتمد على نطاق العمل دائمًا. السؤال هو من يحمل هذه المخاطرة. شرحنا الآلية في مقال Bait-and-Bill (بالإنجليزية)، أما أسعارنا نحن فهي منشورة في صفحة الأسعار لتحاسبونا بالمعيار نفسه.
4. كيف سنعرف أن النظام يعمل كما يجب؟
ما تبحثون عنه هو مقياس وطريقة لقياسه، ويُفضَّل الاتفاق عليهما قبل البناء. دقة على أي مجموعة اختبار؟ معدل حل مقارنةً بأي خط أساس؟ ومن يقيس، وبأي وتيرة؟
إجابة سيئة: نتائج وصفية، أو أرقام عن حجم الاستخدام، أو «سنحدّد معايير النجاح معًا في مرحلة الاستكشاف». الشركة التي تحترف بناء أنظمة الذكاء الاصطناعي لها رأي في طريقة قياسها. هذا بالضبط ما تعنيه مجموعة التقييمات (بالإنجليزية)، وغياب رأي لديها في تقييماتكم إشارة كاشفة.
5. ماذا يحدث حين يخطئ النموذج؟
كل نظام احتمالي يخطئ. تختبرون بهذا السؤال هل فكّر المورّد في حالات الإخفاق قبل أن تسألوه: الضوابط، ومسارات التحويل إلى موظف، ونقاط المراجعة البشرية، وحجم الضرر في يوم سيئ.
إجابة سيئة: «النموذج دقيق جدًا»، أو أي جواب يجعل الموثوقية صفة للنموذج لا للنظام المحيط به. الجواب الحقيقي يصف قيودًا مكتوبة في الشيفرة، لا ثقة بنتائج الاختبارات المعيارية (benchmarks) التي ينشرها مورّد النموذج.
6. ماذا يحدث حين يتغير النموذج الذي يقوم عليه النظام؟
مورّدو النماذج يوقفون الإصدارات، ويعيدون ضبطها، ويغيّرون سلوكها وفق جدولهم هم. اسألوا ما الذي سيتعطل، وكيف سيعرفون، وبأي سرعة يستطيعون التراجع.
إجابة سيئة: نظرة حائرة، أو ادعاء بأن النظام لا يرتبط بنموذج بعينه من دون شيء يسنده. النسخة المقنعة تتضمن إصدارات نماذج مثبّتة، وموجّهات (prompts) لكل منها رقم إصدار، ومجموعة اختبارات تكشف التراجع (regression)، وطريق عودة إلى حالة معروفة وسليمة. وهي الطبقات التي نشرحها في مقال بنية وكيل يعمل في بيئة الإنتاج (بالإنجليزية).
7. من يملك الشيفرة والموجّهات والتقييمات؟
اسألوا عن الثلاثة صراحةً، ومعها البنية التحتية والبيانات. الموجّهات ومجموعات التقييم هي المعرفة التي تراكمت خلال المشروع، وهي أكثر ما يُحتمل أن يحتفظ به المورّد من دون أن يذكر ذلك.
إجابة سيئة: ملكية «التسليمات»، أو ملكية الشيفرة مع بقاء طبقة التنسيق (orchestration) على منصة المورّد. إذا كان الرحيل يعني إعادة البناء، فسعر المشروع يتضمن ألا ترحلوا أبدًا.
8. كم يكلف تشغيل النظام بعد الإطلاق، ومن يشغّله؟
أنظمة الذكاء الاصطناعي العاملة يتغير سلوكها مع الوقت، ولا بد من جهة تراقبها. اطلبوا الرقم الشهري واسم المسؤول عنه.
إجابة سيئة: اعتبار التشغيل اختياريًا أو مجرد باقة دعم. الاستدلال (inference) نفسه رخيص، سنتات لكل عملية، وسعره ينخفض بسرعة. أما المراقبة، ومعالجة تراجع نتائج التقييمات، وإدارة تغيّر السلوك فهي عمل حقيقي. خدمتنا تكلف من 3,000 إلى 20,000 دولار شهريًا بحسب عدد الأنظمة التي نديرها، ونفضّل أن نذكر الرقم من البداية على أن تكتشفوه لاحقًا.
9. متى تنصحوننا بألا نبني هذا؟
أكثر أسئلة القائمة كشفًا، وهو السؤال الذي لا يكاد يطرحه أحد. تختبرون به هل للشركة رأي أصلًا في مدى ملاءمة المشروع، أم أن كل مشكلة تُحل، بالمصادفة، بما تبيعه.
إجابة سيئة: الحماس. الشركة التي تستحق التعاقد تسمّي الظروف التي لا ينبغي فيها أن تمضوا في المشروع: البيانات غير متوافرة، حجم سير العمل صغير جدًا، الإجابة الصحيحة لا يمكن معرفتها، لا أحد مسؤول عن المقياس. وإذا لم تُقنع يومًا عميلًا بالعدول عن مشروع، فأنتم لستم عميلًا عندها، بل صفقة في قائمة مبيعاتها.
كيف تستخدمون الإجابات؟
اطرحوا الأسئلة التسعة على كل مورّد، ونحن منهم، ودوّنوا الإجابات جنبًا إلى جنب. النمط أهم من أي إجابة منفردة: الشركات التي تسلّم أنظمة تعمل تعطي إجابات محددة، مملّة قليلًا، وفيها أرقام. والشركات التي تكتفي بالعروض التجريبية تعطي إجابات واثقة عن الإمكانات. وإذا أردتم النسخة المنظمة من هذه المقارنة، فقد عرضنا الفروق بيننا وبين شركات الاستشارات التقليدية وبيننا وبين وكالات الأتمتة، ومنها الحالات التي يكون فيها كل طرف منهما هو الخيار الأفضل فعلًا.



