أول سؤال في معظم محادثات الذكاء الاصطناعي هو: أي نموذج نستخدم؟ وهو سؤال أول خاطئ، والإجابة عليه مبكراً هي الطريق إلى عرض تجريبي مبهر لا سبيل لمعرفة إن كان يتحسن أو يتراجع.
أما ما يحدد النتيجة فهو أمر أكثر رتابة: قائمة مكتوبة بأسئلة حقيقية من الناس الذين سيستخدمون النظام، مع الإجابة التي يجب أن ينتجها كل سؤال والمصدر الذي تأتي منه. عدة مئات تكفي عادة. جمعها غير مبهر ويستهلك نحو أسبوع من وقت أشخاص آخرين.
لكنها متى وُجدت صار كل ما بعدها قياساً لا جدلاً. تقسيم النصوص وعمق الاسترجاع وإعادة الترتيب وبنية التوجيه واختيار النموذج: كل واحد منها يصبح رقماً ارتفع أو انخفض. وبدونها يدافع عن كل تغيير من عرضه آخر مرة.
وهي تغيّر الحديث مع الإدارة أيضاً. جملة «انتقلت الدقة على مجموعة التقييم من ٧١٪ إلى ٨٨٪» جملة يستطيع الراعي التصرف بناءً عليها، أما «صار أفضل بكثير» فلا، وهذا سبب عدم تحول كثير من التجارب إلى إنتاج ممول.
والجزء غير المريح أن مجموعة تقييم جيدة ستخبرك أحياناً أن النظام غير جاهز. وهذا هو المقصود. معرفة ذلك في الأسبوع الثالث تكلف أسبوعاً، ومعرفتها بعد الإطلاق تكلف مصداقية البرنامج كله.
فقبل مقارنة النماذج، وقبل شراء قاعدة بيانات متجهات، اكتب كيف تبدو الإجابة الصحيحة. كل ما بعد ذلك هندسة.
- التقييم
- RAG
- التنفيذ
