عبر 40 deployments من نماذج اللغة الكبيرة المؤسسية التي رُصدت على مدى ستة أشهر، انخفضت جودة المخرجات المقاسة بوسيط 14% في غضون اثني عشر أسبوعاً من الإطلاق، دون أي تغيير مقابل في النموذج. لم يكتشف تقييم وقت الإطلاق أياً من ذلك. أما التقييم المستمر مقارنةً بعيّنة مدمجة من المجموعة الذهبية والإنتاج، فقد اكتشف التراجع بوسيط 9 أسابيع قبل الإبلاغ عنه من قِبَل المستخدمين.
- انخفض متوسط الجودة المقاسة 14% في غضون 12 weeks من الإطلاق، مع بقاء النموذج دون تغيير.
- لم يكتشف تقييم وقت الإطلاق أياً من التراجع المرصود.
- رصد التقييم المستمر الانجراف بوسيط 9 weeks قبل إبلاغ المستخدمين عن المشكلات.
لماذا يكون الانجراف صامتاً
نادراً ما يكون الانجراف حدثاً مرتبطاً بالنموذج. إنه التباعد التدريجي بين التوزيع الذي جرى تقييم النظام عليه عند الإطلاق والتوزيع الذي يواجهه فعلياً في الإنتاج مع تغيّر المدخلات والمستخدمين والبيانات الأولية. ولأن ملف النموذج لا يتغير أبداً، لا شيء يُحفّز إعادة الاختبار — فيتراكم التراجع دون رصد.
والنتيجة نظام يبدو مستقراً وفق مقاييس إطلاقه بينما يتدهور فيما يهم وحده: حركة المرور الحية التي يخدمها اليوم.
المنهجية
جهّزنا 40 deployments بإطار تقييم مستمر يُسجّل نتائج عيّنة مدمجة: مجموعة ذهبية ثابتة إضافةً إلى عيّنة متجددة من حركة الإنتاج الحقيقية. جُمعت النتائج أسبوعياً وقُورنت بخط الأساس عند الإطلاق ومعدلات الإبلاغ عن المشكلات من قِبَل المستخدمين على مدى ستة أشهر.
- جودة المخرجات مقارنةً بعيّنة مدمجة من المجموعة الذهبية والإنتاج، مُسجَّلة أسبوعياً.
- التباعد بين مقاييس خط الأساس عند الإطلاق ومقاييس العيّنة الحية.
- الفارق الزمني بين الانخفاض المكتشَف بواسطة إطار التقييم والمشكلات التي يُبلّغ عنها المستخدمون.