- عادةً ما يُتحقق مما إذا كان وكيل الذكاء الاصطناعي يتصرف بشكل خاطئ عبر قيام ذكاء اصطناعي آخر بإعادة قراءة مخرجاته. تقول Goodfire إنها قدّمت طريقة تقرأ الإشارات التي يحسبها النموذج داخلياً أثناء عمله، باستخدام كواشف صغيرة تُسمى المجسات.
- في اختبارات الشركة، كلّفت مراقبة نحو 1,500 جلسة من نموذج Kimi K3 حوالي 51 دولار. وقالت الشركة إن العمل نفسه سيكلّف 233 دولار باستخدام نموذج ذكاء اصطناعي رخيص يفحص كل خطوة، و حوالي 10,000 دولار باستخدام نموذج من الفئة العليا.
- في الاختبارات نفسها، رصدت الطريقة 94% من جلسات الاختراق الخبيثة، وأحالت 8.7% من الجلسات غير الضارة إلى مراجعة إضافية. وأوضحت الشركة أنه حتى مع تشغيل 4 مجسات في الوقت نفسه، فإن الوقت الذي يستغرقه النموذج قبل بدء الرد زاد بأقل من 2%.
- يمكن لعملاء Baseten اختيار ما يراقبونه من بين الاختراق، وسوء استخدام الأسلحة الكيميائية والحيوية، والاختراق عبر المكافآت. وعند العثور على شيء ما، يمكنهم تحديد الرد بين التسجيل أو المراجعة البشرية أو رفض الطلب.
تلفت انتباهي عبارة 'النسبة التي التقطها 94%'. لا يوضح المقال ما هي 6% الأخرى، لذلك يبدو الوثوق بها مبكرا قبل معرفة ذلك الجزء. الفرق بين 51 دولار و10,000 دولار كبير أيضا، لكن بما أن الأرقام جاءت من نموذج واحد هو Kimi K3 ومن اختبار داخلي لشركة واحدة، لست متأكدا من أنها ستبقى كما هي في بيئات أخرى. هل سبق لك أن حسبت التكلفة الفعلية لمراقبة الوكلاء؟