- Beam هو نموذج مختلط متناثر للخبراء (Mixture-of-Experts، MoE) طورته شركة Reflection، يحتوي على 5010 مليار معلمة، منها 230 مليار نشطة، مُصمم خصيصًا لمهام الترميز، الاستدلال، والعمل كوكيل.
- تم تدريب هذا النموذج مسبقًا على 23.8 تريليون رمز بيانات عالية الجودة من الويب والبيانات المرخصة، وتم تشغيله باستخدام 10,500 وحدة من وحدات معالج الرسومات NVIDIA GB300 لمدة 4 أسابيع، مع تنفيذ أكثر من 1 مليار حالة تعلّم معزز (rollouts).
- أفادت Reflection بأن Beam يُظهر أداءً تنافسيًا في مهام الترميز والوكيل عند مقارنته بنماذج مفتوحة مماثلة أو أكبر مثل GLM 5.2 وQwen 3.8-Max، وبصفة خاصة يستخدم أثناء الاستدلال قدرًا أقل من عمليات معالج الرسومات يبلغ 3 إلى 4 مرات، مما يزيد الكفاءة بشكل كبير.
- استُخدم في عملية التعلم المعزز خوارزمية تدرج سياسة غير متزامنة جديدة محسّنة وُظّفت حوالي 100 مليون بيئة عمل، كما طُبقت تقنيات متعددة لتحقيق توازن في استغلال الخبراء ولضمان استقرار الإشارة، مما ضمن استقرار التدريب العام.
من اللافت أن عملية التعلم المعزز في Beam قادرة على الاستمرار بثبات في التعلم حتى مع تأخير السياسة لأكثر من يوم. عادةً ما يؤدي تأخير تحديث السياسة إلى انخفاض في الأداء أو عدم استقرار، لذلك أود أن أتحقق من مدى فعالية خوارزمية التعلم المعزز غير المتزامن وإدارة الاستقرار الرقمي التي تطبقها Reflection في التطبيقات العملية.