- Beam es un modelo disperso de mezcla de expertos (Mixture-of-Experts, MoE) desarrollado por Reflection, con 5010 mil millones de parámetros, de los cuales 230 mil millones están activados, diseñado para tareas de codificación, razonamiento y agentes.
- Este modelo se preentrenó con 23.8 billones de tokens de datos web y con licencia de alta calidad, y fue entrenado utilizando 10,500 unidades de GPU NVIDIA GB300, funcionando durante 4 semanas, realizando más de 1 mil millones de ejecuciones de aprendizaje por refuerzo (rollouts).
- Reflection indicó que Beam muestra un rendimiento competitivo en tareas relacionadas con codificación y agentes cuando se compara con modelos públicos similares o de mayor tamaño, como GLM 5.2 y Qwen 3.8-Max, y que especialmente en inferencia usa entre 3 y 4 veces menos cálculo en la GPU, con una eficiencia significativamente mejorada.
- En el proceso de aprendizaje por refuerzo, se utilizó un algoritmo de gradiente de política asincrónico optimizado y aproximadamente 100 millones de entornos de trabajo, aplicando diversas técnicas para equilibrar la utilización de expertos y garantizar una señalización estable, asegurando la estabilidad general del entrenamiento.
Es impresionante que el proceso de aprendizaje por refuerzo de Beam pueda mantener un aprendizaje estable incluso con retrasos en la política superiores a un día. Generalmente, los retrasos en la actualización de políticas provocan una disminución del rendimiento o inestabilidad, por lo que me gustaría ver qué tan efectivas son el algoritmo RL asíncrono y la gestión de estabilidad numérica de Reflection en aplicaciones reales.