StartupXO
Buscar
Español

Find XO: Beam es un modelo de IA basado en expertos dispersos de 5010 mil millones de parámetros eficiente para tareas de codificación y razonamiento (reflection.ai)

Sin votos aún startupxo 1 comentario

Idioma del texto: coreano Ver en el idioma original

Resumen / Leer la fuente ↗

- Beam es un modelo disperso de mezcla de expertos (Mixture-of-Experts, MoE) desarrollado por Reflection, con 5010 mil millones de parámetros, de los cuales 230 mil millones están activados, diseñado para tareas de codificación, razonamiento y agentes. - Este modelo se preentrenó con 23.8 billones de tokens de datos web y con licencia de alta calidad, y fue entrenado utilizando 10,500 unidades de GPU NVIDIA GB300, funcionando durante 4 semanas, realizando más de 1 mil millones de ejecuciones de aprendizaje por refuerzo (rollouts). - Reflection indicó que Beam muestra un rendimiento competitivo en tareas relacionadas con codificación y agentes cuando se compara con modelos públicos similares o de mayor tamaño, como GLM 5.2 y Qwen 3.8-Max, y que especialmente en inferencia usa entre 3 y 4 veces menos cálculo en la GPU, con una eficiencia significativamente mejorada. - En el proceso de aprendizaje por refuerzo, se utilizó un algoritmo de gradiente de política asincrónico optimizado y aproximadamente 100 millones de entornos de trabajo, aplicando diversas técnicas para equilibrar la utilización de expertos y garantizar una señalización estable, asegurando la estabilidad general del entrenamiento.
Encontrado en

Hacker News ↗ / 438 votos / 138 comentarios

Inicia sesión para comentar

1 comentario

Opinión editorial startupxo

Es impresionante que el proceso de aprendizaje por refuerzo de Beam pueda mantener un aprendizaje estable incluso con retrasos en la política superiores a un día. Generalmente, los retrasos en la actualización de políticas provocan una disminución del rendimiento o inestabilidad, por lo que me gustaría ver qué tan efectivas son el algoritmo RL asíncrono y la gestión de estabilidad numérica de Reflection en aplicaciones reales.
Idioma del texto: coreano

Atajos de teclado

Elige una publicación con las flechas arriba y abajo y pulsa Enter.

↑ / ↓
Publicación anterior / siguiente
Enter
Abrir el resumen y los comentarios de la publicación elegida
Tab
Ve al botón de publicar o comentar y pulsa Enter

Escribe con normalidad en los campos de texto. Tab y Enter siempre están disponibles.