Dev.to AI 🤖 Ai 👁 0 📖 8 min read

Reflection presenta Beam, MoE abierto de 501B parámetros

Reflection AI presentó el modelo abierto Beam, un sistema de mixtura de expertos con 501.000 millones de parámetros totales pero solo 23.000 millones activos por token. La startup lo entrenó para código, razonamiento y t

Reflection AI presentó el modelo abierto Beam, un sistema de mixtura de expertos con 501.000 millones de parámetros totales pero solo 23.000 millones activos por token. La startup lo entrenó para código, razonamiento y tareas agénticas, y promete publicar los pesos este mes.

El dato que más llama la atención no es el tamaño sino la eficiencia. Según Reflection, Beam iguala o supera a rivales abiertos como GLM-5.2 usando entre 3 y 4 veces menos cómputo de inferencia por token generado.

TL;DR

  • Reflection lanzó Beam, un modelo MoE de 501.000 millones de parámetros con 23.000 millones activos.- El entrenamiento usó 23,8 billones de tokens y más de 100 millones de rollouts de RL en GPU GB300.- Beam compite con GLM-5.2 en razonamiento usando entre 3 y 4 veces menos cómputo de inferencia.- Los pesos, el reporte técnico y las herramientas para desarrolladores salen este mes.- Queda pendiente el red-teaming final antes de abrir el acceso anticipado al modelo.

Qué es el modelo abierto Beam

El modelo abierto Beam es la primera familia de pesos abiertos de Reflection AI, una startup enfocada en modelos de lenguaje para agentes de software. Es un modelo de mixtura de expertos (MoE) con 501.000 millones de parámetros totales y 23.000 millones activos por token, pensado para programación, razonamiento y uso de herramientas.

La arquitectura de mixtura de expertos (MoE, por sus siglas en inglés) divide la red en bloques especializados, llamados expertos, y activa solo algunos en cada token. Por eso Beam carga 501.000 millones de parámetros en memoria, pero el cálculo real por token usa apenas 23.000 millones, unas 22 veces menos. Es la misma lógica que usan GLM-5.2 y Kimi K3, aunque Reflection la combina con un entrenamiento por refuerzo a una escala distinta.
Beam preentrenó con 23,8 billones de tokens de la web y datos licenciados antes de pasar a RL.

Qué pasó con Beam de Reflection AI

Reflection construyó Beam sobre dos pilares. El primero fue un preentrenamiento con 23,8 billones de tokens curados de la web y de conjuntos de datos licenciados, con el que la compañía dice igualar o superar a modelos base abiertos de tamaño similar.

El segundo pilar fue una corrida de aprendizaje por refuerzo (RL) a gran escala. Reflection desarrolló algoritmos, entornos de entrenamiento e infraestructura propia para sostener ese cómputo, y generó más de 100 millones de rollouts sobre 10.500 GPU NVIDIA GB300 durante cuatro semanas.

La compañía describe esta corrida como una de las más grandes jamás reportadas por un laboratorio abierto. Es una cifra que solo Reflection puede confirmar con sus propios registros, pero el volumen de rollouts y de sandboxes de entrenamiento que detalla en su reporte respalda la afirmación.

El modelo todavía está en etapa de red-teaming final y evaluaciones de seguridad. Reflection abrió una lista de espera para acceso anticipado y anunció que los pesos, el reporte técnico, la tarjeta de modelo y las herramientas para desarrolladores saldrán más adelante este mes.

Contexto: la carrera de los modelos abiertos

Reflection posiciona a Beam como el modelo que empuja la frontera abierta occidental. En benchmarks de código y uso de agentes, la compañía lo describe competitivo con modelos abiertos más grandes como GLM-5.2, y cerca de Qwen 3.8-Max. Modelos como Kimi K3 siguen por delante en capacidad bruta, pero Reflection sostiene que la ventaja de Beam está en la eficiencia al momento de inferir, no en ganar cada benchmark.

La comparación incluye además a GLM-5.3, Nemotron 3 Ultra, DeepSeek V4.1 Flash e Inkling, el modelo de mixtura de expertos de Thinking Machines. Todos compiten hoy en la misma categoría: modelos grandes, con pesos abiertos, pensados para programar y operar herramientas de forma autónoma.

Vale la aclaración: la mayoría de los modelos abiertos que hoy lideran las tablas de benchmarks (GLM, Kimi, Qwen, DeepSeek) vienen de laboratorios chinos. Reflection enmarca explícitamente a Beam como una opción abierta entrenada fuera de ese bloque, algo que importa para empresas que por política interna prefieren no depender de modelos chinos ni de APIs cerradas.

Cómo funciona por dentro: el mecanismo detrás de Beam

La pieza más cara de construir Beam no fue el preentrenamiento, sino la corrida de RL. Reflection usó 10.500 GPU NVIDIA GB300 durante cuatro semanas para generar sus más de 100 millones de rollouts, con una ventana de contexto de hasta 256.000 tokens durante el entrenamiento. Para calificar y entrenar sobre esos rollouts, la compañía ejecutó aproximadamente 1.300 millones de sandboxes, alimentados por un millón de entornos de programación, uso de agentes y ciencia que Reflection construyó específicamente para esta corrida.

Pensalo como una sala de emergencias con un millón de casos simulados: cada sandbox es un paciente con un problema real de código o de uso de herramientas, y el modelo recibe una nota de cuánto acertó. Con suficientes casos y suficientes notas, el modelo aprende qué estrategia de razonamiento funciona mejor en cada tipo de problema, no solo a repetir texto parecido al de su entrenamiento.

Según el reporte de Reflection, las capacidades del modelo siguieron mejorando a medida que crecía el cómputo de RL, sin señales de estancamiento. Para dar una idea de escala, la compañía compara su corrida con las 30 millones de rollouts usadas para entrenar Inkling y las 753.000 de MiMo: Beam entrenó con un volumen de rollouts entre 3 y 130 veces mayor que esos dos modelos.

flowchart TD
    A["Preentrenamiento: 23.8T tokens"] --> B["RL a gran escala: 10.500 GPU GB300, 4 semanas"]
    B --> C["100M+ rollouts, 1.300M sandboxes"]
    C --> D["Beam: 501B total, 23B activos"]
    D --> E["Inferencia eficiente en produccion"]

Reflection mide la eficiencia de Beam en FLOPs estimados, no en costo de inferencia medido en producción. El cálculo multiplica el número de parámetros activados por los tokens generados en cada intento, y deja afuera el prefill del prompt, la atención dependiente del contexto y el overhead del servicio. No hay forma directa de verificar esta comparación desde afuera, porque Reflection no publicó las corridas de inferencia reales detrás del gráfico, solo la metodología del estimado.
ModeloTerminal-Bench v2.1GPQA DiamondHLE (sin herramientas)Beam80.190.536.2GLM-5.281.091.240.5GLM-5.388.291.742.3Kimi K388.393.546.9Qwen 3.8-Max86.692.643.6DeepSeek V4.1 Flash90.690.939.1Nemotron 3 Ultra56.487.026.7Inkling63.887.229.7
Los números vienen del propio reporte de Reflection y de datos de Artificial Analysis, que la compañía usa como referencia para los modelos rivales. Beam queda por debajo de GLM-5.3, Kimi K3 y Qwen 3.8-Max en estos tres benchmarks, pero Reflection argumenta que esos modelos necesitan muchos más parámetros activados por token para llegar ahí.
La corrida de RL de Beam usó 10.500 GPU GB300 durante cuatro semanas consecutivas.

Impacto y análisis

El modelo abierto Beam demuestra que la carrera ya no se gana solo con el benchmark más alto: también se gana con cuánto cuesta cada respuesta. Si una empresa en LATAM necesita desplegar un asistente de código a escala, pagar por 23.000 millones de parámetros activados es mucho más barato que pagar por los más de 2 billones que activan modelos como Qwen 3.8-Max en cada token.

Esto no cierra la discusión sobre quién lidera los modelos abiertos. Kimi K3, GLM-5.3 y DeepSeek V4.1 Flash siguen por delante de Beam en casi todos los benchmarks de la tabla anterior. Lo que cambia es que ahora hay una opción abierta, entrenada fuera de China, que compite en esa misma categoría con una propuesta explícita de eficiencia.

💭 Clave: Beam no busca ser el modelo más capaz de la tabla. Busca ser el más barato de correr entre los que se acercan al tope.

Qué sigue para Beam

Reflection todavía no liberó los pesos de Beam. La compañía dice que completará el red-teaming final y publicará pesos, reporte técnico, tarjeta de modelo y herramientas para desarrolladores durante lo que queda de octubre de 2026. Hasta entonces, el acceso es solo por lista de espera.

Si el calendario se cumple, Beam se sumaría a GLM-5.2, GLM-5.3, Kimi K3, Qwen 3.8-Max y DeepSeek V4.1 Flash como una opción más para correr localmente o en infraestructura propia, sin depender de una API cerrada.

📖 Resumen en Telegram: Ver resumen

Probalo vos: anotate en la lista de espera de acceso anticipado en la publicación oficial de Reflection AI para correr Beam en cuanto liberen los pesos este mes.

Preguntas frecuentes

¿Cuándo se publican los pesos de Beam de Reflection AI?

Reflection anunció que planea liberar los pesos, el reporte técnico, la tarjeta de modelo y las herramientas para desarrolladores durante lo que queda de octubre de 2026, una vez termine el red-teaming final.

¿Cuántos parámetros activa Beam por token?

Beam activa 23.000 millones de parámetros por token, de un total de 501.000 millones. Es una arquitectura de mixtura de expertos, así que la mayoría de los parámetros quedan inactivos en cada paso de cálculo.

¿Beam es mejor que GLM-5.2 o Qwen 3.8-Max?

En benchmarks como GPQA Diamond y Terminal-Bench v2.1, Beam queda apenas por debajo de GLM-5.2 y Qwen 3.8-Max. Reflection sostiene que la diferencia real está en la eficiencia: Beam necesita entre 3 y 4 veces menos cómputo por token que GLM-5.2 para llegar a un resultado comparable.

¿Qué hardware usó Reflection AI para entrenar Beam?

La corrida de aprendizaje por refuerzo usó 10.500 GPU NVIDIA GB300 durante cuatro semanas, generando más de 100 millones de rollouts con hasta 256.000 tokens de contexto.

¿Beam ya está disponible para probar hoy?

No. Beam está en etapa de red-teaming final y Reflection solo ofrece una lista de espera para acceso anticipado; los pesos públicos llegan después, según la compañía, dentro de este mes.

Referencias

  • Reflection AI: anuncio oficial de Beam, con benchmarks, metodología de RL y cronograma de publicación.- Wikipedia: explicación general de la arquitectura de mixtura de expertos (MoE).- Artificial Analysis: fuente de datos usada por Reflection para comparar a Beam con otros modelos.- NVIDIA: fabricante de las GPU GB300 usadas en la corrida de RL de Beam.

📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.

📰 Read the original article on Dev.to AI

Originally published by Dev.to AI. Aggregated on AIWithGhost for educational purposes — full credit and traffic to the original publisher.