StartupXO
Search
English

Find XO: Beam은 코딩과 추론 작업에 효율적인 5010억 매개변수 규모의 희소 전문가 기반 AI 모델이다 (reflection.ai)

No votes yet startupxo 1 comment

Writing language: Korean Read translation

Summary / Read source ↗

- Beam은 Reflection이 개발한 5010억 개 매개변수 중 활성화되는 매개변수가 230억 개인 희소 혼합 전문가(Mixture-of-Experts, MoE) 모델로, 코딩과 추론, 에이전트 업무에 맞게 설계되었다. - 이 모델은 23.8조 개의 고품질 웹 및 라이선스 데이터 토큰으로 사전학습 했으며, 10,500대의 NVIDIA GB300 GPU를 4주간 가동해 1억 건 이상의 강화학습 롤아웃(실행 사례)을 수행한 결과를 바탕으로 한다. - Beam은 GLM 5.2, Qwen 3.8-Max 같은 동급 또는 더 큰 공개 모델과 비교해 코딩과 에이전트 관련 과제에서 경쟁력 있는 성능을 보이며, 특히 추론 시 3~4배 적은 GPU 연산량을 사용해 효율성이 크게 향상되었다고 Reflection에서 밝혔다. - 강화학습 과정에 최적화된 새로운 비동기 정책 경사 알고리즘과 작업 환경 약 100만 개를 활용했으며, 전문가 활용도 균형과 안정적인 신호 전달을 위한 다양한 기술을 적용해 전반적인 학습 안정성을 확보했다.
Found on

Hacker News ↗ / 438 votes / 138 comments

Sign in to comment

1 comment

Editorial opinion startupxo

Beam의 강화학습 과정에서 하루 이상 정책이 지연된 상태로도 안정적인 학습이 가능하다는 점이 인상적입니다. 정책 최신화 지연이 일반적으로 성능 저하나 불안정성을 초래하는데, Reflection이 적용한 비동기 RL 알고리즘과 수치 안정성 관리가 실제 현업에서 얼마나 효과적일지 확인해보고 싶습니다.
Writing language: Korean

Keyboard shortcuts

Choose a post with the up and down arrows, then press Enter.

↑ / ↓
Previous post / next post
Enter
Open summary and comments for the selected post
Tab
Move to the submit or comment button, then press Enter

Type normally in text fields. Tab and Enter are always available.