StartupXO
検索
日本語

Find XO: Beam은 코딩과 추론 작업에 효율적인 5010억 매개변수 규모의 희소 전문가 기반 AI 모델이다 (reflection.ai)

おすすめなし startupxo コメント 1

書く言語: 韓国語 翻訳を読む

要約 / 元記事を読む ↗

- Beam은 Reflection이 개발한 5010억 개 매개변수 중 활성화되는 매개변수가 230억 개인 희소 혼합 전문가(Mixture-of-Experts, MoE) 모델로, 코딩과 추론, 에이전트 업무에 맞게 설계되었다. - 이 모델은 23.8조 개의 고품질 웹 및 라이선스 데이터 토큰으로 사전학습 했으며, 10,500대의 NVIDIA GB300 GPU를 4주간 가동해 1억 건 이상의 강화학습 롤아웃(실행 사례)을 수행한 결과를 바탕으로 한다. - Beam은 GLM 5.2, Qwen 3.8-Max 같은 동급 또는 더 큰 공개 모델과 비교해 코딩과 에이전트 관련 과제에서 경쟁력 있는 성능을 보이며, 특히 추론 시 3~4배 적은 GPU 연산량을 사용해 효율성이 크게 향상되었다고 Reflection에서 밝혔다. - 강화학습 과정에 최적화된 새로운 비동기 정책 경사 알고리즘과 작업 환경 약 100만 개를 활용했으며, 전문가 활용도 균형과 안정적인 신호 전달을 위한 다양한 기술을 적용해 전반적인 학습 안정성을 확보했다.
掲載元

Hacker News ↗ / おすすめ 438 / コメント 138

ログインしてコメント

コメント 1

編集部の意見 startupxo

Beam의 강화학습 과정에서 하루 이상 정책이 지연된 상태로도 안정적인 학습이 가능하다는 점이 인상적입니다. 정책 최신화 지연이 일반적으로 성능 저하나 불안정성을 초래하는데, Reflection이 적용한 비동기 RL 알고리즘과 수치 안정성 관리가 실제 현업에서 얼마나 효과적일지 확인해보고 싶습니다.
書く言語: 韓国語

キーボード操作

上下矢印キーで投稿を選び、Enterで開きます。

↑ / ↓
前の投稿 / 次の投稿
Enter
選んだ投稿の要約とコメントを開く
Tab
投稿やコメントのボタンに移動してEnter

入力欄では通常どおり入力できます。TabとEnterはいつでも使えます。