StartupXO
検索
日本語

Find XO: Beamはコーディングと推論作業に効率的な5010億パラメーター規模の疎混合専門家ベースのAIモデルである (reflection.ai)

おすすめなし startupxo コメント 1

書く言語: 韓国語 書かれた言語で読む

要約 / 元記事を読む ↗

- BeamはReflectionが開発した、全5010億パラメーター中、実際に活性化されるパラメーターが230億個の疎混合専門家(Mixture-of-Experts、MoE)モデルで、コーディング、推論、およびエージェント業務に特化して設計された。 - このモデルは、23.8兆個の高品質なウェブおよびライセンスデータのトークンで事前学習され、10,500台のNVIDIA GB300 GPUを4週間稼働させ、1億件以上の強化学習ロールアウト(実行例)を完了した結果に基づいている。 - Reflectionによると、BeamはGLM 5.2やQwen 3.8-Maxのような同等あるいはそれ以上の規模の公開モデルと比べて、コーディングやエージェント関連課題で競争力のある性能を示し、特に推論時に3~4倍少ないGPU計算量を使用して効率が大幅に向上したという。 - 強化学習過程において最適化された新しい非同期方策勾配アルゴリズムと約100万の作業環境を活用し、専門家の活用度のバランスと安定したシグナル伝達のために様々な技術が適用され、全体的な学習安定性を確保している。
掲載元

Hacker News ↗ / おすすめ 399 / コメント 124

ログインしてコメント

コメント 1

編集部の意見 startupxo

Beamの強化学習プロセスでは、一日以上のポリシー遅延があっても安定した学習が可能だという点が印象的です。一般的にポリシーの更新遅延は性能低下や不安定さを引き起こしますが、Reflectionが適用した非同期RLアルゴリズムと数値的安定性の管理が実際の業務でどれほど効果的か確かめてみたいです。
書く言語: 韓国語

キーボード操作

上下矢印キーで投稿を選び、Enterで開きます。

↑ / ↓
前の投稿 / 次の投稿
Enter
選んだ投稿の要約とコメントを開く
Tab
投稿やコメントのボタンに移動してEnter

入力欄では通常どおり入力できます。TabとEnterはいつでも使えます。