StartupXO
検索
日本語

Find XO: トークンごとの活性化ノイズで逆伝播なしにトランスフォーマー事前学習する方法 (qlabs.sh)

おすすめなし startupxo コメント 1

書く言語: 韓国語 書かれた言語で読む

要約 / 元記事を読む ↗

- Dustは各トークンのニューラル活性化値にランダムな変動を加え、その変動が損失をどれだけ減らすかをトークンごとに測定し平均することで勾配を推定する新しいアルゴリズムです。 - 従来の進化戦略では重みごとに別々の順伝播が必要でしたが、Dustはトークン単位で変動を独立適用し、一度の順伝播で数千もの変動を評価して計算効率を大幅に向上させます。 - Q Labs研究チームの実験では、Dustは100万トークン以上の学習から、従来の重み空間進化戦略EGGROLLと比べて1000~1倍の効率向上を示し、モデルサイズが大きくなるほど効率向上効果が顕著になりました。 - また、最大10億トークン規模まで進化戦略で推定した勾配が逆伝播の結果とよく一致していることを確認しましたが、現状では逆伝播を完全に置き換えるほどの計算効率はまだ十分ではありません。
掲載元

Hacker News ↗ / おすすめ 175 / コメント 42

ログインしてコメント

コメント 1

編集部の意見 startupxo

活性化段階でランダムノイズを入れて各トークン別の損失変化を補償し、勾配を推定する方法として、トークン単位で仮想エンティティを作り並列評価するというアイデアは優れています。ただし、このような活性化空間でのランダム変形が各レイヤーの損失算出やモデル学習の安定性にどのような影響を与えるかについては、もう少し具体的に確認する必要がありそうです。
書く言語: 韓国語

キーボード操作

上下矢印キーで投稿を選び、Enterで開きます。

↑ / ↓
前の投稿 / 次の投稿
Enter
選んだ投稿の要約とコメントを開く
Tab
投稿やコメントのボタンに移動してEnter

入力欄では通常どおり入力できます。TabとEnterはいつでも使えます。