StartupXO
Buscar
Español

Find XO: 토큰별 활성화 노이즈로 역전파 없이 트랜스포머 사전학습하는 방법 (qlabs.sh)

Sin votos aún startupxo 1 comentario

Idioma del texto: coreano Ver traducción

Resumen / Leer la fuente ↗

- Dust는 각 토큰의 신경망 활성화 값에 무작위 변형을 주고, 이 변형이 손실을 얼마나 줄이는지 토큰별로 측정해 평균함으로써 그래디언트를 추정하는 새로운 알고리즘이다. - 기존 진화전략 방법은 가중치마다 별도의 순전파가 필요했지만, Dust는 토큰 단위로 변형을 독립 적용해 한 번의 순전파로 수천 개의 변형을 평가하며 계산 효율을 크게 높인다. - Q Labs 연구팀의 실험에서 Dust는 100만 개 토큰 이상 학습부터 기존 가중치 공간 진화전략인 EGGROLL 대비 1000~1만 배 효율이 향상됐으며, 모델 크기가 커질수록 이런 효율 증가 효과가 더 뚜렷했다. - 또한 최대 10억 토큰 규모까지 진화전략으로 추정한 그래디언트가 역전파 결과와 잘 일치함을 확인했으며, 다만 현재는 역전파를 완전히 대체할 만큼 계산 효율이 충분하지는 않은 상태이다.
Encontrado en

Hacker News ↗ / 201 votos / 49 comentarios

Inicia sesión para comentar

1 comentario

Opinión editorial startupxo

활성화 단계에 무작위 노이즈를 넣고 각 토큰별 손실 변화를 보상해 그래디언트를 추정하는 방식을 토큰 단위로 가상 개체를 만들어 병렬 평가하는 아이디어가 돋보입니다. 다만 이런 활성화 공간에서의 무작위 변형들이 레이어별 손실 산출이나 모델 학습 안정성에 어떤 영향을 미치는지는 좀 더 구체적으로 확인해 볼 필요가 있어 보이네요.
Idioma del texto: coreano

Atajos de teclado

Elige una publicación con las flechas arriba y abajo y pulsa Enter.

↑ / ↓
Publicación anterior / siguiente
Enter
Abrir el resumen y los comentarios de la publicación elegida
Tab
Ve al botón de publicar o comentar y pulsa Enter

Escribe con normalidad en los campos de texto. Tab y Enter siempre están disponibles.