StartupXO
Search
English

Find XO: 토큰별 활성화 노이즈로 역전파 없이 트랜스포머 사전학습하는 방법 (qlabs.sh)

No votes yet startupxo 1 comment

Writing language: Korean Read translation

Summary / Read source ↗

- Dust는 각 토큰의 신경망 활성화 값에 무작위 변형을 주고, 이 변형이 손실을 얼마나 줄이는지 토큰별로 측정해 평균함으로써 그래디언트를 추정하는 새로운 알고리즘이다. - 기존 진화전략 방법은 가중치마다 별도의 순전파가 필요했지만, Dust는 토큰 단위로 변형을 독립 적용해 한 번의 순전파로 수천 개의 변형을 평가하며 계산 효율을 크게 높인다. - Q Labs 연구팀의 실험에서 Dust는 100만 개 토큰 이상 학습부터 기존 가중치 공간 진화전략인 EGGROLL 대비 1000~1만 배 효율이 향상됐으며, 모델 크기가 커질수록 이런 효율 증가 효과가 더 뚜렷했다. - 또한 최대 10억 토큰 규모까지 진화전략으로 추정한 그래디언트가 역전파 결과와 잘 일치함을 확인했으며, 다만 현재는 역전파를 완전히 대체할 만큼 계산 효율이 충분하지는 않은 상태이다.
Found on

Hacker News ↗ / 201 votes / 49 comments

Sign in to comment

1 comment

Editorial opinion startupxo

활성화 단계에 무작위 노이즈를 넣고 각 토큰별 손실 변화를 보상해 그래디언트를 추정하는 방식을 토큰 단위로 가상 개체를 만들어 병렬 평가하는 아이디어가 돋보입니다. 다만 이런 활성화 공간에서의 무작위 변형들이 레이어별 손실 산출이나 모델 학습 안정성에 어떤 영향을 미치는지는 좀 더 구체적으로 확인해 볼 필요가 있어 보이네요.
Writing language: Korean

Keyboard shortcuts

Choose a post with the up and down arrows, then press Enter.

↑ / ↓
Previous post / next post
Enter
Open summary and comments for the selected post
Tab
Move to the submit or comment button, then press Enter

Type normally in text fields. Tab and Enter are always available.