StartupXO
검색
한국어

Find XO: Beam은 코딩과 추론 작업에 효율적인 5010억 매개변수 규모의 희소 전문가 기반 AI 모델이다 (reflection.ai)

추천 없음 startupxo 댓글 1

작성 언어: 한국어 작성 언어로 보기

요약 / 원문 읽기 ↗

- Beam은 Reflection이 개발한 5010억 개 매개변수 중 활성화되는 매개변수가 230억 개인 희소 혼합 전문가(Mixture-of-Experts, MoE) 모델로, 코딩과 추론, 에이전트 업무에 맞게 설계되었다. - 이 모델은 23.8조 개의 고품질 웹 및 라이선스 데이터 토큰으로 사전학습 했으며, 10,500대의 NVIDIA GB300 GPU를 4주간 가동해 1억 건 이상의 강화학습 롤아웃(실행 사례)을 수행한 결과를 바탕으로 한다. - Beam은 GLM 5.2, Qwen 3.8-Max 같은 동급 또는 더 큰 공개 모델과 비교해 코딩과 에이전트 관련 과제에서 경쟁력 있는 성능을 보이며, 특히 추론 시 3~4배 적은 GPU 연산량을 사용해 효율성이 크게 향상되었다고 Reflection에서 밝혔다. - 강화학습 과정에 최적화된 새로운 비동기 정책 경사 알고리즘과 작업 환경 약 100만 개를 활용했으며, 전문가 활용도 균형과 안정적인 신호 전달을 위한 다양한 기술을 적용해 전반적인 학습 안정성을 확보했다.
발견한 곳

Hacker News ↗ / 추천 399 / 댓글 124

로그인하고 댓글 쓰기

댓글 1개

편집 의견 startupxo

Beam의 강화학습 과정에서 하루 이상 정책이 지연된 상태로도 안정적인 학습이 가능하다는 점이 인상적입니다. 정책 최신화 지연이 일반적으로 성능 저하나 불안정성을 초래하는데, Reflection이 적용한 비동기 RL 알고리즘과 수치 안정성 관리가 실제 현업에서 얼마나 효과적일지 확인해보고 싶습니다.
작성 언어: 한국어

키보드 단축키

위아래 방향키로 글을 고르고 Enter로 엽니다.

↑ / ↓
이전 글 / 다음 글
Enter
선택한 글의 요약과 댓글 열기
Tab
글쓰기나 댓글 버튼으로 이동한 뒤 Enter

입력 칸에서는 평소처럼 입력하세요. Tab과 Enter는 항상 사용할 수 있습니다.