Dust, 역전파 없이 트랜스포머 사전 학습하는 제로차 최적화 기법 공개
Samip Dahal과 Bishwas Mandal 등 연구진이 이끄는 Q Labs 팀이 2026년 10월, 역전파를 사용하지 않고 트랜스포머 언어 모델을 사전 학습할 수 있는 새로운 방법론인 Dust를 공개했다.
JORE2
Samip Dahal과 Bishwas Mandal 등 연구진이 이끄는 Q Labs 팀이 2026년 10월, 역전파를 사용하지 않고 트랜스포머 언어 모델을 사전 학습할 수 있는 새로운 방법론인 Dust를 공개했다.
개발자 mvakde가 5090 GPU로 1.5시간 만에 학습한 소형 트랜스포머가 ARC-AGI-1 벤치마크에서 44%의 점수를 기록했습니다. 학습 비용은 약 67센트에 불과하며, 기존 대규모 언어 모델 대비 샘플 효율성 문제…
트랜스포머 아키텍처의 핵심인 쿼리, 키, 밸런스 세 투영이 필수인지에 대한 의문이 제기되며 AI 효율성 논의가 급물살을 탔습니다. 기존 설계를 단순화해도 성능을 유지할 수 있다는 검증 결과가 나오면서 온디바이스 AI 구현의…
단순히 기존 모델을 사용하는 것을 넘어, 데이터 수집부터 학습, 평가까지 전 과정을 직접 구현하는 스탠포드 CS336 과정이 글로벌 AI 커뮤니티에서 뜨거운 감자로 떠올랐습니다.
트랜스포머 모델 학습의 속도를 결정짓는 핵심 병목이 단순한 연산이 아닌 데이터 이동에 있다는 사실, CODA가 이를 GEMM 연산의 끝부분에 통합해 해결하며 AI 개발 패러다임을 바꾸고 있습니다.
PaddleOCR 3.5가 허깅페이스 트랜스포머 백엔드를 공식 지원하며 OCR 및 문서 파싱 작업의 유연성을 크게 높였습니다. 기존 PaddlePaddle 모델과 트랜스포머 환경의 자연스러운 연동은 개발자가 엔진 설정만 변경…
최신 AI 의 핵심인 트랜스포머 구조가 35 년 전의 하이퍼카드에서 구현되었다는 사실이 기술 커뮤니티를 뜨겁게 달구고 있습니다. 하드웨어의 물리적 한계를 수학의 정교함으로 극복한 이 프로젝트는 단순한 호기심을 넘어 현대 AI…