
카카오는 언어모델링 국제 학회 ‘COLM 2026’에서 대규모 전문가 혼합(MoE) 모델의 학습 효율을 높이는 기술과 모델 크기를 줄이면서 성능을 개선하는 경량화 기술을 발표했다고 8일 밝혔다.
카카오는 대규모 MoE 모델 사전학습에 필요한 최적의 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법론을 제시했다. 학습률은 모델이 학습 과정에서 매개변수를 어느 정도 조정할지를 정하는 값으로 학습 안정성과 성능에 영향을 준다.
카카오는 소규모 모델에서 찾은 최적 학습 설정을 대규모 모델로 확장하는 ‘뮤-매개변수화’ 기법을 MoE 구조에 적용했다. 모델 크기와 학습 토큰량을 단계적으로 확대하면서 적정 학습률을 찾고, 짧은 학습 구간에서 찾은 설정이 대규모 학습에서도 적용되는지 검증했다.
이 방법은 카카오의 ‘Kanana-2.6-155b-a17b’ 모델 사전학습에도 적용됐다. 카카오는 이를 통해 10조 토큰 규모까지 안정적인 학습을 진행했다고 설명했다.
모델 경량화 기술인 ‘BBT’도 공개했다. BBT는 기존 단어와 단어 조각 중심의 처리 방식을 더 작은 단위인 바이트 기반으로 바꿔 모델 크기를 줄이는 기술이다. 비교 실험에서는 파라미터 수를 20.2~40.4% 줄이면서 테스트 성능을 2.7~6.6% 개선했다.
카카오는 이 기술을 통해 온디바이스 환경에서 모델의 메모리 부담을 줄이고 다국어 입력이나 오탈자가 많은 대화 환경에서도 안정적인 성능을 구현할 수 있을 것으로 기대하고 있다.
카카오 관계자는 “AI 모델의 성능을 유지하거나 높이면서 학습과 운영 비용을 낮출 수 있는 실용적인 해법”이라며 “다양한 모델 구조와 멀티모달, 다국어 환경으로 연구를 확대할 계획”이라고 말했다.



