AI 핵심 요약
beta- 카카오는 8일 COLM 2026서 LLM 최적화 기술을 공개했다
- MoE 학습률 예측법으로 전체 비용의 약 1%만 사용했다
- BBT로 파라미터 20.2~40.4% 줄이고 성능은 높였다
!AI가 자동 생성한 요약으로 정확하지 않을 수 있어요.
모델 파라미터 20~40% 줄이고 성능은 최대 6.6% 향상
[서울=뉴스핌] 심재민 인턴기자 = 카카오가 고성능 대규모언어모델(LLM) 개발에 필요한 연산 자원을 줄이면서 성능을 유지하거나 높이는 학습 최적화·모델 경량화 기술을 공개했다.
카카오는 언어모델링 국제 학회 'COLM(Conference on Language Modeling) 2026'에서 대규모 전문가 혼합(MoE) 모델의 학습 효율을 높이는 기술과 모델 크기를 줄이는 경량화 연구 성과를 발표했다고 8일 밝혔다.

COLM은 LLM과 언어모델링 연구를 다루는 국제 학회로 2024년 신설됐다. 카카오는 이번 학회 메인 컨퍼런스와 토크나이제이션 워크숍 'TokShop'에서 각각 연구 결과를 발표했다.
카카오가 메인 컨퍼런스에서 발표한 논문은 대규모 MoE 모델을 사전 학습할 때 필요한 최적의 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법을 담았다.
학습률은 AI 모델이 학습 과정에서 매개변수를 얼마나 크게 조정할지 결정하는 값이다. 지나치게 높으면 학습이 불안정해지고 낮으면 학습 속도가 느려질 수 있어 대규모 모델 개발 과정에서 적절한 값을 찾는 것이 중요하다.
카카오는 소규모 모델에서 찾은 최적의 학습 설정을 대규모 모델로 확장하는 '뮤-매개변수화(μ-Parameterization)' 기법을 MoE 구조에 맞게 적용했다.
모델 크기와 학습 토큰량을 단계적으로 늘리며 최적의 학습률을 탐색하고, 짧은 학습에서 찾은 설정이 대규모 학습에서도 유효하다는 점을 검증했다.
해당 방법은 카카오의 AI 모델 카나나 사전학습에도 실제 적용돼 최대 10조개 토큰을 안정적으로 학습하는 데 활용됐다.
카카오는 모델 경량화 기술 'BBT(BPE-Guided Byte Transformer)'도 공개했다. 비교 실험에서 파라미터 수를 20.2~40.4% 줄이면서 테스트 성능은 2.7~6.6% 개선했다.
카카오는 이를 통해 스마트폰 등 온디바이스 환경에서 AI 모델의 메모리 부담을 줄이고 다국어 입력이나 오탈자가 많은 대화 환경에서도 안정적인 성능을 구현할 수 있을 것으로 기대하고 있다.
flurry327@newspim.com












