[더파워 류동우 기자] 카카오가 대규모 AI 모델 학습에 들어가는 시행착오를 줄이고, 모델 크기는 최대 40.4% 줄이면서 성능은 최대 6.6% 높이는 연구 결과를 공개했다. 대규모 전문가 혼합(MoE) 모델의 최적 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법은 실제 ‘카나나’ 모델에 적용돼 10조 토큰 규모의 사전학습까지 이어졌다.
카카오는 언어모델링 국제 학회 ‘COLM 2026’에서 대규모 MoE 모델의 학습 효율을 높이는 기술과 모델을 경량화하면서 성능을 개선하는 연구 성과를 발표했다고 8일 밝혔다.
카카오는 메인 컨퍼런스에서 ‘Let’s Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts’ 논문을 통해 대규모 MoE 모델의 최적 학습률을 적은 비용으로 찾는 방법론을 소개했다.
학습률은 AI 모델이 학습 과정에서 내부 매개변수를 얼마나 크게 조정할지를 정하는 값이다. 지나치게 높으면 학습이 불안정해질 수 있고, 낮으면 속도가 느려질 수 있어 적절한 값을 찾는 과정이 모델 성능과 학습 안정성에 영향을 준다.
특히 MoE는 고성능 대규모언어모델(LLM)의 핵심 구조로 활용되고 있지만 Dense 모델과 비교해 학습 설정과 방법에 대한 공개 연구가 상대적으로 부족해 대규모 학습 과정에서 비용과 시행착오가 커질 수 있다.
카카오는 소규모 모델에서 확보한 최적 학습 설정을 대규모 모델로 확장하는 ‘뮤-매개변수화(μ-Parameterization)’ 기법을 MoE 구조에 맞게 적용했다.
모델 크기와 학습 토큰 수를 단계적으로 늘리면서 최적 학습률을 찾고, 짧은 학습 구간에서 도출한 설정이 대규모 학습에서도 유효한지를 검증하는 방식이다. 이를 통해 전체 학습 비용의 약 1% 수준으로 최적 학습률을 예측할 수 있도록 했다.
해당 방법론은 카카오의 ‘Kanana-2.6-155b-a17b’ 모델 사전학습에도 실제 적용됐다. 카카오는 이를 기반으로 10조 토큰까지 안정적인 학습을 진행했다고 설명했다.
모델 자체를 가볍게 만드는 연구도 함께 공개했다. 카카오는 토크나이제이션 워크숍 ‘TokShop’에서 ‘BBT: BPE-Guided Byte Transformer’를 발표했다.
기존 BPE 방식은 단어나 단어 조각에 해당하는 정보를 다수 저장하는 구조다. BBT는 이를 더 작은 기본 단위인 ‘바이트’ 중심 구조로 바꾸면서도 여러 문자를 묶어 압축 처리하는 기존 BPE 방식의 장점을 유지하도록 설계됐다.
비교 실험에서는 파라미터 수가 20.2~40.4% 감소했다. 반면 테스트 성능은 2.7~6.6% 개선됐다.
오탈자나 문자 교란에 대한 대응 능력도 높였으며, 학습하지 않은 언어로의 전이 성능 역시 개선됐다. 카카오는 이를 통해 온디바이스 환경에서 모델의 메모리 부담을 줄이고 다국어 입력이나 오탈자가 많은 대화 환경에서도 안정적인 성능을 구현할 수 있을 것으로 보고 있다.
카카오는 앞으로 연구 적용 대상을 다양한 모델 구조로 확대하고 대규모 LLM의 학습 비용을 추가로 낮추는 방향으로 기술을 고도화할 계획이다.
카카오 관계자는 "이번 연구들은 AI 모델의 성능을 유지하거나 향상시키면서도 학습 및 운영 비용을 낮출 수 있는 실용적인 해법을 제시했다는 데 의의가 있다"며 "앞으로 다양한 모델 구조와 멀티모달 및 다국어 환경으로 연구를 확장해 실제 서비스 활용 가능성을 높이며 글로벌 경쟁력 강화를 이어가겠다"고 말했다.