■ 논문 리뷰 100편째, 절반 지점에서 만난 질문
이 블로그에서 논문을 리뷰한 지 어느덧 100편째입니다. 200편을 목표로 달려온 여정의 정확히 절반 지점인데요, 마침 이 자리에 어울리는 논문을 골랐습니다. 바로 Apple의 연구진(Pierre Ablin 등)이 공개한 Soup-of-Experts입니다. 제목부터 재미있죠. '전문가들의 수프'라니, 대체 무슨 의미일까요.
질문은 이렇습니다. 회사가 법률 문서에 특화된 모델, 의학 논문에 특화된 모델, 코드에 특화된 모델, 이렇게 수십 개의 특화 모델이 필요하다면 어떻게 해야 할까요. 가장 단순한 방법은 도메인마다 모델을 하나씩 처음부터 학습시키는 것입니다. 하지만 이건 학습 비용이 도메인 개수만큼 곱절로 늘어나는 매우 비효율적인 방식입니다. Soup-of-Experts는 바로 이 문제를, 학습은 딱 한 번만 하고 필요할 때마다 즉석에서 원하는 모델을 만들어내는 방식으로 해결합니다.
■ 핵심 아이디어: 미리 섞어둔 재료로 원하는 요리를 즉석에서
이 논문의 구조는 크게 세 부분으로 이루어져 있습니다. 모든 모델이 공유하는 기본 파라미터(S), 128개의 개별 전문가 파라미터 모음(E), 그리고 원하는 도메인 비율(h)을 입력받아 각 전문가를 얼마나 섞을지 계수(α)를 결정하는 작은 2층짜리 라우팅 MLP입니다. 최종 모델은 Θ = S + Σ αⱼEⱼ, 즉 기본 파라미터에 전문가들을 가중합으로 더한 형태로 만들어집니다.
여기서 재미있는 지점은, 이 전문가 128개와 라우팅 MLP를 처음부터 함께 학습시킨다는 것입니다. 학습 과정에서 매 스텝마다 무작위로 도메인 비율 h를 샘플링하고, 그 비율에 맞춰 데이터를 뽑아 배치를 구성한 뒤, 그 비율에 해당하는 조합 모델을 실제로 만들어 역전파를 수행합니다. 이렇게 하면 전문가 파라미터들은 자연스럽게 어떤 비율로 섞여도 말이 되는 방향으로 정렬됩니다. 흔히 알려진 모델 수프(Model Soups)는 이미 학습이 끝난 여러 모델을 사후에 평균 내는 기법인데, Soup-of-Experts는 애초에 평균 내기 좋게 설계된 재료를 학습 단계에서부터 만들어낸다는 점이 결정적으로 다릅니다.

■ 실험 세팅과 실제 성능
연구진은 110M 파라미터 규모의 GPT-2 스타일 트랜스포머(12개 레이어, 임베딩 차원 768)를 기준 모델로 삼고, 여기에 128개의 전문가를 붙였습니다. 전체 학습 대상 파라미터를 계산하면 (128+1) × 110M, 즉 약 140억 개에 달하는 파라미터 뱅크를 하나의 학습 과정으로 다루는 셈입니다. 학습 데이터는 RedPajama v2를 BERT 임베딩 기반 계층적 k-평균 군집화로 4096개 도메인으로 쪼갠 것을 사용했고, 평가는 arXiv, 수학, 이메일, 법률, 깃허브 코드, 위키피디아, 특허(USPTO) 등 16개의 Pile 하위 도메인에서 이뤄졌습니다.
결과는 인상적입니다. Soup-of-Experts는 일반적인 사전학습 손실에서 기존 단일 모델과 거의 동등한 성능을 유지하면서도, 16개 특화 도메인 평균에서는 도메인별로 모델을 따로 학습시킨 '도메인 전문가' 베이스라인이나 CRISP 기법을 확실히 앞섰습니다. 더 놀라운 것은 비용입니다. 도메인 전문가 방식은 도메인 수만큼 별도의 학습 런이 필요하지만, Soup-of-Experts는 단 한 번의 학습 런으로 이 모든 특화 모델을 대체합니다. 학습 속도는 일반 사전학습 대비 77% 수준으로, 전문가 128개를 추가로 최적화하는 오버헤드치고는 상당히 가벼운 편입니다.
파인튜닝과 비교한 실험도 흥미롭습니다. 특허(USPTO) 도메인의 경우, 일반 사전학습 모델을 파인튜닝해서 Soup-of-Experts가 학습 없이 즉석에서 만들어낸 모델과 같은 성능에 도달하려면 1000만 토큰 규모의 추가 학습이 필요했습니다. 즉 Soup-of-Experts는 사실상 '공짜 파인튜닝'을 이미 손에 쥐고 시작하는 셈입니다.
■ 새로운 도메인에 즉석으로 대응하는 법
그렇다면 처음 보는 도메인, 예를 들어 새로운 고객사의 전용 데이터셋이 주어지면 어떻게 할까요. 논문은 아주 적은 샘플만으로도 적절한 도메인 비율 h를 추정할 수 있음을 보였습니다. 새 데이터의 BERT 임베딩을 미리 학습해둔 4096개 클러스터 중심과 비교해 가장 가까운 것을 찾는 방식(최근접 이웃 매칭)만으로도, 놀랍게도 단 3개의 샘플만으로 일반 모델 수준을 따라잡았고, 100~1000개 샘플이면 최적의 조합에 가까워졌습니다. 필요하다면 저차원인 계수 α만 살짝 경사하강법으로 미세 조정할 수도 있는데, 이 계수의 차원은 128밖에 되지 않아 매우 빠릅니다.
전문가 수를 16, 32, 64, 128개로 바꿔가며 진행한 소거 실험, 그리고 35M, 55M, 110M 세 가지 모델 크기에서 반복한 실험 모두에서 Soup-of-Experts의 우위는 일관되게 유지되었습니다. 다만 저차원(low-rank) 전문가는 동일한 파라미터 예산에서 오히려 일반 밀집(dense) 전문가보다 성능이 떨어졌는데, 연구진은 근본적 한계보다는 최적화의 어려움으로 해석했습니다.

■ 왜 이 논문이 중요한가
지금 업계는 거대한 범용 모델 하나로 모든 것을 처리하려는 흐름과, 도메인마다 세밀하게 특화된 작은 모델을 여러 개 운영하려는 흐름이 공존합니다. 후자를 택하면 서빙 비용과 관리 복잡도가 기하급수적으로 늘어나는 것이 현실적인 걸림돌이었습니다. Soup-of-Experts는 이 딜레마에 '학습은 한 번, 배포는 무한대로 유연하게'라는 답을 제시합니다. 특히 온디바이스 AI처럼 모델 크기 제약이 엄격한 환경에서, 사용자나 상황에 맞춰 즉석으로 특화 모델을 조립해 낼 수 있다는 점은 실용적 의미가 큽니다. 논문 100편을 지나오며 본 여러 효율화 아이디어 중에서도, '평균만으로 새 능력이 생긴다'는 이 발상은 앞으로 다양한 변주를 낳을 잠재력이 커 보입니다.
댓글