본문 바로가기
딥러닝

[논문리뷰] MMLU 문제집, 혹시 정답이 틀렸다면? — Fantastic Bugs and Where to Find Them in AI Benchmarks

by 카이스토 2026. 9. 8.

■ 시험지를 채점하는 시험지는 누가 채점하나

 

우리는 매번 새 LLM이 나올 때마다 "MMLU 몇 점, GSM8K 몇 점"이라는 숫자로 성능을 비교합니다. 그런데 정작 그 시험 문제 자체가 틀렸다면 어떨까요. 정답지가 틀려있거나, 문제가 애매해서 정답이 여러 개일 수 있거나, 자동 채점 스크립트가 "7"과 "$7.00"을 다른 답으로 처리해서 멀쩡한 정답을 오답 처리한다면, 우리가 비교해온 점수 자체가 애초에 신뢰할 수 없는 숫자였다는 뜻이 됩니다. 스탠퍼드대 Sang Truong 등 저자들이 NeurIPS 2025 Datasets & Benchmarks 트랙에 낸 이 논문은 바로 이 불편한 질문을 정면으로 다룹니다. 제목처럼, 유명 벤치마크 안에 숨어 있는 "버그"를 찾아내는 방법을 제시한 것입니다.

 

■ 사람이 일일이 검수할 수 없다는 문제

 

벤치마크 하나에는 보통 수백~수천 개의 문항이 들어 있습니다. 사람이 전문가를 동원해 문항 하나하나를 다시 검토하는 것은 사실상 불가능에 가깝고, 그래서 지금까지는 대부분의 벤치마크가 "일단 공개되면 그걸로 끝(publish-and-forget)"인 채로 몇 년씩 그대로 쓰여 왔습니다. 저자들은 이 문제를 해결하기 위해 심리측정학(psychometrics), 즉 시험 문제의 타당성을 평가하는 고전적인 통계 이론을 가져옵니다. 핵심 가정은 간단합니다. 모델의 실력이라는 것이 하나의 잠재적 능력치(unidimensional latent construct)로 요약될 수 있다면, 실력이 좋은 모델일수록 어려운 문제에서 더 낮은 정답률을, 쉬운 문제에서 더 높은 정답률을 보이는 일관된 패턴이 나타나야 합니다. 만약 어떤 문항에서 이 패턴이 깨진다면, 그 문항 자체에 문제가 있을 가능성이 높다는 것이 이 논문의 통찰입니다.

 

 

■ 세 가지 통계 지표로 의심 문항을 찾아낸다

 

구체적으로는 사청상관계수(tetrachoric correlation), 문항 변별도(item scalability coefficient), 문항-총점 상관(item-total correlation)이라는 세 가지 통계량을 계산합니다. 라쉬 모델(Rasch model) 관점에서 정상적인 문항이라면 이 상관값들이 음수가 되어서는 안 되는데, 음수이거나 비정상적으로 낮게 나오는 문항을 자동으로 걸러냅니다. 이렇게 걸러진 후보 문항은 다시 LLM(예: ChatGPT o1)에게 1차 판독을 맡기고, 그중에서도 가장 의심스러운 것들만 사람 전문가가 최종 검토하는 구조입니다. 즉 수천 개 문항을 사람이 다 보는 대신, 통계와 AI가 후보를 좁혀주고 전문가는 정말 의심스러운 상위 몇십 개만 보면 되는 파이프라인입니다.

 

■ 실제로 얼마나 많은 문제가 발견됐나

 

연구팀은 GSM8K, 여러 버전의 MMLU, AIR-Bench, ThaiExam, MedQA, OpenBookQA 등 널리 쓰이는 벤치마크 9개, 총 8천 개가 넘는 문항을 대상으로 이 방법을 적용했습니다. 각 벤치마크마다 40개에서 91개에 이르는 서로 다른 LLM의 응답을 모아 분석했고, 벤치마크별로 가장 의심스러운 상위 50개 문항을 뽑아 전문가가 검토했습니다. 그 결과 전문가 검토 정밀도가 최대 84%에 달했습니다. 즉 이 방법이 "의심스럽다"고 지목한 문항 10개 중 8개 이상이 실제로 결함이 있었다는 뜻입니다. GSM8K의 경우 997개 문항 중 88개, 약 8.8%가 무효 판정을 받았고, 이 중에는 기존에 여러 차례 개정 작업을 거쳤음에도 아무도 발견하지 못했던 16개의 새로운 오류 문항도 포함되어 있었습니다.

 

■ 어떤 종류의 버그들이 숨어 있었나

 

발견된 오류는 크게 세 가지로 나뉩니다. 첫째는 애매한 문제입니다. MMLU의 임상지식 문항에서는 "병원에서 두 번째로 흔한 감염"이 무엇이냐고 물었는데, 장소나 시기 조건이 빠져 있어 객관적으로 답을 정할 수 없는 문제였습니다. 둘째는 틀린 정답지입니다. MedQA에서는 갑상선 하동맥을 전이 경로로 지목했는데, 이는 전이가 정맥을 통해 퍼진다는 기본 생리학과 모순되는 오류였습니다. GSM8K에서는 지수적으로 감가상각되는 값을 마치 일정 비율씩 단순히 빼는 산수 문제처럼 다뤄서 정답 자체가 수학적으로 틀린 경우도 있었습니다. 셋째는 채점 오류입니다. GSM8K의 유명한 "얼음과자 문제"에서는 "$7.00"이라고 답한 모델은 오답 처리되고 "$7"이라고 쓴 모델만 정답 처리되는 웃지 못할 일이 있었고, 태국어 시험 ThaiExam에서는 태국 숫자 7(๗)이 OCR 과정에서 3(๓)으로 잘못 인식되면서 문제와 정답지가 통째로 틀려버린 사례도 있었습니다.

 

 

■ 그래서 우리는 무엇을 바꿔야 하나

 

이 논문이 흥미로운 이유는 단순히 "벤치마크에 오류가 있다"는 사실을 폭로하는 데 그치지 않고, 그것을 자동으로, 그리고 지속적으로 찾아내는 실용적인 방법을 제시했다는 점입니다. 저자들은 LLM이 분기마다 쏟아져 나오는 지금, 벤치마크도 한 번 만들고 끝나는 결과물이 아니라 계속 관리되어야 하는 살아있는 자산으로 취급해야 한다고 말합니다. 흥미롭게도 오류 탐지 성능은 평가에 쓰인 LLM들의 출처가 다양할수록, 최소 10개 이상의 서로 다른 조직에서 만든 모델을 섞어 쓸수록 좋아졌다고 합니다. 특정 회사 모델들끼리는 비슷한 방식으로 틀리기 때문에, 오히려 다양성이 오류를 드러내는 열쇠가 된다는 뜻입니다. 우리가 매일 보는 벤치마크 순위표 뒤에는 이런 눈에 보이지 않는 결함들이 숨어 있었다는 점에서, 이 연구는 AI 평가 생태계 전체에 조용하지만 묵직한 질문을 던지고 있습니다.

 

댓글