모델 A가 96점, 모델 B가 97점을 받았습니다. B가 더 뛰어난 모델이라고 결론 내릴 수 있을까요?

시험이 충분히 어려운 상태라면 어느 정도 의미가 있을 수 있습니다. 하지만 대부분의 상위 모델이 90점대 후반에 몰려 있다면 이야기가 달라집니다.

이 상태를 benchmark saturation, 즉 벤치마크 포화라고 부릅니다.

포화된 시험은 모델 차이를 잘 못 보여줍니다

학교 시험을 생각하면 쉽습니다.

학생 대부분이 50~80점에 분포하면 시험은 실력 차이를 어느 정도 구분합니다. 하지만 모두가 100점 가까이 받으면 점수 1점 차이에 지나친 의미를 부여하기 어렵습니다.

AI 벤치마크도 마찬가지입니다.

초기
Model A 45
Model B 62
Model C 78

포화 이후
Model A 96
Model B 97
Model C 98

두 번째 상황에서는 작은 실행 조건 차이, 샘플링, 채점 오차가 순위에 더 큰 영향을 줄 수 있습니다.

포화는 '모델이 완벽해졌다'는 뜻이 아닙니다

여기서 가장 흔한 오해가 생깁니다.

벤치마크 99% = 실제 업무도 99% 해결

이 등식은 성립하지 않습니다.

벤치마크는 전체 현실이 아니라 특정 task distribution을 측정합니다. 오래된 시험을 잘 푼다고 해서 긴 프로젝트, UI 조작, 대규모 코드베이스, 새로운 도구 사용까지 모두 잘하는 것은 아닙니다.

그래서 최근 평가는 더 긴 task, agentic workflow, private test set, 실제 산출물 제작처럼 어려운 방향으로 이동하고 있습니다.

CodeBridge Mini Lab: 순위표의 분산을 먼저 보세요

순위표를 발견했을 때 1등만 보지 말고 상위 10개 점수 범위를 봅니다.

Top 10 range: 94 ~ 98

처럼 매우 좁다면 질문을 하나 더 해야 합니다.

이 benchmark가 지금 frontier 모델들을 충분히 구분하고 있는가?

반대로:

Top 10 range: 31 ~ 68

이라면 아직 모델 간 차이를 더 크게 드러내고 있을 가능성이 있습니다.

물론 범위만으로 saturation을 확정할 수는 없습니다. 하지만 좋은 경고 신호가 됩니다.

새로운 벤치마크가 더 어려워지는 이유

2026년의 평가 흐름을 보면 단순 Q&A보다 다음 형태가 늘고 있습니다.

  • 파일 수백~수천 개를 다루는 지식 작업
  • 실제 SaaS 도구를 조작하는 자동화
  • 터미널에서 여러 단계를 수행하는 작업
  • repository 전체를 이해하고 수정하는 agent task
  • binary와 문서만 보고 프로그램을 재구축하는 작업

문제 하나를 맞히는 것보다 작업을 끝까지 완수하는가를 보려는 방향입니다.

포화된 benchmark도 쓸모가 없는 것은 아닙니다

기존 시험은 여전히 regression 확인에 유용할 수 있습니다.

예를 들어 새 모델이 과거 세대보다 기존 benchmark에서 갑자기 크게 떨어지면 특정 능력의 퇴화를 의심할 수 있습니다.

다만 frontier 모델 간 미세한 순위를 정하는 용도로는 정보량이 줄어듭니다.

결론: 좋은 벤치마크는 계속 어려워져야 합니다

모델이 발전하면 시험도 발전해야 합니다.

그래서 벤치마크가 교체되거나 새로운 버전이 나오는 것은 혼란스럽지만 자연스러운 현상입니다.

중요한 질문은 "몇 점인가?"에서 끝나지 않습니다.

이 시험은 현재 모델들의 차이를 아직 충분히 보여주고 있는가?

이 질문까지 해야 숫자를 실전 판단으로 바꿀 수 있습니다.

함께 읽으면 좋은 글

참고 자료