모델 A가 96점, 모델 B가 97점을 받았습니다. B가 더 뛰어난 모델이라고 결론 내릴 수 있을까요?
시험이 충분히 어려운 상태라면 어느 정도 의미가 있을 수 있습니다. 하지만 대부분의 상위 모델이 90점대 후반에 몰려 있다면 이야기가 달라집니다.
이 상태를 benchmark saturation, 즉 벤치마크 포화라고 부릅니다.
포화된 시험은 모델 차이를 잘 못 보여줍니다
학교 시험을 생각하면 쉽습니다.
학생 대부분이 50~80점에 분포하면 시험은 실력 차이를 어느 정도 구분합니다. 하지만 모두가 100점 가까이 받으면 점수 1점 차이에 지나친 의미를 부여하기 어렵습니다.
AI 벤치마크도 마찬가지입니다.
초기
Model A 45
Model B 62
Model C 78
포화 이후
Model A 96
Model B 97
Model C 98
두 번째 상황에서는 작은 실행 조건 차이, 샘플링, 채점 오차가 순위에 더 큰 영향을 줄 수 있습니다.
포화는 '모델이 완벽해졌다'는 뜻이 아닙니다
여기서 가장 흔한 오해가 생깁니다.
벤치마크 99% = 실제 업무도 99% 해결
이 등식은 성립하지 않습니다.
벤치마크는 전체 현실이 아니라 특정 task distribution을 측정합니다. 오래된 시험을 잘 푼다고 해서 긴 프로젝트, UI 조작, 대규모 코드베이스, 새로운 도구 사용까지 모두 잘하는 것은 아닙니다.
그래서 최근 평가는 더 긴 task, agentic workflow, private test set, 실제 산출물 제작처럼 어려운 방향으로 이동하고 있습니다.
CodeBridge Mini Lab: 순위표의 분산을 먼저 보세요
순위표를 발견했을 때 1등만 보지 말고 상위 10개 점수 범위를 봅니다.
Top 10 range: 94 ~ 98
처럼 매우 좁다면 질문을 하나 더 해야 합니다.
이 benchmark가 지금 frontier 모델들을 충분히 구분하고 있는가?
반대로:
Top 10 range: 31 ~ 68
이라면 아직 모델 간 차이를 더 크게 드러내고 있을 가능성이 있습니다.
물론 범위만으로 saturation을 확정할 수는 없습니다. 하지만 좋은 경고 신호가 됩니다.
새로운 벤치마크가 더 어려워지는 이유
2026년의 평가 흐름을 보면 단순 Q&A보다 다음 형태가 늘고 있습니다.
- 파일 수백~수천 개를 다루는 지식 작업
- 실제 SaaS 도구를 조작하는 자동화
- 터미널에서 여러 단계를 수행하는 작업
- repository 전체를 이해하고 수정하는 agent task
- binary와 문서만 보고 프로그램을 재구축하는 작업
문제 하나를 맞히는 것보다 작업을 끝까지 완수하는가를 보려는 방향입니다.
포화된 benchmark도 쓸모가 없는 것은 아닙니다
기존 시험은 여전히 regression 확인에 유용할 수 있습니다.
예를 들어 새 모델이 과거 세대보다 기존 benchmark에서 갑자기 크게 떨어지면 특정 능력의 퇴화를 의심할 수 있습니다.
다만 frontier 모델 간 미세한 순위를 정하는 용도로는 정보량이 줄어듭니다.
결론: 좋은 벤치마크는 계속 어려워져야 합니다
모델이 발전하면 시험도 발전해야 합니다.
그래서 벤치마크가 교체되거나 새로운 버전이 나오는 것은 혼란스럽지만 자연스러운 현상입니다.
중요한 질문은 "몇 점인가?"에서 끝나지 않습니다.
이 시험은 현재 모델들의 차이를 아직 충분히 보여주고 있는가?
이 질문까지 해야 숫자를 실전 판단으로 바꿀 수 있습니다.