AI 모델 순위표를 보다 보면 이상한 일이 생깁니다. 같은 모델인데 몇 달 전 기사와 현재 사이트의 점수가 다릅니다.

모델이 몰래 약해진 걸까요? 그럴 수도 있지만, 더 먼저 확인할 것이 있습니다.

시험 자체가 바뀌었는가?

벤치마크도 버전이 올라갑니다

실제 소프트웨어와 마찬가지로 벤치마크도 문제, 실행 환경, 채점기, 시간 제한이 바뀝니다.

Artificial Analysis Coding Agent Index는 2026년 9월 v1.5에서 Terminal-Bench 2.1을 4.0으로 교체했습니다. Terminal-Bench 4.0은 66개의 더 어려운 task, 수정된 환경과 verifier, 새로운 compute/time budget을 사용합니다.

동시에 DeepSWE도 v1.0에서 v1.1로 바뀌었습니다.

따라서 아래 숫자는 이름이 비슷해도 직접 비교하면 위험합니다.

Coding Agent Index v1.4: 55
Coding Agent Index v1.5: 51

-4점 성능 하락이라고 바로 말할 수 없습니다. 시험 구성이 달라졌기 때문입니다.

왜 시험을 계속 바꿀까요?

대표적인 이유는 네 가지입니다.

  1. 너무 쉬워져 모델 간 차이가 안 보임
  2. flaky test나 채점 오류가 발견됨
  3. 실제 업무와 더 가까운 문제를 넣고 싶음
  4. 공개 문제의 오염·정답 검색 가능성을 줄이고 싶음

벤치마크가 오래될수록 모델과 agent가 그 시험 유형에 최적화될 가능성도 커집니다.

CodeBridge Mini Lab: 뉴스 기사 두 개를 비교할 때

모델 비교 글을 읽을 때 다음 다섯 줄만 메모해도 잘못된 비교를 크게 줄일 수 있습니다.

Model:
Benchmark:
Benchmark version:
Harness / settings:
Measured date:

예를 들어:

Model: GPT-X
Benchmark: Terminal-Bench
Version: 2.1
Agent: A
Date: 2026-08

와

Model: GPT-X
Benchmark: Terminal-Bench
Version: 4.0
Agent: B
Date: 2026-09

는 동일 모델이라는 이유만으로 전후 비교를 해서는 안 됩니다.

같은 이름의 벤치마크도 채점 방식이 달라질 수 있습니다

버전 변경은 문제 목록만 바꾸는 것이 아닙니다.

Coding Agent Index v1.5의 DeepSWE v1.1은 agent가 작업한 환경과 별도 verifier 환경에서 committed patch를 채점합니다. 이 차이는 agent가 로컬 환경을 우연히 망가뜨려 테스트를 통과시키는 식의 오류를 줄이는 데 중요합니다.

즉 benchmark version은 사실상 다음 묶음입니다.

Tasks
+ Environment
+ Tools
+ Time budget
+ Verifier
+ Scoring rule

블로그에서 점수를 쓸 때 이렇게 기록하세요

나쁜 예:

모델 A가 코딩 벤치마크에서 57점을 기록했다.

조금 더 좋은 예:

2026년 9월 Artificial Analysis Coding Agent Index v1.5에서 모델 A + 특정 agent 설정이 57점을 기록했다.

날짜와 버전이 붙으면 나중에 벤치마크가 바뀌어도 글의 의미가 남습니다.

결론: 숫자보다 먼저 버전을 보세요

AI 업계에서 순위표는 빠르게 업데이트됩니다. 그래서 오래 살아남는 비교 글은 단순히 숫자를 복사하지 않습니다.

무슨 시험을, 어떤 버전으로, 어떤 환경에서 봤는지를 기록합니다.

점수가 달라졌다면 모델 성능을 의심하기 전에 먼저 시험지가 달라졌는지 확인해보세요.

함께 읽으면 좋은 글

참고 자료