코딩 AI 벤치마크 점수표가 9월에 크게 바뀌었습니다.
SWE-bench·Terminal-Bench·ProgramBench 비교 글을 써둔 게 있는데, 그때 기준으로는 지금 점수를 읽기 어렵습니다. Terminal-Bench 4.0, AA-Briefcase v1.1, GDPval-AA v2.1 같은 새 시험이 주류가 됐거든요.
이 글은 10월 1일 기준으로 새 점수표를 한 번에 정리합니다. 그리고 점수보다 중요한 것도 같이 짚습니다. 같은 모델인데 누가 재느냐에 따라 숫자가 달라진다는 점입니다.
Terminal-Bench 4.0: 터미널에서 끝까지 일시키기
Terminal-Bench는 채팅 답변이 아니라 터미널 안에서 명령을 실행해 과제를 끝내는지 봅니다. 4.0 기준 주요 점수는 이렇습니다.
| 모델 | 점수 | 측정 조건 |
|---|---|---|
| Claude Opus 5.5 | 66.4% | Anthropic 자체, xhigh, Claude Code 하네스 |
| Claude Opus 5.5 | 59.6% | Artificial Analysis 독립 측정 |
| GPT-6 Astra | 59% | Artificial Analysis 측정 |
| GPT-6 Astra | 57.9% | OpenAI 보고, high effort |
| Claude Opus 5 | 52.3% | 재현 측정 |
같은 Opus 5.5인데 66.4%와 59.6%가 같이 있습니다. 오타가 아닙니다. 하네스와 설정이 다르면 같은 모델도 다르게 나옵니다. Anthropic은 자사 발표에서 표준오차가 ±2.6점이라고도 밝혔습니다.
교훈 1: 점수에는 항상 "누가, 무슨 하네스로, 몇 번 돌렸는지"가 붙어 다닌다
숫자만 외우면 틀린다. 조건까지 같이 적어야 한다.
코딩 벤치 3종도 같이 보세요
터미널 말고 코드 변경 자체를 보는 시험도 업데이트됐습니다.
| 시험 | 보는 것 | 주요 점수 |
|---|---|---|
| FrontierCode v1.1 | 코드 변경이 머지될 만한가 | Opus 5.5 54.4%, Astra 53.3%, GPT-5.6 Sol 47.5% |
| CursorBench 4.0 | 모호한 실전 멀티파일 작업 | Opus 5.5 57.8%, Fable 5.1 51.8%, Opus 5 46.6% |
| Terminal-Bench-Science 0.1 | 터미널 기반 과학 연구 워크플로우 | Astra 64.6%, Opus 5.5 58.7%, Opus 5 29.0% |
재미있는 건 Terminal-Bench-Science에서 Astra가 Opus 5.5를 앞선다는 점입니다. 종합 지능 1위가 모든 시험 1위는 아닙니다. 시험마다 재는 게 다르니, 내 일과 닮은 시험의 점수를 봐야 합니다.
지식 작업 벤치: AA-Briefcase와 GDPval
코딩 말고 문서·분석·발표자료 같은 지식 작업을 보는 시험도 새 버전이 나왔습니다.
| 시험 | 보는 것 | 주요 점수 |
|---|---|---|
| AA-Briefcase v1.1 | 수주 단위 장기 지식 작업, 분석+발표 품질 | Opus 5.5 Elo 1822, Fable 대비 +143 |
| GDPval-AA v2.1 | 44개 직업 실무 과제 | Opus 5.5 Elo 1846, Fable 1735, Opus 5 1708 |
| AutomationBench | 여러 앱에 걸친 업무 자동화 | Opus 5.5 40.0%(Zapier 측정), Astra 69%(AA 구현 측정) |
| GDP.pdf | 전문 문서 추론, 전 항목 통과율 | Astra 31%, GPT-5.6 Sol 27% |
여기에도 함정이 있습니다. AutomationBench에서 Opus 40%와 Astra 69%는 측정 주체가 다릅니다. Opus 수치는 Zapier 자체 평가, Astra 수치는 Artificial Analysis 구현 평가입니다. 구현이 다르면 같은 이름의 시험도 다른 시험처럼 굴 수 있습니다.
교훈 2: 같은 이름이어도 구현이 다르면 다른 시험이다
"AutomationBench 69% vs 40%"를 직접 비교하면 안 된다.
그리고 AA-Briefcase에서 Opus 5.5가 분석 품질과 발표 품질을 모두 잡은 첫 Anthropic 모델이라는 점, Gemini 4 Argon이 루브릭 통과율 65%로 최고를 찍고도 발표 품질은 낮았다는 점도 눈여겨볼 만합니다. 긴 작업에서는 분석력과 발표력이 따로 놀 수 있습니다.
점수 읽을 때 체크리스트 4개
새 점수표를 볼 때는 숫자 옆에 이 네 개를 같이 적으세요.
[ ] 벤치 버전: 4.0인가, v1.1인가, v2.1인가
[ ] 하네스: Claude Code인가, Codex인가, Stirrup 같은 참조 하네스인가
[ ] Effort: low/medium/high/xhigh/max 중 무엇인가
[ ] 시행 횟수: 1회인가, 3~5회 평균인가 (표준오차가 있는가)
예를 들어 "Opus 5.5 Terminal-Bench 66.4%"라고만 적으면 반쪽 정보입니다. "Anthropic 자체 측정, xhigh, Claude Code 하네스, 표준오차 ±2.6"까지 붙여야 나중에 헷갈리지 않습니다. 벤치 점수 읽는 법과 점수가 바뀌는 이유에서 설명한 원칙과 같습니다.
CodeBridge Mini Lab: 내 저장소용 5문항 만들기
공개 벤치는 남의 시험입니다. 진짜 필요한 건 내 저장소 시험 5개입니다.
1. 자주 깨지는 버그 수정 1건 (테스트로 판정)
2. 파일 3개 이상 건드리는 리팩터링 1건 (테스트 + diff 범위로 판정)
3. 문서 1개를 읽고 표 1개로 요약 (사람이 5분 안에 판정)
4. 새 의존성 없이 작은 기능 1개 추가 (테스트로 판정)
5. 실패하는 명령 1개를 주고 원인 설명 (사람이 판정)
각 모델·effort마다 3회씩 실행하고 성공률·시간·비용 기록
→ 공개 벤치 1위와 내 시험 1위가 다르면 내 시험을 믿는다
ProgramBench를 처음부터 다시 만드는 글의 방식과 같습니다. 전체 프로그램을 다시 만드는 시험을 내 repo 축소판으로 만드는 셈입니다.
결론: 버전과 하네스를 먼저 적으세요
10월 기준 코딩·지식 작업의 축은 Terminal-Bench 4.0, FrontierCode, CursorBench, AA-Briefcase v1.1, GDPval-AA v2.1로 옮겨갔습니다. Opus 5.5가 전반적으로 앞서고, Astra가 터미널·과학·문서 추론에서 맞불을 놓는 구도입니다.
하지만 숫자보다 먼저 적을 게 있습니다. 버전, 하네스, effort, 시행 횟수. 이 네 개 없는 점수는 비교 대상이 아닙니다. 그리고 최종 결정은 공개 점수가 아니라 내 저장소 5문항으로 하세요. 그게 이 글의 결론이자 가장 싼 컨설팅입니다.
함께 읽으면 좋은 글
- SWE-bench vs Terminal-Bench vs ProgramBench: 무엇이 다를까
- AI 벤치마크 점수가 갑자기 바뀌는 이유
- ProgramBench란? 전체를 다시 만드는 시험
참고 자료
- Anthropic: Introducing Claude Opus 5.5
- Artificial Analysis: Claude Opus 5.5 takes the top spot
- Artificial Analysis: Benchmarking GPT-6 Astra
- Artificial Analysis: Gemini 4 Argon
- Artificial Analysis: Models Leaderboard
이 주제를 직접 따라가며 배우고 싶다면
벤치를 읽는 것을 넘어 내 프로젝트에 맞는 하네스와 검증 루프를 직접 쌓아보고 싶다면, Claude Code로 실제 저장소에서 성공·비용·시간을 재는 연습이 이 글의 5문항 실험과 바로 이어집니다.