9월 22일에 Opus 5.5가 나왔고, 그 뒤로 Sonnet 5.5 측정치도 Artificial Analysis에 올라왔습니다.

현재 점수는 이렇습니다. Opus 5.5 max가 58점, Opus 5.5 xhigh와 Sonnet 5.5 max가 나란히 56점입니다.

그래서 이런 질문이 생깁니다. 2점 차이 나는데, 그냥 항상 Opus max를 쓰면 되는 거 아니야?

직접 써보면 답이 달라집니다. 요금이 아니라 작업당 들어가는 토큰과 시간까지 같이 보면, Sonnet이나 낮은 effort가 이기는 구간이 꽤 넓거든요.

먼저 점수표부터 제대로 읽어봅시다

Artificial Analysis Intelligence Index 상위권을 나란히 놓으면 이렇습니다.

모델 Intelligence Index 비고
Claude Opus 5.5 (max) 58 현재 측정 1위
Claude Opus 5.5 (xhigh) 56
Claude Sonnet 5.5 (max) 56 Opus xhigh와 동점
Claude Opus 5.5 (high) 54
Claude Fable 5.1 (max) 53 이전 세대 강자
GPT-6 Astra (max) 53
GPT-6.1 Sol (max) 52 9월 29일 교체 투입

여기서 눈에 띄는 건 Sonnet 5.5 max가 Opus 5.5 xhigh와 같다는 점입니다. 한 등급 아래 모델의 최대 출력이, 위 등급의 한 단계 낮은 설정과 맞먹는 거죠.

그리고 9월 29~30일에는 GPT-6.1 Sol(52점, Astra 대비 4분의 1 이하 작업 비용)과 Gemini 4 Argon(53점, 할인 적용 시 작업당 약 $1.99)까지 나왔습니다. 흐름이 분명합니다. 최고 점수 하나가 아니라 점수대별 가성비 자리가 빠르게 채워지고 있습니다.

예전 선택지:  비싼 최고 모델 vs 싼 구형 모델 (2택)

지금 선택지:  58 / 56 / 54 / 53 / 52점대가 각각 다른 가격에 존재
→ "몇 점짜리가 이 작업에 필요한가?"로 질문이 바뀜

Opus max가 비싼 진짜 이유: 토큰을 많이 쓴다

Opus 5.5의 공식 가격은 입력 $4, 출력 $20(100만 토큰당)입니다. 전작 Opus 5보다 20% 내렸고, 캐시 읽기는 $0.50에서 $0.20으로 60% 내렸습니다.

그런데 Artificial Analysis 측정에서 Opus 5.5 max의 Intelligence 작업당 출력 토큰은 약 11만 9천 개입니다. Opus 5 max 약 7만 3천 개, Fable 5.1 max 약 7만 8천 개, GPT-6 Astra max 약 2만 7천 개와 비교하면 1.5배에서 4배까지 많습니다.

즉 구조가 이렇습니다.

작업 1건 비용 = 토큰 단가 × 사용 토큰 수

Opus 5.5 max: 단가는 내렸지만, max에서 토큰을 많이 씀
→ 단독 max 비교에서는 작업당 비용이 생각보다 높게 나옴

Anthropic 발표에서도 힌트가 있습니다. Opus 5.5는 기본 설정(medium)에서 FrontierCode 54.6%, Terminal-Bench 4.0에서 Opus 5 max를 앞지르고, GPT-6 Astra max와 대등한 결과를 약 20~40% 비용으로 냈다고 설명합니다. max가 아니라 medium 이야기가 먼저 나오는 이유가 여기 있습니다.

Effort가 먼저, 등급은 그다음입니다

Opus 5.5에는 low, medium, high, xhigh, max 다섯 단계가 있습니다. Artificial Analysis에 따르면 max, xhigh, high, medium 네 단계가 모두 Intelligence 대비 작업 비용 파레토 경계에 올라 있습니다. 쉽게 말해 각 effort가 자기 가격대에서 제값을 한다는 뜻입니다.

그래서 실전 순서는 이렇게 잡는 게 좋습니다.

1단계: Opus max로 기준점 3회 측정 (성공률, 시간, 비용 기록)
2단계: 같은 Opus에서 high → medium으로 낮추며 어디까지 버티는지 확인
3단계: medium에서 버티면, Sonnet max / Sonnet high로 바꿔서 비교
4단계: 그래도 되면 낮은 effort + 캐시 읽기 활용으로 고정

Anthropic이 공개한 사례를 보면 low effort에서도 되는 일이 생각보다 많습니다. 딜로이트 테스트에서는 Opus 5.5 최저 설정이 코드 리뷰 버그 검출 72%를 기록했고, 금융 분석 업체 평가에서는 최저 설정이 Opus 5의 high 설정을 앞질렀다고 합니다. 물론 업체 제공 수치라 그대로 믿을 건 아니지만, 방향은 분명합니다. 낮은 effort부터 올려보는 게 순서입니다.

CodeBridge Mini Lab: 2점 차이가 돈을 바꿀 때

같은 저장소에서 작은 작업을 정해 양쪽에 3회씩 시켜보세요.

Task: 로그인 폼 validation 버그 1건 수정 + 기존 테스트 유지 + 회귀 테스트 1개 추가

기록표 (매 실행마다)
Model / Effort: ______
Tests passed: Y / N
Files changed: __ (필요 이상 건드렸는가)
Time: __ 분
Cost: $__
설명 품질: 1~5점 (왜 고쳤는지 알겠는가)

판정 기준은 미리 정해둡니다.

- 3회 중 3회 성공하고 설명이 읽힐 만하면 그 조합을 채택
- Sonnet max가 Opus high와 성공률이 같다면 싼 쪽 채택
- 실패가 1회라도 있으면 effort를 올리기 전에 "지시가 모호했나"부터 확인

여기서 흔한 실수가 있습니다. 1회만 돌리고 결정하는 것입니다. 에이전트 작업은 실행마다 흔들리니 3회는 돌려야 합니다. 이건 코딩 에이전트 Pass@1·비용·시간을 같이 보는 글에서 설명한 방식과 같습니다.

결론: 질문을 바꾸세요

"Opus냐 Sonnet이냐"가 아니라 이렇게 물어보세요.

이 작업에 58점이 필요한가, 56점으로 충분한가, 54점으로도 되는가?

제 경험상 문서 요약, 테스트 추가, 정형화된 마이그레이션은 Sonnet급이나 Opus 낮은 effort에서 충분히 되는 경우가 많습니다. 반대로 수십만 줄 마이그레이션, 여러 저장소에 걸친 감사처럼 길을 잃기 쉬운 장기 작업은 Opus 높은 effort가 값을 합니다. Anthropic이 68만 줄 마이그레이션이나 20만 줄 코드 감사를 Opus 5.5 사례로 든 것도 같은 맥락입니다.

한 줄로 정리하면 이렇습니다. max를 기본값으로 삼지 말고, 낮은 effort와 아래 등급부터 올려보세요. 2점 차이가 문제가 되는 작업은 생각보다 적습니다.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

모델을 고르는 감각은 표를 외워서 생기지 않습니다. 같은 저장소에서 effort와 등급을 바꿔가며 성공률·시간·비용을 직접 재보는 연습이 필요하다면, Claude Code로 실제 프로젝트에 하네스를 쌓는 과정이 이 글의 비교 실험과 바로 이어집니다.