먼저 고백부터 하겠습니다. 이틀 전 쓴 Sonnet vs Opus 글에서 "낮은 effort와 아래 등급부터 올려보라"고 적었습니다. 방향은 맞았는데, 9월 28일에 공개된 Sonnet 5.5 세부 측정을 보니 한 가지를 정정해야 합니다. Sonnet의 max는 생각보다 훨씬 비쌉니다.

Artificial Analysis가 Sonnet 5.5를 깊게 쟀습니다. 결과는 한 줄로 이렇습니다. Terminal-Bench 1등과 측정 사상 최대 토큰 사용량이 같은 모델에서 나왔습니다.

새 숫자 4개를 먼저 보세요

항목 Sonnet 5.5 max 비교
Intelligence Index 56 Opus xhigh와 동점, 전체 2위
작업당 출력 토큰 약 193k 측정 사상 최대, Astra max의 약 7배
작업당 비용 약 $7.60 Sonnet 5보다 약 50% 높음
Terminal-Bench 4.0 64% Opus 5.5 60%, Astra를 앞선 1위

가격 자체는 그대로입니다. 입력 $2, 출력 $10(100만 토큰당)으로 Sonnet 5와 같습니다. 비싼데도 작업당 비용이 뛴 이유는 토큰을 많이 쓰기 때문입니다. 전편에서 Opus max가 토큰을 많이 쓴다고 했는데, Sonnet max는 그보다 60% 더 씁니다.

토큰 단가는 그대로인데 작업당 비용이 50% 상승
원인: 같은 점수를 토큰 물량으로 밀어붙이는 구조
→ 단가표만 보면 모르는 함정

그런데 Terminal-Bench에서는 1등입니다

여기가 재미있는 지점입니다. Sonnet 5.5 max는 Terminal-Bench 4.0에서 64%를 찍었습니다. Opus 5.5의 60%, Astra의 59%를 앞선 수치입니다. AA-Briefcase(1811 vs 1822 Elo), GDPval-AA(1844 vs 1846 Elo), AutomationBench-AA(71% vs 70%)에서도 Opus와 거의 같습니다.

즉 Sonnet max는 "지능은 Opus급, 연비는 최하"라는 이상한 조합입니다. 왜 쓸까요? 답은 effort를 낮추면 나옵니다.

진짜 정답: high effort가 스위트 스폿이다

AA 분석에서 Sonnet 5.5의 high effort 설정이 가장 경쟁력 있다고 나왔습니다. GPT-6 Sol과 사실상 같은 작업당 비용에 근접한 지능을 냅니다. 반면 max와 xhigh는 파레토 경계 밖에 있습니다.

Sonnet 5.5 effort별 정리:
- max:   지능 최상, 비용 최악 (특수한 경우만)
- high:  가성비 최상 (기본값 후보)
- medium 이하: 같은 돈이면 Sol 계열이 토큰을 적게 씀

그리고 약점도 분명합니다. 사실 지식(AA-Omniscience 정확도 54% vs Opus 66%)과 과학 추론(HLE·SciCode 약 6점 차)에서는 작은 등급의 한계가 보입니다. 터미널·업무 자동화는 Opus급, 팩트 암기는 Opus 아래. 용도가 갈립니다.

Sonnet high가 어울리는 일:
- 터미널에서 도는 코딩·운영 작업
- 문서 읽고 표·발표자료 만드는 업무
- 도구 호출이 많은 반복 워크플로우

Opus가 여전히 필요한 일:
- 사실 정확도가 생명인 조사·리서치
- 과학·수학 추론이 섞인 문제
- 수십만 줄급 장기 마이그레이션

CodeBridge Mini Lab: 전편 실험에 한 줄 추가하기

전편의 3회 비교 실험 그대로 쓰되, 후보를 이렇게 바꾸세요.

비교 후보 (전편 Opus max/high/medium → 이번):
1. Sonnet high (새 기본값 후보)
2. Sonnet max (Terminal-Bench류 작업만)
3. GPT-6.1 Sol max (비용 하한선 확인용)

기록표는 동일: 성공률·시간·비용·설명 품질
판정: Sonnet max가 high보다 성공률이 높지 않으면 high 채택

참고로 AA 측정은 사전 배포판 기준이고, 구조화 출력 관련 버그가 공개판에서 수정됐다고 Anthropic이 밝혔습니다. 점수는 그대로이거나 소폭 오를 수 있다는 점만 알아두세요. 벤치 점수 읽는 법에서 말한 대로 측정 조건을 함께 적어두는 습관이 여기서 빛납니다.

결론: 전편 조언을 이렇게 고칩니다

전편: "낮은 effort와 아래 등급부터 올려보세요."

업데이트: "Sonnet은 max가 아니라 high부터 시작하세요. max는 터미널 1등이 필요할 때만 꺼내는 카드입니다."

2점 차이가 문제가 되는 작업은 적다는 말은 그대로입니다. 다만 그 2점을 메우는 방식이 토큰 물량이라는 게 이번에 드러났습니다. 지능 점수 옆에 토큰 수를 꼭 같이 적으세요. 성공 1건당 비용으로 계산하는 한, 이 습관이 돈을 아껴줍니다.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

effort와 등급을 바꿔가며 성공률·시간·비용을 재는 감각은 실제 저장소에서 길러집니다. Claude Code로 하네스와 검증 루프를 쌓는 연습이 이 글의 비교 실험과 바로 이어집니다.