10월 7일, Anthropic이 Claude Haiku 5.5를 내놨습니다. 헤드라인은 자극적입니다. Haiku 4.5보다 토큰 단가 90% 인하, 작업당 평균 비용 약 75% 감소.
그런데 공식 발표를 끝까지 읽으면 할인이 다가 아닙니다. 처음 effort 조절을 단 소형 모델이라는 점, 벤치마크마다 측정 조건이 따로 있다는 점, 10만 토큰 경계를 넘는 순간 요금이 달라진다는 점이 같이 나옵니다. 이 글은 가격표보다 조건을 먼저 읽습니다.
가격: 90%는 10만 토큰 이하일 때만
공식 요금표를 그대로 옮기면 이렇습니다. 100만 토큰당 기준입니다.
| 항목 | Haiku 5.5 (10만 이하 / 초과) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| 입력 | $0.10 / $0.50 | $1.00 | $2.00 |
| 출력 | $0.50 / $2.50 | $5.00 | $10.00 |
| 캐시 읽기 | $0.01 / $0.05 | $0.10 | $0.10 |
| 캐시 쓰기 | $0.125 / $0.625 | $1.25 | $2.50 |
정리하면 이렇습니다.
프롬프트 10만 토큰 이하: Haiku 4.5보다 90% 인하
프롬프트 10만 토큰 초과: Haiku 4.5보다 50% 인하
Haiku 4.5 요청의 약 90%가 10만 이하 구간에 속했음 (Anthropic 집계)
→ 평균 작업 비용 약 75% 감소 (토크나이저 변화 반영済)
여기에 함정이 하나 있습니다. Haiku 5.5는 새 토크나이저를 씁니다. Sonnet·Opus 5.5와 같은 계열이라, 같은 글도 Haiku 4.5보다 토큰이 약 30% 늘어난다고 분석됐습니다. Anthropic의 75% 수치는 이 증가분을 반영한 값입니다. 스티커 가격 90%와 체감 75%의 차이가 여기서 납니다.
더 날카로운 함정은 경계입니다. 요금은 요청 전체 프롬프트 길이에 따라 한 구간이 통으로 적용됩니다. 10만 토큰짜리 입력 비용은 $0.010인데, 100,001 토큰이면 통째로 높은 구간이라 약 $0.050이 됩니다. 입력 5배, 출력도 5배입니다. Haiku 4.5에서 9만 토큰이던 작업이 새 토크나이저에서 약 11.7만 토큰이 되면, 경계를 넘어 절감률이 90%가 아니라 35% 수준으로 떨어진다는 계산도 나옵니다. 마이그레이션 가이드가 10만 근처 프롬프트를 model: claude-haiku-5-5 기준으로 다시 세어보라고 한 이유입니다.
성능: 숫자는 올랐고, 격차도 남았다
공식 발표의 벤치마크 표입니다. 전부 Anthropic 자체 측정, 최고 effort 기준입니다.
| 평가 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 (에이전트 코딩) | 39.2% | 0.0% | 16.4% | 70.6% |
| OSWorld 2.1 오프라인 부분집합 (컴퓨터 조작) | 72.4% | 15.7% | 48.9% | 83.9% |
| FrontierCode 1.1 Main | 46.4% | — | 42.4% | 52.1% |
| GDPval-AA v2.1 (지식 작업) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| HLE (도구 없음 / 도구 사용) | 45.9% / 57.4% | 10.2% / 18.7% | — | 56.9% / 64.5% |
그림으로 그리면 이렇습니다.
저비용 구간 (Haiku 5.5가 Luna를 앞섬):
Terminal-Bench 39.2% vs 16.4%
OSWorld 부분 72.4% vs 48.9%
GDPval-AA 1620 vs 1437
상위 구간 (Sonnet 5.5가 여전히 앞섬):
Terminal-Bench 70.6% vs 39.2% (약 31%p 격차)
OSWorld 부분 83.9% vs 72.4%
GDPval-AA 1840 vs 1620
공식 발표의 차트가 말하는 것도 같습니다. 정확도 대 시도당 비용 곡선에서 Haiku 5.5는 저비용 구간을 새로 열었지만, 복잡한 터미널 코딩은 Sonnet·Opus 몫으로 남겼습니다. Anthropic도 용도를 분명히 합니다. Haiku 5.5는 요약·압축·조회·분류 같은 고빈도 반복 작업과 코딩 서브에이전트용입니다.
조건: 같은 점수도 effort와 부분 점수가 다르다
여기가 재검증의 핵심입니다. 숫자 옆에 조건을 붙이지 않으면 오독합니다.
Terminal-Bench 4.0 (39.2%):
- 66개 과제 × 각 10회 시도
- Claude Code 베어 모드, 최고 effort
- 세이프가드 켜짐, 폴백 없음 (1.8%는 차단돼 실패 처리)
- 인터넷 차단, 리소스 사전 캐시 → 점수가 낮게 나올 수도 있음
- 표준오차 약 ±1.9
OSWorld 2.1 (72.4%):
- 전체 108개 중 오프라인 82개 부분집합
- 인터넷 없는 VM, 1080p, 최대 500 스텝
- 부분 점수(partial) 기준, 엄격 통과(strict)는 37.1%
- Sonnet 5.5도 부분 83.9% / 엄격 48.8% (둘을 같이 봐야 함)
- Luna 48.9%는 Anthropic이 OpenAI API로 직접 돌린 값
그리고 effort의 함정. Haiku 사상 처음 들어간 Low→Max 조절에서 기본값은 medium입니다. Terminal-Bench는 최고 effort에서 약 39%, medium에서 약 20% 수준으로 그려집니다. "Haiku 5.5는 39%"라고만 외우면, 기본 설정에서 그 절반이 나오는 이유를 놓칩니다. 벤치 점수 읽는 법과 버전별 점수 변화에서 강조한 원칙 그대로입니다. 버전·하네스·effort·시행 횟수를 같이 적으세요.
같이 온 것: Sonnet 캐시 인하와 크레딧
Haiku만 바뀐 게 아닙니다.
① Sonnet 5.5 캐시 읽기 $0.20 → $0.10 (50% 인하)
→ 에이전트 작업 대부분에서 약 20% 저렴
② Max·Team 구독자 월 API 크레딧
→ Max 5x $100, Max 20x $200, Team 합산 $500
③ Python·TypeScript SDK에 컴퓨터·브라우저 사용 베타
→ Haiku 5.5가 속도·가격상 잘 맞는 자리
Terminal-Bench 차트에 Sonnet 구·신 캐시 단가가 둘 다 그려진 이유입니다. 상위 모델도 운영비를 낮추는 방향으로 같이 움직였습니다. 라우팅의 재료가 위아래로 동시에 좋아진 셈입니다.
고객 사례도 발표에 포함됐습니다. Asana는 작업 완료 지연 약 30% 감소·턴당 추론 최대 2.5배, HubSpot은 CRM 시뮬레이션 92.8%, AlphaSense는 문서 질의 0.84 대 0.76, Box는 11점 상승에 절반 지연, Rogo는 10-K 수치 추출 서브에이전트, Cognition은 Devin Fusion 사이드킥으로 FrontierCode 66.2점입니다. 전부 자사 평가라 독립 검증은 아니지만, 어디에 쓰라는지의 힌트는 분명합니다. 짧고 많은 일, 그리고 큰 모델 옆의 서브에이전트입니다.
CodeBridge Mini Lab: 같은 일을 두 모델에 시키기
# cost_lab.py — 개념 스케치 (구조 참고용)
MAX_ESCALATIONS = 2
def run_batch(tasks, call_model, log):
for task in tasks:
# 1. 싼 모델 먼저 (Haiku 5.5급, medium effort)
result = call_model("light", task)
ok = verify(result, task)
log.record(model="light", cost=result.cost,
latency=result.latency, retries=0, ok=ok)
# 2. 실패하면 상위 모델로 승격 (최대 2회)
attempts = 0
while not ok and attempts < MAX_ESCALATIONS:
attempts += 1
result = call_model("strong", task)
ok = verify(result, task)
log.record(model="strong", cost=result.cost,
latency=result.latency, retries=attempts, ok=ok)
# 3. 판정: 성공률·지연·재시도·완료 1건당 비용
return log.summarize(by=["model"])
측정 4종 세트 (브리핑의 액션 그대로):
[ ] 성공률 (같은 작업, 각 3회 이상)
[ ] 지연시간 (완료까지, effort별로 분리)
[ ] 재시도 횟수 (승격률 10~20%가 목표)
[ ] 완료 1건당 비용 (토큰 단가가 아니라 성공 1건 기준)
주의 2개:
[ ] 10만 토큰 근처 프롬프트는 새 토크나이저로 다시 측정
[ ] Terminal-Bench류는 effort·시행 횟수를 결과에 같이 기록
성공 1건당 비용 글의 계산법과 라우팅 구현 글의 승격 구조를 겹치면 이 실험이 완성됩니다.
결론: 싼 모델이 생기면 설계가 바뀐다
한 줄로 정리합니다.
토큰 단가가 아니라 성공 1건당 비용을 재세요. Haiku 5.5는 라우터의 아랫단을 새로 깔아준다.
90% 인하의 실체는 이렇습니다. 10만 이하 구간 90%, 초과 구간 50%, 토크나이저 반영 평균 75%. 저비용 구간에서 Luna를 앞서는 점수, 상위 모델과의 여전한 격차, effort와 부분 점수라는 조건표. 이걸 다 읽고 나면 액션은 하나입니다. 소형과 상위를 같은 작업에 붙이고 네 지표를 재는 것. 그 로그가 다음 분기 모델 배치를 정합니다.
함께 읽으면 좋은 글
참고 자료
- Anthropic: Introducing Claude Haiku 5.5 (Oct 7, 2026) — 가격·벤치마크·차트
- Anthropic Haiku 5.5 System Card
- Anthropic Haiku 5.5 Migration Guide
- VentureBeat: Claude Haiku 5.5, 90% price cut (Oct 7, 2026)
이 주제를 직접 따라가며 배우고 싶다면
분류·위임·검증으로 비용과 성공률을 함께 설계하는 연습이 필요하다면, 하네스·루프·그래프를 순서대로 쌓는 과정이 이 글의 라우팅 실험과 바로 이어집니다.