10월 7일, Anthropic이 Claude Haiku 5.5를 내놨습니다. 헤드라인은 자극적입니다. Haiku 4.5보다 토큰 단가 90% 인하, 작업당 평균 비용 약 75% 감소.

그런데 공식 발표를 끝까지 읽으면 할인이 다가 아닙니다. 처음 effort 조절을 단 소형 모델이라는 점, 벤치마크마다 측정 조건이 따로 있다는 점, 10만 토큰 경계를 넘는 순간 요금이 달라진다는 점이 같이 나옵니다. 이 글은 가격표보다 조건을 먼저 읽습니다.

가격: 90%는 10만 토큰 이하일 때만

공식 요금표를 그대로 옮기면 이렇습니다. 100만 토큰당 기준입니다.

항목 Haiku 5.5 (10만 이하 / 초과) Haiku 4.5 Sonnet 5.5
입력 $0.10 / $0.50 $1.00 $2.00
출력 $0.50 / $2.50 $5.00 $10.00
캐시 읽기 $0.01 / $0.05 $0.10 $0.10
캐시 쓰기 $0.125 / $0.625 $1.25 $2.50

정리하면 이렇습니다.

프롬프트 10만 토큰 이하: Haiku 4.5보다 90% 인하
프롬프트 10만 토큰 초과: Haiku 4.5보다 50% 인하
Haiku 4.5 요청의 약 90%가 10만 이하 구간에 속했음 (Anthropic 집계)
→ 평균 작업 비용 약 75% 감소 (토크나이저 변화 반영済)

여기에 함정이 하나 있습니다. Haiku 5.5는 새 토크나이저를 씁니다. Sonnet·Opus 5.5와 같은 계열이라, 같은 글도 Haiku 4.5보다 토큰이 약 30% 늘어난다고 분석됐습니다. Anthropic의 75% 수치는 이 증가분을 반영한 값입니다. 스티커 가격 90%와 체감 75%의 차이가 여기서 납니다.

더 날카로운 함정은 경계입니다. 요금은 요청 전체 프롬프트 길이에 따라 한 구간이 통으로 적용됩니다. 10만 토큰짜리 입력 비용은 $0.010인데, 100,001 토큰이면 통째로 높은 구간이라 약 $0.050이 됩니다. 입력 5배, 출력도 5배입니다. Haiku 4.5에서 9만 토큰이던 작업이 새 토크나이저에서 약 11.7만 토큰이 되면, 경계를 넘어 절감률이 90%가 아니라 35% 수준으로 떨어진다는 계산도 나옵니다. 마이그레이션 가이드가 10만 근처 프롬프트를 model: claude-haiku-5-5 기준으로 다시 세어보라고 한 이유입니다.

성능: 숫자는 올랐고, 격차도 남았다

공식 발표의 벤치마크 표입니다. 전부 Anthropic 자체 측정, 최고 effort 기준입니다.

평가 Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
Terminal-Bench 4.0 (에이전트 코딩) 39.2% 0.0% 16.4% 70.6%
OSWorld 2.1 오프라인 부분집합 (컴퓨터 조작) 72.4% 15.7% 48.9% 83.9%
FrontierCode 1.1 Main 46.4% — 42.4% 52.1%
GDPval-AA v2.1 (지식 작업) 1620 735 1437 1840
AA-Briefcase v1.1 1578 614 1336 1824
HLE (도구 없음 / 도구 사용) 45.9% / 57.4% 10.2% / 18.7% — 56.9% / 64.5%

그림으로 그리면 이렇습니다.

저비용 구간 (Haiku 5.5가 Luna를 앞섬):
  Terminal-Bench  39.2% vs 16.4%
  OSWorld 부분    72.4% vs 48.9%
  GDPval-AA       1620 vs 1437

상위 구간 (Sonnet 5.5가 여전히 앞섬):
  Terminal-Bench  70.6% vs 39.2% (약 31%p 격차)
  OSWorld 부분    83.9% vs 72.4%
  GDPval-AA       1840 vs 1620

공식 발표의 차트가 말하는 것도 같습니다. 정확도 대 시도당 비용 곡선에서 Haiku 5.5는 저비용 구간을 새로 열었지만, 복잡한 터미널 코딩은 Sonnet·Opus 몫으로 남겼습니다. Anthropic도 용도를 분명히 합니다. Haiku 5.5는 요약·압축·조회·분류 같은 고빈도 반복 작업과 코딩 서브에이전트용입니다.

조건: 같은 점수도 effort와 부분 점수가 다르다

여기가 재검증의 핵심입니다. 숫자 옆에 조건을 붙이지 않으면 오독합니다.

Terminal-Bench 4.0 (39.2%):
 - 66개 과제 × 각 10회 시도
 - Claude Code 베어 모드, 최고 effort
 - 세이프가드 켜짐, 폴백 없음 (1.8%는 차단돼 실패 처리)
 - 인터넷 차단, 리소스 사전 캐시 → 점수가 낮게 나올 수도 있음
 - 표준오차 약 ±1.9

OSWorld 2.1 (72.4%):
 - 전체 108개 중 오프라인 82개 부분집합
 - 인터넷 없는 VM, 1080p, 최대 500 스텝
 - 부분 점수(partial) 기준, 엄격 통과(strict)는 37.1%
 - Sonnet 5.5도 부분 83.9% / 엄격 48.8% (둘을 같이 봐야 함)
 - Luna 48.9%는 Anthropic이 OpenAI API로 직접 돌린 값

그리고 effort의 함정. Haiku 사상 처음 들어간 Low→Max 조절에서 기본값은 medium입니다. Terminal-Bench는 최고 effort에서 약 39%, medium에서 약 20% 수준으로 그려집니다. "Haiku 5.5는 39%"라고만 외우면, 기본 설정에서 그 절반이 나오는 이유를 놓칩니다. 벤치 점수 읽는 법과 버전별 점수 변화에서 강조한 원칙 그대로입니다. 버전·하네스·effort·시행 횟수를 같이 적으세요.

같이 온 것: Sonnet 캐시 인하와 크레딧

Haiku만 바뀐 게 아닙니다.

① Sonnet 5.5 캐시 읽기 $0.20 → $0.10 (50% 인하)
   → 에이전트 작업 대부분에서 약 20% 저렴
② Max·Team 구독자 월 API 크레딧
   → Max 5x $100, Max 20x $200, Team 합산 $500
③ Python·TypeScript SDK에 컴퓨터·브라우저 사용 베타
   → Haiku 5.5가 속도·가격상 잘 맞는 자리

Terminal-Bench 차트에 Sonnet 구·신 캐시 단가가 둘 다 그려진 이유입니다. 상위 모델도 운영비를 낮추는 방향으로 같이 움직였습니다. 라우팅의 재료가 위아래로 동시에 좋아진 셈입니다.

고객 사례도 발표에 포함됐습니다. Asana는 작업 완료 지연 약 30% 감소·턴당 추론 최대 2.5배, HubSpot은 CRM 시뮬레이션 92.8%, AlphaSense는 문서 질의 0.84 대 0.76, Box는 11점 상승에 절반 지연, Rogo는 10-K 수치 추출 서브에이전트, Cognition은 Devin Fusion 사이드킥으로 FrontierCode 66.2점입니다. 전부 자사 평가라 독립 검증은 아니지만, 어디에 쓰라는지의 힌트는 분명합니다. 짧고 많은 일, 그리고 큰 모델 옆의 서브에이전트입니다.

CodeBridge Mini Lab: 같은 일을 두 모델에 시키기

# cost_lab.py — 개념 스케치 (구조 참고용)
MAX_ESCALATIONS = 2

def run_batch(tasks, call_model, log):
    for task in tasks:
        # 1. 싼 모델 먼저 (Haiku 5.5급, medium effort)
        result = call_model("light", task)
        ok = verify(result, task)
        log.record(model="light", cost=result.cost,
                   latency=result.latency, retries=0, ok=ok)
        # 2. 실패하면 상위 모델로 승격 (최대 2회)
        attempts = 0
        while not ok and attempts < MAX_ESCALATIONS:
            attempts += 1
            result = call_model("strong", task)
            ok = verify(result, task)
            log.record(model="strong", cost=result.cost,
                       latency=result.latency, retries=attempts, ok=ok)
    # 3. 판정: 성공률·지연·재시도·완료 1건당 비용
    return log.summarize(by=["model"])
측정 4종 세트 (브리핑의 액션 그대로):
 [ ] 성공률 (같은 작업, 각 3회 이상)
 [ ] 지연시간 (완료까지, effort별로 분리)
 [ ] 재시도 횟수 (승격률 10~20%가 목표)
 [ ] 완료 1건당 비용 (토큰 단가가 아니라 성공 1건 기준)

주의 2개:
 [ ] 10만 토큰 근처 프롬프트는 새 토크나이저로 다시 측정
 [ ] Terminal-Bench류는 effort·시행 횟수를 결과에 같이 기록

성공 1건당 비용 글의 계산법과 라우팅 구현 글의 승격 구조를 겹치면 이 실험이 완성됩니다.

결론: 싼 모델이 생기면 설계가 바뀐다

한 줄로 정리합니다.

토큰 단가가 아니라 성공 1건당 비용을 재세요. Haiku 5.5는 라우터의 아랫단을 새로 깔아준다.

90% 인하의 실체는 이렇습니다. 10만 이하 구간 90%, 초과 구간 50%, 토크나이저 반영 평균 75%. 저비용 구간에서 Luna를 앞서는 점수, 상위 모델과의 여전한 격차, effort와 부분 점수라는 조건표. 이걸 다 읽고 나면 액션은 하나입니다. 소형과 상위를 같은 작업에 붙이고 네 지표를 재는 것. 그 로그가 다음 분기 모델 배치를 정합니다.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

분류·위임·검증으로 비용과 성공률을 함께 설계하는 연습이 필요하다면, 하네스·루프·그래프를 순서대로 쌓는 과정이 이 글의 라우팅 실험과 바로 이어집니다.