10월 7일, Anthropic이 Claude Haiku 5.5를 내놨습니다. "지금까지 낸 소형 모델 중 가장 싸고, 가장 빠르고, 가장 유능하다"는 소개와 함께요. 가격과 벤치마크 조건은 Haiku 5.5 가격 분석 글에서 따로 다뤘습니다. 10만 토큰 경계 2단 요금제, 새 토크나이저, Terminal-Bench 39.2%와 OSWorld 72.4%의 측정 조건이 궁금하면 그 글을 먼저 보세요.
이 글은 다른 질문을 답합니다. "그래서 이 싼 모델을 어디에 어떻게 일시키나?" Anthropic이 콕 집은 용도는 분류·요약·라우팅·서브에이전트입니다. 큰 모델 하나로 다 하는 게 아니라, 작고 많은 일을 Haiku에 맡기고 어려운 판단만 위로 올리는 구조요.
왜 이번 Haiku가 다른가: 처음 달린 effort 조절
Haiku에 effort(노력 정도) 조절이 들어간 건 이번이 처음입니다. Low부터 Max까지 고를 수 있고, 기본값은 medium입니다.
낮은 effort (low·중간): 싸고 빠름, 쉬운 일용
→ medium 기본값에서 GDPval-AA 1277점, 출력 토큰은 max의 약 1/10
높은 effort (max): 비싸고 느림, 어려운 일용
→ GDPval-AA 1620점, Terminal-Bench 39.2%, OSWorld 부분 72.4%
공식 발표의 정확도 대 비용 곡선이 말하는 것도 같습니다. Haiku 5.5는 저비용 구간을 새로 열었고, 복잡한 터미널 코딩은 Sonnet·Opus 몫으로 남겼습니다. Terminal-Bench에서 Sonnet 5.5가 70.6%, Haiku 5.5가 39.2%로 약 31%p 벌어지는 이유입니다. 싼 모델이 생기면 "이걸로 다 한다"가 아니라 "어디까지 맡긴다"를 정해야 합니다.
스펙도 실무형입니다. API 이름은 claude-haiku-5-5, 컨텍스트 100만 토큰, 최대 출력 12.8만 토큰, 지식 기준 2026년 6월. Claude API뿐 아니라 Bedrock·Vertex·Foundry에서도 같은 짧은 이름으로 부릅니다. 가격은 10만 이하 입력 기준 100만 토큰당 입력 $0.10·출력 $0.50, 초과하면 5배($0.50·$2.50)입니다. 평균 75% 절감은 토크나이저 변화(약 30% 토큰 증가)를 반영한 수치라, 10만 근처 프롬프트는 새 모델 기준으로 다시 세어야 합니다.
벤치마크를 일로 번역하면: 어디에 쓰라는 건가
공식 표를 일의 언어로 옮기면 이렇습니다. 전부 Anthropic 자체 측정, 최고 effort 기준이라 독립 검증은 아닙니다.
| 평가 | Haiku 5.5 | Haiku 4.5 | 같은 값 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (지식 작업) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1 오프라인 부분 | 72.4% | 15.7% | 48.9% | 83.9% |
| Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| FrontierCode 1.1 Main | 46.4% | — | 42.4% | 52.1% |
| HLE 도구 없음 / 사용 | 45.9% / 57.4% | 10.2% / 18.7% | — | 56.9% / 64.5% |
Haiku 5.5가 Luna(같은 $0.10/$0.50)를 앞선 구간:
지식 작업·컴퓨터 조작·터미널·시각 추론 전부
→ 같은 값이면 Haiku가 낫다는 게 공식 주장
Sonnet 5.5가 여전히 앞선 구간:
Terminal-Bench 31%p, OSWorld 부분 11%p, GDPval 220점
→ 복잡한 코딩은 상위 모델 몫
고객 사례도 같은 말을 합니다. Asana는 작업 지연 약 30% 감소·턴당 최대 2.5배, HubSpot은 CRM 시뮬레이션 92.8%, Box는 11점 상승에 절반 지연, Rogo는 10-K 수치 추출 서브에이전트, Cognition은 Devin Fusion의 사이드킥으로 FrontierCode 66.2점. 전부 자사 평가지만, 배치는 일치합니다. 짧고 많은 일, 그리고 큰 모델 옆의 서브에이전트.
주의할 독립 측정도 있습니다. Artificial Analysis는 지능 지수 43점(1년 전 Haiku보다 26점 상승, Luna 38점·Sonnet 5.5 56점 사이)으로 평가하면서도, 작업당 비용은 max effort $0.21·xhigh $0.12, max에서 Luna보다 출력 토큰을 약 3배 쓴다고 덧붙였습니다. AutomationBench에서는 과도한 거부로 35%에 그쳤다는 지적도 있습니다. 싸다고 무조건 싼 게 아니라, effort와 토큰량을 같이 봐야 한다는 뜻입니다.
CodeBridge Mini Lab: 100건 비교 실험
브리핑의 액션 그대로입니다. 지금 쓰는 요약·분류 100건을 꺼내서 비교하세요.
# volume_lab.py — 개념 스케치 (구조 참고용)
EFFORT = "medium" # 기본값에서 시작, 올리기 전에 측정
def run_batch(tasks, call_model, log):
for task in tasks[:100]:
# 1. Haiku급(저비용)으로 먼저
r = call_model("haiku-5-5", task, effort=EFFORT)
ok = verify(r, task)
log.record(model="haiku", cost=r.cost,
latency=r.latency, tokens=r.tokens, ok=ok)
# 2. 실패만 상위 모델로 승격 (전부 올리지 않기)
if not ok:
r2 = call_model("sonnet-5-5", task, effort="high")
ok2 = verify(r2, task)
log.record(model="sonnet", cost=r2.cost,
latency=r2.latency, tokens=r2.tokens, ok=ok2)
return log.summarize(by=["model"])
측정 4종 (성공 1건 기준):
[ ] 정확도 — 같은 작업 각 3회 이상, effort별로 분리 기록
[ ] 지연시간 — 완료까지, medium과 max를 따로
[ ] 승격률 — 상위 모델로 넘어간 비율 10~20%가 목표
[ ] 완료 1건당 비용 — 토큰 단가가 아니라 성공 1건당
배치 규칙 3개:
[ ] 요약·압축·조회·분류는 Haiku 기본
[ ] 코딩 서브에이전트(추출·정리·초안)는 Haiku + 검증 루프
[ ] 복잡한 터미널·긴 추론은 Sonnet·Opus로 승격
함정 2개:
[ ] 10만 근처 프롬프트는 claude-haiku-5-5 기준으로 다시 측정
[ ] Terminal-Bench류 점수는 effort·시행 횟수를 결과에 같이 적기
라우팅 구현 글의 승격 구조와 성공 1건당 비용 글의 계산법을 겹치면 이 실험이 완성됩니다. 같은 날 Sonnet 5.5 캐시 읽기가 절반($0.20→$0.10)으로 내려 에이전트 작업이 약 20% 저렴해진 것도 같이 반영하세요. 위아래가 동시에 싸진 셈입니다.
결론: 작은 모델을 두는 자리가 실력이다
한 줄로 정리합니다.
토큰 단가가 아니라 성공 1건당 비용을 재고, Haiku는 앞단과 옆자리(서브에이전트)에 두세요.
Haiku 5.5는 첫 번째로 믿을 만한 Haiku 에이전트입니다. OSWorld 15.7%→72.4%, Terminal-Bench 0.0%→39.2%라는 점프가 증거입니다. 그래도 Sonnet과의 격차, effort별 성능 차이, 토큰 증가와 10만 경계는 그대로 남습니다. 가격표가 아니라 배치표로 읽고, 100건 실험의 로그로 다음 분기 모델 배치를 정하세요.
함께 읽으면 좋은 글
- Claude Haiku 5.5는 왜 90% 싼가: 가격표보다 먼저 읽을 조건들
- AI 모델 라우팅 직접 구현: 싼 모델부터 쓰고 막히면 올리기
- 성공 1건당 비용으로 AI 요금표 읽기
참고 자료
- Anthropic: Introducing Claude Haiku 5.5 (Oct 7, 2026) — 가격·벤치마크·차트
- Artificial Analysis: Claude Haiku 5.5 release (Oct 7, 2026) — 지능 지수 43·작업당 비용
- Simon Willison: Claude Haiku 5.5 notes (Oct 7, 2026) — 토크나이저·Luna 비교
이 주제를 직접 따라가며 배우고 싶다면
싼 모델부터 쓰고 막히면 올리는 라우팅과 검증 루프를 코드로 연결하는 연습이 필요하다면, 하네스·루프·그래프를 순서대로 쌓는 과정이 이 글의 100건 실험과 바로 이어집니다.