10월 7일, Anthropic이 Claude Haiku 5.5를 내놨습니다. "지금까지 낸 소형 모델 중 가장 싸고, 가장 빠르고, 가장 유능하다"는 소개와 함께요. 가격과 벤치마크 조건은 Haiku 5.5 가격 분석 글에서 따로 다뤘습니다. 10만 토큰 경계 2단 요금제, 새 토크나이저, Terminal-Bench 39.2%와 OSWorld 72.4%의 측정 조건이 궁금하면 그 글을 먼저 보세요.

이 글은 다른 질문을 답합니다. "그래서 이 싼 모델을 어디에 어떻게 일시키나?" Anthropic이 콕 집은 용도는 분류·요약·라우팅·서브에이전트입니다. 큰 모델 하나로 다 하는 게 아니라, 작고 많은 일을 Haiku에 맡기고 어려운 판단만 위로 올리는 구조요.

왜 이번 Haiku가 다른가: 처음 달린 effort 조절

Haiku에 effort(노력 정도) 조절이 들어간 건 이번이 처음입니다. Low부터 Max까지 고를 수 있고, 기본값은 medium입니다.

낮은 effort (low·중간): 싸고 빠름, 쉬운 일용
  → medium 기본값에서 GDPval-AA 1277점, 출력 토큰은 max의 약 1/10
높은 effort (max): 비싸고 느림, 어려운 일용
  → GDPval-AA 1620점, Terminal-Bench 39.2%, OSWorld 부분 72.4%

공식 발표의 정확도 대 비용 곡선이 말하는 것도 같습니다. Haiku 5.5는 저비용 구간을 새로 열었고, 복잡한 터미널 코딩은 Sonnet·Opus 몫으로 남겼습니다. Terminal-Bench에서 Sonnet 5.5가 70.6%, Haiku 5.5가 39.2%로 약 31%p 벌어지는 이유입니다. 싼 모델이 생기면 "이걸로 다 한다"가 아니라 "어디까지 맡긴다"를 정해야 합니다.

스펙도 실무형입니다. API 이름은 claude-haiku-5-5, 컨텍스트 100만 토큰, 최대 출력 12.8만 토큰, 지식 기준 2026년 6월. Claude API뿐 아니라 Bedrock·Vertex·Foundry에서도 같은 짧은 이름으로 부릅니다. 가격은 10만 이하 입력 기준 100만 토큰당 입력 $0.10·출력 $0.50, 초과하면 5배($0.50·$2.50)입니다. 평균 75% 절감은 토크나이저 변화(약 30% 토큰 증가)를 반영한 수치라, 10만 근처 프롬프트는 새 모델 기준으로 다시 세어야 합니다.

벤치마크를 일로 번역하면: 어디에 쓰라는 건가

공식 표를 일의 언어로 옮기면 이렇습니다. 전부 Anthropic 자체 측정, 최고 effort 기준이라 독립 검증은 아닙니다.

평가 Haiku 5.5 Haiku 4.5 같은 값 Luna Sonnet 5.5
GDPval-AA v2.1 (지식 작업) 1620 735 1437 1840
AA-Briefcase v1.1 1578 614 1336 1824
OSWorld 2.1 오프라인 부분 72.4% 15.7% 48.9% 83.9%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 Main 46.4% — 42.4% 52.1%
HLE 도구 없음 / 사용 45.9% / 57.4% 10.2% / 18.7% — 56.9% / 64.5%
Haiku 5.5가 Luna(같은 $0.10/$0.50)를 앞선 구간:
 지식 작업·컴퓨터 조작·터미널·시각 추론 전부
 → 같은 값이면 Haiku가 낫다는 게 공식 주장

Sonnet 5.5가 여전히 앞선 구간:
 Terminal-Bench 31%p, OSWorld 부분 11%p, GDPval 220점
 → 복잡한 코딩은 상위 모델 몫

고객 사례도 같은 말을 합니다. Asana는 작업 지연 약 30% 감소·턴당 최대 2.5배, HubSpot은 CRM 시뮬레이션 92.8%, Box는 11점 상승에 절반 지연, Rogo는 10-K 수치 추출 서브에이전트, Cognition은 Devin Fusion의 사이드킥으로 FrontierCode 66.2점. 전부 자사 평가지만, 배치는 일치합니다. 짧고 많은 일, 그리고 큰 모델 옆의 서브에이전트.

주의할 독립 측정도 있습니다. Artificial Analysis는 지능 지수 43점(1년 전 Haiku보다 26점 상승, Luna 38점·Sonnet 5.5 56점 사이)으로 평가하면서도, 작업당 비용은 max effort $0.21·xhigh $0.12, max에서 Luna보다 출력 토큰을 약 3배 쓴다고 덧붙였습니다. AutomationBench에서는 과도한 거부로 35%에 그쳤다는 지적도 있습니다. 싸다고 무조건 싼 게 아니라, effort와 토큰량을 같이 봐야 한다는 뜻입니다.

CodeBridge Mini Lab: 100건 비교 실험

브리핑의 액션 그대로입니다. 지금 쓰는 요약·분류 100건을 꺼내서 비교하세요.

# volume_lab.py — 개념 스케치 (구조 참고용)
EFFORT = "medium"  # 기본값에서 시작, 올리기 전에 측정

def run_batch(tasks, call_model, log):
    for task in tasks[:100]:
        # 1. Haiku급(저비용)으로 먼저
        r = call_model("haiku-5-5", task, effort=EFFORT)
        ok = verify(r, task)
        log.record(model="haiku", cost=r.cost,
                   latency=r.latency, tokens=r.tokens, ok=ok)
        # 2. 실패만 상위 모델로 승격 (전부 올리지 않기)
        if not ok:
            r2 = call_model("sonnet-5-5", task, effort="high")
            ok2 = verify(r2, task)
            log.record(model="sonnet", cost=r2.cost,
                       latency=r2.latency, tokens=r2.tokens, ok=ok2)
    return log.summarize(by=["model"])
측정 4종 (성공 1건 기준):
 [ ] 정확도 — 같은 작업 각 3회 이상, effort별로 분리 기록
 [ ] 지연시간 — 완료까지, medium과 max를 따로
 [ ] 승격률 — 상위 모델로 넘어간 비율 10~20%가 목표
 [ ] 완료 1건당 비용 — 토큰 단가가 아니라 성공 1건당

배치 규칙 3개:
 [ ] 요약·압축·조회·분류는 Haiku 기본
 [ ] 코딩 서브에이전트(추출·정리·초안)는 Haiku + 검증 루프
 [ ] 복잡한 터미널·긴 추론은 Sonnet·Opus로 승격

함정 2개:
 [ ] 10만 근처 프롬프트는 claude-haiku-5-5 기준으로 다시 측정
 [ ] Terminal-Bench류 점수는 effort·시행 횟수를 결과에 같이 적기

라우팅 구현 글의 승격 구조와 성공 1건당 비용 글의 계산법을 겹치면 이 실험이 완성됩니다. 같은 날 Sonnet 5.5 캐시 읽기가 절반($0.20→$0.10)으로 내려 에이전트 작업이 약 20% 저렴해진 것도 같이 반영하세요. 위아래가 동시에 싸진 셈입니다.

결론: 작은 모델을 두는 자리가 실력이다

한 줄로 정리합니다.

토큰 단가가 아니라 성공 1건당 비용을 재고, Haiku는 앞단과 옆자리(서브에이전트)에 두세요.

Haiku 5.5는 첫 번째로 믿을 만한 Haiku 에이전트입니다. OSWorld 15.7%→72.4%, Terminal-Bench 0.0%→39.2%라는 점프가 증거입니다. 그래도 Sonnet과의 격차, effort별 성능 차이, 토큰 증가와 10만 경계는 그대로 남습니다. 가격표가 아니라 배치표로 읽고, 100건 실험의 로그로 다음 분기 모델 배치를 정하세요.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

싼 모델부터 쓰고 막히면 올리는 라우팅과 검증 루프를 코드로 연결하는 연습이 필요하다면, 하네스·루프·그래프를 순서대로 쌓는 과정이 이 글의 100건 실험과 바로 이어집니다.