Anthropic은 2026년 9월 22일 Claude Opus 5.5를 공개했습니다. 새로운 Claude 5.5 패밀리의 첫 모델이고, 발표의 방향은 분명합니다. 더 똑똑한 모델을 새로 내놓은 게 아니라 상위 모델급 성능을 더 낮은 비용으로 제공하는 쪽에 초점이 맞춰져 있습니다.

이 글에서는 공개된 가격과 성능 숫자를 정리하고, 코딩 에이전트를 쓰는 입장에서 이 발표를 어떻게 읽어야 하는지 풀어봅니다.

공개된 내용부터 정리해 봅시다

Anthropic의 설명을 한 줄로 줄이면 이렇습니다.

대부분의 작업에서 Fable 5.1 수준의 성능을 내면서, Opus 5보다 운영하는 데 40% 덜 든다.

가격표는 이렇게 바뀌었습니다.

항목 Opus 5 Opus 5.5
입력 / 1M tokens $5 $4
출력 / 1M tokens $25 $20
캐시 읽기 $0.50 $0.20
캐시 쓰기 $6.25 $5

단가 인하는 20%인데 전체 운영비가 40% 줄어든다고 말하는 이유는 토큰 사용량 자체가 줄고 출력 속도가 30% 이상 빨라졌기 때문입니다. 같은 작업을 더 적은 토큰으로, 더 빨리 끝낸다는 것입니다. Claude Code와 Claude Platform에는 최대 2.5배 빠른 fast mode도 추가됐는데, 이쪽은 입력 $8, 출력 $40 요금의 별도 옵션입니다.

성능 쪽에서 앞에 내세운 숫자는 agentic 코딩 영역입니다.

Terminal-Bench 4.0
Opus 5.5 66.4% vs Fable 5.1 55.8%

FrontierCode
Opus 5.5 54.4% vs Fable 5.1 50.3%

외부 비교 관전 포인트도 붙었습니다. 기본 effort의 FrontierCode에서 GPT-6 Astra를 대략 20% 수준의 작업당 비용으로 앞섰고, CursorBench에서는 GPT-5.6 Sol을 11점 차이로 앞섰는데 비용은 3분의 1 수준이었다는 설명입니다. 일부 소프트웨어 개발 평가에서 GPT-5.6 Sol을 앞섰다는 보도가 나온 배경이 여기에 있습니다. 다만 Anthropic 스스로도 이 정도 구간에서는 몇 점 차이가 체감 차이로 곧장 이어지지는 않는다고 덧붙였습니다. 솔직한 주의사항이라고 봅니다.

벤치마크보다 기억에 남는 대목은 장시간 작업 예시입니다. 한 테스터는 68만 줄 코드 마이그레이션을 하루 안에 끝냈고, 다른 테스트에서는 여섯 개 저장소에 걸쳐 18시간 넘게 스스로 일했다는 이야기가 나옵니다. 내부 리서치 리포트 18개 중 16개가 품질 기준을 넘었는데 Opus 5나 Fable 5.1은 하나도 넘지 못했다는 대목도 있습니다. 에이전트 모델 발표에서는 점수보다 이런 이야기가 더 중요합니다.

외부 평가는 Frontier Design과 METR이 맡았고, Anthropic의 자동 행동 감사에서는 지금까지 테스트한 모델 중 가장 좋은 결과를 냈다고 합니다. Sonnet 5.5와 Haiku 5.5는 몇 주 안에 뒤따를 예정이고, GitHub Copilot에서도 쓸 수 있게 됐습니다.

에이전트에서는 단가보다 루프 횟수가 돈을 결정합니다

코딩 에이전트는 한 작업을 모델 한 번 호출로 끝내지 않습니다. 읽고, 고치고, 빌드하고, 실패하고, 다시 고치는 루프를 돕니다.

작업 1건 비용
=
호출 횟수 × 매 호출 토큰 × 토큰 단가
+
빌드·테스트·사람 검토 비용

그래서 이런 관계가 성립합니다.

토큰 단가가 20% 싸다
≠
작업 비용이 항상 20% 싸다

호출 횟수가 절반으로 줄면
→
단가가 같아도 작업 비용은 절반에 가깝다

Opus 5.5 발표에서 GitHub Copilot 쪽이 언급한 것도 같은 맥락입니다. 초기 테스트에서 Opus 5와 비슷한 수준으로 작업을 해결하면서도 "significantly fewer steps and tokens"를 썼다는 것입니다. 이게 사실이라면 단가 인하보다 루프 단축이 실제 청구서에는 더 크게 찍힙니다.

반대 방향도 같이 봐야 합니다. 토큰 단가가 낮아 보여도 max effort처럼 많은 reasoning 토큰을 쓰는 설정에서는 실제 작업당 비용이 올라갈 수 있습니다. 이전에 Opus 5.5와 GPT-6 Astra를 비교한 글에서 다룬 것처럼, 단가와 작업 비용은 다른 숫자입니다. 모델을 고를 때는 가격표가 아니라 내 작업에서의 평균 호출 횟수와 토큰 사용량을 봐야 합니다.

안전장치 이야기는 아키텍처 문제로 읽어야 합니다

Opus 5.5는 Fable 5.1급 안전 분류기를 함께 싣고 나왔습니다. 사이버 보안, 생물학, frontier AI 개발 같은 고위험 영역에서 분류기가 동작하면 요청이 조용히 구형 모델로 넘어갑니다. 알려진 연결은 대략 이렇습니다.

사이버 보안 관련 플래그 → Opus 4.8로
생물학 · frontier LLM 개발 플래그 → Opus 5로

내 코드를 직접 디버깅하는 용도는 그대로 Opus 5.5가 처리한다고 Anthropic은 설명합니다. 그래도 에이전트 워크플로우를 만드는 입장에서는 한 가지를 염두에 둬야 합니다. 여러 턴에 걸친 작업에서 중간 어느 요청이 다른 모델로 처리될 수 있다는 것입니다. 평가를 만들 때 모든 요청이 같은 모델에 갔다고 가정하면, 재현이 안 되는 흔들림이 생길 수 있습니다.

CodeBridge Mini Lab: 같은 repo에서 10~20개만 재보세요

Claude Code나 Codex 계열을 쓰고 있다면 공개 점수보다 이 표가 유용합니다. 같은 저장소에서 실제 작업을 10~20개 고르고 세 가지만 적어보세요. 성공률, 평균 비용, 완료 시간입니다.

Model: ______
Run: 1 / 2 / 3
Tests passed: Y / N
Files changed: __
Retries: __
Time: __ sec
Cost: $__
Unexpected changes: Y / N

작은 CSV로 시작해도 됩니다.

task_id,model,cost,success,retries,time_sec
1,opus-5-5,0.12,1,0,24
2,opus-5-5,0.31,0,2,88
3,opus-5-5,0.14,1,1,41
import pandas as pd

df = pd.read_csv("runs.csv")
summary = df.groupby("model").agg(
    total_cost=("cost", "sum"),
    successes=("success", "sum"),
    avg_time=("time_sec", "mean"),
    avg_retries=("retries", "mean"),
)
summary["cost_per_success"] = summary["total_cost"] / summary["successes"]
print(summary)

여기서 볼 값은 토큰 단가가 아니라 cost_per_success입니다. 싼 모델이 세 번 실패하면 싼 게 아니라는 이야기는 비용 글에서도 다뤘는데, Opus 5.5는 그 계산을 다시 해보라는 계기에 가깝습니다.

결론: 모델 선택은 순위가 아니라 작업 설계입니다

Opus 5.5가 던지는 질문은 "이 모델이 1등인가?"가 아닙니다. "내 작업을 끝까지 성공시키는 데 평균적으로 얼마가 드는가?"입니다. 단가 인하 20%는 시작점이고, 루프 단축과 캐시 읽기 인하 같은 요소까지 합쳐져야 실제 숫자가 됩니다. 구독 쪽도 같은 방향입니다. 5시간 사용량 제한이 20% 늘고, 낮은 비용 덕분에 제한이 25% 더 오래 간다는 안내가 붙었습니다.

최종 결정은 공개 벤치마크가 아니라 내 저장소에서의 작은 반복 실험으로 확인하는 편이 좋습니다.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

에이전트 코딩을 감으로 쓰지 않고 검증과 제약이 있는 개발 흐름으로 통제하는 연습이 필요하다면, Claude Code 기준으로 CLAUDE.md·Skills·Hooks·Subagents·MCP를 쌓는 과정이 이 글과 바로 이어집니다.