AI API 가격표를 보면 보통 이렇게 비교합니다.
Model A: 입력 $0.10 / 출력 $0.50
Model B: 입력 $2 / 출력 $10
그러면 Model A가 20배 싸 보입니다.
하지만 실제 업무에서는 한 가지가 빠져 있습니다.
그 작업이 성공했는가?
모델이 싸더라도 자주 실패해서 두세 번 다시 실행해야 한다면 실제 비용 차이는 훨씬 작아질 수 있습니다.
토큰 가격과 작업 비용은 다릅니다
Artificial Analysis는 모델 비교에서 Cost per Task라는 지표를 사용합니다.
단순 API 단가가 아니라 실제 benchmark workload에서 사용한 입력·캐시·출력 token을 계산해 작업 하나를 수행하는 평균 비용을 구합니다.
이 접근이 중요한 이유는 모델마다 답변 길이와 reasoning token 사용량이 다르기 때문입니다.
같은 $1 / 1M tokens
Model A → 5,000 tokens 사용
Model B → 30,000 tokens 사용
실제 비용은 다름
하지만 제품을 운영할 때는 여기서 한 단계 더 내려가야 합니다.
CodeBridge식으로 한 번 더 계산해보기
가장 단순한 지표는 이것입니다.
Effective Cost per Success
=
총 실행 비용 / 성공한 작업 수
예를 들어 모델 A와 B를 각각 10번 실행했다고 가정해보겠습니다.
| 모델 | 총 비용 | 성공 | 성공 1건당 비용 |
|---|---|---|---|
| A | $0.80 | 5 | $0.16 |
| B | $1.60 | 9 | 약 $0.18 |
A는 총 비용이 절반이지만 성공 1건당 비용 차이는 거의 없습니다.
더 중요한 업무에서는 실패 비용까지 포함할 수 있습니다.
Total Effective Cost
=
API 비용
+
재시도 비용
+
사람이 검토하는 시간
+
실패로 발생한 복구 비용
물론 모든 것을 정확한 달러로 환산할 필요는 없습니다. 방향을 보는 것만으로도 충분합니다.
GPT-6 Sol과 Luna가 좋은 예입니다
2026년 9월 기준 GPT-6 Luna는 Sol보다 API 단가가 크게 낮습니다.
Artificial Analysis의 max effort 기준 Cost per Intelligence task는:
GPT-6 Luna 약 $0.07
GPT-6 Sol 약 $1.06
로 큰 차이가 납니다.
하지만 종합 성능과 복잡한 agentic 작업에서는 Sol이 더 강합니다.
그래서 실제 시스템에서는:
모든 요청 → Sol
도 비효율적이고,
모든 요청 → Luna
도 실패율 때문에 비효율적일 수 있습니다.
더 좋은 질문은:
어떤 작업까지 Luna로 보내도 성공률이 충분한가?
입니다.
CodeBridge Mini Lab: CSV 하나로 실제 비용 계산하기
작은 실험을 해보겠습니다.
20개 작업을 준비하고 다음 정보를 기록합니다.
task_id,model,cost,success,retries,time_sec
1,luna,0.01,1,0,8
2,luna,0.02,0,2,31
3,sol,0.18,1,0,22
Python으로 계산하면 간단합니다.
import pandas as pd
df = pd.read_csv("runs.csv")
summary = (
df.groupby("model")
.agg(
total_cost=("cost", "sum"),
successes=("success", "sum"),
avg_time=("time_sec", "mean"),
avg_retries=("retries", "mean"),
)
)
summary["cost_per_success"] = (
summary["total_cost"] / summary["successes"]
)
print(summary)
여기서 가장 중요한 열은 cost_per_success입니다.
단, 성공 정의는 반드시 먼저 정해야 합니다.
코딩이라면:
모든 테스트 통과
lint 통과
예상하지 않은 파일 변경 없음
문서 생성이라면:
필수 항목 포함
근거 링크 존재
금지 표현 없음
처럼 자동으로 확인할 수 있는 조건이 좋습니다.
비용만 최적화하면 안 되는 이유
성공 1건당 비용도 완벽한 지표는 아닙니다.
예를 들어 두 모델의 성공률이 같아도:
- 하나는 5초
- 다른 하나는 3분
이라면 사용자 경험은 완전히 다릅니다.
그래서 실제로는 최소한 다음 네 가지를 같이 보기를 권합니다.
Success rate
Cost per success
Latency
Human review time
이 네 값만 있어도 “토큰 단가가 싸니까 이 모델”이라는 선택보다 훨씬 현실적인 판단이 가능합니다.
라우팅이 비용 최적화의 핵심이 되는 이유
모든 업무가 같은 난이도는 아닙니다.
따라서 하나의 모델을 찾는 것보다 이렇게 나누는 것이 자연스럽습니다.
단순 작업
→ 저비용 모델
검증 실패
→ 상위 모델
여전히 실패
→ 사람 검토
이 구조에서는 모델 하나의 가격보다 전체 경로의 기대 비용이 중요합니다.
결론: 가장 싼 모델보다 가장 싼 성공 경로를 찾으세요
AI 비용을 줄이는 가장 쉬운 방법은 무조건 싼 모델을 고르는 것이 아닙니다.
내 작업을 끝까지 성공시키는 데 평균적으로 얼마가 드는가?
를 측정하는 것입니다.
작은 CSV 하나만 만들어도 모델 선택 기준이 꽤 달라집니다.
그리고 이 숫자가 쌓이면 자연스럽게 모델 라우팅, effort 조절, fallback 같은 다음 단계로 넘어갈 수 있습니다.