AI API 가격표를 보면 보통 이렇게 비교합니다.

Model A: 입력 $0.10 / 출력 $0.50
Model B: 입력 $2 / 출력 $10

그러면 Model A가 20배 싸 보입니다.

하지만 실제 업무에서는 한 가지가 빠져 있습니다.

그 작업이 성공했는가?

모델이 싸더라도 자주 실패해서 두세 번 다시 실행해야 한다면 실제 비용 차이는 훨씬 작아질 수 있습니다.

토큰 가격과 작업 비용은 다릅니다

Artificial Analysis는 모델 비교에서 Cost per Task라는 지표를 사용합니다.

단순 API 단가가 아니라 실제 benchmark workload에서 사용한 입력·캐시·출력 token을 계산해 작업 하나를 수행하는 평균 비용을 구합니다.

이 접근이 중요한 이유는 모델마다 답변 길이와 reasoning token 사용량이 다르기 때문입니다.

같은 $1 / 1M tokens

Model A → 5,000 tokens 사용
Model B → 30,000 tokens 사용

실제 비용은 다름

하지만 제품을 운영할 때는 여기서 한 단계 더 내려가야 합니다.

CodeBridge식으로 한 번 더 계산해보기

가장 단순한 지표는 이것입니다.

Effective Cost per Success
=
총 실행 비용 / 성공한 작업 수

예를 들어 모델 A와 B를 각각 10번 실행했다고 가정해보겠습니다.

모델 총 비용 성공 성공 1건당 비용
A $0.80 5 $0.16
B $1.60 9 약 $0.18

A는 총 비용이 절반이지만 성공 1건당 비용 차이는 거의 없습니다.

더 중요한 업무에서는 실패 비용까지 포함할 수 있습니다.

Total Effective Cost
=
API 비용
+
재시도 비용
+
사람이 검토하는 시간
+
실패로 발생한 복구 비용

물론 모든 것을 정확한 달러로 환산할 필요는 없습니다. 방향을 보는 것만으로도 충분합니다.

GPT-6 Sol과 Luna가 좋은 예입니다

2026년 9월 기준 GPT-6 Luna는 Sol보다 API 단가가 크게 낮습니다.

Artificial Analysis의 max effort 기준 Cost per Intelligence task는:

GPT-6 Luna   약 $0.07
GPT-6 Sol    약 $1.06

로 큰 차이가 납니다.

하지만 종합 성능과 복잡한 agentic 작업에서는 Sol이 더 강합니다.

그래서 실제 시스템에서는:

모든 요청 → Sol

도 비효율적이고,

모든 요청 → Luna

도 실패율 때문에 비효율적일 수 있습니다.

더 좋은 질문은:

어떤 작업까지 Luna로 보내도 성공률이 충분한가?

입니다.

CodeBridge Mini Lab: CSV 하나로 실제 비용 계산하기

작은 실험을 해보겠습니다.

20개 작업을 준비하고 다음 정보를 기록합니다.

task_id,model,cost,success,retries,time_sec
1,luna,0.01,1,0,8
2,luna,0.02,0,2,31
3,sol,0.18,1,0,22

Python으로 계산하면 간단합니다.

import pandas as pd

df = pd.read_csv("runs.csv")

summary = (
    df.groupby("model")
      .agg(
          total_cost=("cost", "sum"),
          successes=("success", "sum"),
          avg_time=("time_sec", "mean"),
          avg_retries=("retries", "mean"),
      )
)

summary["cost_per_success"] = (
    summary["total_cost"] / summary["successes"]
)

print(summary)

여기서 가장 중요한 열은 cost_per_success입니다.

단, 성공 정의는 반드시 먼저 정해야 합니다.

코딩이라면:

모든 테스트 통과
lint 통과
예상하지 않은 파일 변경 없음

문서 생성이라면:

필수 항목 포함
근거 링크 존재
금지 표현 없음

처럼 자동으로 확인할 수 있는 조건이 좋습니다.

비용만 최적화하면 안 되는 이유

성공 1건당 비용도 완벽한 지표는 아닙니다.

예를 들어 두 모델의 성공률이 같아도:

  • 하나는 5초
  • 다른 하나는 3분

이라면 사용자 경험은 완전히 다릅니다.

그래서 실제로는 최소한 다음 네 가지를 같이 보기를 권합니다.

Success rate
Cost per success
Latency
Human review time

이 네 값만 있어도 “토큰 단가가 싸니까 이 모델”이라는 선택보다 훨씬 현실적인 판단이 가능합니다.

라우팅이 비용 최적화의 핵심이 되는 이유

모든 업무가 같은 난이도는 아닙니다.

따라서 하나의 모델을 찾는 것보다 이렇게 나누는 것이 자연스럽습니다.

단순 작업
→ 저비용 모델

검증 실패
→ 상위 모델

여전히 실패
→ 사람 검토

이 구조에서는 모델 하나의 가격보다 전체 경로의 기대 비용이 중요합니다.

결론: 가장 싼 모델보다 가장 싼 성공 경로를 찾으세요

AI 비용을 줄이는 가장 쉬운 방법은 무조건 싼 모델을 고르는 것이 아닙니다.

내 작업을 끝까지 성공시키는 데 평균적으로 얼마가 드는가?

를 측정하는 것입니다.

작은 CSV 하나만 만들어도 모델 선택 기준이 꽤 달라집니다.

그리고 이 숫자가 쌓이면 자연스럽게 모델 라우팅, effort 조절, fallback 같은 다음 단계로 넘어갈 수 있습니다.

함께 읽으면 좋은 글

참고 자료