GPT-6.1 Sol이 2026년 9월 29일 공개됐습니다.

처음 가격표만 보면 눈에 들어오는 숫자는 간단합니다.

GPT-6.1 Sol
Input  $2 / 1M
Output $10 / 1M

GPT-6 Astra
Input  $10 / 1M
Output $50 / 1M

표준 가격 기준으로 정확히 5배 차이입니다.

그러면 결론도 단순할까요?

"Sol이 Astra보다 5배 싸니까 Sol을 쓰면 된다."

실제 AI Agent 비용은 그렇게 계산되지 않습니다.

모델이 실패해서 두 번 더 실행되거나, reasoning effort를 높여 훨씬 많은 토큰을 사용하거나, tool call이 늘어나면 결과가 달라집니다.

그래서 GPT-6.1 Sol에서 더 흥미로운 질문은 이것입니다.

토큰 하나가 얼마인가가 아니라, 성공한 작업 하나를 만드는 데 얼마가 드는가?

먼저 스펙은 생각보다 비슷합니다

OpenAI API 문서 기준으로 두 모델의 기본 구조를 비교하면 다음과 같습니다.

항목 GPT-6.1 Sol GPT-6 Astra
Input / 1M $2 $10
Cached input / 1M $0.10 $1
Output / 1M $10 $50
Context 1.05M 1.05M
Max output 128K 128K
Knowledge cutoff 2026-04-30 2026-04-30

둘 다 긴 컨텍스트와 tool use를 지원합니다.

즉 Astra가 단순히 "더 긴 모델"이라서 비싼 것은 아닙니다.

OpenAI의 현재 model selection 문서도 대략 다음 역할로 나눕니다.

Astra
가장 까다롭고 품질 우선인 작업

GPT-6.1 Sol
복잡하지만 비용과 시간도 관리해야 하는 작업

Luna
범위가 명확하고 자주 반복되는 작업

이제 모델 선택 자체가 하나의 routing 문제에 가까워지고 있습니다.

GPT-6.1 Sol의 가장 작은 변화 중 하나가 의외로 중요합니다

기존 GPT-6 Sol과 비교하면 input/output 기본 단가는 같습니다.

하지만 cached input은:

GPT-6 Sol      $0.20 / 1M
GPT-6.1 Sol    $0.10 / 1M

으로 절반이 됐습니다.

에이전트형 코딩에서는 같은 저장소 설명, system instruction, tool schema가 반복해서 들어가는 경우가 많습니다.

그래서 캐시 적중률이 높다면 작은 단가 차이가 누적됩니다.

긴 공통 context
+ 반복 실행
+ 높은 cache hit
=
실제 비용 차이가 커짐

독립 측정에서도 "Astra 바로 아래"라는 그림이 보입니다

Artificial Analysis의 9월 29일 측정에서는 GPT-6.1 Sol Max가 Intelligence Index 52로, GPT-6 Astra보다 1점 낮게 측정됐습니다.

같은 분석에서 Intelligence Index task당 비용은:

GPT-6.1 Sol Max   약 $0.72
GPT-6 Astra       약 $3.26

로 계산됐습니다.

즉 독립 측정에서도 성능 차이보다 task cost 차이가 훨씬 큰 구간이 관찰됩니다.

다만 여기서도 "Sol이 Astra를 이겼다"라고 단순화하면 안 됩니다.

reasoning effort가 달라지면 결과가 바뀝니다.

예를 들어 Artificial Analysis의 비교에서:

Sol Medium
Intelligence Index 48
Cost per task 약 $0.21

Astra Xhigh
Intelligence Index 52
Cost per task 약 $2.31

처럼 품질을 조금 더 사기 위해 비용이 크게 올라가는 구간이 생깁니다.

반대로 가장 어려운 작업에서 4점 차이가 실제 실패를 막는다면 Astra가 더 쌀 수도 있습니다.

Cost per Task와 Cost per Success를 구분해 보세요

모델 비용을 세 단계로 나누면 이해가 쉽습니다.

Token price
↓
한 번 실행하는 비용

Cost per Task
↓
한 task를 평가할 때 평균 비용

Cost per Success
↓
실제로 성공한 결과 하나를 얻는 비용

예를 들어:

Sol
10회 실행
8회 성공
총 비용 $2.40

Cost per Success = $0.30


Astra
10회 실행
10회 성공
총 비용 $4.00

Cost per Success = $0.40

라면 Sol이 경제적입니다.

하지만 Sol이 4번만 성공한다면:

$2.40 / 4
= $0.60 per success

가 되어 Astra가 더 싸집니다.

그래서 공개 가격표만 보고 모델을 고르면 안 됩니다.

간단한 Python으로 직접 계산할 수 있습니다

실제 작업을 10~20개만 모아도 충분합니다.

task_id,model,cost,success,time_sec
1,gpt-6.1-sol,0.12,1,42
2,gpt-6.1-sol,0.09,1,31
3,gpt-6.1-sol,0.18,0,73
4,gpt-6-astra,0.41,1,55
5,gpt-6-astra,0.38,1,48
import pandas as pd

df = pd.read_csv("runs.csv")

summary = df.groupby("model").agg(
    total_cost=("cost", "sum"),
    successes=("success", "sum"),
    avg_time=("time_sec", "mean"),
)

summary["cost_per_success"] = (
    summary["total_cost"] / summary["successes"]
)

print(summary)

여기서 가장 중요한 열은 cost_per_success입니다.

토큰 단가가 아니라 완료된 결과의 단가가 나옵니다.

도식으로 보면 모델 Routing이 자연스럽습니다

처음부터 모든 작업에 Astra를 넣는 대신 다음처럼 갈 수 있습니다.

작업 입력
   ↓
GPT-6.1 Sol
   ↓
완료 조건 통과?
  ├─ Yes → 종료
  └─ No
      ↓
   Astra로 승격
      ↓
   재실행 / 검토

이 방식은 "싼 모델을 무조건 쓴다"는 전략이 아닙니다.

낮은 비용으로 충분한 작업은 Sol에서 끝내고, 실제로 더 높은 capability가 필요한 경우에만 Astra 비용을 지불하는 전략입니다.

Reasoning effort도 모델 선택만큼 중요합니다

GPT-6.1 Sol은:

low
medium
high
xhigh
max

reasoning effort를 지원합니다.

모델 이름은 같아도 effort가 바뀌면 비용·시간·품질이 크게 달라질 수 있습니다.

따라서 비교를 이렇게 하면 안 됩니다.

Sol vs Astra

보다 실제로는:

Sol Medium
Sol High
Sol Max
Astra Medium
Astra Xhigh

를 하나의 조합으로 보는 편이 정확합니다.

벤치마크 점수를 읽을 때 effort 표기가 중요한 이유입니다.

CodeBridge Mini Lab: "Astra가 필요한 task"를 찾아보세요

내 프로젝트에서 작업 15개 정도를 골라봅니다.

가능하면 난이도를 섞습니다.

5개 — 작은 수정
5개 — 여러 파일 수정
5개 — 분석 + 구현 + 테스트가 필요한 작업

그리고 같은 완료 조건을 둡니다.

- 테스트 전부 통과
- lint 통과
- public API 변경 없음
- 예상하지 않은 파일 변경 없음

먼저 Sol Medium으로 실행합니다.

실패한 것만 Sol High, 그래도 실패한 것만 Astra로 올립니다.

Sol Medium
    ↓ fail
Sol High
    ↓ fail
Astra

이렇게 하면 "Astra가 좋은가?"보다 훨씬 유용한 답이 나옵니다.

내 프로젝트에서 Astra가 필요한 작업은 어떤 종류인가?

그게 routing rule의 시작입니다.

결론: 가장 좋은 모델보다 가장 싼 성공 경로가 중요합니다

GPT-6.1 Sol은 단순한 GPT-6 Sol의 소폭 업데이트라기보다 Astra급 capability에 얼마나 낮은 가격으로 접근할 수 있는가라는 질문을 더 선명하게 만들었습니다.

현재 가격 구조와 독립 벤치마크를 보면 Sol이 상당히 넓은 영역을 맡을 수 있어 보입니다.

하지만 최종 선택은 공개 점수표가 아니라 내 workflow에서 확인해야 합니다.

모델 가격
+
reasoning effort
+
cache hit
+
tool calls
+
재시도
+
성공률
=
실제 작업 비용

이 식으로 보면 "어느 모델이 최고인가?"보다 "어떤 경로가 가장 경제적으로 성공하는가" 가 더 중요한 질문이 됩니다.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

모델을 바꾸는 것만으로 끝내지 않고, 에이전트가 컨텍스트·규칙·도구·검증 루프 안에서 안정적으로 일하게 만드는 방법을 익히고 싶다면 Claude Code를 기준으로 하네스 구조를 직접 만드는 아래 강의가 가장 가깝습니다.