Open weights라는 말을 들으면 자연스럽게 저렴하다 또는 공짜다를 떠올리기 쉽습니다.
하지만 모델 weight를 내려받을 수 있다는 것과 inference가 공짜라는 것은 전혀 다른 이야기입니다.
API로 쓰는 오픈웨이트 모델도 가격이 있습니다
Artificial Analysis의 2026년 9월 비교를 보면 GLM-5.3, Kimi K3, Qwen3.8 같은 오픈웨이트 모델도 provider API로 사용할 때 서로 다른 token 가격, speed, cost per task를 보입니다.
흥미로운 점은 token 단가와 task 비용의 순서가 항상 같지 않다는 것입니다.
모델이 더 많은 reasoning/output token을 사용하면 낮은 단가의 장점이 줄어들 수 있습니다.
그래서 최소한 다음을 함께 봐야 합니다.
Intelligence / task success
Input price
Output price
Tokens per task
Time per task
Cost per task
Self-hosting이면 정말 무료일까?
직접 GPU에 올리면 API token bill은 없어질 수 있습니다. 대신 다른 비용이 생깁니다.
GPU rental / depreciation
+ idle capacity
+ inference server
+ autoscaling
+ observability
+ engineering time
+ model updates
따라서 비교식은 이렇게 바뀝니다.
Hosted API TCO
vs
Self-hosted TCO
CodeBridge Mini Lab: 월간 Break-even 계산
현재 workload를 한 달 기준으로 적습니다.
input tokens / month
output tokens / month
peak requests per second
required latency
API 비용:
input_tokens × input_rate
+ output_tokens × output_rate
Self-host 비용:
GPU hours
+ storage/network
+ 운영 인력 시간
그리고 workload가 30%, 100%, 300%일 때 각각 계산해봅니다.
낮은 사용량에서는 GPU가 놀기 때문에 API가 유리할 수 있고, 일정하고 큰 workload에서는 self-hosting이 경쟁력을 가질 수 있습니다.
모델 크기보다 Active Parameters도 확인할 만합니다
MoE 모델은 총 parameter 수와 실제 inference에서 활성화되는 parameter 수가 다를 수 있습니다.
Artificial Analysis는 GLM-5.3이나 Kimi K3 같은 모델에 대해 total과 active parameter를 구분해 표시합니다.
숫자 하나만 보고 "2.8T라서 무조건 느리다"처럼 판단하기보다 실제 provider speed와 latency를 측정하는 것이 낫습니다.
Open Weights의 진짜 장점은 비용만이 아닙니다
상황에 따라 더 중요한 이유가 있습니다.
- 내부망 배포
- 모델 수정/미세조정
- inference stack 통제
- 특정 provider 종속 감소
- 데이터 위치 통제
반대로 managed frontier API가 더 빠르게 새로운 기능과 tool integration을 제공할 수도 있습니다.
결론: Open Weights vs Closed는 가격표 한 줄로 결정할 문제가 아닙니다
오픈웨이트는 강력한 선택지지만 무료 모델이라는 프레임은 현실을 너무 단순화합니다.
실제 선택에서는 다음을 비교하세요.
성공 1건당 비용 + 필요한 latency + 운영 복잡도 + 통제권
이 네 가지를 같이 보면 어떤 workload에서 self-hosting이 의미가 있고, 어떤 workload에서는 API가 더 경제적인지 훨씬 명확해집니다.