오픈웨이트 진영이 조용히 바뀌었습니다.

Artificial Analysis 기준으로 오픈웨이트 1위는 MiMo-V2.6-Pro 46점, 2위는 GLM-5.3 45점, 3위는 Kimi K3 44점입니다. 1점씩 촘촘하게 붙어 있어서 점수만 보면 셋이 비슷해 보입니다.

그런데 실제로 써보려면 점수가 제일 나중에 봐야 할 항목입니다. 쓸 수 있는 라이선스인지, 내 GPU나 예산에 서빙이 되는지, 토큰을 얼마나 먹는지. 이 세 개가 먼저입니다.

점수표: 1점 차이의 의미

모델 Intelligence Index 특징
MiMo-V2.6-Pro 46 현재 오픈웨이트 1위
GLM-5.3 (max) 45 비즈니스 워크플로우 강세
Kimi K3 (max) 44 오픈 프런티어, 초대형 MoE

GLM-5.3은 AutomationBench 계열에서 62%를 기록했고, Kimi K3는 2.8조 파라미터급 MoE 구조로 화제가 됐습니다. 자세한 배경은 Kimi K3 글과 오픈웨이트 비용 글에 정리돼 있습니다.

여기서 헷갈리기 쉬운 게 있습니다. 46점이면 폐쇄형 최고 58점보다 12점 낮으니 "아직 멀었다"고 느끼는 것입니다. 하지만 용도를 바꾸면 이야기가 달라집니다. 매번 최고 지능이 필요한 게 아니라면, 오픈 모델의 낮은 서빙 단가와 데이터 통제 장점이 점수 차이를 덮는 구간이 있습니다.

질문 바꾸기:
"가장 똑똑한가?" → "이 점수대에서 내 워크로드가 도는가?"

한국 팀이라면: Upstage Solar Mini 4 소식도 같이 보세요

9월 30일에 한국 Upstage의 Solar Mini 4가 나왔습니다. Intelligence 24점에 소형급인데, Artificial Analysis 지적이 재미있습니다. 토큰 단가는 GPT-6 Luna와 비슷한데 작업당 비용은 약 5배가 든다는 것입니다.

이게 오픈·소형 모델 선택의 핵심을 보여줍니다. 토큰 단가가 비슷해도 한 작업을 끝내는 데 쓰는 토큰이 많으면 실제 청구액은 벌어집니다. 소형·오픈 모델을 고를 때는 단가표가 아니라 내 태스크에서의 성공률과 재시도 횟수를 봐야 합니다.

토큰 단가 50% 저렴 × 재시도 3배 = 오히려 비쌈

→ 반드시 "성공 1건당 비용"으로 계산 (측정법은 아래 Mini Lab)

고르기 전에 확인할 세 가지

1. 라이선스: 상업 이용이 되는가

오픈웨이트라고 다 같은 조건이 아닙니다. 비상업 제한, 추가 조건부 상업 허용, 완전 상업 허용이 섞여 있습니다. Artificial Analysis도 Openness Index에서 상업 제한 여부를 따로 표기합니다.

회사 프로젝트라면 모델 카드의 라이선스 항목을 먼저 읽으세요. 점수 비교는 그다음입니다.

2. 서빙: 어디에서 돌릴 것인가

선택지는 크게 세 가지입니다.

A. 호스팅 API로 쓰기
   - 장점: GPU 걱정 없음, 바로 시작
   - 확인할 것: 작업당 비용, 캐시 할인, 속도

B. 클라우드 GPU에 직접 올리기
   - 장점: 데이터 통제, 사용량 많으면 단가 유리
   - 확인할 것: VRAM 요구량, 동시성에서의 p95 지연

C. 노트북·워크스테이션에서 돌리기
   - 장점: 완전 로컬, 실험 자유
   - 확인할 것: 양자화 후 품질 하락, 속도

C가 궁금하다면 9월 29일에 나온 AA-AgentPerf-Local이 참고가 됩니다. DGX Spark, Ryzen AI Halo, MacBook Pro(M5 Pro), RTX 5090에서 오픈 모델 4종의 에이전트 실행 속도를 재는 오픈소스 도구입니다. 노트북에서 에이전트를 돌리는 게 취미가 아니라 측정 대상이 됐다는 뜻입니다.

서빙 측정은 평균이 아니라 p95와 동시성으로 봐야 합니다. 방법은 NVIDIA AIPerf 글에 정리돼 있습니다.

3. 토큰 효율: MoE면 Active를 보세요

Kimi K3 같은 MoE는 전체 파라미터와 실제 추론에 쓰는 Active 파라미터가 다릅니다. 전체가 크다고 매 토큰 계산량이 큰 건 아닙니다. 반대로 Active가 작아도 라우팅과 메모리 구조 때문에 서빙 난이도가 올라갈 수 있습니다. 개념 정리는 MoE Active 파라미터 글을 참고하세요.

비교표에 넣을 항목:
- Intelligence 점수 (max 기준인지, 어떤 effort인지 명시)
- 작업당 출력 토큰 수
- 작업당 비용 (성공 기준)
- 컨텍스트 길이와 실제 긴 입력에서의 품질
- 라이선스 조건

CodeBridge Mini Lab: 후보 2개를 10개 태스크로 비교하기

점수표만 보고 고르지 말고, 내 일 10개를 뽑아 돌려보세요.

준비물: 자주 하는 일 10개 (요약, 분류, 코드 수정, 표 분석 등)

각 모델마다 기록:
- 성공: Y / N (기준을 미리 정함, 예: 테스트 통과 + 근거 인용)
- 재시도 횟수
- 총 토큰과 비용
- 실패 유형: 지시 불이행 / 환각 / 도구 호출 실패 / 형식 오류

판정:
성공률 80% 미만이면 탈락 (아무리 싸도 소용없음)
성공률 동점이면 성공 1건당 비용이 낮은 쪽 채택

이때 성공 1건당 비용 글의 계산 방식을 그대로 쓰면 됩니다. 토큰 단가가 아니라 성공까지 든 총비용입니다.

결론: 오픈웨이트 선택은 점수 게임이 아니다

정리하면 순서가 이렇습니다.

라이선스 확인 → 내 태스크 10개로 성공률 측정 → 성공 1건당 비용 비교 → 서빙 방식 결정

46, 45, 44점의 차이는 대부분의 실무에서 오차범위처럼 느껴질 때가 많습니다. 대신 라이선스 하나, 서빙 실패 한 번, 재시도 폭증 한 번이 프로젝트를 멈춥니다. 점수는 후보를 추리는 용도, 결정은 내 태스크 측정으로. 이 한 줄이 오픈 모델 선택의 전부입니다.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

저렴한 오픈 모델을 고르는 것만으로는 에이전트가 완성되지 않습니다. 하네스·루프·그래프 구조로 작업을 나누고 검증하는 설계 연습이 필요하다면, 다섯 단계를 순서대로 쌓는 과정이 이 글의 비교 실험과 바로 이어집니다.