"판단 AI가 35배 빠르다." 썸네일로는 완벽한 문장입니다. 그런데 이 35배가 뭘 재고 비교한 값인지 모르면, 도입 판단이 틀어집니다. 이 글은 Microsoft가 10월 9일에 내놓은 세 숫자, 정확도 83.5%, 속도 35배, 가격 $0.042를 하나씩 풀어봅니다.
먼저 모델 자체가 뭔지 모르면 개요 글부터 보세요. 이 글은 숫자 읽기에만 집중합니다.
83.5%: 36개, 약 14만 7천 문항의 평균이다
Microsoft 발표의 정확도 문장을 풀어 쓰면 이렇습니다.
- 36개 벤치마크, 약 147,137문항을 평균한 값
- 학습 때 안 보여준(held-out) 문제 포함, 라우팅· 랭킹· 긴 문맥· 다국어· 분포 밖· 추론· 안전을 아우름
- 비교 대상: Quyet-1.0-Large, H2O-Lightning-4B, GPT-6 Luna Decisions 등 (Jev는 정확도· 보정 비교에 나중에 추가)
- 결과: Decision-1 83.5%, Quyet 81.9%, GPT-6 Luna Decisions 79.4%, H2O-Lightning-4B 77.2%
표로 놓으면 깔끔합니다. 공식 발표 수치를 그대로 옮긴 표입니다.
| 모델 | 기반 | 정확도 (Microsoft 측정) | 보정 점수 |
|---|---|---|---|
| Microsoft-Decision-1 | Qwen3.5-9B 후속 학습 | 83.5% | 92.2 |
| Quyet-1.0-Large | Gemma-4-31B-it LoRA 병합 | 81.9% | 93.1 |
| GPT-6 Luna Decisions | 미공개 | 79.4% | 89.9 |
| H2O-Lightning-4B | Qwen3.5-4B | 77.2% | 91.8 |
보정(calibration) 점수도 같이 봐야 합니다. 90%라고 말한 것들이 실제로 90%쯤 맞아야 한다는 지표입니다. Decision-1은 92.2로 2위, Quyet이 93.1로 1위입니다. 확신도를 걸고 자동 처리할 생각이라면 정확도보다 이 숫자가 더 중요합니다.
그리고 가장 중요한 단서. 이건 Microsoft가 정하고 잰 자체 평가입니다. 36개 목록이 전부 공개된 것도 아니고, 외부에서 그대로 재현했다는 보고도 아직 없습니다. 독립 평가는 Foundry 카탈로그에도 비어 있다는 지적이 있습니다. 그러니 이 표는 "업계 순위"가 아니라 "Microsoft의 결과"로 읽어야 합니다. 여러분 서비스의 정확도를 보장하는 숫자가 아닙니다.
35배: 전체 성능이 아니라 판단 지연의 중앙값이다
다음은 35배의 정체입니다. 발표 문장을 다시 읽어봅니다.
p50 지연시간이 GPT-6 Sol보다 약 35배 빠르다.
여기서 p50은 평균이 아닙니다. 요청 100개를 세웠을 때 절반이 이 시간 안에 끝났다는 중앙값입니다. Microsoft가 밝힌 값은 Decision-1 p50 85ms, p95 125ms입니다. 같은 발표 안에서 Quyet은 약 380ms, GPT-6 Sol은 약 3,010ms로 측정됐습니다.
85ms × 35 ≈ 2,975ms ≒ GPT-6 Sol 측정값
→ "35배"는 이 특정 판단 작업 구간의 비교
발표가 바뀐 흔적도 알아두면 좋습니다. 처음에는 차순위(runner-up)를 H2O-Lightning-4B v1.1로 적고 2.5배라고 했고, 최신 본문에서는 Quyet 대비 4.5배라는 표현이 들어갔습니다. 영상이나 글에서 runner-up 수치를 전면에 내세우지 않는 게 좋은 이유입니다. 바뀔 수 있는 숫자니까요.
더 흔한 오해도 바로잡습니다. 긴 글쓰기나 코딩에서도 35배 빨라진다는 뜻이 아닙니다. Decision-1은 애초에 글을 안 씁니다. 비교된 건 구조화된 판단 한 번의 지연입니다. 단위가 다른 지표를 섞으면 잘못된 결론이 나옵니다.
맞는 읽기:
- 구조화된 판단 1회, p50 기준, Microsoft 측정 환경에서 35배
틀린 읽기:
- 코딩· 글쓰기· 추론 전부 35배
- 평균 응답시간이 35분의 1
- 어떤 환경에서도 35배 보장
Microsoft가 예로 든 계산은 와닿습니다. 20단계가 이어지는 워크플로에서 단계마다 100ms를 줄이면 전체에서 2초를 아낍니다. 판단이 반복될수록 작은 지연이 쌓인다는 얘기입니다. 반대로 말하면 판단이 한두 번뿐인 일에서는 35배가 체감으로 크지 않을 수 있습니다.
강건성 수치도 함께 발표됐습니다. 같은 요청을 8가지로 살짝 바꿔도 결정이 바뀌는 비율이 평균 1.3%, 선택지 설명을 바꾸거나 순서를 뒤섞을 때는 0이었다고 합니다. 안정적이라는 신호로는 의미 있지만, 그 선택이 고객 정책에 맞는 정답인지는 다른 문제입니다.
$0.042: 입력 100만 토큰당, 출력은 무료
가격은 단순합니다. 입력 100만 토큰에 0.042달러, 출력 토큰은 무료입니다. Jev와 소수점까지 같은 가격이라 "가격을 그대로 가져왔다"는 얘기도 나왔습니다.
| 항목 | Decision-1 | 참고 |
|---|---|---|
| 입력 | $0.042 / 100만 토큰 | Jev와 동일 단가 |
| 출력 | 무료 | 문장을 안 만드니 당연한 구조 |
| 그 외 | 네트워크· 운영비 별도 | 요청 입력 길이에 따라 실제 청구 달라짐 |
Microsoft가 든 예시도 있습니다. 같은 분량으로 100만 건을 분류하면 Decision-1은 약 11달러, GPT-6 Sol은 약 2,434달러라는 모델 계산입니다. 고객 청구서가 아니라 가정한 비교입니다. 입력량이 같고 출력 과금이 포함된다는 전제가 깔려 있습니다.
실무에서 더 중요한 건 토큰 단가가 아니라 판단 한 건당 비용입니다.
비교해야 할 것:
토큰 100만 개당 가격 X
올바르게 끝난 판단 1건당 비용 O
= 입력 토큰 + 재시도 + 상위 모델 확인 + 사람 검토까지 포함한 값
Xbox 사례가 이 관점을 보여줍니다. 1만 건 넘는 피드백 분류에서 GPT-6 Sol과 비슷한 품질로 14배 이상 빠르고 200분의 1 비용이었다는 겁니다(Foundry 글에는 80~100배라는 표현도 있습니다. 같은 내부 실험을 다르게 요약한 것으로 보입니다). Copilot 팀은 GPT-5.6 Luna와 비슷한 품질로 100배 빠르다는 평가를, Discovery 팀은 루브릭 채점 일관성 46배, 속도 3배, 재계획 4배라는 평가를 내놨습니다. 전부 Microsoft 내부 측정이라 그대로 일반화하면 안 되지만, "어디서 아꼈나"를 보는 힌트는 됩니다. 분류처럼 반복되는 자리를 떼어냈더니 전체가 줄었다는 얘기입니다.
숫자를 볼 때 체크리스트: 네 칸만 확인하자
세 숫자를 다 봤으니 정리합니다. 새 모델 발표를 볼 때마다 이 네 칸만 확인하세요.
| 확인할 것 | Decision-1에서 물어볼 질문 |
|---|---|
| 무엇을 쟀나 | 36개 평균인가, 내 일과 비슷한 작업인가 |
| 누구 환경인가 | 공급사 측정인가, 독립 재현이 있나 |
| 분포는 어떤가 | 평균· 중앙값뿐 아니라 p95와 느린 꼬리는 어떤가 |
| 정답당 비용은 얼마인가 | 토큰 단가가 아니라 올바른 판단 1건에 뭐가 드나 |
이 틀은 벤치마크 읽는 법 글의 5가지 확인과 같은 얘기입니다. 버전과 effort, 하네스, 작업당 비용, 세부 구성을 같이 보라는 겁니다. 특히 Decision AI에서는 확률 보정을 빼놓으면 안 됩니다. 성공 1건당 비용 글에서 본 것처럼, 토큰이 싸도 많이 부르면 비싸집니다.
결론: 숫자가 아니라 조건을 가져가라
한 줄로 정리합니다.
83.5%는 Microsoft의 시험 결과이고, 35배는 판단 지연 중앙값 비교이고, $0.042는 입력 단가이다.
세 숫자 다 거짓말이 아닙니다. 다만 적용 범위가 있습니다. 그 범위를 벗어나면 숫자는 맞는데 결정은 틀립니다.
다음 할 일도 단순합니다. 여러분 일에서 100개 정도의 실제 예제를 모아보세요. 기존 방법과 Decision-1을 같은 입력, 같은 기준으로 돌리고 정확도와 보정, p95, 정답당 비용을 함께 재면 됩니다. 그 실험 설계는 공정 비교 글과 도입 체크리스트 글에서 이어집니다.
함께 읽으면 좋은 글
- 판단만 하는 AI가 나왔다: Microsoft-Decision-1 개요
- AI 벤치마크 점수만 보면 틀릴 수 있다
- AI 모델 비용은 성공 1건당 비용으로 봐야 한다
- Jev·Laya·Microsoft를 한 줄로 세우면 틀린다
참고 자료
- Microsoft Command Line: Introducing Microsoft-Decision-1 (2026-10-09)
- Microsoft Foundry Blog: Introducing Microsoft-Decision-1 in Microsoft Foundry (2026-10-09)
- IAMag: Microsoft-Decision-1 9B Agent Decision Model (2026-10-10)
- Brocker: Microsoft-Decision-1 ships with top accuracy and 35x faster latency (2026-10-09)
- OrcaRouter: Microsoft-Decision-1 Is GA on Foundry, With No Benchmarks (2026-10-10)
- System One Models: Microsoft-Decision-1 specs and limits
이 주제를 직접 따라가며 배우고 싶다면
숫자 읽는 법까지 알았으면 다음은 내 데이터로 재는 일만 남습니다. 어디서 100개를 모으고, 어떤 기준으로 정답을 정하고, 확신도 몇에서 사람에게 넘길지 정하는 부분이 실무에서 가장 막막합니다.
실무 Decision AI 과정에서는 Laya를 직접 실행하면서 상태와 질문을 만들고, 확신도를 정책과 Human Review로 연결하는 법과 내 업무에 적용하기 전 검증 틀을 함께 잡습니다. 토큰 단가가 아니라 정답당 비용으로 따져보고 싶은 분이라면, 이 글의 체크리스트와 그대로 이어집니다.