모델이 셋이면 순위를 매기고 싶어집니다. Microsoft 83.5%, Jev 점수, Laya 76.6%. 숫자를 나란히 놓으면 답이 나올 것 같죠. 그런데 이 세 숫자는 각자 다른 시험에서 나온 값입니다. 한 줄에 세우면 순위가 아니라 착시가 됩니다.

이 글은 두 종류의 근거를 나눠서 읽는 법을 정리합니다. 각자 내놓은 수치와, 같은 입력으로 직접 붙인 실험입니다.

다른 시험끼리 비교 금지와 같은 입력 비교를 나눈 개념도

먼저 분리: 다른 시험 vs 같은 시험

비교 전에 딱 이것만 기억하세요.

다른 시험 (분리해서 읽기):
  Microsoft 자체 36개 평균 / Jev 외부 평가· JevBench / Laya 추적표
  → 조건이 다르니 우열 단정 금지

같은 시험 (나란히 놓기 가능):
  sysone-bench v2, Laya 추적표에 인용된 동일 입력 실험
  → Jev vs Laya만 비교, Microsoft는 이 실험에 없음

이 구분을 안 하면 많은 영상과 글이 실수합니다. 화면에 세 숫자를 띄우고 승자를 고르는 장면이 대표적입니다.

각자 내놓은 수치: 조건부터 읽기

세 모델이 공개한 값을 조건과 함께 놓으면 이렇습니다.

모델 공개 수치 조건
Microsoft-Decision-1 83.5% 평균 정확도 36개, 약 14.7만 문항, Microsoft 자체 평가, 학습 때 안 보여준 문제 포함
Jev 여러 외부 평가와 JevBench 기록 JevBench Score는 정확도 %가 아님, 버전(jev-1.13.0 등)과 방법론에 따라 변동
Laya 파인튜닝 체크포인트 76.6%, 기본 36.1% 400케이스 2,000판단, T4, Typed Decisions 계열에 맞춘 특화 수치

Jev 쪽을 조금 더 풀면, JevBench v1.6.1 기준으로 Jev 1.13.0의 Capability가 77.1, Laya 영어 체크포인트가 32.5라는 기록이 있습니다. 그런데 Capability는 Intelligence와 Calibration의 평균이고, Composite는 속도와 비용까지 넣은 2차 점수입니다. 정확도 %처럼 읽으면 안 됩니다. 버전이 바뀌면 수치와 순위도 바뀝니다.

Laya 쪽은 함정이 하나 더 있습니다. 흔히 인용되는 76.6%는 Typed Decisions에 맞춰 파인튜닝한 체크포인트의 값입니다. 같은 보고서에서 기본 Laya는 36.1%였습니다. 특화 튜닝 모델의 수치로 범용 성능을 설명하면 안 됩니다. Laya 추적표도 이 점을 맨 위에 못 박고 있습니다. 지연시간 32.8ms 역시 T4 GPU 내부 측정이라 네트워크가 포함된 API 지연과 비교하면 안 됩니다.

Microsoft 쪽은 숫자 읽기 글에서 다뤘듯 공급사 측정입니다. 36개 목록이 전부 공개된 것도 아니고, 독립 재현도 아직 없습니다.

정리:
- Microsoft 83.5% = Microsoft의 시험 결과
- Jev 수치 = 외부· 커뮤니티 평가의 기록 (정의와 버전 확인 필수)
- Laya 76.6% = 특화 튜닝 모델의 수치 (기본 모델 아님)
→ 셋을 한 표에 두면 안 됨

같은 시험: sysone-bench v2에서 Jev와 Laya는 붙었다

반대로 Jev와 Laya는 같은 입력으로 붙인 공개 실험이 있습니다. sysone-bench v2, 751개 상태를 바이트 단위로 똑같이 주고 같은 시드로 돌린 실험입니다. Laya 추적표에도 인용된 결과입니다. Jev는 jev-1.13.0 고정, Laya는 영어 체크포인트를 로컬 M2 CPU에서 돌렸고, Jev 전체 실행 비용은 0.008달러였다고 합니다.

대표 네 작업만 뽑으면 이렇습니다.

작업 표본 Jev Laya 포인트
지원 요청 분류 Triage n=160 88.8% 80.0% Jev 우위
가드레일 Guardrails n=60 96.7% 88.3% Jev 우위, 표본 적어 해석 주의
뉴스 분류 AG News n=100 91.0% 94.0% Laya 우위
자연어 추론 MNLI n=60 86.7% 98.3% Laya 우위

전체 9개로 넓히면 그림이 더 분명해집니다. Jev는 6-way 의도 분류나 독성 판정, 다국어 의도 같은 데서 크게 앞섰고, Laya는 AG News와 MNLI에서 앞섰습니다. 감정 분류는 둘 다 0.54 수준으로 약했고, 5단계 점수 매기기는 Jev와 오픈 기준선이 동률이었습니다.

여기서 볼 포인트는 승자가 아니라 패턴입니다. 한 모델이 전 유형에서 항상 이기지 않는다는 것. 비교 모양의 문제(MNLI 같은 전제-가설 비교)에서는 Laya 같은 인코더가 잘 맞고, 라벨이 많거나 다국어에서는 Jev가 벌어집니다.

읽을 때 주의:
- 표본이 작다 (60~160개). 가드레일 차이는 오차 안에 있을 수 있음
- 한 사람이 만든 선별 케이스 포함, 영어 중심
- 버전 고정 (jev-1.13.0). latest가 움직이면 다시 재야 함
- Microsoft는 이 실험에 없음. 셋 중 승자 없음

Laya Router 얘기도 덧붙입니다. 영어 체크포인트만 쓰면 다국어 의도가 36.0%까지 떨어지는데, Router로 돌리면 84.0%까지 오릅니다. 그래도 같은 조건에서 Jev는 100%였습니다(표본 25개). 라우터라는 설계 결정 하나로 2배 넘게 오르는 지점이 있다는 게 이 실험이 주는 힌트입니다.

지연시간도 같은 실수를 한다

정확도만큼 지연 비교도 섞기 쉽습니다.

  • Microsoft p50 85ms는 Foundry 호스팅 측정
  • Laya 32.8ms는 T4 GPU 내부 측정
  • sysone-bench의 Laya 180~660ms는 로컬 M2 CPU 5문항 호출, Jev 925~1,068ms는 같은 실험의 API 종단간 측정(지역 영향 포함)
  • Jev 공식 안내는 70~500ms, Cloudflare 측정에서는 중앙값 524ms라는 기록도 있음

하드웨어, 문항 수, 네트워크가 다르면 숫자를 나란히 놓을 수 없습니다. 특히 GPU 내부 시간과 API 종단간 시간을 섞으면 안 됩니다. 여러분 서비스에서는 네트워크와 오케스트레이션을 포함한 종단간 지연을 따로 재야 합니다.

비용도 마찬가지입니다. Jev와 Decision-1 모두 입력 100만 토큰에 $0.042, 출력 무료라는 단가는 같습니다. Laya는 내려받으면 한계비용 0원입니다. 그런데 751개 상태 실험에서 Jev 전체 비용이 0.008달러였다는 대목이 더 와닿습니다. 작은 판단 모델의 가격 이야기는 단가보다 "묶으면 얼마나 싸지나"로 봐야 합니다.

CodeBridge Mini Lab: 내 비교표 만들기

남의 순위표를 외우지 말고, 내 표를 하나 만드세요.

① 100개 모으기: 실제 입력 + 정답 라벨 (애매한 것도 버리지 말기)
② 고정하기: 모델 버전 기록, 입력 바이트 동일, 같은 시드· 같은 질문
③ 같이 재기: 정확도 + 보정(ECE) + p50· p95 + 정답당 비용
④ 나눠 보기: 작업별로 쪼개서 (분류· 가드레일· 추론 따로)
⑤ 게이팅 확인: 확신도 0.85에서 몇 %를 자동 처리하고 정확도가 어떤지

sysone-bench의 교훈을 그대로 가져오면 됩니다. 질문 해시를 먼저 맞추고, 버전을 고정하고, 표본 수와 한계를 적는 것. 그게 공정 비교의 전부입니다.

결론: 순위가 아니라 조건을 물어라

한 줄로 정리합니다.

다른 시험의 최고점끼리 비교하지 말고, 같은 시험의 작업별 결과로 읽어라.

Microsoft 83.5%, Jev 기록, Laya 76.6%는 각자의 자리에서 읽을 숫자입니다. 같은 입력 비교에서는 Jev가 앞서는 작업과 Laya가 앞서는 작업이 갈렸습니다. Microsoft는 그 실험에 없으니 셋의 승자는 없습니다.

다음 순서는 실전입니다. 어디에 붙이면 돈이 되는지 실전 패턴 글에서, 도입 전에 뭘 재야 하는지 체크리스트 글에서 이어집니다.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

공정 비교의 감각은 표를 읽는 데서 끝나지 않습니다. 내 입력 100개로 같은 실험을 돌려보고, 확신도가 낮을 때 어디서 멈출지 정해봐야 몸에 남습니다.

실무 Decision AI 과정에서는 Laya를 직접 실행하면서 상태 설계부터 Choice·Score·Noul 해석, 확신도와 정책·Human Review 연결까지 한 흐름으로 연습합니다. 남의 순위가 아니라 내 작업의 작업별 표를 만들고 싶은 분이라면, 이 글의 Mini Lab 다음 순서로 이어서 보셔도 좋습니다.