모델 고를 때 지능 점수랑 가격만 보신 적 있죠. 저도 그랬습니다.

그런데 음성 에이전트나 코딩 에이전트를 실제로 붙여보면 세 번째 축이 튀어나옵니다. 속도입니다. 아무리 똑똑해도 답이 10초 뒤에 오면 못 씁니다.

이 글은 속도 지표 세 개를 헷갈리지 않게 정리합니다. 출력 속도, 첫 토큰 지연, 작업 완료 시간. 그리고 10월 기준 측정치와 함께 체감을 올리는 방법을 적어둡니다.

세 지표를 먼저 구분하세요

요청 ──→ [생각 + 입력 처리] ──→ 첫 토큰 ──→ 토큰 술술 ──→ 500 토큰 완성
         └──── 지연시간 ────┘                        └── 출력 속도 ──┘
         └────────────── 끝까지 걸린 시간 (체감) ─────────────────┘
지표 의미 체감 예시
출력 속도 (tokens/s) 생성 중 초당 토큰 긴 답이 술술 나오는 느낌
지연시간 (TTFT, 초) 첫 토큰까지 시간, 추론 모델은 생각 시간 포함 "응?" 하고 기다리는 침묵
작업 완료 시간 (분) 출력 토큰 수 ÷ 속도 에이전트 한 일이 끝날 때까지

추론 모델은 첫 토큰 전에 오래 생각해서 지연이 깁니다. 출력 속도가 빨라도 생각 시간이 길면 체감은 느립니다. 반대로 짧은 답은 출력 속도보다 지연이 체감을 정합니다.

10월 기준 측정치: 누가 빠르고 누가 민첩한가

Artificial Analysis 실측 기준입니다.

부문 1위 수치
출력 속도 Celeris-1 초당 약 1502 토큰
출력 속도 2위 Mercury 2 초당 약 811 토큰
첫 토큰 지연 Gemini 2.5 Flash-Lite (non-reasoning) 약 0.33초
지연 2위 Nemotron 3 Nano Omni 30B 약 0.38초
지연 3위 Gemini 2.5 Flash (non-reasoning) 약 0.45초

그리고 프런티어 쪽 소식도 있습니다. Opus 5.5는 전작보다 출력이 30% 이상 빨라졌고, Claude Code·플랫폼용 Fast 모드는 최대 2.5배 속도를 표방합니다. 대신 Fast 모드 가격은 입력 $8, 출력 $40으로 일반의 2배입니다.

빠른 모델 ≠ 만능
- Celeris·Mercury류: 속도 최강, 지능은 별도 확인 필요
- Flash-Lite류: 첫 반응 최강, 짧은 상호작용·음성에 유리
- 프런티어 추론형: 지능 최강, 생각 시간 때문에 첫 반응은 느림
→ 용도별로 다른 1위가 있다

에이전트는 "작업 완료 시간"으로 보세요

코딩 에이전트의 체감은 초당 토큰이 아니라 한 일이 끝날 때까지 걸린 시간입니다. 공식이 있습니다.

작업 완료 시간 ≈ 출력 토큰 수 ÷ 출력 속도 (+ 생각 시간)

예시:
- 토큰 2만 개 쓰는 가벼운 작업, 초당 800 토큰 → 약 25초
- 토큰 12만 개 쓰는 깊은 작업, 초당 800 토큰 → 약 150초
→ 토큰을 줄이는 게 속도를 올리는 지름길이기도 하다

그래서 Opus 5.5가 토큰 효율을 강조하고, GPT-6 Astra가 작업당 2만 7천 토큰으로 파레토 경계를 정의했다는 이야기가 속도와 연결됩니다. 토큰을 적게 쓰는 모델은 같은 속도에서도 먼저 끝납니다. 성공 1건당 비용 글의 논리가 시간에도 그대로 적용됩니다.

서빙을 직접 한다면 평균이 아니라 p95와 동시성을 보세요. 동시 요청이 붙으면 p95부터 무너집니다. 측정 도구는 AIPerf 글에서 다뤘습니다. TTFT, 스트리밍 간격(ITL), 처리량, 동시성을 함께 보는 방식입니다.

체감을 올리는 실전 패턴 4개

1. 스트리밍은 기본값으로

완성될 때까지 기다렸다 보여주면 체감이 반토막 납니다. 첫 토큰부터 흘려보내세요. 스트리밍이 끊기지 않는지(ITL)도 함께 봅니다.

2. 작은 모델이 먼저 받고, 큰 모델이 검토한다

빠른 모델: 첫 분류·초안·진행 상황 안내 (지연 담당)
  ↓
무거운 모델: 어려운 분석·최종 검토 (지능 담당)
  ↓
사용자는 기다리는 동안 진행 상황을 본다 (체감 개선)

여러 AI 도구를 나누어 쓰는 글과 Luna·Sol·Astra 라우팅 글의 패턴을 속도에 적용한 것입니다.

3. 음성은 1초 예산을 먼저 정하세요

Gemini Live 음성 에이전트 글에서 다룬 것처럼, 음성은 대화 중 도구 실행이 핵심입니다. 일반적인 감각선은 이렇습니다.

0.5초 이내: 자연스러움
1초 전후:   참을 만한 한계
2초 이상:   "끊겼나?" 확인 시작
→ 추론형 max effort를 음성 첫 응답에 직결하면 망한다
→ 첫 마디는 가볍게, 깊은 작업은 뒤에서 돌리고 말로 경과를 알린다

4. 캐시로 생각 시간을 아끼세요

반복되는 지시·문서는 프롬프트 캐싱으로 입력 처리를 줄입니다. Opus 5.5의 캐시 읽기는 $0.20으로 95% 할인 수준이고, Gemini 4 Argon도 캐시 95% 할인을 내세웁니다. 돈뿐 아니라 시간도 아낍니다. 자세한 계산은 프롬프트 캐싱 글을 참고하세요.

CodeBridge Mini Lab: 500토큰 체감 재기

Artificial Analysis의 End-to-End 응답 시간처럼, 500토큰 완성을 직접 재보세요.

같은 프롬프트(코드 리뷰 1건, 문서 요약 1건)를 후보 2개에 실행:

- 첫 토큰까지: __ 초 (스톱워치 or 로그)
- 500토큰 완성까지: __ 초
- 스트리밍 끊김 체감: 1~5점
- 스트리밍 + p95 3회 측정 후 평균이 아닌 최악값으로 비교

판정: 평균이 아니라 최악값이 좋은 쪽을 고른다
(사용자는 평균이 아니라 최악을 기억한다)

결론: 속도표는 세 줄로 요약하세요

모델을 고를 때 지능 점수 옆에 이 두 줄을 덧붙이세요.

첫 토큰은 몇 초인가, 500토큰 완성은 몇 초인가.

그리고 에이전트라면 한 줄 더:

한 작업 완료까지 몇 분인가.

똑똑하고 싼데 느린 모델, 빠르지만 생각이 얕은 모델. 둘 다 쓸모가 있습니다. 다만 자리가 다릅니다. 첫 반응이 중요한 곳과 마무리가 중요한 곳을 나누는 순간, 속도표가 돈이 됩니다.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

빠른 첫 반응과 무거운 분석을 나누는 설계는 에이전트의 실행 구조를 이해할 때 쉬워집니다. 하네스·루프·그래프 관점에서 작업을 쪼개고 검증하는 연습이 필요하다면, 다섯 단계를 쌓는 과정이 이 글의 속도 패턴과 바로 이어집니다.