AI API 가격을 비교할 때 가장 먼저 보는 숫자는 보통 1M tokens당 얼마입니다. 하지만 에이전트형 작업이 길어지면 이 숫자만으로 실제 비용을 설명하기 어려워집니다.
2026년 9월 공개된 DeepSeek V4.1 Flash가 흥미로운 이유 중 하나는 이 점을 모델 구조에서 직접 건드렸기 때문입니다. DeepSeek는 V4.1 Flash가 552B 규모의 MoE 모델이며 입력과 출력에서 활성화되는 파라미터를 다르게 사용하는 비대칭 구조를 채택했다고 설명합니다. 또 이전 세대와 비교해 KV cache의 HBM 사용량을 1/4, SSD 사용량을 1/8 수준으로 줄였다고 밝히고 있습니다.
여기서 중요한 질문은 파라미터 수가 아닙니다.
왜 캐시가 에이전트 비용에서 그렇게 중요할까요?
에이전트는 같은 맥락을 여러 번 다시 봅니다
단일 질문은 보통 이렇게 끝납니다.
질문 → 모델 → 답변
하지만 코딩 에이전트나 리서치 에이전트는 다릅니다.
요구사항
→ 파일 읽기
→ 모델 판단
→ 도구 실행
→ 결과 추가
→ 모델 재판단
→ 다른 파일 읽기
→ 다시 판단
→ ...
매 단계에서 이전 대화와 작업 결과가 다시 컨텍스트에 들어갈 수 있습니다. 작업이 길수록 같은 앞부분을 반복해서 처리하는 비용이 커집니다.
KV cache와 prompt cache가 중요한 이유가 여기에 있습니다.
CodeBridge 미니 실험: ‘짧은 20번’과 ‘긴 1번’을 비교해보기
실제 사용하는 API나 코딩 도구의 사용량 화면에서 다음 두 작업을 비교해보세요.
작업 A
짧은 질문을 새 대화에서 20번 수행합니다.
작업 B
하나의 프로젝트 세션에서 같은 배경정보를 유지한 채 20단계 작업을 이어갑니다.
그리고 아래 항목을 기록합니다.
총 입력 토큰:
캐시된 입력 토큰:
출력 토큰:
도구 호출 횟수:
전체 소요 시간:
재시도 횟수:
중요한 것은 어느 모델이 무조건 싸다는 결론이 아닙니다. 비용이 어디에서 발생하는지 직접 보는 것입니다.
에이전트에서는 입력 단가가 조금 저렴한 것보다 같은 맥락을 효율적으로 재사용하는 것이 더 큰 차이를 만들 수 있습니다.
‘Flash’라는 이름을 단순히 작은 모델로 보면 안 됩니다
DeepSeek는 V4.1 Flash를 새 아키텍처 계열의 가장 작은 모델이라고 부르지만, 여기서 ‘작다’는 표현은 단순한 파라미터 수와 다릅니다.
MoE 모델에서는 전체 파라미터와 한 토큰을 처리할 때 실제 활성화되는 파라미터가 다를 수 있습니다. V4.1 Flash는 입력 처리와 출력 생성에서도 활성량을 다르게 둡니다.
이런 설계의 목표는 결국 하나입니다.
같은 작업을 더 적은 계산과 메모리로 처리할 수 있는가?
서비스 운영에서는 벤치마크 한 점보다 이 질문이 더 현실적일 때가 많습니다.
AI 모델 비용은 4개로 나눠보면 쉽습니다
1. 입력 비용
프롬프트, 파일, 이전 대화처럼 모델이 읽는 양입니다.
2. 출력 비용
모델이 생성하는 답변, 코드, 계획의 양입니다.
3. 반복 비용
실패해서 다시 시키거나 불필요하게 여러 번 도구를 호출하는 비용입니다.
4. 지연 비용
사용자가 기다리거나 서버가 오래 점유되는 시간입니다. 직접적인 토큰 비용이 아니더라도 실제 제품에서는 중요합니다.
따라서 “토큰 단가가 30% 싸다”보다 “같은 목표를 몇 번의 턴과 몇 번의 재시도로 끝내는가?”가 더 나은 지표가 될 수 있습니다.
실전에서 자주 놓치는 부분
컨텍스트를 끝없이 유지한다
캐시가 있어도 오래된 정보가 계속 쌓이면 모델의 집중도와 비용 모두 나빠질 수 있습니다. 작업 단위가 끝났다면 새 세션으로 넘어가는 것이 더 낫기도 합니다.
모든 단계에 가장 강한 모델을 쓴다
파일 분류, 간단한 요약, 형식 변환 같은 단계까지 최고가 모델을 쓸 필요는 없습니다. 역할에 따라 모델을 나누는 방식도 고려할 수 있습니다.
실패 비용을 계산하지 않는다
싸지만 3번 재시도해야 하는 모델과 비싸지만 한 번에 끝나는 모델의 총비용은 반대가 될 수 있습니다.
이 관점은 여러 AI 도구를 작업별로 나누어 쓰는 방법과 연결됩니다.
결론: 에이전트 비용은 ‘한 번의 호출 가격’이 아니라 ‘작업을 끝내는 전체 경로’입니다
DeepSeek V4.1 Flash의 구조에서 배울 수 있는 가장 실용적인 포인트는 “모델이 더 싸졌다”가 아닙니다.
장시간 AI 작업에서는 메모리, 캐시, 반복 횟수, 도구 호출, 지연 시간까지 하나의 시스템 비용으로 봐야 한다는 점입니다.
다음에 모델 가격표를 비교할 때는 $/1M tokens 옆에 한 칸을 더 만들어보세요.
이 모델은 내 작업을 몇 번의 턴으로 끝내는가?