10월 3일 독일 통일기념일에 Aleph Alpha가 Kolibri를 냈습니다. 독일·영어 오픈웨이트 MoE, Apache 2.0, Hugging Face 공개. 숫자가 눈길을 끕니다. 전체 78.1B인데 token당 활성은 3.46B, 약 4.4%만 켜집니다.
이번 주말 본격 평가가 시작된 모델이라, 점수보다 구조와 고르는 법 위주로 정리합니다.
스펙: 크고 가볍다
| 항목 | 내용 |
|---|---|
| 구조 | MoE, 50 layers, 384 experts 중 6개 활성 |
| 파라미터 | 78.1B total / 3.46B active-per-token (FP8) |
| 컨텍스트 | 262,144 학습, 최대 약 1M 설정 |
| 언어 | 독일어·영어 (독일어 학습 비중 21.3%) |
| 학습 인프라 | 독일·핀란드 |
| 기능 | reasoning effort 지정, tool calling |
| 라이선스 | Apache 2.0 |
재미있는 기록이 있습니다. 10월 4일 NVIDIA 포럼에 DGX Spark에서 Kolibri를 돌린 설정·수치가 올라왔습니다. DGX Spark 글의 "책상 위 100B" 이야기가 오픈 당일에 현실이 된 셈입니다.
점수 읽기: 평균이 아니라 workload다
브리프의 관전 포인트가 정확합니다. 벤더 점수를 그대로 받기보다 workload별 차이를 봐야 합니다.
- Aleph Alpha 자체 harness: Honeypot agentic-RAG 80.8
- 전체 영어 benchmark: Qwen3.8 27B가 더 높음
→ "최강 open model"이 아니라 특정 enterprise workload용에 가깝다
오픈웨이트 글에서 46·45·44점 1점 게임을 다뤘는데, Kolibri는 다른 축입니다. 종합 순위가 아니라 독일어·주권·온프렘이라는 도메인 축입니다. MoE 글의 active 개념이 여기서 실전이 됩니다. 78B라는 숫자는 저장·메모리 이야기고, 3.46B가 돈·속도 이야기입니다.
4축 평가: 내 workload·VRAM·속도·경계
브리프의 액션을 평가표로 풀면 이렇습니다.
open model 비교 4축:
[ ] 내 workload: 평균 벤치 1개가 아니라 내 태스크 10개 (독일어면 독일어 태스크)
[ ] VRAM: 78B 전체가 올라가는가 (최소 2x A100 80GB급 권장 사양 확인)
[ ] tokens/sec: 내 하드웨어에서 실측 (AgentPerf류로 재기)
[ ] deployment boundary: 데이터가 어디까지 나가는가 (sovereign·on-prem 요구)
서빙 측정 글의 p95·동시성과 RAG 실패 분석의 20개 분류를 합치면 4축이 됩니다. 특히 agentic-RAG 80.8 같은 수치는 RAG 파이프라인 위에서 재현해봐야 의미가 있습니다.
CodeBridge Mini Lab: 후보 2개 4축 비교
① Kolibri vs 현재 쓰는 1개를 정한다
② 4축을 잰다 (각 30분 이내로):
- workload 10개 성공률 (도메인 태스크 위주)
- VRAM 사용량 (양자화 전후)
- tokens/sec (p50·p95)
- 데이터 경계 (외부 호출 여부)
③ 판정:
- 도메인 태스크에서 이기면 채택 검토
- 평균만 높으면 보류 (우리 일이 평균이 아니다)
성공 1건당 비용에 배포 경계를 곱한 것입니다. 싸고 똑똑해도 데이터를 못 내보내면 쓸 수 없습니다. 반대로 경계 안에서 도메인을 이기면 종합 점수는 부차적입니다.
결론: 오픈 경쟁은 나뉜다
한 줄로 정리합니다.
parameter 수가 아니라 active × 도메인 × 온프렘으로 세분화된다.
Kolibri의 의미는 78B가 아니라 3.46B에 있습니다. 크게 저장하고 가볍게 돌리고, 특정 일에 맞추고, 집에 두는 것. 오픈 모델 고르기도 종합 순위에서 workload 매칭으로 넘어갑니다. 오늘 할 일은 하나입니다. 우리 태스크 10개짜리 평가 셋을 만드는 것. 그 셋이 있으면 어떤 새 모델이 나와도 4축으로 재면 됩니다.
함께 읽으면 좋은 글
- 오픈웨이트 새 1위 경쟁: MiMo, GLM-5.3, Kimi K3를 고르는 법
- MoE에서 6B Active면 정말 6B 모델일까
- 100B 모델을 책상에 두는 시대: DGX Spark 64GB
참고 자료
- Aleph Alpha: Kolibri Has Landed
- Aleph Alpha: Kolibri
- Marktechpost: Aleph Alpha Releases Kolibri (Oct 4, 2026)
- NVIDIA Forum: Kolibri-1 runs on the Spark (Oct 4, 2026)
이 주제를 직접 따라가며 배우고 싶다면
워크로드에 맞는 모델 선택과 에이전트 설계를 연습하고 싶다면, 하네스·루프·그래프를 순서대로 쌓는 과정이 이 글의 4축 평가와 바로 이어집니다.