10월 1일 뉴스를 보면 이상한 공통점이 있습니다. 가장 좋다는 모델들이 안 열립니다.
- Gemini 4 Argon: 사이버 파트너·미 정부 한정 배포, 전체 공개 일정 없음
- Claude Mythos 5.1: 심사 통과 조직 전용, 사이버·생명과학용
- GPT-6 Astra 6.1: 안전 기준 미달로 출시 취소
Gemini 4 Pro 루머 확인 글에서 "공식 정보만 보자"고 했는데, 이번에는 공식 정보 자체가 "안 연다"는 발표입니다. 개발자 입장에서는 질문이 하나입니다. 그래서 뭘 쓰라는 거야?
자물쇠 뒤에 있는 것들부터 정리합시다
| 모델 | 상태 | 조건 |
|---|---|---|
| Gemini 4 Argon | 한정 배포 | Fairwind 사이버 파트너 + 미 정부, 공개 일정 미정 |
| Claude Mythos 5.1 | 심사제 | 사이버 검증·생명과학 검증 프로그램 통과 조직만 |
| GPT-6 Astra 6.1 | 취소 | 안전 기준 미달, 출시 안 함 |
| Claude Fable 5.1 | 전체 공개 | 그대로 사용 가능 |
| Opus·Sonnet 5.5, Astra, Sol 계열 | 전체 공개 | 그대로 사용 가능 |
배경도 알아두면 좋습니다. Anthropic은 6월에 Fable·Mythos 5 접속을 중단했다가 7월에 복구한 적이 있고, Mythos Preview 시절에는 무단 접속 시도 보도까지 있었습니다. 모델이 강력해질수록 배포가 신중해지는 추세입니다. Guardian은 Anthropic IPO(9월 말 서류, 10월 중순 마케팅 보도)와 묶어서 이 흐름을 전했습니다.
흐름 정리:
모델이 강해질수록 → 공개는 좁아지고 → 인증 프로그램이 늘어난다
Daybreak(OpenAI) · Glasswing(Anthropic) · Fairwind(Google)
인증 프로그램은 뭘 하는 곳인가
이름이 헷갈리니 역할만 정리합니다.
사이버 방어용: Glasswing(Anthropic) · Fairwind(Google) · Cyber Verification Program
생명과학용: Life Sciences Verification Program (초대형 베타)
기업용: Enterprise Frontier Safeguards — 제로 보관 수준 프라이버시 + 적대적 사용 방지
공통점: 신원 심사 + 용도 제한 + 조건부 접근
→ 일반 개발자가 신청해서 바로 쓰는 통로가 아니다
해당 업무(사이버 방어·생명과학)를 하는 조직이라면 신청을 검토할 만합니다. 그 외의 개발자라면 이 프로그램들을 "내가 못 쓰는 것"으로 분류하고 설계를 이어가야 합니다.
쓸 수 있는 것으로 설계하는 법 3가지
1. 게이티드 모델을 가정하지 마라
로드맵에 "Argon 공개되면 전환"이라고 적혀 있으면 지금 지우세요. 공개 일정이 없는 모델에 대한 의존은 기술 부채입니다.
나쁜 계획: "Mythos 풀리면 보안 에이전트 고도화"
좋은 계획: "Fable·Opus·Sonnet·Astra·Sol 라인에서 폴백 체인 구성,
게이티드 모델은 열리면 그때 평가"
라우팅 구현 글의 승격 구조를 그대로 쓰면 됩니다. 강한 모델 자리에 특정 모델명이 아니라 "현재 쓸 수 있는 최상"이라는 슬롯을 두는 것입니다.
2. 공개 라인의 점수대를 외워둬라
10월 초 기준 쓸 수 있는 카드입니다.
58점대: Opus 5.5 max (종합 1위, 토큰 많이 씀)
56점대: Sonnet 5.5 max / Opus xhigh (터미널은 Sonnet max 64% 1위)
53점대: Fable 5.1 / Astra max (Astra는 토큰 효율 1위)
52점대: GPT-6.1 Sol max (Astra 1점 아래, 4분의 1 이하 비용)
게이티드 3종 없이도 52~58점 풀 라인업이 갖춰져 있습니다. Sonnet high 글에서 말한 것처럼 조합으로 커버되는 구간이 넓습니다.
3. 안전 거부를 설계에 넣어라
Cyber Index 글에서 본 것처럼 프런티어 모델들은 보안 과제의 98% 이상을 거부합니다. 게이티드가 아니어도, 쓸 수 있는 모델에도 가드레일은 있습니다.
호출 1건 = 성공 or 실패 or 거부
거부 → 폴백 모델 or 사람 큐 (분기 필수)
거부율 모니터링 (성공률과 분리 집계)
CodeBridge Mini Lab: 우리 팀 가용성 지도 그리기
① 쓰는 모델 목록을 적는다 (벤더·모델·effort·용도)
② 각 칸에 표시한다:
[ ] 전체 공개인가, 조건부인가
[ ] 거부율이 높은 업무인가 (보안·바이오·금융 규제 등)
[ ] 폴백이 있는가 (거부/장애 시 다음 카드)
③ 게이티드 모델 의존을 찾는다:
- 있으면 "열려 있는 카드"로 교체 계획을 적는다
- 분기 1개: 월 1회 가용성 재확인 (릴리즈 레이더와 연결)
여러 AI 도구 나누어 쓰기와 비용·시간 같이 보기의 연장선입니다. 도구를 나누는 이유에 "가용성"이 추가된 것입니다.
결론: 열려 있는 것으로 이기는 설계가 좋은 설계다
정리하면 세 줄입니다.
게이티드 모델에 기대지 마라. 공개 라인업 52~58점으로 조합을 짜라. 거부는 정상 응답으로 처리하라.
언젠가 자물쇠가 풀리면 그때 평가하면 됩니다. 좋은 아키텍처는 모델이 바뀌어도 안 바뀌는 부분에 있습니다. 검증 루프, 폴백 체인, 비용 로그. 이 세 개가 있으면 Argon이 열리든 Mythos가 열리든 슬롯에 꽂기만 하면 됩니다. 반대로 이 세 개가 없으면 어떤 모델이 와도 못 씁니다.
함께 읽으면 좋은 글
- Gemini 4 Pro는 출시됐을까? 공식 정보만 확인하는 방법
- 취약점을 찾고 고치는 AI: Cyber Index가 재는 3가지 시험
- Luna에서 Sol, Astra로: 최고 모델을 매번 쓰지 않는 전략
참고 자료
- Google: Gemini 4 Argon announcement (via QZ)
- The Guardian: Google rolls out new Gemini AI model but restricts access
- Anthropic: Claude Mythos
- Anthropic: Introducing Claude Fable 5.1 and Claude Mythos 5.1
- Artificial Analysis: Gemini 4 Argon
이 주제를 직접 따라가며 배우고 싶다면
쓸 수 있는 모델로 하네스와 검증 루프를 짜는 연습이 필요하다면, Claude Code로 실제 저장소에서 성공·비용·시간을 재는 과정이 이 글의 조합 설계와 바로 이어집니다.