10월 1일 뉴스를 보면 이상한 공통점이 있습니다. 가장 좋다는 모델들이 안 열립니다.

  • Gemini 4 Argon: 사이버 파트너·미 정부 한정 배포, 전체 공개 일정 없음
  • Claude Mythos 5.1: 심사 통과 조직 전용, 사이버·생명과학용
  • GPT-6 Astra 6.1: 안전 기준 미달로 출시 취소

Gemini 4 Pro 루머 확인 글에서 "공식 정보만 보자"고 했는데, 이번에는 공식 정보 자체가 "안 연다"는 발표입니다. 개발자 입장에서는 질문이 하나입니다. 그래서 뭘 쓰라는 거야?

자물쇠 뒤에 있는 것들부터 정리합시다

모델 상태 조건
Gemini 4 Argon 한정 배포 Fairwind 사이버 파트너 + 미 정부, 공개 일정 미정
Claude Mythos 5.1 심사제 사이버 검증·생명과학 검증 프로그램 통과 조직만
GPT-6 Astra 6.1 취소 안전 기준 미달, 출시 안 함
Claude Fable 5.1 전체 공개 그대로 사용 가능
Opus·Sonnet 5.5, Astra, Sol 계열 전체 공개 그대로 사용 가능

배경도 알아두면 좋습니다. Anthropic은 6월에 Fable·Mythos 5 접속을 중단했다가 7월에 복구한 적이 있고, Mythos Preview 시절에는 무단 접속 시도 보도까지 있었습니다. 모델이 강력해질수록 배포가 신중해지는 추세입니다. Guardian은 Anthropic IPO(9월 말 서류, 10월 중순 마케팅 보도)와 묶어서 이 흐름을 전했습니다.

흐름 정리:
모델이 강해질수록 → 공개는 좁아지고 → 인증 프로그램이 늘어난다
Daybreak(OpenAI) · Glasswing(Anthropic) · Fairwind(Google)

인증 프로그램은 뭘 하는 곳인가

이름이 헷갈리니 역할만 정리합니다.

사이버 방어용: Glasswing(Anthropic) · Fairwind(Google) · Cyber Verification Program
생명과학용: Life Sciences Verification Program (초대형 베타)
기업용: Enterprise Frontier Safeguards — 제로 보관 수준 프라이버시 + 적대적 사용 방지

공통점: 신원 심사 + 용도 제한 + 조건부 접근
→ 일반 개발자가 신청해서 바로 쓰는 통로가 아니다

해당 업무(사이버 방어·생명과학)를 하는 조직이라면 신청을 검토할 만합니다. 그 외의 개발자라면 이 프로그램들을 "내가 못 쓰는 것"으로 분류하고 설계를 이어가야 합니다.

쓸 수 있는 것으로 설계하는 법 3가지

1. 게이티드 모델을 가정하지 마라

로드맵에 "Argon 공개되면 전환"이라고 적혀 있으면 지금 지우세요. 공개 일정이 없는 모델에 대한 의존은 기술 부채입니다.

나쁜 계획: "Mythos 풀리면 보안 에이전트 고도화"
좋은 계획: "Fable·Opus·Sonnet·Astra·Sol 라인에서 폴백 체인 구성,
            게이티드 모델은 열리면 그때 평가"

라우팅 구현 글의 승격 구조를 그대로 쓰면 됩니다. 강한 모델 자리에 특정 모델명이 아니라 "현재 쓸 수 있는 최상"이라는 슬롯을 두는 것입니다.

2. 공개 라인의 점수대를 외워둬라

10월 초 기준 쓸 수 있는 카드입니다.

58점대: Opus 5.5 max (종합 1위, 토큰 많이 씀)
56점대: Sonnet 5.5 max / Opus xhigh (터미널은 Sonnet max 64% 1위)
53점대: Fable 5.1 / Astra max (Astra는 토큰 효율 1위)
52점대: GPT-6.1 Sol max (Astra 1점 아래, 4분의 1 이하 비용)

게이티드 3종 없이도 52~58점 풀 라인업이 갖춰져 있습니다. Sonnet high 글에서 말한 것처럼 조합으로 커버되는 구간이 넓습니다.

3. 안전 거부를 설계에 넣어라

Cyber Index 글에서 본 것처럼 프런티어 모델들은 보안 과제의 98% 이상을 거부합니다. 게이티드가 아니어도, 쓸 수 있는 모델에도 가드레일은 있습니다.

호출 1건 = 성공 or 실패 or 거부
거부 → 폴백 모델 or 사람 큐 (분기 필수)
거부율 모니터링 (성공률과 분리 집계)

CodeBridge Mini Lab: 우리 팀 가용성 지도 그리기

① 쓰는 모델 목록을 적는다 (벤더·모델·effort·용도)
② 각 칸에 표시한다:
   [ ] 전체 공개인가, 조건부인가
   [ ] 거부율이 높은 업무인가 (보안·바이오·금융 규제 등)
   [ ] 폴백이 있는가 (거부/장애 시 다음 카드)
③ 게이티드 모델 의존을 찾는다:
   - 있으면 "열려 있는 카드"로 교체 계획을 적는다
   - 분기 1개: 월 1회 가용성 재확인 (릴리즈 레이더와 연결)

여러 AI 도구 나누어 쓰기와 비용·시간 같이 보기의 연장선입니다. 도구를 나누는 이유에 "가용성"이 추가된 것입니다.

결론: 열려 있는 것으로 이기는 설계가 좋은 설계다

정리하면 세 줄입니다.

게이티드 모델에 기대지 마라. 공개 라인업 52~58점으로 조합을 짜라. 거부는 정상 응답으로 처리하라.

언젠가 자물쇠가 풀리면 그때 평가하면 됩니다. 좋은 아키텍처는 모델이 바뀌어도 안 바뀌는 부분에 있습니다. 검증 루프, 폴백 체인, 비용 로그. 이 세 개가 있으면 Argon이 열리든 Mythos가 열리든 슬롯에 꽂기만 하면 됩니다. 반대로 이 세 개가 없으면 어떤 모델이 와도 못 씁니다.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

쓸 수 있는 모델로 하네스와 검증 루프를 짜는 연습이 필요하다면, Claude Code로 실제 저장소에서 성공·비용·시간을 재는 과정이 이 글의 조합 설계와 바로 이어집니다.