먼저 오해부터 걷어냅니다. 10월 8일 Anthropic 발표는 새 모델 출시가 아닙니다. 이용 정책 변경입니다. 바뀐 이유는 한 문장으로 요약됩니다. Claude가 더 오래, 더 독립적으로 일하게 됐기 때문입니다. 몇 마디 주고받는 챗봇을 전제로 쓴 규칙으로는 스스로 도구를 부르고 외부 시스템에 손을 대는 에이전트를 감당할 수 없습니다. 새 정책 시행일은 11월 12일이고, 그전까지는 2025년 9월 15일자 구버전이 적용됩니다.

이번에 바뀐 것: 에이전트 시대를 위한 문구 손질

발표문 기준으로 큰 줄기를 옮기면 이렇습니다.

1. 기만 캠페인 금지 신설
   가짜 인물·계정·언론사, 여론 조작·가짜 후기·스폰서 숨기기,
   검색·AI 답변 심기, 그 인프라 구축·판매까지

2. 선거에서 민주 절차 보호로 초점 이동
   유권자 기만·선거 방해 금지 유지,
   정당한 다국어 투표 안내·투표 치유 안내는 허용

3. 무기 범위 명확화
   조준·사격 통제·교전용 소프트웨어와 드론·자율탈것 무장 포함

4. 감시·법집행 다시 쓰기
   동의 없는 추적 금지(실시간·과거 데이터 분석 불문),
   수사·체포·기소·양형·석방 결정·권고 금지

5. 모델 향한 sustained 학대 금지 (극단적 경우만)
   실망·반박·다크 픽션·테스트는 제외, 집행은 대화 종료 수준

6. 지원 지역 명확화
   미지원 지역에 물리적으로 있거나 설립·본사·지배 관계면 사용 불가

근거로 깔린 건 9월 위협 인텔리전스 보고서입니다. 2025년 12월부터 2026년 8월까지 7개 위해 영역에서 Haiku·Sonnet·Opus가 남용된 사례를 관측한 기록이죠. 새로 금지한 게 아니라, 집행 경험을 문구에 옮긴 쪽에 가깝습니다.

고위험 영역: 업종 금지가 아니라 쓰임새 규칙

실무와 가장 맞닿은 대목입니다. 예전 정책은 소비자용 용도에 넓게 걸려 있었고 분류도 모호했습니다. 새 정책은 누가 어떤 결정을 내리느냐로 묻습니다. 고위험 AI 권고(High-risk AI Recommendation)를 내리거나, 고위험 물리적 행동이 가능한 장비를 다루는 경우가 대상입니다.

필수 통제 3종:
  - 자격 있는 사람의 실질 검토 (바꿀 권한 포함, 전달·결정 전에)
  - 영향받는 사람에게 AI 사용 고지 (회사·모델명까지 밝힐 필요는 없음)
  - 물리적 행동은 사람이 보고 멈출 수 있고, 개입·연결 끊김 시 안전 상태로
    + 속도·힘·범위·온도·압력·전압·에너지·용량·작업 구역 상한은
      모델 출력이 아닌 장비·독립 컨트롤러가 강제

고위험 영역은 11개로 못 박혔습니다. 법률, 의료(진단·치료·투약·용량·정신건강 포함), 금융(개별 종목 매매·보유·배분, 세무 신고), 신용(승인·한도·금리·신용점수 활용), 보험(인수·가격·청구·보장·해지), 주거(승인·순위·퇴거·압류), 고용(선별·승진·배치·징계·해고), 교육·자격(입학·성적·면허·징계), 의료 접근(트리이지·대기·자격), 공공 급여·서비스, 법적 지위·재판(이민·망명·시민권 포함)입니다. 법집행·형사사법 결정은 고위험이 아니라 전면 금지 쪽에 있습니다.

예외도 실무적입니다. 개인에게 적용하지 않는 일반·교육 정보, 수면·스트레스·영양·운동 같은 웰니스, 이미 내려진 전문 판단을 풀어 설명하는 일(새 권고가 아닐 때), 최종 권고가 아닌 내부 초안·조사·요약, 판단 없이 정해진 규칙을 집행하는 일, 특정 개인과 무관한 B2B 운영은 HITL·고지 대상이 아닙니다. 전부 유리한 결정(보험금 지급, 의사가 지시한 보장 승인, 의료·급여 자격 부여처럼 부분·조건부가 아닌 완전한 호의)은 사전 검토 없이 진행해도 되지만, 고지와 법적 의무는 남습니다.

물리적 행동: 6가지 트리거와 멈춤 장치

모델 출력이 사람 승인 없이 하드웨어로 이어지고, 그 하드웨어가 아래 중 하나라도 할 수 있으면 물리 통제가 발동합니다.

1. 사람이 있을 수 있는 공유 공간 이동 (차·선박·항공기·드론·이동로봇)
2. 다칠 수 있는 힘 가하기 (팔·프레스·리프트·문·컨베이어의 타격·협착·낙하)
3. 위험 에너지·물질 다루기 (불·열·압력·고전압·레이저·유해 화학·생물)
4. 신체에 직접 작용 (투약·수액·가스·전기 자극·방사선·절개·삽입 기기)
5. 안전 시스템 제어 (소화·비상정지·경보·환기·잠금의 무장·해제·무력화)
6. 산업 공정 운영 (고장이 작업자·공중에 닿는 경우, 식중독·불량품 확산 포함)

제외되는 것도 분명합니다. 최악의 결과가 불편함에 그치는 가정용 기기, 자격 있는 사람이 실행 전에 검토한 계획·코드·툴패스·웨이포인트, 제어 없는 감시·감지·보고, 비유해 물질의 밀폐 랩 자동화. 8월의 Model Hardware Standard 미리보기(읽기·쓰기 원시 동작, 자연어 태그의 기준 파일, MCP·CLI·코드로 제어)와 이어지는 그림입니다. Genentech·워싱턴대·CMU 같은 프리뷰 파트너와 안전 평가를 먼저 쌓고 공개하겠다는 순서도 함께 보세요.

CodeBridge Mini Lab: 행동별 승인 매트릭스

브리핑의 실무 액션을 표로 바꿨습니다. 읽기·쓰기·외부 전송·결제처럼 에이전트 행동마다 승인 수준과 로그를 정합니다.

T0 자율 (통지·고지만):
  일반 정보, 웰니스, 내부 초안, 정해진 규칙 집행,
  감시 전용, 가정용·밀폐랩 예외
  → 외부 상대에게는 AI 고지 유지

T1 고지+통지:
  소비자 챗봇·에이전트의 세션 시작·화면 고지
  고위험 권고는 영향받는 사람에게 AI 사용 고지

T2 승인 (HITL):
  11개 고위험 권고는 전달·결정 전에 자격자 승인·수정 필수
  → 기록: 검토자 ID·자격·면허, 시각, 변경분, 사유
  → 전부 유리한 결정 경로는 사전 검토 생략 가능 (고지는 유지)

T3 물리 게이트 + 데드맨:
  자격자가 보고 언제든 멈춤, 독립 상한 강제,
  개입·연결 끊김 시 자동 안전 상태
  → 순서: 계획 생성 → 사람 승인 → 실행

로그 한 줄 원칙:
  모든 도구 호출·결정·메모리·외부 연동을 실행 이력과 함께,
  모델·MCP 버전, 감독 결정(누가·왜·언제), 고지 수령,
  물리 명령·센서·상한·비상정지·연결 끊김까지 위변조 방지 보관

정책 본문에 logging이라는 단어는 없습니다. 로그는 의무를 증명하는 수단입니다. 추가 사용 지침 쪽 문구가 더 직접적입니다. 에이전트의 행동(도구·브라우저·연결 시스템을 통한 동작 포함)은 사용자 책임이고, 모든 소비자 챗봇·에이전트는 세션 시작·화면에 AI임을 밝혀야 합니다. 키·토큰은 운영 자격증명처럼 다루세요. 위협 보고서에 탈취 키로 연산을 돌린 사례가 나옵니다. 에이전트 보안·샌드박스 글의 격리 원칙과 옵저버빌리티 글의 계측 관점이 여기 붙습니다.

위반 집행은 Safeguards 팀의 탐지·모니터링에서 경고·제한·정지·종료로 갑니다. 실시간 차단은 그 자체로 위반 확정이 아닙니다. 조정된 보호가 필요하면 Cyber·Life Sciences 확인 절차가 있고, 신고는 [email protected]입니다.

결론: 오래 일하는 AI일수록 허락·멈춤·기록이 먼저다

한 줄로 정리합니다.

자율성이 길어질수록 제품 설계는 모델 성능이 아니라 승인 체계와 실행 기록으로 갈린다.

새 모델이 아니라 새 규칙이라는 점을 다시 강조합니다. 읽기·쓰기·외부 전송·결제·물리 동작마다 누가 허락하고, 누가 멈추고, 무엇을 남기는지. 이 세 칸이 비어 있으면 에이전트는 데모에서는 빛나고 운영에서는 막힙니다. 오늘 자기 에이전트의 행동 목록을 뽑아 T0부터 T3까지 한 줄씩 매겨보세요. 그 표가 11월 12일 이후의 최소 준비물입니다.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

반복되는 판단을 코드와 연결하고, 자동 처리와 사람 검토를 나누는 기준을 설계하는 과정이 이 글의 T0~T3 승인 매트릭스와 바로 이어집니다. 확신도·정책·사람 검토를 함께 설계해보고 싶다면 이 과정부터 보세요.