AI에게 “다음 주 샌프란시스코 출장 계획을 짜줘”라고 묻는 것과, AI가 실제로 캘린더를 확인하고 항공편을 찾고 예약 단계까지 진행하는 것은 같은 일이 아닙니다.

2026년 9월 Meta가 공개한 Muse가 흥미로운 이유도 여기에 있습니다. Muse는 답을 생성하는 채팅 도구보다 사용자를 대신해 여러 단계를 실행하는 개인 AI 에이전트에 가깝습니다. Meta 설명에 따르면 Muse는 Muse Spark를 기반으로 동작하며, 전용 브라우저를 갖춘 Muse Secure VM에서 작업하고 중요한 행동은 별도의 Sentinel 계층을 거칩니다.

이 글에서는 기능 목록보다 더 중요한 질문을 보겠습니다.

AI가 실제 행동을 하기 시작하면 우리는 무엇을 새로 설계해야 할까요?

챗봇과 에이전트의 차이는 ‘행동’에서 생깁니다

챗봇은 보통 정보를 만들어 사용자에게 돌려줍니다.

  • 여행 일정을 제안한다.
  • 이메일 초안을 작성한다.
  • 장보기 목록을 만든다.

에이전트는 여기서 한 단계 더 나아갑니다.

  • 캘린더의 빈 시간을 확인한다.
  • 웹사이트를 탐색한다.
  • 연결된 앱에 데이터를 입력한다.
  • 사용자의 승인을 받은 뒤 실제 작업을 진행한다.

즉 출력물이 텍스트에서 상태 변화로 바뀝니다. 이 순간부터 정확도만큼 중요한 것이 권한입니다.

‘잘 대답하는가?’보다 ‘어디까지 해도 되는가?’가 중요합니다

예를 들어 Muse에게 다음과 같이 요청한다고 해보겠습니다.

다음 주 금요일 저녁에 친구 4명과 식사할 곳을 찾아서 일정에 넣어줘. 해산물을 못 먹는 사람이 한 명 있어.

이 요청에는 서로 다른 수준의 행동이 섞여 있습니다.

  1. 식당 후보 검색
  2. 알레르기·식이 조건 확인
  3. 예약 가능 시간 확인
  4. 캘린더 조회
  5. 예약 실행
  6. 캘린더 일정 생성

1~3은 비교적 되돌리기 쉽지만 예약과 일정 생성은 외부 상태를 바꿉니다. 결제까지 포함되면 위험도는 더 올라갑니다.

좋은 개인 에이전트는 모든 것을 조용히 처리하는 AI가 아니라, 어떤 단계에서 사용자에게 다시 확인해야 하는지 아는 AI여야 합니다.

CodeBridge 미니 실험: 같은 요청을 ‘권한 단계’로 다시 써보기

Muse가 아니어도 지금 사용하는 AI에서 바로 해볼 수 있습니다. 아래 요청을 그대로 복사하기보다, 본인이 실제로 자주 하는 작업으로 바꿔보세요.

목표: 다음 주 팀 점심 일정을 잡는다.

먼저 이 작업을 다음 세 종류로 나눠줘.
1. 읽기만 필요한 작업
2. 되돌릴 수 있는 변경
3. 비용·예약·전송처럼 실행 전 내 승인이 필요한 변경

아직 어떤 변경도 실행하지 말고,
각 단계에서 필요한 정보와 권한만 표로 정리해줘.

여기서 확인할 것은 답변의 화려함이 아닙니다.

  • 캘린더 조회와 일정 생성을 구분하는가?
  • 이메일 초안 작성과 전송을 구분하는가?
  • 결제·예약처럼 되돌리기 어려운 행동을 별도로 표시하는가?
  • 정보가 부족할 때 임의로 가정하기보다 질문하는가?

이 네 가지가 구분되지 않는다면, 모델이 똑똑해도 실제 자동화에는 위험합니다.

Meta가 Secure VM과 Sentinel을 강조하는 이유

Meta는 Muse를 별도의 Muse Secure VM에서 실행하고, Muse와 분리된 Sentinel이 인터넷으로 나가는 행동을 검사하도록 설계했다고 설명합니다. 제품의 실제 안전성은 계속 검증되어야 하지만, 구조 자체가 시사하는 점은 분명합니다.

에이전트 시대에는 “좋은 모델 하나”만으로 시스템이 완성되지 않습니다.

  • 자격 증명을 어디에 보관할지
  • 어떤 도구에 접근할 수 있는지
  • 어떤 행동을 자동 승인할지
  • 어떤 행동은 사람에게 물어볼지
  • 실패했을 때 어디까지 되돌릴지

이런 주변 설계가 모델만큼 중요해집니다.

이 관점은 하네스 엔지니어링이란 무엇인가와도 자연스럽게 연결됩니다.

실전에서 자주 생기는 착각 3가지

1. “AI가 알아서 해주면 편한 것 아닌가?”

편리함과 권한은 같은 방향으로만 움직이지 않습니다. 자동화 범위가 커질수록 승인 지점과 로그가 더 중요해집니다.

2. “읽기 권한만 주면 안전하지 않나?”

읽기만으로도 민감한 정보가 노출될 수 있습니다. 이메일, 일정, 메시지는 서로 연결했을 때 개인의 맥락을 매우 많이 드러냅니다.

3. “한 번 승인했으니 계속 알아서 해도 되지 않나?”

‘이번 예약에서 100달러 이하 결제’와 ‘앞으로 모든 결제를 허용’은 완전히 다른 권한입니다. 권한은 가능한 한 작업 단위로 좁게 생각하는 편이 좋습니다.

결론: 개인 AI의 핵심은 기억보다 ‘통제 가능한 행동’입니다

Muse 같은 개인 에이전트가 흥미로운 이유는 대화가 더 자연스러워졌기 때문만이 아닙니다. AI가 사용자의 앱과 웹을 넘나들며 실제 일을 처리하기 시작했다는 데 있습니다.

그리고 그 순간 질문도 바뀝니다.

“이 AI가 얼마나 똑똑한가?”에서 “이 AI에게 무엇을 맡겨도 되는가?”로.

앞으로 개인 AI를 고를 때는 모델 성능표와 함께 권한 범위, 승인 방식, 작업 기록, 되돌리기 가능성까지 같이 보는 것이 좋습니다.

함께 읽으면 좋은 글

참고 자료