AI 코딩 도구의 초기 데모는 보통 짧았습니다.
버튼 하나 추가해줘.
하지만 실제 개발은 짧지 않습니다.
오래된 인증 모듈을 새 API로 바꾸되 기존 모바일 앱과 호환성을 유지하고, 테스트를 수정하고, 문서를 업데이트하고, 배포 설정은 건드리지 마.
이런 작업에서는 모델이 코드를 잘 쓰는 것만으로 부족합니다. 몇십 분 동안 목표를 잃지 않고 작업을 이어가는 능력이 중요합니다.
Meta의 Muse Spark 1.3은 바로 이 long-horizon agentic/coding 작업을 강조합니다. Meta는 1.2보다 불필요한 턴과 도구 호출을 줄이고, 모호할 때 사용자에게 질문하며, 여러 작업이 섞인 긴 컨텍스트에서도 요구사항을 유지하도록 개선했다고 설명합니다.
긴 작업의 실패는 보통 한 줄의 문법 오류가 아닙니다
장기 코딩에서 더 흔한 실패는 이런 형태입니다.
- 처음 요구사항 하나를 중간에 잊음
- 수정하지 말라고 한 디렉터리까지 변경
- 이미 해결한 문제를 다시 분석
- 도구 결과를 읽지 않고 같은 명령 반복
- 막혔는데도 사용자에게 묻지 않고 임의로 우회
즉 문제는 code generation보다 state management에 가깝습니다.
CodeBridge 미니 실험: 작업 메모를 일부러 외부화하기
AI 코딩 도구에 다음처럼 요청해보세요.
이 작업을 바로 수정하지 말고 먼저 WORKLOG 형식으로 정리해줘.
- Goal: 최종 목표
- Constraints: 절대 바꾸면 안 되는 것
- Done: 이미 확인/완료한 것
- Next: 다음 한 단계
- Unknowns: 아직 모르는 것
- Verify: 다음 단계 후 실행할 검증
각 큰 단계가 끝날 때 WORKLOG를 갱신하고,
Unknowns 때문에 위험한 가정이 필요하면 작업을 멈추고 질문해줘.
중요한 것은 특정 파일 이름이 아닙니다. 모델의 머릿속에만 있던 진행 상태를 사람이 볼 수 있는 형태로 꺼내는 것입니다.
몇 단계 뒤 다음을 확인해보세요.
- Goal이 바뀌지 않았는가?
- Constraints가 유지되는가?
- 이미 한 일을 반복하지 않는가?
- Unknowns가 줄어드는가?
- Verify가 실제 실행으로 이어지는가?
‘질문하는 모델’이 왜 더 실용적일 수 있을까?
AI가 자율적으로 움직인다는 말을 들으면 사람에게 묻지 않는 것이 더 좋은 것처럼 느껴질 수 있습니다.
하지만 실제 개발에서는 모르는 것을 숨기지 않는 모델이 더 안전할 때가 많습니다.
예를 들어:
README에는 Node 22라고 되어 있지만 CI는 Node 20을 사용합니다.
어느 버전을 기준으로 변경할까요?
이 질문 하나가 잘못된 대규모 수정 수십 개를 막을 수 있습니다.
Meta는 Muse Spark 1.3이 모호할 때 clarification을 요청하고, 막혔을 때 사용자 도움을 요청하도록 훈련했다고 설명합니다. 이런 특성은 “자율성”을 더 현실적으로 정의하게 합니다.
자율적이라는 것은 무조건 혼자 결정하는 것이 아니라, 언제 혼자 결정하면 안 되는지 아는 것에 가깝습니다.
도구 호출 횟수도 품질 지표가 될 수 있습니다
Meta는 1.3이 내부 비교에서 더 적은 tool call과 token을 사용했다고 설명합니다. 숫자 자체보다 중요한 것은 방향입니다.
같은 작업을 끝냈다면:
- 파일을 30번 읽은 에이전트
- 파일을 8번 읽고 핵심을 유지한 에이전트
중 두 번째가 비용과 속도뿐 아니라 작업 흐름도 더 이해하기 쉬울 가능성이 큽니다.
따라서 모델 비교 시 최종 코드만 보지 말고 다음도 기록해볼 수 있습니다.
완료 여부:
수정 파일 수:
도구 호출 수:
실패한 명령 수:
사용자에게 물어본 횟수:
불필요한 반복 횟수:
이렇게 하면 ‘느낌상 더 똑똑하다’보다 구체적인 기준이 생깁니다.
긴 작업에서 가장 중요한 것은 리셋 지점입니다
컨텍스트가 길어질수록 오래된 시도와 실패 로그도 쌓입니다. 모든 것을 영원히 유지하는 것이 항상 좋은 것은 아닙니다.
작업이 한 단락 끝났다면:
- 현재 상태를 짧게 요약
- 결정 사항을 파일/메모에 남김
- 필요 없는 로그 제거
- 다음 세션에서 요약부터 시작
처럼 새 출발점을 만드는 것이 유용할 수 있습니다.
이것이 하네스 엔지니어링에서 프로젝트 규칙과 작업 맥락을 외부화하는 이유와도 연결됩니다.
결론: 장기 코딩 모델의 경쟁력은 ‘첫 답’보다 ‘끝까지 방향을 유지하는 능력’입니다
Muse Spark 1.3의 의미를 단순히 코딩 벤치마크 향상으로만 보면 절반만 보는 셈입니다.
긴 작업에서 중요한 것은:
- 목표를 잊지 않기
- 제약을 유지하기
- 도구 결과를 반영하기
- 막히면 질문하기
- 완료를 검증하기
입니다.
AI 코딩이 길어질수록 프롬프트 한 번의 품질보다 진행 상태를 어디에 남기고 어떻게 다시 읽게 할 것인가가 더 중요해집니다.