MIT와 Sakana AI 연구진이 9월 17일에 논문 하나를 올렸습니다. SIFT(Self Improvement via Fast Tree-search, arXiv 2609.19526). 코딩 에이전트가 자기 프롬프트·도구·코드를 고쳐가며 스스로 나아지는 연구입니다.

재귀적 자기 개선 글에서 "AI가 자기를 고치는 시대"를 다뤘는데, SIFT는 그 다음 질문에 답합니다. 고치는 건 되는데, 뭐가 좋은 변경인지 확인하는 게 너무 비싸다는 문제입니다.

병목은 생성에서 검증으로 옮겼다

기존 self-evolution 방식의 구조를 보면 이렇습니다.

후보 변경안 생성 → 전부 비싼 벤치마크에 실행 → 점수로 판단
문제: 후보가 수백 개면 CPU 수천 시간 + 수만 달러 (SWE-bench 전체 평가비가 대표적)

논문이 찍은 병목이 정확합니다. 본격 평가는 신호는 좋은데 비싸고, 일부 태스크만 돌리면 싸지만 노이즈가 큽니다. 이 "신호 대 비용"이 나쁘다는 것입니다.

SIFT의 답은 중간 신호를 하나 더 두는 것입니다. 비싼 본평가 전에 LLM judge의 pairwise 비교로 후보를 랭킹하고, 유망한 것만 실제로 평가합니다.

SIFT 구조:
후보 생성 → pairwise judge 비교 → Bradley-Terry로 강도 점수 집계
→ 점수로 부모 샘플링 (트리 탐색 계속)
→ 유망 노드만 비싼 downstream 평가 (비동기로 병렬 진행)

판정(readout)이 아니라 대결으로 거르는 게 포인트입니다. "이 패치가 좋은가"를 묻는 대신 "둘 중 어느 패치가 낫나"를 잔뜩 물어 승패 기록을 점수로 바꿉니다. 그리고 탐색을 멈추지 않습니다. 느린 평가가 돌아오는 동안에도 judge 신호로 다음 가지를 뻗습니다. 논문 표현대로 disaggregated, 즉 탐색과 평가를 분리한 파이프라인입니다.

숫자: 35.1%와 judge의 기여도

Polyglot(225개 과제) 결과입니다.

설정 점수
o3-mini base agent 14.2%
SIFT without judge (o3-mini) 29.8%
DGM (기존 강자) 30.7%
SIFT + gpt-5.4 judge (o3-mini) 35.1%
Qwen3-30B base → SIFT 20.0% → 32.0%

재미있는 행이 있습니다. judge 없는 SIFT(29.8%)는 DGM(30.7%)보다 낮습니다. judge를 붙여야 35.1%로 뜁니다. 즉 트리 탐색 구조가 아니라 judge의 기여가 핵심이라는 것이 분리돼 보입니다.

자원도 같이 봐야 합니다. o3-mini 기준 50 CPU 시간 미만·벽시계 5시간, Qwen3 기준 250 CPU 시간 미만·7시간입니다. 기존 방식의 수천 CPU 시간과 비교하면 진입 장벽이 확 낮아집니다. 그리고 찾은 하네스를 다른 모델(gpt-5-mini·gpt-5.4-mini)에 붙여도 base보다 좋았다고 합니다. 특정 모델용 과적합이 아니라 설계 개선이라는 뜻입니다.

실무 번역: 5단계 파이프라인으로 나누기

논문을 그대로 구현할 필요는 없습니다. VentureBeat도 지적했듯 SIFT는 DGM 하네스 위에 올라가는 구조라, 뼈대는 5단계로 나눠 가져오면 됩니다.

1. Candidate generation: 변경안 후보 모으기 (프롬프트·도구·코드)
2. Cheap judge: pairwise 비교로 랭킹 (비싼 평가는 아직 안 함)
3. Real eval: 상위만 실제 태스크로 평가
4. Held-out regression: 따로 뺀 셋으로 퇴보 확인
5. Promotion: 통과분만 반영 + 기록

내 저장소 5문항이 3~4번, 라우터 로그가 5번에 해당합니다. 없는 조각은 2번, 싼 심사입니다. "둘 중 뭐가 낫나"를 묻는 judge 프롬프트 1개면 시작할 수 있습니다.

CodeBridge Mini Lab: judge 1개 붙이기

① 변경안 2개를 고른다 (예: 시스템 프롬프트 A vs B)
② judge 프롬프트 1개를 만든다:
   "두 후보를 코드로 비교하고, 어느 쪽이 나은지 1개만 골라라.
    이유는 3줄 이내."
③ 10쌍을 돌려 승패를 센다 (Bradley-Terry까지는 나중에)
④ 상위 1개만 실제 태스크 5개로 평가한다
⑤ 판정: judge 1위와 실측 1위가 같으면 judge를 믿고 규모를 키운다

Pass@1·비용·시간 글의 측정 습관과 같은 결입니다. 전수 평가를 하기 전에 싼 심사로 거르는 것. 이 한 단락이 SIFT의 실무 버전입니다.

결론: 무엇을 검증할 가치가 있나

SIFT가 옮긴 질문을 다시 적습니다.

"더 좋은 변경을 만들 수 있나"가 아니라 "무엇을 검증할 가치가 있나"다.

에이전트 개선 파이프라인을 짤 때 생성부터 늘리지 마세요. 싼 심사 → 진짜 평가 → 별도 셋 회귀 → 반영의 5단계를 먼저 깔아두세요. 검증이 싸지면 시도가 늘어납니다. 시도가 늘면 개선이 옵니다. 순서는 거꾸로가 아닙니다.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

후보 생성·심사·평가·반영의 루프를 구조로 설계해보고 싶다면, 하네스·루프·그래프를 순서대로 쌓는 과정이 이 글의 5단계 파이프라인과 바로 이어집니다.