"AI가 이제 자기 자신을 개선한다"는 문장은 강렬합니다.
하지만 이 표현만 보면 이런 모습을 떠올리기 쉽습니다.
AI
↓
자기 weights 수정
↓
더 강한 AI
↓
다시 자기 weights 수정
↓
무한 반복
2026년 현재 실제 상황은 이것과 다릅니다.
AI는 이미 AI를 만드는 연구·개발 과정의 상당 부분을 자동화하고 있지만, Anthropic도 완전한 Recursive Self-Improvement에 아직 도달하지 않았다고 명확히 설명합니다.
그럼 지금 어디까지 왔을까요?
먼저 Recursive Self-Improvement를 좁게 정의해봅시다
완전한 형태를 단순화하면 이런 loop입니다.
AI₀
↓
더 좋은 AI를 설계하고 개발
↓
AI₁
↓
AI₁이 다시 더 좋은 후속 모델 설계
↓
AI₂
↓
...
여기서 중요한 것은 단순히 "AI가 코드를 쓴다"가 아닙니다.
후속 AI의:
- 연구 방향
- 실험 설계
- 구현
- 학습
- 평가
- 다음 개선 방향
까지 충분히 자율적으로 결정해야 loop가 닫힙니다.
현재는 아직 이 전체 loop가 자동화된 단계가 아닙니다.
하지만 AI 개발 과정 안으로 AI가 깊게 들어온 것은 사실입니다
Anthropic은 2026년 공개한 When AI builds itself에서 내부 AI 개발에 Claude가 사용되는 정도를 공개했습니다.
공개 자료에 따르면 2026년 5월 기준 Anthropic 코드베이스에 merge된 코드 중 80% 이상이 Claude가 작성한 것으로 집계됐습니다.
또 2026년 2분기에는 엔지니어당 merge되는 코드량이 2024년보다 약 8배 증가했다고 설명합니다.
다만 Anthropic도 이 수치를 그대로 생산성 8배라고 해석하면 안 된다고 명시합니다. 코드 줄 수는 품질을 측정하는 지표가 아니기 때문입니다.
중요한 변화는 사람이 직접 모든 구현을 하지 않아도 되는 작업의 범위가 커지고 있다는 것입니다.
연구에서는 어디까지 왔을까?
Anthropic의 구분을 이해하기 쉽게 줄이면 세 단계가 있습니다.
1. 정해진 실험 실행
인간: 목표와 평가 기준 지정
AI: 코드 수정 → 실행 → 측정 → 반복
이 영역은 이미 상당히 강합니다.
Anthropic은 작은 모델 training code를 최적화하는 반복 실험에서 최신 내부 모델들이 과거 모델보다 훨씬 큰 speedup을 찾아냈다고 보고합니다.
2. 어떤 실험을 할지 제안
문제 발견
↓
가설 생성
↓
실험 선택
↓
결과 분석
↓
다음 가설
이 단계도 빠르게 좋아지고 있습니다.
Anthropic은 agent들이 AI safety 연구 문제에서 여러 가설과 실험을 스스로 설계·반복한 사례를 공개했습니다.
3. 무엇을 연구해야 할지 결정
여기서는 여전히 인간과의 차이가 큽니다.
무슨 문제가 가장 중요한가?
어떤 목표를 최적화해야 하는가?
어떤 trade-off를 받아들일 것인가?
같은 direction-setting은 단순 구현보다 훨씬 어렵습니다.
이 차이가 현재 AI-assisted R&D와 완전한 recursive self-improvement 사이의 중요한 간격입니다.
Self-improving Agent와 Recursive Self-Improvement도 구분해야 합니다
실무에서는 더 작은 의미의 "self-improving agent"도 많이 사용합니다.
예를 들어 PR Review Agent가 사람의 수정 피드백을 모아 다음 review rule을 개선할 수 있습니다.
Agent output
↓
Human correction
↓
Failure pattern 저장
↓
Skill / instruction 후보 수정
↓
Eval
↓
다음 버전에 적용
이것은 매우 유용한 self-improvement loop지만, 새로운 foundation model을 스스로 훈련해 successor를 만드는 full recursive self-improvement와는 다른 층입니다.
Anthropic이 소개한 Warp 사례도 agent가 팀의 correction을 학습 신호로 사용해 skill을 개선하는 방향을 보여줍니다.
CodeBridge Mini Lab: 안전한 Self-Improvement Loop 만들어보기
완전한 RSI를 만들 필요는 없습니다.
작은 agent를 하나 정하고 검증 가능한 개선 loop를 만드는 것부터 시작할 수 있습니다.
예를 들어 PR Review Agent를 가정합니다.
Step 1. 고정 Eval Set을 만듭니다
20개의 PR
- 실제 bug 포함 8개
- 정상 변경 8개
- 애매한 변경 4개
각 PR에 기대 결과를 적습니다.
Step 2. 실패를 저장합니다
{
"case": "pr_014",
"failure": "missed_bug",
"reason": "null handling path not checked"
}
Step 3. Agent에게 Skill 수정 후보를 제안하게 합니다
예:
현재 review instruction과 실패 로그를 보고
다음 실행에서 같은 유형의 오류를 줄일 수 있는
최소한의 rule 변경을 제안해라.
Step 4. 바로 Production에 적용하지 않습니다
이 단계가 중요합니다.
candidate skill
↓
held-out eval
↓
기존 성공 case regression 확인
↓
human approval
↓
promotion
"스스로 개선한다"고 해서 스스로 배포하게 만들 필요는 없습니다.
오히려 변경 후보 생성과 적용 권한을 분리해야 개선이 누적되면서도 통제할 수 있습니다.
왜 Eval이 없으면 Self-Improvement가 위험할까?
Agent가 자신의 prompt나 skill을 바꿀 수 있어도 무엇이 "좋아졌다"인지 측정할 기준이 없다면 방향이 쉽게 틀어집니다.
예를 들어 PR Review Agent에게 단순히:
더 많은 문제를 찾아라
라는 목표만 주면 false positive를 잔뜩 만들 수도 있습니다.
그래서 improvement loop에는 최소한 다음이 필요합니다.
Success metric
Regression set
Cost limit
Change log
Rollback
Human approval boundary
이 구조는 모델의 intelligence보다 Harness와 Loop 설계 문제에 가깝습니다.
Recursive Self-Improvement에서 진짜 병목은 무엇일까?
코드를 작성하는 능력만 보면 발전이 매우 빠릅니다.
하지만 후속 모델을 스스로 만드는 데에는 더 큰 문제가 있습니다.
목표 설정
좋은 benchmark 점수를 만드는 것과 실제로 더 좋은 모델을 만드는 것은 다를 수 있습니다.
실험 선택
실험 공간이 너무 큽니다. 어떤 연구 방향에 compute를 쓸지 판단해야 합니다.
평가
AI가 만든 모델을 AI가 평가하면 judge bias나 reward hacking 문제가 생길 수 있습니다.
안전성과 통제
성능 향상 자체가 유일한 목표가 되어서는 안 됩니다.
따라서 RSI가 가까워질수록 인간의 역할이 사라진다기보다 구현에서 검증·목표 설정·감독 쪽으로 이동할 가능성이 큽니다.
결론: AI가 AI를 만드는 시대는 이미 일부 시작됐지만 Loop는 아직 닫히지 않았습니다
2026년 현재 가장 정확한 표현은 이렇습니다.
AI가 AI 연구와 개발을 빠르게 자동화하고 있지만, 스스로 후속 모델의 목표를 정하고 설계·훈련·검증해 다시 자신의 후속 버전을 만드는 완전한 recursive loop는 아직 아니다.
다만 중요한 것은 마지막 단계만 바라보느라 현재의 변화를 놓치지 않는 것입니다.
지금도 이미:
Human goal
↓
Agent implementation
↓
Experiment
↓
Evaluation
↓
Iteration
의 상당 부분이 자동화되고 있습니다.
실무 개발자가 준비해야 할 것은 "AI가 언제 완전히 자기 자신을 만들까?"라는 날짜 예측보다 자동화된 loop에 어떤 평가와 통제를 넣을 것인가에 더 가깝습니다.