10월 1일에 인수가 하나 완료됐습니다. Dynatrace가 AI 옵저버빌리티 기업 Arize AI 인수를 마무리했습니다. 8월 13일 발표된 $915M 규모의 딜입니다.

숫자보다 중요한 건 방향입니다. AI 모니터링이 별도의 실험 도구에서 벗어나 일반 production 옵저버빌리티 스택의 일부가 되고 있습니다. Arize의 tracing·evaluation·experimentation이 Dynatrace의 애플리케이션·인프라·사용자 경험 모니터링과 붙는다는 발표 그대로입니다.

왜 지금인가: 에이전트가 운영으로 내려왔다

Dynatrace 발표에 인용된 조사 수치가 상황을 말해줍니다. 에이전트 AI 리더 919명 중 51%가 대규모 에이전트 관리·모니터링의 기술적 어려움을 최대 장벽으로 꼽았고, 45%는 에이전트 자율 실행과 사람 개입의 기준이 없다고 답했습니다.

실험실 단계: "돌아가는가" (실행 여부)
운영 단계:   "제대로 일하는가" (정확·신뢰·비용)
→ 재는 것이 바뀌면 도구가 바뀌고, 도구가 바뀌면 시장이 움직인다

AI 옵저버빌리티 시장이 2030년 100억 달러를 넘긴다는 전망도 같은 맥락입니다. 에이전트가 production에 내려오는 속도가 시장을 끌고 있습니다.

무엇이 합쳐지나: Phoenix는 남는다

쪽 가져오는 것
Arize AI 네이티브 tracing·evaluation·experimentation, Phoenix 오픈소스, OpenInference 표준
Dynatrace 엔터프라이즈 옵저버빌리티, 인프라·GPU·비즈니스 프로세스 데이터 기반

오픈소스 사용자에게 중요한 소식도 있습니다. Phoenix는 계속 지원되고, OpenInference 관리도 이어간다는 입장입니다. 인수가 끝나도 양쪽이 당분간 독립 운영된다고 밝혔습니다. 당장 갈아탈 필요는 없다는 뜻입니다.

Arize CEO의 말이 핵심을 찌릅니다. "에이전트가 실제로 제대로 일하는지 아는 방법이 필요했다." Running과 working의 차이입니다. 성공 1건당 비용 글에서 실행 횟수가 아니라 성공을 세자고 한 것과 같은 이야기입니다.

실전: execution 하나로 묶어보기

인수 뉴스를 읽고 끝내면 남는 게 없습니다. 대시보드에 적용해야 합니다. 원칙은 하나입니다.

latency와 error rate만 보지 말고, trace부터 user outcome까지 한 execution으로 묶어라.

execution 1건 = {
  trace:        프롬프트→검색→도구→생성 전체 경로
  tool calls:   무엇을 몇 번 불렀는가 (이름·인자·결과)
  eval result:  정답·인용·형식 평가 통과 여부
  cost:         토큰·시간·돈 (성공 기준 분모)
  user outcome: 사용자가 원한 게 됐는가 (해결·전환·만족)
}

각 층이 기존 글과 연결됩니다. trace·tool calls는 하네스 글의 검증 루프, eval은 미니 eval 글의 5문항, cost는 라우팅 글의 로그, outcome은 RAG 실패 분석의 20개 분류입니다. 뿔뿔이 있던 측정이 execution 하나로 모이는 것입니다.

CodeBridge Mini Lab: 월요일 아침에 볼 5개 숫자

① 이번 주 execution 100건을 뽑는다
② 5개를 센다:
   [ ] 성공률 (기준: 테스트·인용·형식 중 task에 맞는 것)
   [ ] 단계당 평균 tool 호출 수 (많을수록 느리고 비쌈)
   [ ] 실패 유형 분포 (부분 성공·과잉 수정·거부·타임아웃)
   [ ] 성공 1건당 비용 (토큰 + 시간)
   [ ] user outcome (해결 여부, 재요청률)
③ 판정:
   - tool 호출이 많은데 성공률이 낮다 → 라우팅·Decider 분리 검토
     ([Decider 글](/blog/strands-decider-2b-decision-models/)의 선택 떼어내기)
   - 특정 단계에서 반복 실패 → 그 단계의 eval을 강화
   - 비용이 튄다 → effort·등급 재조정
     ([Sonnet high 글](/blog/sonnet-5-5-high-effort-sweet-spot/)의 스위트 스폿)

작게 시작하세요. 거창한 플랫폼이 아니라 스프레드시트 1장이면 됩니다. execution 100건의 5개 숫자. 이게 AI 옵저버빌리티의 최소 단위입니다.

결론: 모니터링이 곧 평가가 된다

인수 뉴스가 가리키는 한 줄입니다.

개발과 운영의 fragmentation이 끝나면, eval과 모니터링이 하나로 합쳐진다.

실험할 때 쓰던 평가가 운영에서도 돌고, 운영 신호가 다음 실험의 데이터셋이 됩니다. Dynatrace 발표 표현대로 "지속적 개선의 피드백 루프"입니다. 오늘 할 일은 작습니다. 우리 agent의 execution 100건을 뽑아 5개 숫자를 세는 것. 그 표가 있으면 도구가 바뀌어도 흔들리지 않습니다.

함께 읽으면 좋은 글

참고 자료

이 주제를 직접 따라가며 배우고 싶다면

측정·검증·개선 루프를 에이전트 구조 안에 넣고 싶다면, 하네스·루프·그래프를 순서대로 쌓는 과정이 이 글의 execution 묶기와 바로 이어집니다.