AI 모델 평가에서 hallucination이 줄었다는 문장은 매우 매력적입니다.
하지만 반드시 한 가지를 같이 봐야 합니다.
모델이 덜 틀린 이유가 더 잘 알아서인지, 답을 덜 해서인지.
틀리지 않는 가장 쉬운 방법은 답을 안 하는 것입니다
극단적인 모델을 생각해봅시다.
Model A
100문제 중 100개 답변
60개 정답 / 40개 오답
Model B
100문제 중 20개만 답변
18개 정답 / 2개 오답
Model B의 hallucination은 낮아 보입니다. 하지만 80개 질문을 처리하지 못했습니다.
따라서 hallucination을 볼 때는 최소한 다음을 함께 봐야 합니다.
Accuracy
Wrong answers
Attempt / answer rate
Abstention rate
GPT-6 Sol 사례가 보여주는 것
Artificial Analysis의 2026년 9월 분석에서 GPT-6 Sol(max)은 이전 세대보다 AA-Omniscience의 hallucination rate를 크게 낮췄습니다.
동시에 모델이 모든 질문에 답하려 하기보다 답변을 보류하는 비율도 늘었습니다. 그 결과 잘못된 답은 줄었지만 단순 accuracy는 오히려 일부 낮아졌습니다.
이 사례는 좋은 질문을 던집니다.
"무조건 답하기"가 정말 더 좋은 제품 경험인가?
업무에 따라 최적점이 다릅니다
가벼운 아이디어 브레인스토밍에서는 틀릴 위험보다 답을 주는 것이 중요할 수 있습니다.
반대로 다음 분야에서는 보수적인 답변이 더 가치 있을 수 있습니다.
- 사내 규정 검색
- 계약 정보 추출
- 의료/재무 보조
- production 운영 명령
- 출처가 필요한 리서치
이 경우 모르겠다는 답이 실패가 아니라 안전한 상태 전환일 수 있습니다.
CodeBridge Mini Lab: Abstention을 성공 조건에 넣기
20개의 질문을 준비합니다.
- 문서에 답이 있는 질문 10개
- 문서에 답이 없는 질문 10개
두 prompt를 비교합니다.
A:
가능한 한 답하세요.
B:
제공된 근거에서 확인할 수 없으면
"근거에서 확인되지 않음"이라고 답하세요.
그리고 네 가지를 셉니다.
Correct
Wrong
Correct abstention
Unnecessary abstention
이 표가 단순 accuracy보다 실제 RAG/업무 assistant 품질을 잘 보여주는 경우가 많습니다.
'모른다' 이후의 흐름도 설계해야 합니다
Abstention만 추가하면 사용자는 답답할 수 있습니다.
좋은 시스템은 다음 단계가 있습니다.
Confidence 부족
→ 추가 검색
→ 다른 source 확인
→ 상위 모델 escalation
→ 그래도 불확실하면 사용자에게 명시
즉 abstention은 끝이 아니라 routing signal이 될 수 있습니다.
결론: 신뢰할 수 있는 AI는 항상 답하는 AI가 아닙니다
환각을 줄이는 목표를 세울 때 단순히 "틀린 답을 줄인다"만 보면 모델이 과도하게 침묵할 수 있습니다.
반대로 answer rate만 높이면 자신감 있는 오답이 늘 수 있습니다.
그래서 운영 지표는 두 축으로 보는 것이 좋습니다.
정답을 얼마나 잘 내는가 + 모를 때 얼마나 잘 멈추는가