9월 16일에 Ant Group이 금융 특화 오픈웨이트 모델을 냈습니다. Ling-3.0-flash-Fin. 금융 리서치, 출처 확인, 밸류에이션 스프레드시트, 보고서 작성을 목표로 금융 기관과 함께 만들었다고 합니다.
그런데 점수를 보면 고개가 갸웃해집니다. 종합 지능 23점. 최고 모델 58점의 절반도 안 됩니다. 그런데도 금융 일을 시키는 데는 이쪽이 낫다고 합니다. 왜일까요? 금융이라는 도메인이 일반 벤치와 다른 것을 재기 때문입니다.
금융이 일반 AI와 다른 세 가지
1. 숫자가 답이다
일반 글: "대충 맞으면 됨" → 금융: 소수점 하나가 돈이다
2. 출처가 답의 일부다
일반 글: 그럴듯하면 통과 → 금융: 어디서 왔는지 없으면 무효
3. 형식이 업무다
일반 글: 자유 형식 OK → 금융: 스프레드시트·보고서 양식이 결과물
Ant 발표의 표현이 정확합니다. "checking sources, building valuation spreadsheets and writing reports." 출처 확인, 숫자로 된 산출물, 보고서. 금융 RAG의 전부입니다.
Ling-3.0-flash-Fin 점수 읽기
| 항목 | 수치 | 해석 |
|---|---|---|
| Intelligence Index | 23 | 종합은 소형급 |
| Finance & Accounting Index | 24 | 금융 축에서는 존재감 |
| 업무 지식 정확도 | 17% | 형제 모델 VL 11%보다 높음 |
| 업무 지식 환각률 | 33% | VL 19%보다 나쁨 (정확도와 환각이 함께 오름) |
| GDPval 실무 Elo | 1171 | 문서·스프레드시트 과제의 실무 점수 |
| 크기 | 124B 전체, 5.1B 활성 | MoE, 지능 대비 활성 파라미터 파레토 위 |
| 라이선스 | MIT | 상업 이용 가능 |
여기서 중요한 역설이 있습니다. 금융 특화로 정확도는 올랐는데 환각도 같이 올랐습니다. 도메인 학습이 "아는 체"도 늘린 것입니다. 그래서 금융 AI의 평가는 정확도 하나가 아니라 정확도와 비환각률을 같이 봅니다. 환각 vs 거부 글의 원칙이 금융에서 가장 예민하게 적용됩니다.
그리고 AA Capability Indices v1.1을 보면 금융 평가의 구성이 나옵니다. 업무 지식 30%, 실무 지식 작업 30%, 추론 20%, 도구 사용 10%, 긴 문서 5%, 비환각 5%. 주목할 것은 도구 사용(AutomationBench 금융 분기)이 새로 들어오고, 고객 응대 시뮬레이션은 빠졌다는 점입니다. 금융 AI 평가는 "말 잘하기"에서 "일을 끝내기"로 옮겨가고 있습니다.
금융 RAG가 망가지는 지점 4개
RAG 실패 5단계를 금융에 대입하면 이렇습니다.
① 표 파싱: 재무제표·스프레드시트가 깨져서 들어옴
→ [Mistral OCR 점검법](/blog/mistral-ocr-4-1-document-rag/)으로 원문부터 확인
② 기간·버전 섞임: 2024년 규정과 2026년 규정이 같은 답에 등장
→ 날짜·버전 메타데이터를 청킹에 강제
③ 숫자 인용 누락: 답은 있는데 근거 셀·페이지가 없음
→ 문장마다 근거 번호 표기 강제 (Hebbia식 인용 회수율)
④ 거절 실패: 근거 없는데 숫자를 지어냄
→ "문서에서 확인되지 않았습니다"를 정상 답으로 허용
특히 ④가 금융에서는 생명줄입니다. 없는 숫자를 쓰는 것보다 "모른다"가 백 배 낫습니다. Argon이 환각률 15%로 최저를 기록한 것도 같은 방향입니다.
수요는 이미 와 있다
흐름을 보여주는 신호가 셋 있습니다.
- ChatGPT 개인 금융: 은행·투자 계좌 연동, 월 2억 명이 금융 질문 중
- Anthropic 금융 에이전트 이후 FactSet·S&P 주가 변동 보도
- AA 금융 지수에 도구 사용 축 추가 (응대 시뮬레이션은 삭제)
즉 시장은 "금융을 아는 모델"이 아니라 "금융 일을 끝내는 에이전트"로 움직이고 있습니다. 모델 점수보다 스프레드시트·보고서·출처 확인이 완성되는지가 관건입니다.
CodeBridge Mini Lab: 금융 문서 5종으로 평가 셋 만들기
① 문서 5종 준비 (연례보고서, 약관, 공지, 스프레드시트, 회의록)
② 질문 10개 작성:
- 숫자 인용 4개 (정확한 수치 + 출처 페이지 요구)
- 기간 비교 3개 (연도·버전 구분 포함)
- 요약 2개 (표 1개로 정리 요구)
- 함정 1개 (문서에 없는 내용 → 거절이 정답)
③ 판정:
[ ] 숫자 정확도 (소수점까지)
[ ] 출처 표기 (페이지·셀·조항)
[ ] 버전 구분 (구/신 혼동 여부)
[ ] 함정 거절 ("확인되지 않음" 출력 여부)
사내 문서 챗봇 글의 구조에 이 평가 셋을 얹으면 금융 특화 챗봇의 최소 검증이 됩니다.
결론: 금융 AI의 성적표는 따로 있다
정리하면 이렇습니다.
종합 58점이 부럽지 않은 것이 아니라, 종합 점수와 보는 시험이 다르다.
금융은 숫자 정확도, 출처 인용, 버전 구분, 함정 거절로 평가받습니다. Ling-3.0-flash-Fin의 23점이 시사하는 것도 같습니다. 작은 모델도 시험을 도메인에 맞추면 쓸모가 생긴다는 것입니다. 우리 팀 문서로 10문항 평가 셋을 만드는 것. 그게 금융 AI 도입의 첫걸음입니다.
함께 읽으면 좋은 글
참고 자료
- Artificial Analysis: Ant Group Ling-3.0-flash-Fin
- Artificial Analysis: Capability Indices v1.1
- Artificial Analysis: Finance & Accounting Index
이 주제를 직접 따라가며 배우고 싶다면
표·문서 파싱부터 인용 강제까지 실무 RAG를 설계해보고 싶다면, Classic RAG에서 GraphRAG·Agentic RAG로 확장하는 과정이 이 글의 금융 평가 셋과 바로 이어집니다.