READ THE PULSE
다음 뉴스에서 확인할 다섯 가지
01
무엇이 실제로 새로 공개됐는가?
- WHERE TO CHECK
- 미스트랄 공식 발표와 Search Toolkit 제공 범위
- HOW TO READ IT
- 다섯 탐색 도구를 반복 호출하는 검색 계층과 제공 채널은 확인된 제품 정보입니다.
- DOES NOT PROVE
- 기능이 공개됐다는 사실만으로 모든 문서에서 정확도가 높아지는 것은 아닙니다.
근거: Mistral · Introducing Agentic Search · arXiv · FinanceBench: A New Benchmark for Financial Question Answering
02
벤치마크 수치를 그대로 믿어도 되는가?
- WHERE TO CHECK
- 독립 재현 보고서, 동일 데이터셋·모델·평가자 설정
- HOW TO READ IT
- 현재 수치는 미스트랄이 측정한 회사 자체 결과입니다.
- DOES NOT PROVE
- 두 공개 벤치마크의 개선이 한국어 내부 문서의 실전 성능을 보장하지 않습니다.
03
실제 업무 비용은 무엇을 포함해야 하는가?
- WHERE TO CHECK
- 오답 수정 횟수, 근거 링크 추적, 사람의 검토 시간, 접근권한 로그
- HOW TO READ IT
- 장기 에이전트 작업은 자동화 뒤에도 수동 조정과 철저한 검토가 남을 수 있습니다.
- DOES NOT PROVE
- 한 사용자의 워크플로 사례가 Agentic Search 자체의 성능을 평가한 것은 아닙니다.
근거: 9to5Mac · These AI tools make my life much easier on the Mac
04
한국어 내부 문서에서 무엇을 재현해야 하는가?
- WHERE TO CHECK
- 질문 유형별 기준 세트와 one-shot RAG 대조군의 정답률·근거 추적률·p90 지연시간
- HOW TO READ IT
- 같은 모델과 인덱스를 고정하고 검색 루프만 바꿔야 Agentic Search가 만든 차이를 분리할 수 있습니다.
- DOES NOT PROVE
- 영어 금융 벤치마크의 회사 측 결과는 한국어 계약서나 권한이 섞인 사내 문서의 성능을 증명하지 않습니다.
근거: arXiv · FinanceBench: A New Benchmark for Financial Question Answering · Mistral · Introducing Agentic Search
무엇이 달라졌나: 한 번의 검색에서 반복 조사로
전통적인 one-shot RAG는 검색 인덱스에서 고정된 텍스트 청크를 가져온 뒤 모델이 한 번에 답하게 합니다. 미스트랄은 이 방식이 긴 보고서의 표와 각주를 따라가거나 여러 문서를 비교하고 근거를 재확인해야 할 때 부족하다고 설명합니다.
Agentic Search는 기존 인덱스를 버리지 않습니다. 그 위에 search, open, navigate, read, grep이라는 다섯 도구를 올리고, 모델이 첫 결과가 부족하면 검색을 다듬고 문서를 열어 특정 위치로 이동해 주변 내용을 읽도록 합니다. 바뀐 것은 인덱스 자체보다 모델이 인덱스 이후에 수행하는 조사 루프입니다.
미스트랄이 제시한 수치와 그 경계
미스트랄은 FinanceBench에서 정확도가 26.7%에서 86%로 높아졌고, 표가 많은 다중 문서 질문을 다루는 OfficeQA Pro에서는 6.3%에서 51.9%로 상승했다고 밝혔습니다. 또한 전체 탐색 도구를 쓰면 검색만 반복하는 루프보다 토큰 사용량이 Mistral Medium 3.5에서 23.9%, GLM-5.2에서 33.7% 줄었다고 보고했습니다.
FinanceBench 원 논문은 이 벤치마크를 상장기업 관련 10,231개 질문과 답·근거 문자열로 구성된 오픈북 금융 질의응답 평가 세트라고 설명합니다. 즉 미스트랄의 86%는 이 특정 평가 틀에서 나온 회사 측 결과이며, 원 논문 자체가 Agentic Search의 성능을 검증한 것은 아닙니다.
이 숫자는 제품의 가능성을 보여주는 출발점이지 독립 검증의 종착점이 아닙니다. 평가 데이터, 모델, 툴킷, 일부 채점 방식까지 회사가 정한 조건에서 나온 자체 측정이며, 공식 발표에는 외부 기관의 재현 결과가 제시되지 않았습니다. 특히 영어 금융 문서 벤치마크가 한국어 계약서·매뉴얼·사내 지식베이스의 결과를 대신하지 않습니다.
THREE-STEP VERIFICATION
Agentic Search 주장을 검증하는 세 단계
제품 공개와 실전 효과 사이에는 두 번의 추가 검증이 필요합니다.
- 01
1 · COMPANY BENCHMARK
회사가 공개한 데이터셋·모델·평가 조건을 확인합니다.
- 02
2 · INDEPENDENT REPRODUCTION
제3자가 같은 조건에서 정확도·토큰·지연시간을 재현하는지 봅니다.
- 03
3 · REAL DOCUMENTS
한국어 내부 문서에서 근거 추적과 사람의 검토 시간까지 측정합니다.
근거: arXiv · FinanceBench: A New Benchmark for Financial Question Answering · Mistral · Introducing Agentic Search · 9to5Mac · These AI tools make my life much easier on the Mac
기존 RAG를 대체하는가: 질문 복잡도에 따라 다르다
미스트랄도 단순한 질문에는 one-shot RAG가 충분할 수 있다고 설명합니다. 답의 위치가 이미 알려져 있고 추가 탐색으로 얻을 이익이 작다면 반복 도구 호출은 필요하지 않을 수 있습니다. 반대로 긴 문서의 표·각주·조항을 찾거나 여러 문서의 근거를 맞춰야 할 때 Agentic Search의 조사 루프가 의미를 갖습니다.
따라서 비교 단위는 '새 방식 대 낡은 방식'이 아니라 질문 유형이어야 합니다. 단순 조회, 장문 탐색, 다중 문서 비교, 근거 재검증을 나눠 기존 RAG와 Agentic Search를 같은 모델·문서·성공 기준으로 시험해야 합니다.
실전에서는 자동화 뒤의 검토 비용을 재야 한다
9to5Mac의 AI 도구 사용기는 Agentic Search 자체를 시험한 리뷰가 아닙니다. 다만 약 200개의 여러 쪽짜리 문서를 분석하고 데이터를 스프레드시트로 옮기는 장기 에이전트 작업이 조정과 시행착오를 거쳐 완성됐고, 여전히 수동 조정과 철저한 검토가 필요했다고 설명합니다.
이 사례가 제공하는 반론은 정확도 수치를 부정하는 것이 아니라 측정 범위를 넓히라는 것입니다. 한국 팀은 정답률과 토큰만 보지 말고, 틀린 근거를 찾아 고치는 시간, 권한이 다른 문서의 접근 통제, 최종 결과를 사람이 검토하는 시간까지 총비용에 포함해야 합니다.
한국 팀의 도입 전 체크리스트
첫째, 실제 한국어 문서에서 질문 유형별 기준 세트를 만듭니다. 둘째, 같은 모델과 인덱스를 유지한 채 one-shot RAG와 조사 루프만 바꿉니다. 셋째, 정답률뿐 아니라 인용 근거의 정확성, 실패한 검색 횟수, p90 지연시간, 총 토큰, 사람의 수정 시간을 함께 기록합니다.
마지막으로 접근권한과 감사 로그를 확인해야 합니다. 문서를 더 깊게 탐색할수록 검색 계층이 볼 수 있는 자료의 범위와 결과에 남는 근거 추적이 중요해집니다. Agentic Search의 진짜 가치는 더 많이 찾는 데만 있지 않고, 왜 그 답에 도달했는지를 사람이 다시 확인할 수 있을 때 드러납니다.

