AI 모델 및 플랫폼
인공 지능 에이전트의 실제 연구 능력은 어떠한가? Deep Research Bench 보고서 내부
대규모 언어 모델(LLM)이 빠르게 발전하면서 강력한 연구 보조 도구로서의 가능성도 커지고 있습니다. 이제 LLM은 단순한 사실 질문에 답하는 수준을 넘어 다단계 추론, 상충하는 정보 평가, 웹 전반의 자료 수집, 일관된 결과물로의 종합이 필요한 ‘심층 연구’ 과제를 수행합니다.
주요 연구소는 이 기능을 서로 다른 이름으로 판매합니다. OpenAI는 ‘Deep Research’, Anthropic은 ‘Extended Thinking’, Google Gemini는 ‘Search + Pro’, Perplexity는 ‘Pro Search’ 또는 ‘Deep Research’라고 부릅니다. 실제 효과는 어느 정도일까요? FutureSearch의 새 보고서 Deep Research Bench(DRB): 웹 연구 에이전트 평가는 지금까지 가장 엄격한 평가를 제시하며, 인상적인 능력과 중대한 약점을 함께 보여줍니다.
Deep Research Bench란?
FutureSearch 팀이 만든 Deep Research Bench는 웹 기반 다단계 연구 과제에서 AI 에이전트의 성능을 평가하도록 세심하게 설계된 벤치마크입니다. 정답이 명확한 단순 질문이 아니라 분석가, 정책 입안자, 연구자가 현실에서 마주하는 복잡하고 개방적인 문제를 반영합니다.
벤치마크에는 다음과 같은 8개 범주의 서로 다른 과제 89개가 포함됩니다.
- 숫자 찾기: 예: “FDA 2등급 의료기기 리콜은 몇 건이었나?”
- 주장 검증: 예: “ChatGPT는 Google 검색보다 에너지를 10배 더 사용하는가?”
- 데이터셋 구축: 예: “2019~2023년 미국 소프트웨어 개발자 고용 추세”
각 과제는 사람이 검증한 답을 갖추고 있으며 RetroSearch라는 수집 웹페이지 고정 데이터셋으로 평가됩니다. 실시간 웹의 변화를 피하면서 모델 평가의 일관성을 보장하는 방식입니다.
에이전트 구조: ReAct와 RetroSearch
DRB의 중심에는 ‘Reason + Act’를 뜻하는 ReAct 구조가 있습니다. 사람이 연구하듯 과제를 생각하고, 웹 검색 같은 행동을 하고, 결과를 관찰한 뒤 반복할지 결론을 낼지 결정합니다.
이전 모델은 이 순환을 명시적으로 따르지만 최신 ‘사고’ 모델은 추론을 행동에 더 유연하게 결합합니다. 평가의 일관성을 위해 DRB는 맞춤형 정적 웹인 RetroSearch를 도입했습니다. 에이전트는 계속 변하는 인터넷 대신 Serper, Playwright, ScraperAPI로 수집한 웹페이지 보관소에 접근합니다. ‘근거 수집’처럼 복잡한 과제에서는 18만9천 페이지가 넘는 고정 자료를 제공해 공정하고 재현 가능한 시험 환경을 만듭니다.
어떤 AI 에이전트가 가장 뛰어났나?
OpenAI의 o3가 1점 만점에 0.51점으로 가장 높은 성적을 거뒀습니다. 과제 정의와 채점의 모호성 때문에 완벽한 에이전트도 약 0.8이라는 ‘잡음 상한’을 넘기 어렵다는 점을 고려해야 합니다. 오늘날 최고 모델조차 체계적이고 지식이 풍부한 인간 연구자에는 미치지 못합니다.
o3는 거의 모든 과제 유형에서 빠르고 일관되게 선두를 달렸습니다. Anthropic의 Claude 3.7 Sonnet은 사고·비사고 모드 모두에서 유연성을 보였고, Gemini 2.5 Pro는 구조화된 계획과 단계별 추론 과제에서 두드러졌습니다. 오픈 웨이트 DeepSeek-R1은 GPT-4 Turbo와 비슷한 성능을 내며 개방형과 폐쇄형 모델 사이 격차를 좁혔습니다.
전체적으로 최신 사고 기능 모델이 이전 모델보다 꾸준히 우수했고, 폐쇄형 모델이 오픈 웨이트 대안보다 뚜렷한 우위를 유지했습니다.
에이전트는 어디에서 어려움을 겪나?
DRB 보고서의 실패 양상은 익숙합니다. 긴 연구나 콘텐츠 제작 세션에서 에이전트가 하던 일을 잊어버리는 문제가 대표적입니다. 컨텍스트가 길어질수록 핵심 세부사항이 흐려지고 목표가 뒤섞이며 응답이 단절되거나 방향을 잃습니다. 때로는 생성한 결과를 버리고 처음부터 다시 시작하는 편이 낫습니다.
이런 망각은 DRB 평가에서 가장 강력한 실패 예측 요인이었습니다. 일부 모델은 같은 검색을 반복하는 도구 사용 순환에 빠졌고, 다른 모델은 비판적으로 검색 전략을 세우지 않고 키워드만 맞추는 부실한 질의를 만들었습니다. 충분한 통찰 없이 형식만 갖춘 조기 결론을 내리는 경우도 잦았습니다.
상위 모델 사이 차이도 뚜렷했습니다. GPT-4 Turbo는 이전 단계를 잊는 경향이 있었고 DeepSeek-R1은 그럴듯하지만 틀린 정보를 환각할 가능성이 더 높았습니다. 모든 모델이 결과를 마무리하기 전 출처를 교차 확인하거나 발견 내용을 검증하지 않는 일이 많았습니다. 인간처럼 생각하고 연구하는 에이전트까지는 아직 갈 길이 멉니다.
기억만 사용한 성능은?
DRB는 웹 검색이나 문서 검색 같은 외부 도구 없이 작동하는 ‘도구 없는’ 에이전트도 평가했습니다. 이들은 학습 데이터와 내부 기억에만 의존하므로 정보를 찾아보거나 검증할 수 없고, 배운 내용을 바탕으로 추정합니다.
놀랍게도 일부 과제에서는 완전한 연구 에이전트와 거의 같은 성능을 보였습니다. 주장의 타당성을 평가하는 ‘주장 검증’ 과제에서 0.61점을 받아 도구 사용 에이전트 평균 0.62점에 근접했습니다. o3와 Claude 같은 모델이 강한 사전 지식을 갖고 있어 흔한 주장의 진위를 검색 없이도 자주 판단할 수 있다는 뜻입니다.
하지만 여러 출처의 값을 결합해야 하는 ‘숫자 도출’이나 다양한 사실을 맥락 속에서 찾아 평가해야 하는 ‘근거 수집’처럼 어려운 과제에서는 완전히 무너졌습니다. 최신 정보와 실시간 조회가 없으면 정확하고 포괄적인 답을 만들 수 없었습니다.
오늘날 LLM은 많은 것을 ‘아는 것처럼’ 보일 수 있지만 심층 연구에는 기억뿐 아니라 최신의 검증 가능한 정보를 바탕으로 한 추론이 필요합니다. 이는 도구를 갖춘 에이전트만 제대로 제공할 수 있습니다.
마무리 생각
DRB 보고서는 최고 AI 에이전트가 범위가 좁은 과제에서는 평균적인 인간보다 앞설 수 있지만, 전략적 계획, 과정 중 적응, 미묘한 추론에서는 숙련된 범용 연구자보다 뒤처진다는 점을 보여줍니다.
이 격차는 길고 복잡한 세션에서 특히 분명합니다. 에이전트가 과제의 목적을 서서히 놓치면서 일관성과 유용성이 무너질 수 있습니다.
Deep Research Bench는 표면적 지식만 시험하지 않고 도구 사용, 기억, 추론, 적응의 교차점을 살핍니다. 따라서 MMLU나 GSM8K보다 현실 연구에 가까운 평가를 제공합니다.
LLM이 전문 지식 업무에 더 깊이 통합될수록 FutureSearch의 DRB 같은 도구는 시스템이 무엇을 아는지뿐 아니라 실제로 얼마나 잘 작동하는지를 평가하는 데 필수적일 것입니다.












