AI 모델 및 플랫폼
인공 지능 에이전트의 실제 연구 능력은 어떠한가? Deep Research Bench 보고서 내부
인공 지능 언어 모델(Large Language Model, LLM)이 빠르게 발전함에 따라, 강력한 연구 보조 도구로서의 가능성도 함께 증가하고 있다. 이제는 단순한 사실 질문에 답변하는 것을 넘어서, 다단계推論, 상반된 정보 평가, 웹 데이터 소싱, 그리고 일관된 출력을 생성하는 “깊은 연구” 작업을 수행할 수 있다.
이러한 새로운 기능은 주요 연구소에서 다양한 브랜드 이름으로 판매되고 있다. 오픈AI는 이를 “Deep Research”라고 부르며, Anthropic은 “Extended Thinking”이라고 부르며, Google의 Gemini은 “Search + Pro” 기능을 제공하며, Perplexity는 이를 “Pro Search” 또는 “Deep Research”라고 부른다. 그러나 이러한 기능이 실제로 얼마나 효과적인지에 대해서는 아직 명확하지 않다. FutureSearch의 새로운 보고서인 Deep Research Bench (DRB): 웹 연구 에이전트 평가 보고서는 이러한 기능을 평가한 가장严格한 보고서이며, 그 결과는 둘 다 놀라운 능력과 중요한 약점을 보여준다.
Deep Research Bench란 무엇인가?
FutureSearch 팀이 생성한 Deep Research Bench는 인공 지능 에이전트의 웹 기반 연구 작업 성능을 평가하기 위한 벤치마크이다. 이는 단순한 질문과 답변을 넘어서, 실제 연구자, 정책결정자, 분석가들이 직면하는 복잡하고 개방적인 도전을 반영한다.
이 벤치마크에는 89개의 서로 다른 작업과 8개의 카테고리가 포함되어 있다.
- 번호 찾기: 예를 들어, “FDA Class II 의료 기기 리콜이 몇 건 발생했는가?”
- 주장 검증: 예를 들어, “ChatGPT가 Google (GOOGL ) 검색보다 10배 더 에너지 집약적이다?”
- 데이터셋 구축: 예를 들어, “2019년부터 2023년까지 미국 소프트웨어 개발자 직업 동향”
각 작업 유형은 인간이 검증한 답변과 함께 주어지며, RetroSearch라고 불리는 웹 페이지의 고정 데이터 세트를 사용하여 평가된다. 이는 모델 평가에서 일관성을 보장하며, 웹의 변동하는 상태를 피한다.
에이전트 아키텍처: ReAct와 RetroSearch
Deep Research Bench의 핵심에는 ReAct 아키텍처가 있다. 이는 “Reason + Act”를 의미하며, 인간 연구자가 문제를 해결하는 방식과 유사하다. 즉, 작업을 생각하고, 웹 검색과 같은 행동을 취하고, 결과를 관찰하고, 반복 또는 종료를 결정한다.
이전 모델은 이 루프를 명시적으로 따르지만, 새로운 “思考” 모델은 이过程를 더 유연하게 통합한다. 일관성을 보장하기 위해, DRB는 RetroSearch를 도입한다. 이는 웹의 정적 버전이다. 에이전트는 라이브 인터넷에 의존하지 않고, 웹 페이지의 커리된 아카이브에 접근한다. RetroSearch는 Serper, Playwright, ScraperAPI와 같은 도구를 사용하여 웹 페이지를 수집한다. 이는 평가를 위한 공정하고 재현 가능한 환경을 제공한다.
어떤 에이전트가 가장 잘 수행하는가?
모든 에이전트 중에서, 오픈AI의 o3이最高 성능을 보였다. 이는 Deep Research Bench에서 0.51의 점수를 얻은 것이다. 이는 벤치마크의 난이도에 비추어 볼 때, 아직도 많은 개선의 여지가 있다. 그러나 o3는 거의 모든 작업 유형에서 강한 성능을 보였다.
리더보드는 흥미로운 통찰을 제공한다. o3는 패키지에서 가장 잘 수행되었으며, Claude 3.7 Sonnet은 “思考”와 “非思考” 모드에서 모두 유연성을 보여주었다. Gemini 2.5 Pro는 구조화된 계획과 단계별推論이 필요한 작업에서 두드러졌다. DeepSeek-R1은 GPT-4 Turbo와의 성능 격차를 좁혔다.
전반적으로, 새로운 “思考” 모델이 이전 모델보다 더 잘 수행되었다. 또한, 폐쇄형 모델이 개방형 모델보다 더 나은 성능을 보였다.
에이전트는 어디서 어려움을 겪는가?
Deep Research Bench 보고서에서 강조된 실패 패턴은 놀랍도록 친숙했다. 특히, 에이전트가 작업을 기억하지 못하는 경우가 많다. 컨텍스트 창이 넓어지면, 모델은 중요한 세부 사항을 잃어버리기 시작하며, 목표가 불분명해지고, 응답이 불일치하거나 무의미해진다.
이러한 실패는 개인적인 경험이다. 에이전트는 반복적인 도구 사용에 빠지거나, 효과적으로 검색하지 못하거나, 조기 결론에 도달한다. 이러한 문제는 실제 연구에서 직면하는 도전을 반영한다.
최상위 모델에서도 이러한 문제가 존재한다. GPT-4 Turbo는 이전 단계를 잊는 경향이 있었으며, DeepSeek-R1은 허구의 정보를 생성하는 경향이 있었다. 모든 모델은 출처를 교차 확인하거나 결과를 검증하지 않은 채로 작업을 종료하는 경우가 많았다.
기억 기반 성능은 어떠한가?
Deep Research Bench는 또한 “도구 없는” 에이전트를 평가했다. 이는 외부 도구에 접근하지 못하는 언어 모델이다. 이러한 에이전트는 내부 훈련 데이터와 기억에만 의존한다. 이는 웹을 검색하거나 정보를 검증할 수 없다는 것을 의미한다.
놀랍게도, 이러한 에이전트는 특정 작업에서 도구를 사용하는 에이전트와 거의 같은 성능을 보였다. 그러나 더 어려운 작업에서는 완전히 무너졌다.
이러한 결과는 오늘날의 언어 모델이 강한 내부 지식과 기억력을 가지고 있지만, 실제 연구에는 최신 정보와 검증된 정보가 필요하다는 것을 강조한다.
최종 생각
Deep Research Bench 보고서는 오늘날의 최고 에이전트가 좁은 작업에서 인간을 능가할 수 있지만, 실제 연구에서는 여전히 인간 연구자에 뒤진다는 것을 보여준다.
이러한 격차는 특히 장기 또는 복잡한 세션에서 명확하다. 에이전트는 작업의 목적을 잃어버리기 시작하며, 응답은 불일치하거나 무의미해진다.
Deep Research Bench의 가치는 실제 연구를 반영하는 평가를 제공한다는 것이다. 이는 도구 사용, 기억, 推論, 그리고 적응의 교차점을 평가한다.
언어 모델이 지식 작업에 통합됨에 따라, FutureSearch의 도구는 이러한 시스템이 실제로 어떻게 작동하는지 평가하는 데 필수적이다.












