AI 모델 및 플랫폼
에이전트 연구소: AMD와 존스 홉킨스 대학의 가상 연구 팀

모두가 AI 에이전트와 자동화에 대해 열광하는 동안, AMD와 존스 홉킨스 대학은 연구에서 인간과 AI의 협력을 개선하는 데 노력해 왔습니다. 그들의 새로운 오픈소스 프레임워크인 에이전트 연구소는 인간-AI 팀워크를 통해 과학 연구를 가속화하는 새로운 방식을 완전히 재창조한 것입니다.
다수의 AI 연구 프레임워크를 살펴본 후, 에이전트 연구소는 실제적인 접근 방식으로 인해 돋보입니다. 기존의 많은 솔루션들이 인간 연구자를 대체하려고 하는 반면, 에이전트 연구소는 연구의 시간이 걸리는 측면을 처리함으로써 인간 연구자의 능력을 강화하는 데 중점을 둡니다.
핵심 혁신은 간단하지만 강력합니다: 완전히 자율적인 연구를 추구하는 대신, 에이전트 연구소는 여러 전문 AI 에이전트가 협력하여 각각 연구 프로세스의 다른 측면을 처리하는 가상 연구실을 생성합니다.
가상 연구실 분해
에이전트 연구소를 잘 조직된 연구 팀으로 생각해 보세요. 그러나 이 팀은 AI 에이전트가 전문 역할을 맡습니다. 실제 연구실과 마찬가지로, 각 에이전트는 특정한 책임과 전문 지식을 가지고 있습니다:
- 박사 학위 에이전트는 문헌 검토와 연구 계획을 담당합니다
- 포스트독 에이전트는 실험 접근 방식을 정제하는 데 도움을 줍니다
- 머신 러닝 엔지니어 에이전트는 기술적인 구현을 처리합니다
- 교수 에이전트는 연구 결과를 평가하고 점수를 매깁니다
이 시스템이 특히 интерес하는 점은 워크플로입니다. 전통적인 AI 도구가 고립되어 작동하는 반면, 에이전트 연구소는 이러한 에이전트가 상호 작용하고 서로의 작업을 구축하는 협력 환경을 만듭니다.
프로세스는 자연스러운 연구 진행을 따릅니다:
- 문헌 검토: 박사 에이전트는 arXiv API를 사용하여 학술 논문을 검색하고 관련 연구를 수집 및 조직합니다
- 계획 수립: 박사와 포스트독 에이전트는 함께 자세한 연구 계획을 수립합니다
- 구현: 머신 러닝 엔지니어 에이전트는 코드를 작성하고 테스트합니다
- 분석 및 문서화: 팀은 함께 결과를 해석하고 포괄적인 보고서를 생성합니다
하지만 여기서 실제로 중요한 점은: 프레임워크는 컴퓨팅 유연성을 제공하므로 연구자들은 컴퓨팅 파워와 예산 제약에 따라 자원을 할당할 수 있습니다. 이것은 실제 연구 환경을 위한 도구입니다.

Schmidgall et al.
인간 요인: AI와 전문 지식의 만남
에이전트 연구소는 자동화 기능을 제공하지만,真正의 마법은 “공동 조종 모드”에서 발생합니다. 이 설정에서 연구자들은 각 단계에서 피드백을 제공할 수 있으며, 인간 전문 지식과 AI 지원 간의真正한 협력을 만듭니다.
공동 조종 피드백 데이터는 일부 흥미로운 통찰력을 제공합니다. 자율 모드에서 에이전트 연구소가 생성한 논문은 평균 3.8/10의 인간 평가를 받았습니다. 그러나 연구자들이 공동 조종 모드를 사용할 때, 점수는 4.38/10으로 증가했습니다. 특히 이러한 개선이 나타난 곳은 – 논문은 명확성 (+0.23)과 제시 (+0.33)에서 크게 향상되었습니다.
하지만 여기서 실제적인 점은: 인간 참여에도 불구하고, 이러한 논문은 여전히 평균적으로 1.45 점 아래로 평가되었습니다 (평균적으로 5.85의 NeurIPS 논문). 이것은 실패가 아니라, AI와 인간 전문 지식이 서로를 보완해야 하는 중요한 학습입니다.
평가에서 나타난 또 다른 흥미로운 점은: AI 평가자는 일관되게 논문을 2.3 점 더 높게 평가했습니다. 이 격차는 연구 평가에서 인간의 감독이 여전히 중요한 이유를 강조합니다.

Schmidgall et al.
숫자 분해
연구 환경에서真正로 중요한 것은 비용과 성능입니다. 에이전트 연구소의 모델 비교 접근 방식은 이方面에서 일부 놀라운 효율성 향상을 보여줍니다.
GPT-4o는 속도 챔피언으로 나타났습니다. 전체 워크플로를 단 1,165.4초 만에 완료했습니다. 이는 o1-mini보다 3.2배, o1-preview보다 5.3배 더 빠릅니다. 그러나 더욱 중요한 점은, 이는 단지 2.33달러의 비용으로 이루어졌다는 것입니다. 이전의 자율 연구 방법과 비교하면, 이는 84%의 비용 감소입니다.
모델 성능을 살펴보면:
- o1-preview는 유용성과 명확성에서最高 점수를 받았습니다
- o1-mini는 실험 품질 점수에서 최고를 달성했습니다
- GPT-4o는 메트릭에서 뒤처졌지만 비용 효율성에서 앞섰습니다
실제적인 의미는重大합니다.
연구자들은 이제 자신의 필요에 따라 접근 방식을 선택할 수 있습니다:
- 신속한 프로토 타이핑이 필요한 경우, GPT-4o는 속도와 비용 효율성을 제공합니다
- 실험 품질을 우선하는 경우, o1-mini가 최선의 선택일 수 있습니다
- 가장 정교한 출력을 원하는 경우, o1-preview는 약속을 보여줍니다
이러한 유연성은 연구 팀이 프레임워크를 자신의 자원과 요구 사항에 맞게 조정할 수 있음을 의미합니다. 하나의 크기만으로 모든 것을 해결하는 대신, 연구 팀은 자신의 상황에 맞게 프레임워크를 사용할 수 있습니다.
새로운 연구 장
에이전트 연구소의 능력과 결과를 살펴본 후, 나는 연구가 어떻게 провод될 것인지에 대한重大한 변화를 보게 될 것이라고 확신합니다. 그러나 이는 자율성의 이야기가 아니라, 훨씬 더细致하고 강력한 것입니다.
에이전트 연구소의 논문은 아직 최고의 컨퍼런스 표준에 도달하지 못했지만, 새로운 연구 가속 패러다임을 만들고 있습니다. 이는 연구를 가속화하는 AI 연구 보조 팀을 갖는 것과 같습니다. 각 에이전트는 과학적 프로세스의 다른 측면을 전문으로 합니다.
연구자들에게서의 의미는重大합니다:
- 문헌 검토와 기본 코딩에 소요되는 시간을 창의적인 아이디어 생성에 할당할 수 있습니다
- 자원 제약으로 인해 보류된 연구 아이디어가 실행 가능해집니다
- 신속한 프로토 타이핑과 가설 테스트가 가능해져서 더 빠른 혁신을 달성할 수 있습니다
현재의 제한 사항, 즉 AI와 인간 평가 점수 간의 격차는 기회입니다. 이러한 시스템의 각 반복은 인간과 AI의 더 정교한 연구 협력을 위한 발전을 가져옵니다.
미래를 내다보면, 세 가지 주요 개발이 과학적 발견을 재정의할 수 있습니다:
- 보다 정교한 인간-AI 협력 패턴이 나타날 것입니다
- 비용과 시간 절약으로 연구를 민주화하여 더 작은 연구소와 기관이 더 야심찬 프로젝트를 추구할 수 있습니다
- 신속한 프로토 타이핑 기능으로 더 많은 실험적 접근 방식이 연구에서 나타날 수 있습니다
이 잠재력을 최대화하는 열쇠는 에이전트 연구소와 유사한 프레임워크가 자동화가 아니라 증폭을 위한 도구라는 것을 이해하는 것입니다. 연구의 미래는 인간 전문 지식과 AI 능력 사이에서 선택하는 것이 아니라, 이를 결합하는创新적인 방법을 찾는 것입니다.












