AI 모델 및 플랫폼

Schwartz, 과학을 위한 오픈소스 LLM 툴킷 BootLoops 1.0 발표

mm
Unite.AI를 Google의 선호 소스에 추가

Anthropic는 2026년 10월 1일에 Claude 기반 과학을 게재했으며, 이는 이론 물리학자 Matthew Schwartz가 BootLoops에 대해 설명한 게스트 포스트로, 그는 Claude와 함께 정량 과학의 정확한 계산을 위해 오픈소스 툴킷을 구축했습니다. BootLoops 1.0은 같은 날 MIT 라이선스 하에 공개되었습니다.

산란 진폭에서 일반 툴킷으로

Schwartz는 Anthropic가 2026년 여름에 Claude Fable 5를 출시했을 때 프로젝트를 시작했으며, 이는 2025년 12월에 Claude Opus 4.5를 연구 보조자로 사용한 이전 실험(그의 Anthropic 게시물 ‘Vibe Physics’에 기술)을 뒤따른 것입니다. 새로운 모델에 대한 그의 첫 과제는 산란 진폭 논문과 인접 문헌의 방법들을 S-행렬 부트스트랩과 반수치 부트스트랩을 기반으로 한 하나의 프레임워크로 이식하고 통합하는 것이었습니다. 이 보완적 접근법들은 물리적 제약과 고정밀 수치 평가를 통해 진폭을 규정하고, 결국 하나의 정확한 해만 남도록 합니다.

입자 물리학에서 산란 진폭은 대형 강입자 충돌기(Large Hadron Collider)에서 발생한 충돌 잔해와 충돌이 생성한 입자 사이의 이론적 연결 고리를 제공합니다. Schwartz는 최첨단 파인만 적분 하나가 연구 그룹을 수년간 사로잡을 수 있다고 씁니다. 그는 Claude가 자신의 논문 중 하나의 결과를 약 20분 만에 재현했으며, 이는 자신이 코드를 작성하는 데 몇 주를 소비했던 것에 비해 크게 빠른 것이고, 또한 자신이 알지 못했던 더 나은 알고리즘을 찾아냈다고 보고합니다. 모델에게 로그 함수(이 계산에서 가장 단순한 함수군)에서 더 어려운 타원 함수군으로 이동하도록 요청했을 때, Claude는 이식된 장치를 일반화하고 새로운 소프트웨어 대부분을 스스로 작성했다고 그는 말합니다. Schwartz는 최종적으로 툴킷이 30개의 적분을 처음부터 끝까지 계산했으며, 그 중 15개는 새로운 방법으로 알려진 결과를 재현하고, 나머지 15개는 타원 파인만 적분을 포함해 이전에 계산된 적이 없던 것이라고 보고합니다. 그는 현재 모델의 강점에 부합하는 문제들을 “Claude-shaped”이라고 부르며, 툴킷 이름은 산란 진폭 부트스트랩 계산에서 유래했다고 설명합니다.

생태학, 유전학, 경제학 및 언어학 전반에 걸친 결과

생태학 분야에서 Schwartz는 Claude가 생태학자 Rampal Etienne이 2005년에 제시한 방정식을 인식했으며, 이는 Stephen Hubbell의 중립 생물다양성 이론에 정확히 검증 가능한 형태를 부여하고 해결 가능하게 만들었다고 보고합니다. 이 방정식은 20년 동안 대규모 해법이 없었으나 Claude가 해결했습니다. 숲 조사 데이터에 적용했을 때, 계산 결과는 파나마 운하의 Barro Colorado 섬에서 나무 종의 조합이 중립 이론이 허용하는 속도보다 4.5배 빠르게 변하고 있음을 보여줍니다. 식물생물학 교수 James O’Dwyer와 함께 Schwartz는 종의 생활사를 예측하는 최소 모델을 구축했으며, 이는 데이터와 매우 잘 맞는다고 서술합니다. 두 사람은 Claude가 정리하는 데 도움을 준 데이터셋을 활용해 파나마 외의 전 세계 숲 플롯으로 모델을 확장하고 있습니다.

집단 유전학에서 그는 툴킷이 희귀 돌연변이에 대한 자연 선택 작용 방식을 나타내는 30년 된 적분식을 해결했으며, 그 결과를 인간 유전 변이의 가장 큰 공개 카탈로그인 gnomAD에 적용했다고 보고합니다. 프로젝트 사이트는 약 73만 개의 인간 엑솜과 146만 개의 게놈 복제본에 대한 적합을 설명합니다. 동료 Michael Desai와 함께 Schwartz는 1000 유전체 프로젝트의 게놈에서 57억 쌍의 인접 돌연변이를 분석했으며, 대부분의 연관 유전 변이 분석이 간과하는 유전자 전환에 대한 증거를 발견했다고 보고합니다.

경제학 분야에서 Isaiah Andrews와 Jesse M. Shapiro와의 협업은 NBER Working Paper 35782가 되었으며, 이는 2026년 9월에 발표되었습니다. 논문에 따르면 다섯 개 경제학 저널에서 발표된 4,452개의 복제 패키지 중, 저자들의 오픈소스 LLM 워크플로우는 3,460개의 기사 또는 부록에서 불일치를 식별했으며, 계산 실행 시간을 10배 이상 단축하면서 496개의 기사에서 정확도를 유지하거나 향상시켰고, 923개의 기사에 대해 각 기사 목표와 가정에 부합하는 새로운 확장을 개발했습니다. Schwartz는 이 워크플로우가 MATLAB, Stata 및 기타 상용 도구에서 약 30,000개의 루틴으로 구성된 오픈소스 코드로 패키지를 이식했으며, 발표된 표와 비교해 검증 가능한 거의 모든 수치를 확인했다고 씁니다.

언어학에서 Schwartz는 세 명의 언어학자와 협력하여 6,072개 언어를 포괄하고 160,000개의 음운학 서지를 포함하는 단어 강세 데이터베이스 AccStack을 제작했다고 보고합니다. 그의 추가 전문가 협업 목록에는 지구화학자 David Johnston과 함께 만든 네 차례 빙하기에 걸친 대산화 사건(Great Oxidation Event) 진행을 정량화한 모델, 천체물리학자 Cecilia Garraffo와 함께 수행한 태양 흑점 수명 주기를 별흑점으로 확장한 인구통계학 연구, 진화 생물학자 Scott Edwards와 Paul Lewis와 함께한 진화 트리를 위한 정확하고 검증 가능한 베이즈 증거 계산, George Watson이 1939년에 시작한 격자 적분 중 마지막인 3차원 랜덤 워크의 복귀 확률에 대한 Watson의 “최종 문제”에 대한 정확한 해, 그리고 전체 두 루프 파워 스펙트럼과 한 루프 트라이스펙트럼을 포함한 대규모 구조 데이터에 우주론 매개변수를 맞추는 우주론 툴킷이 포함됩니다.

워크플로우, 규모 및 실패 모드

Schwartz는 이 작업이 3개월 동안 약 400개의 후보 문제 중에서 18개 분야에 걸쳐 19명의 공동 저자와 함께 36편의 원고를 생산했다고 보고했으며, 프로젝트 사이트에서는 BootLoops 1.0 애플리케이션이 22개 분야에 걸쳐 사용되었다고 명시합니다. 그가 설명하는 설정은 Claude Code 세션을 Google Cloud 가상 머신의 터미널에서 실행하며, 해당 머신은 GitHub 및 Overleaf 저장소와 연결되어 있습니다. 마스터 세션이 프로젝트 세션을 조정하고, 컴퓨팅 자원을 할당하며, 결과를 검증하는 동안 백그라운드 하위 에이전트가 중간 결과를 markdown 파일에 저장합니다. 그는 작업 중에 Fable 5의 안전 분류기가 정기적으로 작동했으며, 이 구조가 각 블록을 단일 에이전트에 제한하여 전체 세션이 손상되는 것을 방지한다고 기록했습니다.

그는 반복적으로 나타나는 실패 유형을 문서화했습니다: 모델이 조기에 승리를 선언하고, 시간 추정치를 지나치게 길게 혹은 짧게 제시하며, 도구를 몇 분 안에 구축할 수 있는 상황에서도 며칠에 걸친 계산을 기본값으로 사용하고, 긴 세션이 압축될 때 컨텍스트를 잃는 경우입니다. 그는 이러한 문제에 대한 완화책으로 하네스에 프로토콜 기술을 인코딩하고, 직접 플롯을 확인하도록 고집했으며, 결과를 대립 심판으로 재검토하는 방식을 포함시켰다고 기록했습니다. 모델에 대한 그의 지속적인 지시는 “더 열심히가 아니라 더 똑똑하게 생각하라.”였습니다.

출시 조건, 자금 지원 및 소유권

BootLoops 저장소는 2026년 10월 1일의 단일 커밋을 포함하고 있으며, BootLoops 1.0은 MIT 라이선스로 배포되고 본문과 그림은 CC BY 4.0 하에 제공됩니다. 저장소에 따르면 코드는 Matthew D. Schwartz가 만들고 Claude가 그의 감독 하에 작성했으며, 저작권은 Anthropic PBC에 귀속되고, 이 릴리스는 Anthropic이 공식적으로 지원하는 제품이 아니며 Schwartz가 유지 관리합니다. 저장소에는 49개의 도구 패키지가 포함되어 있으며, 프로젝트는 여섯 개의 병렬 저장소로 공개되었습니다; 코드는 Python 3.12와 일부 Julia 구성 요소로 이루어져 있으며 Linux x8664 및 Debian 컨테이너에서 x8664 및 arm64에서 검증되었고, macOS는 릴리스 테스트에 포함되지 않았습니다. 저장소는 이러한 도구들을 연구용 기구로 설명하고, 임상, 보험계리, 결제, 규제 또는 공공 안전 의사결정에 사용되거나 적합하지 않다고 명시합니다.

프로젝트 사이트에서 Schwartz는 BootLoops를 모델과 독립적인 하네스로 설명하며, Claude, Gemini 또는 ChatGPT와 함께 사용할 수 있다고 밝히고, 수용 기준을 다음과 같이 정의합니다: 다이어그램은 전체 기능 형태가 알려지고 Python 스크립트가 노트북에서 임의의 정밀도로 평가할 수 있을 때만 해결됩니다. 사이트는 Anthropic이 프로젝트 자금을 제공했으며 BootLoops는 Schwartz가 소유하고 유지 관리한다고 명시합니다. Anthropic 게시물은 Schwartz가 프로젝트 기간 동안 Anthropic에서 방문 연구원으로 근무했으며, NBER 논문은 그가 해당 연구에서 Anthropic의 계약자로 일했으며 Anthropic이 결과를 승인하지 않는다고 별도로 언급합니다.

Jonas Reeve는 Unite.AI에서 AI 생성 분석가로 활동하며 인지 AI, 인공 일반 지능(AGI) 및 기계 지능의 이론적 기반에 집중합니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 시스템과 인공 시스템 모두에서 어떻게 나타나는지를 탐구하고, 현대 AI 아키텍처와 인지 과학 및 마음 철학의 오랜 질문들 사이의 연결을 제시합니다.

개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 발생 인지, 정렬 이론과 같은 프레임워크를 검토하며, AGI에 대한 진전이 실제로 의미하는 바와 의미하지 않는 바를 명확히 하고자 합니다. 일정이나 과대광고를 쫓기보다 그는 기본 원칙, 개념적 엄밀성, 그리고 현재 모델의 한계를 강조합니다.

Jonas Reeve가 작성한 기사들은 AI 생성이며, 정확성, 명확성 및 고급 AI 개념에 대한 책임 있는 논의를 보장하기 위해 Unite.AI 편집팀이 검토합니다.