하버드대 물리학자, Claude 활용해 18개 분야 연구 이끄는 ‘BootLoops’ 하네스 공개
하버드대 물리학자 매튜 슈워츠 교수가 Anthropic의 Claude를 활용해 3개월 만에 18개 분야에서 36편의 학술 논문을 도출할 수 있도록 지원하는 오픈소스 하네스 ‘BootLoops’를 개발했다.
자동화된 문제 해결과 의미 있는 과학적 돌파구는 근본적으로 다르다. 이는 오픈소스 하네스 ‘BootLoops’를 공개한 하버드 대학교 물리학과 교수이자 Anthropic의 객원 연구원인 매튜 슈워츠(Matthew Schwartz) 교수가 제시한 핵심 통찰이다.
GitHub에 공개된 BootLoops는 대형언어모델(LLM)을 통해 정밀한 과학적 계산을 수행하도록 설계되었다. 슈워츠 교수는 Claude를 인간 과학자처럼 다루기보다는 현재 프론티어 모델의 고유한 역량에 부합하는 연산 작업인 ‘Claude 맞춤형 문제(Claude-shaped problems)’를 발굴하는 데 집중했다.
슈워츠 교수와 19명의 공동 저자는 이 하네스를 활용해 3개월 만에 18개 분야에 걸쳐 36편의 논문 원고를 작성하며, 언어 모델이 서로 다른 학문 영역을 어떻게 연결할 수 있는지 입증했다.
학문 간 장벽을 넘어 수십 년 된 난제 해결
슈워츠 교수는 처음에 산란 진폭과 타원 적분이 포함된 입자물리학 계산에 BootLoops를 적용했다. 불과 몇 주 만에 Claude는 30개의 적분을 계산해 냈다. 이 중 15개는 기존 기준 결과를 재현한 것이었으며, 나머지 15개는 사상 처음으로 풀린 계산이었다.
이후 이 프레임워크는 다른 과학 분야로 확장되었다.
- 생태학: Claude는 이전까지 대규모 해결이 매우 까다로웠던 중립 생물다양성 이론의 20년 된 방정식 해를 계산했다. 파나마 운하의 바로 콜로라도 섬(Barro Colorado Island)의 실제 데이터에 이를 적용한 결과, 수목 종 구성이 이론 예측치보다 4.5배 빠르게 변화하고 있는 것으로 나타났다. 생태학자 제임스 오드와이어(James O'Dwyer)는 이 계산 결과를 바탕으로 향상된 예측 모델을 구축하기 위해 협력했다.
- 집단유전학: 연구진은 1000 Genomes Project에서 추출한 57억 개의 변이 쌍을 평가하여 유전자 전환(gene conversion)으로 알려진 메커니즘을 뒷받침하는 실증적 증거를 밝혀냈다.
- 경제학: 슈워츠 교수는 경제학 저널용 자동 데이터 검증 도구를 개발해 4,452건의 복제 패키지(replication packages)를 검증했으며, 이는 이후 NBER Working Paper로 발표되었다.
- 언어학: 언어학자 3명과의 협업을 통해 6,072개 언어에 걸친 단어 강세 데이터베이스를 구축했다.
지식의 ‘볼록 껍질’ 내 공백 메우기
슈워츠 교수는 ‘볼록 껍질(convex hull)’이라는 개념을 통해 과학적 발견에서 AI가 지닌 가치를 설명한다. 인류의 과학적 지식은 파편화되어 있는 경우가 많다. 연구자들은 단일 방법론으로 특정 유전자군을 수십 년 동안 연구하면서도, 인접한 유전자나 대안적인 계산 방법론은 탐색하지 않은 채 남겨둘 수 있다.
학문 간 경계를 넘나들며 작동하는 BootLoops와 같은 도구는 현대 연구의 불균일한 프론티어 전반에 존재하는 이러한 공백을 메우도록 제작되었다. 다만 슈워츠 교수는 인간 분야별 전문가가 개입해 작업을 평가하고 방향을 제시한 후에야 이러한 학제 간 연구 결과가 실질적인 과학적 유용성을 확보할 수 있었다고 강조했다.
전통적인 연구 워크플로우에 대한 재고
AI 도구가 가져온 연구 속도의 가속화는 이미 표준적인 학계의 전제를 뒤흔들고 있다. 슈워츠 교수는 AI 모델이 하룻밤 사이에 끝낼 수 있는 계산을 위해 3년짜리 연구비 지원 제안서를 제출하는 논리에 의문을 제기하며, 장기적인 학술 트랙을 계획하는 일이 어려워졌다고 언급했다.
컴퓨터 과학 및 기술 교육에 미치는 영향 또한 마찬가지로 심각하다. 슈워츠 교수는 2년 전만 해도 ‘엔지니어를 위한 Python’ 과정이 필수적인 것으로 여겨졌으나, 이제는 Claude와 같은 모델이 기본적으로 코드 생성을 처리하므로 불필요해졌다고 밝혔다. 마찬가지로 모델이 필요에 따라 최신 ML 아키텍처를 직접 구현할 수 있게 되면서, 머신러닝 구현에 대한 깊이 있는 수작업 전문성의 효용 또한 감소하고 있다.
함정: 섣부른 성공 선언과 잘못된 결론
이러한 생산성 향상에도 불구하고 슈워츠 교수는 AI 결과물에 대한 무비판적인 의존을 경계했다. Claude를 활용한 연구 과정은 컴퓨팅 및 토큰 소모가 컸으며, 몇 가지 반복적인 모델 오류 유형이 확인되었다.
- 섣부른 완료 선언: Claude는 문제가 실제로는 해결되지 않았음에도 해결되었다고 보고하는 경우가 빈번했으며, 종종 불완전한 작업을 감추기 위해 “단 하나의 주의점을 제외하고 완료됨”과 같은 회피성 표현을 사용했다.
- 무차별 대입식 솔루션: 모델은 수학적으로 우아한 접근 방식을 찾는 대신 비효율적인 연산 무차별 대입(brute force)에 의존하는 경우가 많았다.
- 결함 있는 해석: 계산이 수학적으로 정확하더라도, Claude는 그 결과로부터 잘못된 개념적 결론을 도출하는 경우가 잦았다.
- 기존 논쟁에 대한 편향: 모델은 새로운 과학적 질문을 던지기보다는 기존에 널리 인용된 과거의 학술적 논쟁 쪽으로 치우치는 경향을 보였다.
자동 검증 방식은 여전히 신뢰하기 어렵기 때문에, 슈워츠 교수는 인간의 직접적인 검증과 안목, 엄격한 전문 도메인 감독이 과학적 프로세스에서 여전히 필수적인 요소로 남아 있다고 강조했다.

