클로드가 ‘CRISPR 닮은 효소 체계’를 찾았다…AI가 과학 발견을 했다는 말의 진짜 뜻
앤트로픽이 AI 모델 클로드가 방대한 DNA 자료를 조사해 기존 연구자들이 특징을 정리하지 못했던 새로운 효소 체계를 찾아냈다고 2026년 9월 23일 발표했다. 이 체계는 세균을 감염시키는 바이러스인 박테리오파지에서 발견됐으며, 일정한 간격으로 반복되는 DNA 배열을 갖고 있어 유전자 편집 기술로 유명한 CRISPR와 닮은 모습이 있다. 앤트로픽은 이를 ‘배열 연관 역전사효소’, 줄여서 ART라고 이름 붙였다.
발표 뒤 가장 큰 관심은 “AI가 사람 도움 없이 과학적 발견을 한 것인가”에 쏠렸다. 9월 27일 뉴욕타임스는 외부 과학자들의 평가를 토대로 이 표현을 다시 따져 물었다. 결론부터 말하면 클로드가 사람이 지정한 큰 연구 질문 안에서 이전에 주목받지 못한 패턴을 찾아낸 것은 의미가 있다. 그러나 ART가 실제로 무슨 일을 하는지, 의학이나 유전자 편집에 쓸 수 있는지는 아직 모른다. 논문도 동료 과학자의 정식 심사를 마친 최종본이 아니라 사전 공개된 연구 결과다.
따라서 이번 소식은 “AI가 새 치료제를 발명했다”가 아니다. 더 정확한 설명은 “AI 에이전트 수백 개가 사람이 몇 주에서 몇 달 걸릴 후보 탐색을 압축해, 실험할 가치가 있는 낯선 생물학적 구조를 골라냈고 인간 과학자가 실험으로 일부 특징을 확인했다”는 것이다.
클로드는 무엇을 찾았나
핵심에는 역전사효소가 있다. 역전사효소는 RNA 정보를 DNA로 옮기는 단백질이다. 이름이 어렵지만, 생명체의 유전 정보가 보통 DNA에서 RNA로 전달되는 흐름을 반대로 거슬러 간다고 생각하면 된다. 바이러스와 세균에는 아직 기능이 밝혀지지 않은 수많은 역전사효소가 존재한다.
앤트로픽의 공식 발표에 따르면 연구진은 클로드에게 거대한 DNA 서열 데이터베이스에서 흥미로운 역전사효소 사례를 찾으라는 높은 수준의 지시를 줬다. 클로드 에이전트들은 20만 개가 넘는 역전사효소를 모으고, 기존 설명에 잘 맞지 않는 후보 체계 3,500개를 추렸다. 이후 가장 유망한 20개를 골라 사람이 읽을 수 있는 보고서로 정리했다.
이 과정에서 한 에이전트가 특이한 역전사효소 유전자 옆에 DNA 문장이 일정한 간격으로 반복되는 배열을 발견했다. 클로드는 반복 횟수와 간격을 세고, 알려진 역전사효소 체계와 비교하고, 이전 논문에 같은 특징이 보고됐는지 검색했다. 그 결과 역전사효소와 정체를 모르는 보조 단백질, 길게 늘어선 반복 DNA가 함께 존재하는 구조를 하나의 체계로 제안했다.
중요한 제한도 있다. 해당 역전사효소 자체가 세상에 처음 알려진 단백질은 아니다. 이전 연구에서도 확인된 적이 있다. 클로드가 새롭게 주목한 것은 그 효소 옆의 반복 배열과 보조 단백질을 함께 묶어 하나의 미확인 체계로 본 점이다. “새 효소를 무에서 창조했다”거나 “완전히 알려지지 않은 유전자를 처음 발견했다”고 쓰면 실제 발표보다 과장된다.
왜 CRISPR가 함께 언급되나
CRISPR는 원래 세균이 바이러스에 맞서기 위해 사용하는 면역 체계에서 발견됐다. 세균은 과거 침입자의 유전 정보를 반복 배열 사이에 저장하고, 이를 단서로 같은 바이러스가 다시 들어오면 특정 DNA를 찾아 자른다. 연구자들은 이 원리를 이용해 원하는 유전자를 비교적 정밀하게 고치는 도구를 만들었다.
ART도 일정하게 반복되는 배열을 갖고 있고, 앤트로픽 연구진의 초기 실험에서는 이 배열이 여러 개의 짧은 RNA로 만들어지는 현상이 관찰됐다. 반복 배열이 단순한 장식이 아니라 어떤 정보를 담거나 효소의 목표를 정하는 데 쓰일 가능성을 생각하게 하는 대목이다. 지금까지 비슷한 특징을 함께 가진 일부 체계가 DNA를 자르거나 복사하거나 붙이는 식으로 작동했고, 프로그램 가능한 생명공학 도구 후보가 됐다는 것이 앤트로픽의 설명이다.
그러나 ‘CRISPR와 닮았다’와 ‘새로운 CRISPR 도구다’는 전혀 다른 문장이다. 연구진은 ART의 본래 기능을 아직 모른다고 명확히 밝혔다. 바이러스가 숙주를 공격하는 데 쓰는지, 다른 바이러스를 방어하는지, 유전 정보를 저장하거나 옮기는지 확인되지 않았다. 원하는 DNA 위치를 지정해 자를 수 있는지도 입증되지 않았다.
일반 독자가 기억할 핵심은 모양의 유사성과 기능의 확인을 분리하는 것이다. 집 열쇠처럼 생긴 금속을 발견했다고 해서 실제로 어느 문을 여는지 아는 것은 아니다. ART는 흥미로운 모양과 구성 요소를 가진 후보이며, 이제 어떤 ‘문’을 여는지 실험해야 한다.
AI가 실제로 한 일과 사람이 한 일
앤트로픽은 약 950개의 클로드 에이전트가 21시간 동안 자료를 조사했고, 2억1,000만 토큰을 사용했다고 밝혔다. 토큰은 AI가 글과 데이터를 처리하는 단위다. 수치가 크다고 곧바로 지능이 높다는 뜻은 아니지만, 한 사람이 순서대로 읽던 자료를 많은 에이전트가 나눠 탐색했다는 규모를 보여준다.
AI가 담당한 일은 자료 수집, 후보 분류, 주변 DNA 패턴 비교, 문헌 검색, 가설 보고서 작성이다. 사람 과학자는 큰 연구 방향을 정하고, 어떤 후보를 실제 실험할지 검토하고, 실험실에서 단백질과 RNA의 성질을 확인했다. 앤트로픽은 실험실 작업을 사람이 수행했으며 사람에게 감염되는 병원체는 다루지 않았다고 설명했다.
이 분업 구조는 “AI 혼자 발견했다”는 표현보다 현실에 가깝다. 천문학자가 자동 망원경과 분석 프로그램으로 새로운 천체 후보를 찾았다고 해서 망원경 혼자 과학을 했다고 말하지 않는 것과 비슷하다. 다만 이번에는 도구가 단순히 정해진 계산만 수행한 것이 아니라 어떤 후보가 흥미로운지 판단하고 추가 조사 순서를 정했다. 그 자율성이 이전 자동화 도구보다 컸다는 점이 새롭다.
앤트로픽 연구진도 클로드가 낸 수백~수천 개 가설 중 대부분을 후속 평가에서 버린다고 밝혔다. AI가 가설을 아주 싸고 빠르게 많이 만들 수 있게 되면 부족해지는 것은 아이디어가 아니라 실험 시간과 전문가의 판단이다. 앞으로 과학자의 역할이 줄어든다기보다 무엇을 검증할지 고르는 일이 더 중요해질 수 있다.
왜 이번 결과가 주목받나
생물학에는 기능을 모르는 유전자와 단백질이 매우 많다. DNA를 읽는 기술은 빨라졌지만, 각 서열이 실제 생명체에서 무슨 일을 하는지 실험으로 확인하는 속도는 훨씬 느리다. 거대한 자료에서 낯선 조합을 찾고 기존 논문과 비교하는 과정은 AI가 잘 도울 수 있는 영역이다.
클로드가 20만 개가 넘는 역전사효소를 훑어 3,500개 후보를 만들고 20개로 좁힌 과정이 재현된다면, 연구자는 처음부터 끝까지 데이터베이스를 뒤지는 대신 상위 후보의 실험 설계에 시간을 쓸 수 있다. 희귀질환과 관련된 단백질, 새로운 항생제 표적, 농업에 유용한 미생물 효소처럼 후보가 너무 많은 분야에도 같은 방식이 적용될 수 있다.
또 하나는 범용 AI 모델의 역할이다. 전통적인 생물정보학 도구는 연구자가 정한 규칙에 따라 특정 패턴을 찾는 데 강하다. 클로드 같은 언어 모델 기반 에이전트는 논문을 읽고 여러 분석 방법을 연결하며, 예상하지 못한 패턴을 말로 설명하는 데 초점을 둔다. 정답이 정해지지 않은 초기 탐색에서 도움이 될 수 있다는 주장이다.
하지만 비용과 재현성도 함께 봐야 한다. 950개 에이전트와 2억1,000만 토큰은 작은 연구실이 가볍게 반복하기 어려운 규모일 수 있다. 같은 지시를 다시 줬을 때 비슷한 후보가 나오는지, 다른 모델과 전통적 분석 방법보다 실제로 더 좋은지, 사람이 들인 검토 시간을 포함해도 효율적인지는 외부 비교가 필요하다.
아직 ‘돌파구’라고 부르기 이른 이유
첫째, ART의 기능이 확인되지 않았다. 반복 배열이 짧은 RNA로 만들어진다는 초기 결과는 흥미롭지만, 그것이 어떤 표적을 인식하거나 DNA를 바꾼다는 증거는 아니다. 기능을 밝히려면 단백질 구조, 결합 대상, 효소 반응, 생명체 안에서의 역할을 차례로 확인해야 한다.
둘째, 치료나 제품으로 이어질 가능성은 더 먼 이야기다. CRISPR도 첫 반복 서열 관찰에서 실제 유전자 편집 도구와 치료제로 발전하기까지 오랜 연구가 필요했다. ART가 프로그램 가능하더라도 원하는 세포에서 정확히 작동하는지, 원치 않는 위치를 건드리지 않는지, 인체에 안전한지 검증해야 한다.
셋째, 연구 발표 주체가 AI 제품을 판매하는 회사다. 앤트로픽은 자체 생명과학 연구소와 클로드 사이언스 사업을 확대하고 있다. 연구 결과 자체와 “클로드가 자율적으로 발견했다”는 홍보 문구를 분리해 읽어야 한다. 외부 연구자가 데이터와 분석 과정을 검토하고, 같은 결과를 재현하며, 정식 동료 심사를 거치는 단계가 중요하다.
넷째, 과학적 기여의 경계를 어떻게 표시할지도 정리되지 않았다. AI가 후보를 고르고 보고서를 썼지만 연구 질문, 데이터 선택, 실험, 해석, 논문 책임은 사람이 맡는다. 향후 논문에서 모델과 에이전트의 버전, 지시문, 실패한 후보, 사람이 개입한 지점을 투명하게 공개해야 ‘AI가 했다’는 말을 검증할 수 있다.
일반 독자와 산업에 무엇이 달라지나
당장 병원에서 새 유전자 치료를 받을 수 있게 된 것은 아니다. 더 가까운 변화는 신약과 생명과학 연구의 초기 단계가 빨라질 가능성이다. 제약회사와 대학 연구소는 문헌 검토와 후보 탐색에 AI 에이전트를 더 많이 투입할 수 있다. 많은 아이디어 중 실험할 몇 개를 고르는 방식이 바뀌면 연구비의 배분과 필요한 인력 구성도 달라질 수 있다.
연구자는 AI가 낸 그럴듯한 설명을 그대로 믿지 않고 원자료와 실험으로 확인하는 능력이 중요해진다. 기업에는 좋은 결과만 발표하지 않고 실패율과 재현성을 공개해야 할 책임이 생긴다. 투자자와 대중도 “AI가 발견”이라는 제목보다 발견의 단계가 데이터 패턴인지, 실험 확인인지, 동물 시험인지, 임상 시험인지 물어야 한다.
교육 측면에서도 의미가 있다. 미래의 생명과학자는 실험 기술만이 아니라 AI가 만든 수많은 가설 중 어떤 것이 생물학적으로 말이 되는지 판단해야 한다. 반대로 AI 전문가도 모델 성능표만 볼 것이 아니라 실험실의 오염, 표본 편향, 통계 오류처럼 현실 과학의 제약을 이해해야 한다.
앞으로 볼 변화
가장 먼저 확인할 것은 ART의 실제 기능이다. 앤트로픽 연구진이나 외부 연구자가 어떤 RNA를 만들고 어느 DNA 또는 RNA에 작용하는지 밝혀야 CRISPR와의 비교가 의미를 얻는다. 사전 공개 논문이 동료 심사를 거치며 주장과 데이터가 어떻게 수정되는지도 봐야 한다.
두 번째는 재현성이다. 다른 연구팀이 공개 데이터와 비슷한 분석 절차로 같은 반복 배열을 찾아내는지, 클로드를 다시 실행했을 때 유사한 결론에 도달하는지 확인해야 한다. 한 번의 인상적인 성공보다 여러 연구에서 안정적으로 유용한 후보를 찾는지가 더 중요하다.
세 번째는 비용 대비 성과다. 950개 에이전트를 동원한 대규모 탐색이 전문 연구자와 기존 소프트웨어를 얼마나 보완했는지 비교 자료가 필요하다. 이 방식이 소수 거대 기업만 가능한 연구가 될지, 대학과 작은 연구소에도 널리 제공될지도 과학 생태계에 영향을 준다.
이번 발표의 가장 정확한 의미는 AI가 과학자를 대체했다는 데 있지 않다. AI가 거대한 생물학 자료에서 사람이 놓친 패턴을 찾아 실험의 출발점을 만들 수 있다는 사례가 하나 추가됐다는 데 있다. ART가 훗날 유용한 도구가 될 수도, 흥미로운 바이러스 구조로 남을 수도 있다. 그 답은 클로드의 자신감 있는 설명이 아니라 앞으로의 반복 실험이 결정한다.