메타 AI가 수학 난제 논문 6편을 도왔다…‘혼자 증명했다’고 말하면 안 되는 이유
메타가 10월 2일(현지시간) 자사 AI 모델 ‘뮤즈 스파크’와 수학자들이 함께 진행한 연구 논문 6편을 공개했다. 메타에 따르면 이 가운데 5편은 이전까지 답이 알려지지 않았던 공개 연구 문제를 다룬다. 분야는 확률, 미분방정식, 군론, 최적화, 수론과 물리학의 접점, 비결합대수까지 넓다.
‘AI가 수학 난제 6개를 풀었다’는 식으로 요약하면 눈길은 끌지만 사실을 과장한다. 문제를 고르고 연구 방향을 결정한 사람은 수학자였고, 모델의 제안을 확인하고 오류를 고치며 최종 논증을 책임진 것도 사람이다. 다른 수학자 그룹이 결과를 검토했지만, 모델이 스스로 자신의 증명을 형식적으로 인증한 것은 아니다. 일부 결과는 다른 연구팀의 비슷한 발견과 시기가 겹친다.
그럼에도 이번 발표는 의미가 있다. 기존의 AI 수학 성과는 답이 이미 존재하는 올림피아드 문제나 시험 문제에서 점수를 받는 방식이 많았다. 이번에는 정답지가 없는 연구 질문을 대상으로, 일반 메타 AI 채팅 화면에서 쓰는 모델이 계산, 반례 탐색, 증명 아이디어, 초안 작성에 실제 기여했다. AI가 연구자를 대체했다는 증거가 아니라, 숙련된 연구자가 AI를 어떤 도구로 사용할 수 있는지를 보여주는 사례에 가깝다.
올림피아드 문제와 열린 연구 문제는 무엇이 다른가
수학 경시대회 문제는 매우 어렵더라도 출제자가 알고 있는 정답과 풀이가 있다. 모델의 답을 채점할 기준이 비교적 분명하다. 반면 열린 연구 문제는 답이 존재하는지조차 확실하지 않을 수 있다. 며칠 동안 시도한 방법이 막히면 처음부터 다시 생각해야 하고, 그럴듯한 한 줄의 오류가 전체 결론을 무너뜨릴 수 있다.
메타는 뮤즈 스파크가 수학·물리·화학 대회에서 높은 성적을 낸 뒤 더 어려운 질문을 던졌다고 설명한다. 이미 알려진 답을 재현하는 수준을 넘어, 해결 경로가 없는 문제에 기여할 수 있느냐는 것이다. 수학자들은 수개월 동안 뮤즈 스파크 1.1과 1.2의 ‘생각 모드’를 사용했다. 별도의 연구 전용 시스템을 만든 것이 아니라 일반 메타 AI 채팅 인터페이스를 이용했다는 점도 강조했다.
하지만 일반 채팅창을 썼다는 사실이 ‘누구나 버튼 한 번으로 논문을 만들 수 있다’는 뜻은 아니다. 어떤 질문이 중요한지 고르고, 모델이 제시한 식과 논리를 검증하며, 기존 연구와 충돌하지 않는지 판단하려면 깊은 전문성이 필요하다. 같은 답변을 받은 비전문가는 오류를 발견하지 못할 수 있다.
실제로 AI는 어떤 일을 했나
여섯 연구에서 모델의 역할은 제각각이었다. 하나의 만능 수학자처럼 처음부터 끝까지 해결한 것이 아니다. 어떤 연구에서는 가능한 반례를 찾는 프로그램을 작성했고, 다른 연구에서는 계산을 전개하거나 증명 후보를 제안했다. 또 다른 논문에서는 기술적인 본문 초안을 작성했고 연구자들이 이를 확인하고 다듬었다.
가장 이해하기 쉬운 사례는 군론의 반례 탐색이다. 군론은 대칭의 구조를 연구하는 수학 분야다. 2024년에 제안된 한 추측은 특정 성질을 가진 모든 유한군이 또 다른 성질도 가질 것이라고 예상했다. 뮤즈 스파크는 군론 계산 프로그램 GAP에서 후보를 찾는 검색 코드를 만들었다. 그 결과 원소 384개를 가진 반례 후보가 나왔고, 수학자들이 이를 검증한 뒤 논증을 완성했다.
여기서 모델의 공헌은 방대한 후보를 효율적으로 뒤진 것이다. 반례 하나가 확인되면 ‘모든 경우에 성립한다’는 추측은 무너진다. 하지만 프로그램이 무언가를 출력했다는 사실만으로 증명이 되지는 않는다. 연구자는 코드가 올바른지, 출력된 구조가 정말 조건을 만족하는지, 기존 정의와 일치하는지 확인해야 한다.
확률 분야의 논문은 고차원 공간의 무작위 점들을 타원체 표면에 정확히 맞출 수 있는 조건을 연구했다. 연구팀은 일정한 경계를 기준으로 그 아래에서는 정확한 타원체가 존재할 가능성이 높고, 위에서는 거의 존재하지 않는다는 날카로운 전환점을 제시했다. 다만 바로 경계에 해당하는 경우는 아직 해결되지 않았다. 제목에서 ‘난제 해결’이라고 부르더라도 문제 전체의 모든 경우가 끝난 것은 아니라는 점을 보여준다.
미분방정식 연구는 레이저 물리에서 영감을 받은 파동 모델을 다뤘다. 안으로 모이게 하는 효과와 밖으로 퍼지게 하는 효과가 경쟁할 때 파동이 유한한 시간 안에 붕괴하는지를 묻는다. 연구팀은 중심을 기준으로 대칭이고 에너지가 음수이며 차원이 둘 이상인 조건에서 유한 시간 붕괴를 증명했다고 설명했다. 이는 2015년부터 남아 있던 질문의 특정 조건을 해결한 것이지 모든 파동에 대한 보편적인 결론은 아니다.
나머지 연구도 비슷하다. 어려운 최적화 문제를 단순한 형태로 바꿔도 정확한 답을 보존하는 조건을 찾거나, 수론의 개념과 문자열 이론 계산 사이의 관계가 더 넓은 경우에 성립함을 보이거나, 생물학에서 영감을 받은 대수 구조에 대한 추측의 예외와 새로운 설명을 제시했다. 메타가 공개한 한 논문의 초록에는 AI 사용 사실이 명시돼 있고, 별도의 ‘AI 사용 설명’을 참고하라고 적혀 있다.
‘AI가 풀었다’보다 ‘사람과 AI가 나눠 한 일’을 봐야 한다
메타는 각 프로젝트에서 수학자가 연구를 지휘했고 두 번째 수학자 그룹이 결과를 검토했다고 밝혔다. 논문에는 사람이 주로 작성한 부분과 AI가 주로 작성한 부분을 구분하고, 바탕이 된 선행연구를 표시했다고 설명한다. 비슷한 결과를 독립적으로 발표한 다른 팀도 인정했다.
이런 공개는 중요하다. 과학 연구에서 결과만큼 중요한 것이 과정이기 때문이다. 어떤 아이디어가 모델에서 나왔는지, 연구자가 어떤 수정을 했는지, 사용한 대화 기록과 계산 코드를 다시 확인할 수 있는지 알아야 다른 연구자가 결과를 재현하고 책임 소재를 판단할 수 있다.
현재 공개 자료만으로는 모든 대화 기록과 계산 비용, 각 논문의 검증 상태를 일반 독자가 한눈에 확인하기 어렵다. 동료 검토를 받았다는 설명도 전통적인 학술지의 정식 심사를 모두 마쳤다는 뜻과 같지는 않다. 일부 논문은 메타 연구 페이지에 공개된 연구 결과이며, 향후 학계가 세부 증명을 검토해야 한다.
따라서 가장 정확한 표현은 ‘뮤즈 스파크가 수학자들의 열린 문제 연구에 기여했고, 그 결과 6편의 논문이 공개됐다’이다. ‘AI가 혼자 6개 난제를 완전히 해결했다’는 표현은 문제 선택, 인간 검증, 제한 조건, 독립적인 확인이 필요하다는 사실을 지운다.
왜 수학은 AI 연구의 중요한 시험대인가
수학은 답이 참인지 거짓인지 엄밀하게 따질 수 있다는 장점이 있다. 문장이 자연스럽거나 사람에게 설득력 있어 보인다는 이유만으로 맞다고 인정되지 않는다. 한 단계라도 논리가 틀리면 결론이 무너진다. 그래서 AI가 장문의 그럴듯한 설명을 만드는 능력과 실제 추론 능력을 구분하기 좋은 분야다.
동시에 수학 연구는 단순 채점으로 끝나지 않는다. 중요한 문제를 발견하고, 여러 분야의 개념을 연결하고, 실패한 시도에서 새로운 질문을 만드는 창의성이 필요하다. 뮤즈 스파크 사례는 AI가 후보를 많이 만들고 계산을 빠르게 시도하는 데 강점을 보일 수 있음을 시사한다. 연구자는 그 후보 가운데 의미 있는 길을 선택하고 엄밀하게 검증한다.
이 협업이 잘 작동하면 연구 속도가 빨라질 수 있다. 반례 검색처럼 반복 계산이 많은 작업을 모델이 맡고, 사람은 개념적 해석과 증명에 집중할 수 있다. 한 분야의 연구자가 다른 분야의 관련 정리를 발견하는 데 도움을 받을 수도 있다. 젊은 연구자는 AI의 설명을 통해 낯선 영역의 출발점을 찾을 수 있다.
반대로 위험도 있다. 모델은 존재하지 않는 정리를 인용하거나 조건을 슬쩍 바꾸고도 자신감 있게 말할 수 있다. 유명 모델이 제안했다는 이유로 연구자가 검증을 덜 하면 오류가 논문으로 퍼질 수 있다. 계산 코드가 길고 복잡할수록 인간이 모든 부분을 확인하기 어려워진다. AI가 낸 아이디어의 독창성과 기존 학습 자료의 관계를 밝히기도 쉽지 않다.
대학과 연구기관에는 어떤 기준이 필요할까
첫째, AI 사용을 숨기지 않는 기준이 필요하다. 어떤 모델과 버전을 언제 사용했는지, 아이디어 탐색·코드 작성·본문 초안 중 어디에 썼는지 기록해야 한다. 모델 이름만 적고 끝내기보다 사람이 확인한 단계와 수정한 내용을 설명하는 것이 좋다.
둘째, 검증 가능한 자료를 남겨야 한다. 반례를 찾은 코드, 주요 계산, 필요한 경우 대화 기록을 보존해야 한다. 개인 정보나 미공개 연구 내용 때문에 전체 대화를 공개하지 못하더라도, 결과를 재현할 최소한의 자료는 마련해야 한다. 모델이 바뀌거나 서비스가 종료돼도 논문의 근거가 사라지지 않아야 한다.
셋째, 저자와 책임의 경계를 분명히 해야 한다. AI는 오류에 책임질 수 없고 연구 윤리 심사나 이해 충돌 공개를 수행할 수도 없다. 최종 논문에 이름을 올린 사람은 모델의 제안을 포함한 전체 내용을 이해하고 방어할 수 있어야 한다. ‘AI가 썼다’는 말은 책임을 넘기는 핑계가 될 수 없다.
넷째, 부정적인 결과도 공유할 필요가 있다. 성공한 여섯 논문만 보면 모델이 대부분의 연구 질문을 해결한 것처럼 보일 수 있다. 몇 개의 문제를 시도했고 얼마나 자주 잘못된 길을 제안했는지, 사람이 검증하는 데 시간이 얼마나 들었는지 공개돼야 생산성을 제대로 평가할 수 있다.
일반 사용자에게도 중요한 이유
수학 연구는 일상과 멀게 느껴지지만 이번 사례는 AI 답변을 읽는 방법을 가르쳐 준다. 모델이 전문가처럼 말하는 것과 검증된 사실을 만드는 것은 다르다. 전문 연구에서도 사람이 문제를 정하고 출력을 점검하며 다른 전문가가 검토했다면, 건강·법률·금융처럼 실수가 큰 분야에서 일반 사용자가 AI 답변을 그대로 믿어서는 안 된다.
또한 AI가 일을 대체하는 방식이 ‘한 직업 전체를 한 번에 없애는 것’보다 직업 안의 작업을 재배치하는 형태일 수 있음을 보여준다. 수학자는 사라지는 대신 반례 후보와 계산 초안을 더 많이 받아 검토하는 사람이 될 수 있다. 그러면 가치 있는 능력도 바뀐다. 계산을 빨리 하는 능력뿐 아니라 좋은 질문을 고르고 오류를 찾아내며 결과의 의미를 설명하는 능력이 더 중요해진다.
학생에게도 같은 원칙이 적용된다. AI가 만든 풀이를 제출하는 것보다 각 단계가 왜 맞는지 설명하고 다른 방법과 비교할 수 있어야 한다. 교육기관은 AI 사용을 일괄 금지하거나 무조건 허용하기보다 과정 기록과 구두 설명, 재현 가능한 계산을 평가하는 방식으로 바꿀 필요가 있다.
아직 확인되지 않은 점
메타가 공개한 여섯 논문의 정확성과 중요성은 관련 분야 전문가들의 장기 검토를 거쳐야 한다. 회사와 연구자 그룹이 마련한 검토는 긍정적 신호지만, 폭넓은 학계의 합의와 동일하지 않다. ‘5개의 열린 문제’도 각 분야 전체의 가장 유명한 난제 5개라는 뜻은 아니다. 특정 조건 아래 남아 있던 질문이나 비교적 최근 제안된 추측도 포함된다.
뮤즈 스파크가 다른 연구자에게 같은 수준의 도움을 주는지도 아직 모른다. 이번 연구자들은 문제를 깊이 이해하고 모델의 오류를 수정할 수 있는 전문가였다. 일반 이용자가 같은 채팅창에 질문한다고 같은 결과를 얻는다는 보장은 없다. 성공 사례가 어떤 선택 과정을 거쳐 공개됐는지, 실패한 시도는 얼마나 많았는지도 알려지지 않았다.
모델의 학습 데이터와 선행연구 사이의 관계도 계속 확인해야 한다. 알려진 아이디어를 새 조합으로 제시한 것인지, 실제로 새로운 전략을 만든 것인지 판단하려면 대화 과정과 문헌 검토가 필요하다. 비슷한 결과를 다른 팀이 독립적으로 발표한 경우 우선권과 공헌을 세심하게 구분해야 한다.
앞으로 볼 변화
이번 발표의 핵심은 AI가 수학자를 대신했다는 선언이 아니다. 정답지가 없는 연구에서도 일반 채팅형 모델이 검색과 계산, 아이디어 제안, 초안 작성에 쓸모 있는 기여를 할 수 있다는 사례가 여섯 건 생겼다는 점이다. 동시에 모든 사례에서 전문가의 방향 설정과 검증이 필요했다.
앞으로는 논문 수보다 세 가지를 봐야 한다. 첫째, 외부 수학자들이 결과를 재현하고 오류가 없다고 확인하는가. 둘째, 성공한 사례뿐 아니라 전체 시도와 실패율이 공개되는가. 셋째, AI가 작성한 부분과 인간의 공헌을 투명하게 구분하는 표준이 자리 잡는가.
독자가 기억할 문장은 간단하다. 뮤즈 스파크는 수학 난제를 ‘혼자 해결한 천재’가 아니라, 수학자가 매우 엄격하게 감독한 연구 도구였다. 이 구분이 지켜질 때 이번 성과는 과장된 홍보가 아니라 인간과 AI가 함께 지식을 만드는 방법을 시험한 중요한 기록이 된다.