오픈AI가 중국 문샷AI의 ‘모델 베끼기’를 지목했다…AI 증류 논쟁의 진짜 쟁점
오픈AI가 2026년 9월 30일 자사 AI 모델의 추론 능력을 대규모로 빼내려는 조직적 활동을 차단했다고 발표했다. 오픈AI는 이 활동의 핵심 집단 일부가 중국 AI 기업 문샷AI와 관련된 인물들이라고 주장했다. 문샷AI는 대화형 서비스 ‘키미(Kimi)’를 만드는 회사다.
사건의 규모만 보면 눈길을 끈다. 오픈AI에 따르면 의심스러운 활동은 7월 1일 처음 포착됐고, 7월 24~25일에는 약 4천 명의 이용자가 비슷한 추출 패턴을 보이는 1만6천 개의 요청을 보냈다. 7월 28일까지 의심 계정은 1만5천 명 수준으로 늘었으며, 오픈AI는 이날 활동을 완전히 차단했다고 밝혔다.
그러나 이 사건을 곧바로 “중국 기업이 오픈AI의 데이터베이스를 해킹했다”거나 “GPT의 소스코드를 훔쳤다”고 이해하면 안 된다. 오픈AI 설명상 데이터베이스 침입이나 저장된 대화의 직접 유출은 없었다. 공격자는 AI와의 대화를 교묘하게 이어가며 원래 사용자에게 보이지 않게 보호된 추론 정보를 다른 형태로 다시 출력하게 만들었다. 더 정확한 표현은 시스템 침입보다는 모델의 답변을 대량으로 이용한 능력 추출 시도다.
무슨 일이 있었나
오픈AI가 공개한 설명을 종합하면, 활동은 처음부터 한 번에 폭발하지 않았다. 7월 초 낮은 수준으로 시작해 몇 주 동안 점점 커졌다. 특정 시점에 수천 계정이 유사한 질문 패턴을 반복했고, 오픈AI는 이를 단순한 인기 질문이 아니라 모델의 내부 추론 방식을 재현하려는 움직임으로 판단했다.
사용된 방법도 기존의 단순 복사와 달랐다. 오픈AI는 모델의 자세한 내부 추론을 그대로 보여주지 않기 위해 일부 정보를 암호화하거나 사용자에게 숨기는 방식을 쓴다. 공격자는 한 대화에서 암호화된 추론 데이터를 복사한 뒤, 별도의 대화에서 모델에게 그 내용을 해석하고 평문으로 옮기도록 유도했다고 회사는 밝혔다.
이 표현 때문에 “암호가 뚫렸다”는 오해가 생길 수 있다. 오픈AI는 공격자가 암호 체계를 깨거나 서버 데이터베이스에 침입한 것은 아니라고 강조했다. 모델이 입력을 처리하는 방식을 조작해 보호된 내용이 사용자에게 보이는 형태로 다시 생성되도록 만들었다는 설명이다. 자물쇠 자체를 부순 것이 아니라, 같은 건물 안의 다른 창구를 속여 잠긴 서류의 내용을 읽어 달라고 한 것에 가깝다.
오픈AI는 문제가 된 계정을 차단하고 가입 절차와 인프라 통제를 강화했으며, 네트워크 감시 범위를 넓혔다고 밝혔다. 한 대화에서 가져온 보호 데이터를 다른 대화에서 풀어내게 할 수 있었던 버그도 수정했다고 한다. 유사한 문제가 다른 AI 모델에도 있을 수 있다고 보고 관련 정보를 프런티어 모델 포럼과 공유했다.
‘모델 증류’란 무엇인가
이번 논쟁의 핵심 용어는 모델 증류다. 원래 증류는 크고 비싼 AI가 내놓는 답을 작은 AI의 학습 재료로 사용해, 더 적은 비용으로 비슷한 능력을 갖게 하는 기술이다. 선생님 모델이 문제를 풀어 보여주면 학생 모델이 그 예시를 반복해 배우는 방식으로 비유할 수 있다.
이 기술 자체가 불법이거나 나쁜 것은 아니다. 한 회사가 자신이 만든 큰 모델로 작은 모델을 훈련해 스마트폰이나 사내 시스템에서 빠르게 작동하게 만들 수도 있다. 공개적으로 허용된 모델의 출력과 적법하게 확보한 데이터로 연구하는 경우도 있다. AI 산업에서 널리 쓰이는 정상적인 최적화 기법이다.
문제가 되는 것은 다른 회사 서비스의 이용약관을 어기고 수많은 계정을 동원해 답변을 대량 수집하거나, 공개하지 않은 추론 방식까지 재현하려 할 때다. 모델을 직접 훔치지 않고도 충분히 많은 질문과 답을 모으면 경쟁 모델의 성능을 빠르게 끌어올릴 수 있기 때문이다. 최고급 모델을 훈련하는 데 필요한 막대한 컴퓨팅 비용과 시행착오를 줄일 수 있어 기업 간 이해가 충돌한다.
따라서 “증류”라는 단어만으로 정상 연구와 공격을 구분할 수는 없다. 누구의 모델을 사용했는지, 서비스 제공자의 허락이 있었는지, 어떤 규모로 자동 요청을 보냈는지, 보호 장치를 우회했는지, 결과를 어떤 목적으로 사용했는지를 함께 봐야 한다.
왜 문샷AI가 지목됐나
오픈AI는 전체 의심 활동이 하나의 조직에서 나왔다고 단정하지 않았다. 모든 운영자가 서로 관련됐는지는 불분명하지만, 핵심 집단에 문샷AI를 위해 일한 인물들이 포함됐다고 주장했다. 다만 CyberScoop은 오픈AI의 공개 글에 이 귀속 판단을 뒷받침하는 구체적인 기술 증거가 제시되지 않았다고 지적했다. 오픈AI는 보안상 이유로 추가 정보를 공개하지 않았고, 보도 시점까지 문샷AI의 반론도 확인되지 않았다.
이 구분은 중요하다. 계정 활동을 차단했다는 사실과 배후가 누구인지 증명하는 일은 별개다. 특정한 요청 패턴, 접속 위치, 결제 수단, 계정 연결 관계가 의심을 키울 수는 있지만, 공개 검증 자료가 없다면 외부 독자는 오픈AI의 주장으로 받아들여야 한다. “문샷AI가 했다”는 확정적 표현보다 “오픈AI가 문샷AI 관련 인물을 핵심 집단으로 지목했다”는 표현이 현재 확인된 수준에 맞다.
문샷AI는 중국의 주요 AI 스타트업 가운데 하나로, 키미 계열 모델을 제공한다. 중국 기업들은 미국의 대형 AI 회사보다 상대적으로 제한된 고성능 반도체와 자금으로 경쟁해야 하는 상황에 놓여 있다. 이런 격차 때문에 서구 기업과 미국 정부는 중국 연구소가 미국 모델의 출력을 이용해 빠르게 따라오려 한다고 꾸준히 의심해왔다. 반면 중국 기업만의 문제로 단순화하면, 미국과 유럽 기업도 일상적으로 사용하는 증류 기술의 정상 범위와 비정상 범위를 설명하기 어려워진다.
이 사건이 일반 사용자에게 왜 중요한가
첫째, AI 서비스의 계정 인증이 더 까다로워질 수 있다. 기업들이 대량 추출을 막기 위해 전화번호나 결제 수단 확인, 요청 속도 제한, 비정상 사용 탐지를 강화하면 평범한 사용자도 가입과 사용 과정에서 추가 확인을 경험할 수 있다. 여러 계정을 만들거나 짧은 시간에 비슷한 질문을 반복하는 행동은 더 빨리 차단될 가능성이 있다.
둘째, 모델이 답을 만드는 내부 과정을 얼마나 보여줄지를 둘러싼 변화가 예상된다. 자세한 추론 과정은 사용자가 답을 검토하는 데 도움이 될 수 있지만, 경쟁자가 능력을 복제하거나 공격자가 안전장치를 우회하는 단서로 쓸 수도 있다. 기업은 앞으로 긴 ‘생각 과정’을 그대로 공개하기보다 짧은 근거 요약과 검증 가능한 출처만 보여주는 방식을 선호할 수 있다.
셋째, AI 기업 간 분쟁이 서비스 가격과 공개 정책에 영향을 줄 수 있다. 어떤 회사가 비싼 모델의 답변으로 저렴한 경쟁 모델을 빠르게 만들 수 있다면, 원 개발사는 사용량 제한과 계약 조건을 강화하려 할 것이다. 반대로 지나치게 넓은 금지는 연구와 호환성 평가, 교육 목적의 사용까지 막을 수 있다. 이 균형에 따라 무료 사용량, 기업 계약, 외부 연구자의 접근 범위가 달라진다.
넷째, ‘오픈 모델’이라는 말도 더 복잡해진다. 최종 모델의 가중치를 공개했다고 해서 학습 과정에 사용한 데이터와 교사 모델의 권리 문제가 자동으로 해결되지는 않는다. 저렴하고 공개적인 모델이 어떤 자료와 어떤 허락을 바탕으로 만들어졌는지에 대한 질문이 커질 수 있다.
저작권 논쟁과는 어떻게 다른가
이 사건은 언론 기사나 책을 AI 학습에 사용한 저작권 분쟁과 닮았지만 동일하지 않다. 저작권 사건에서는 원본 콘텐츠를 학습에 사용한 행위가 공정 이용인지, 결과물이 원작을 대체하는지가 쟁점이 된다. 이번 사건에서는 경쟁 AI 서비스의 출력, 이용약관, 기술적 보호 조치, 영업상 비밀에 가까운 추론 능력을 조직적으로 추출했는지가 중심이다.
그렇다고 오픈AI의 주장이 곧 법적 결론인 것도 아니다. 모델 출력이 어느 범위까지 재산권으로 보호되는지, 추론 능력을 모방하는 것이 법적으로 무엇에 해당하는지, 여러 국가의 법이 어떻게 적용되는지는 복잡하다. 서비스 약관 위반은 비교적 분명하게 다툴 수 있어도, 그것이 곧 저작권 침해나 영업비밀 침해와 같은지는 별도 판단이 필요하다.
여기에는 아이러니도 있다. 생성형 AI 기업들은 그동안 인터넷의 대규모 텍스트와 이미지를 학습에 사용하면서 창작자들의 허락과 보상 요구를 받아왔다. 이제는 자사 모델의 출력과 추론 방식을 경쟁사가 학습에 사용하는 것을 막으려 한다. 양쪽 사건의 법적 구조는 다르지만, “다른 사람의 결과물을 학습 재료로 사용할 때 어떤 허락과 보상이 필요한가”라는 공통 질문을 피하기 어렵다.
기업들은 어떻게 대응할까
가장 직접적인 대응은 비정상 사용 탐지다. 짧은 시간에 유사한 질문을 수천 번 보내는 계정, 서로 연결된 가입 정보, 모델의 보호 정보를 끌어내려는 반복 패턴을 찾아 차단할 수 있다. 하나의 계정만 보지 않고 여러 계정의 행동을 묶어서 보는 네트워크 분석도 강화될 가능성이 높다.
두 번째는 모델 설계 변경이다. 숨겨진 추론을 다른 대화에서 복원하지 못하도록 대화 간 경계를 강화하고, 보호된 정보가 입력되면 그대로 해석하지 않게 할 수 있다. 사용자가 볼 수 있는 설명과 내부 작업 기록을 더 분명하게 분리하는 것도 한 방법이다.
세 번째는 기업 간 정보 공유다. 같은 집단이 한 서비스를 차단당한 뒤 다른 모델로 옮겨갈 수 있기 때문에, 공격 패턴과 계정 특징을 업계가 공유할 유인이 커진다. 다만 이 과정에서 정상 사용자의 개인정보와 경쟁사 정보가 과도하게 공유되지 않도록 기준이 필요하다.
네 번째는 계약과 외교의 영역이다. 미국 정부는 고성능 반도체 수출 제한뿐 아니라 미국 AI 모델의 능력이 경쟁국에 이전되는 문제에도 관심을 보이고 있다. 이번 사건은 기술 기업의 이용약관 분쟁을 넘어 미·중 AI 경쟁과 연결될 가능성이 있다. 하지만 공개 증거가 부족한 상태에서 국적만으로 연구자나 기업을 의심하면 국제 공동 연구와 정상적인 서비스 이용까지 위축될 수 있다.
과장해서는 안 되는 부분
이번 발표는 오픈AI가 조사해 내놓은 회사 측 설명이다. 수치와 사건 경과를 보도할 때도 “오픈AI에 따르면”이라는 단서를 유지해야 한다. 문샷AI와의 관련성은 독립적인 수사기관이나 법원의 판단으로 확정된 것이 아니다. 공개된 기술 증거도 제한적이다.
또 1만5천 명의 의심 사용자가 모두 문샷AI 직원이라는 뜻이 아니다. 오픈AI는 핵심 집단 일부를 문샷AI 관련 인물로 연결했을 뿐, 전체 활동의 관계는 불분명하다고 밝혔다. 1만6천 건이라는 숫자도 전체 사건 기간의 모든 요청이 아니라 7월 24~25일 특정 패턴으로 관찰된 요청을 가리킨다.
“추론을 훔쳤다”는 표현 역시 모델의 전체 내부 구조나 소스코드가 빠져나갔다는 뜻이 아니다. 모델과 상호작용하며 보호된 추론 형태를 반복적으로 보이게 하고, 그 결과를 능력 복제에 활용하려 했다는 주장이다. 실제로 그 결과가 문샷AI 모델 학습에 얼마나 사용됐고 성능 향상에 어떤 영향을 줬는지는 공개 자료로 확인되지 않았다.
앞으로 볼 변화
첫 번째는 문샷AI의 공식 반응과 오픈AI의 추가 증거 공개다. 반론이나 독립 조사 없이 한쪽 발표만으로 귀속 문제를 확정해서는 안 된다. 법적 조치가 이어진다면 계정 연결과 요청 패턴에 관한 더 구체적인 자료가 나올 수 있다.
두 번째는 다른 AI 회사의 대응이다. 같은 약점이 여러 모델에 존재할 수 있다는 오픈AI의 설명이 맞다면, 경쟁사들도 대화 간 정보 분리와 대량 요청 감시를 강화할 것이다. 이 과정에서 내부 추론을 사용자에게 보여주는 기능이 줄어드는지도 관찰할 필요가 있다.
세 번째는 정상적인 증류와 부당한 추출을 나누는 업계 기준이다. 연구 목적의 비교, 고객이 자기 데이터로 만든 출력의 재사용, 서비스 이전을 위한 호환성 시험까지 모두 금지한다면 혁신과 경쟁이 막힐 수 있다. 반대로 수천 계정을 동원한 보호 장치 우회를 방치하면 막대한 투자로 만든 모델을 복제하는 시장이 생긴다. 허용 범위를 계약과 기술 표준, 법률로 더 구체화해야 한다.
이번 사건의 핵심은 “어느 나라 AI가 더 낫다”는 경쟁 구호가 아니다. AI 모델의 답변이 새로운 AI를 만드는 원료가 되는 시대에 누가 어떤 조건으로 그 원료를 사용할 수 있는지에 관한 충돌이다. 오픈AI의 귀속 주장은 더 검증돼야 하지만, 대량 계정과 교묘한 대화만으로도 모델의 보호된 능력을 노릴 수 있다는 사실은 업계 전체가 풀어야 할 보안 문제로 남았다.
핵심 출처
- OpenAI 공식 발표(2026년 9월 30일): https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign/
- CyberScoop 보도(2026년 9월 30일): https://cyberscoop.com/openai-moonshot-ai-model-distillation-attack/
- Semafor 보도(2026년 9월 30일): https://www.semafor.com/article/09/30/2026/openai-accuses-top-chinese-lab-of-distilling-models