오픈AI 안전 보고서를 쓰던 직원이 사임했다…‘빨리 출시하고 고치는 문화’가 위험하다는 이유
오픈AI에서 주요 제품 출시의 안전 보고서 작성을 이끌었던 데이비드 로빈슨이 회사를 떠났다. 그는 10월 3일(현지시간) 미국 잡지 애틀랜틱에 기고한 글에서 오픈AI의 “문화가 망가졌다”고 주장했다. 약 3년 반 동안 회사 안전 조직에서 일한 사람이 공개적으로 제기한 비판이라 파장이 크다.
로빈슨의 핵심 주장은 단순히 안전 규칙 하나가 부족하다는 것이 아니다. AI를 일단 제한적으로 내놓고, 실제 이용에서 문제가 발견되면 보호장치를 보완하는 ‘반복 배포’ 방식 자체가 강력한 AI에는 맞지 않을 수 있다는 지적이다. 일반 소프트웨어에서는 빠른 출시와 잦은 수정이 혁신을 만드는 방법이었지만, AI가 스스로 여러 단계를 계획하고 외부 도구를 다루기 시작하면 한 번의 실패가 만드는 피해도 커질 수 있다는 것이다.
오픈AI는 반박했다. 회사는 모델이 안전하게 관리할 수 있는 수준보다 강력해지지 않도록 하고 있으며, 필요하면 훈련을 중단하거나 모델 공개를 보류한다고 밝혔다. 보안 강화, 외부 평가 확대, 책임 있게 작업하도록 하는 훈련, 실시간 감시 개선도 진행 중이라고 설명했다.
이번 사건은 어느 한쪽의 주장만으로 결론 내릴 수 없다. 퇴사자의 비판은 중요한 내부자 증언이지만 회사 전체의 안전 상태를 독립적으로 입증한 감사 결과는 아니다. 반대로 회사의 대응 역시 구체적인 중단 사례와 평가 자료가 공개돼야 검증할 수 있다. 중요한 질문은 “오픈AI가 안전한가, 위험한가”라는 이분법보다 빠른 AI 개발에서 어떤 실패까지 감수할 수 있고 누가 멈춤 버튼을 누를 수 있느냐에 있다.
로빈슨은 어떤 일을 했나
로빈슨은 자신이 오픈AI의 주요 모델과 제품 출시에 따라붙는 안전 보고서를 만드는 일을 이끌었다고 밝혔다. 이런 문서는 새 모델이 위험한 요청에 어떻게 반응하는지, 어떤 시험을 거쳤는지, 회사가 어떤 보호장치를 마련했는지 외부에 설명하는 역할을 한다. 소비자에게는 제품 설명서처럼 보일 수 있지만, 연구자와 정책 담당자에게는 회사가 위험을 어떻게 정의하고 평가하는지 보여주는 중요한 자료다.
그가 회사의 모든 안전 업무를 총괄한 최고 책임자였다는 뜻은 아니다. 오픈AI에는 모델 평가, 보안, 정책, 신뢰와 안전 등 여러 조직이 있다. 다만 출시 보고서를 가까이에서 작성한 직원이 내부 절차와 문화에 문제를 제기했다는 점에서 무게가 있다. 로빈슨은 자신도 오랫동안 회사 안에서 변화를 만들려고 했지만, 모두가 계속 전력 질주하는 환경에서는 근본적인 조직 개편을 논의하기 어려웠다고 썼다.
퇴사 글은 최근 AI 기업에서 반복되는 장면과도 닮았다. 안전 연구자나 정책 담당자가 회사를 떠난 뒤 개발 속도, 경영진의 우선순위, 외부 감시 부족을 비판한다. 이런 증언이 나올 때마다 기업은 안전 투자를 늘리고 있다고 답한다. 독자는 양쪽의 강한 표현보다 실제로 무엇이 공개되고 어떤 절차가 바뀌는지를 봐야 한다.
‘반복 배포’는 무엇이고 왜 논쟁이 되나
반복 배포는 완벽한 제품을 한 번에 내놓기보다 비교적 제한된 사용자에게 먼저 공개하고, 실제 사용에서 얻은 문제와 피드백을 바탕으로 계속 개선하는 방식이다. 챗봇의 엉뚱한 답변, 악용 방법, 사용자가 예상하지 못한 행동은 연구실 시험만으로 모두 찾기 어렵기 때문에 현실 사용에서 배우겠다는 논리다.
이 방식에는 장점이 있다. 다양한 언어와 문화, 장애 접근성, 예상 밖의 사용법은 내부 직원만으로 시험하기 어렵다. 작은 규모로 공개하고 이용 범위를 제한하면 실제 문제를 빨리 발견할 수 있다. 모든 위험이 사라질 때까지 기다리면 유용한 기술의 혜택도 늦어지고, 경쟁사나 악의적인 행위자가 먼저 움직일 수 있다는 주장도 있다.
로빈슨은 바로 그 장점이 더 강력한 시스템에서는 약점이 될 수 있다고 본다. 문제를 발견한 뒤 고치는 방식은 일정한 실패가 먼저 일어남을 전제로 한다. 사진 편집 앱의 작은 오류라면 업데이트로 바로잡을 수 있지만, AI가 기업 시스템에 접속해 파일을 읽고 메시지를 보내거나 보안 도구를 작동한다면 첫 실패부터 개인정보 유출이나 시스템 침해로 이어질 수 있다.
그는 AI 기업이 원자력발전소나 대형 공항처럼 운영돼야 한다고 주장했다. 이런 산업은 사람의 실수가 반드시 생긴다고 가정하고 여러 겹의 보호장치, 독립적인 확인, 느리고 명시적인 승인 절차를 둔다. 한 사람이 잘못 눌러도 사고가 일어나지 않게 만들고, 사고에 가까운 징후도 기록해 공유한다. 로빈슨은 최첨단 AI 회사에 이런 고신뢰 산업의 경험을 가진 인력이 부족하다고 비판했다.
일반 소프트웨어와 강력한 AI는 무엇이 다른가
모든 AI 오류가 재앙은 아니다. 챗봇이 식당 영업시간을 틀리게 말하거나 문장을 어색하게 쓰는 문제는 사용자가 다른 출처를 확인해 바로잡을 수 있다. 이런 서비스까지 항공기와 똑같은 절차로 운영하면 개선 속도와 이용 편의가 지나치게 떨어질 수 있다.
핵심은 능력과 권한이다. 답변만 보여주는 챗봇보다 이메일을 보내고 결제하며 외부 시스템을 조작하는 AI 에이전트의 실패 비용이 크다. 개인의 일정 정리보다 전력망, 금융, 의료, 군사처럼 사회 기반시설에 연결된 작업이 더 엄격한 기준을 요구한다. 같은 모델이라도 어디에 연결되고 얼마나 오래 자율적으로 움직이는지에 따라 위험 등급을 달리 봐야 한다.
따라서 논쟁은 ‘빠른 출시를 전부 금지하자’와 ‘문제는 나중에 고치면 된다’ 사이의 선택이 아니다. 낮은 위험의 기능은 제한적으로 시험하되, 영향이 큰 행동에는 사람의 승인과 사용 범위 제한, 즉시 중단 기능, 자세한 기록, 독립 평가를 요구하는 층별 접근이 필요하다. 로빈슨의 비판은 AI의 권한이 커지는 속도만큼 회사의 운영 문화가 바뀌고 있는지 묻는다.
오픈AI는 어떻게 답했나
테크크런치와 비즈니스인사이더가 전한 오픈AI의 입장은 네 가지로 요약된다. 첫째, 안전하게 관리할 수 없는 수준으로 모델이 강해지지 않도록 살피고 필요하면 훈련을 멈추거나 공개를 보류한다. 둘째, 연구와 시험 환경의 보안을 강화한다. 셋째, 외부 평가자와의 협업을 확대한다. 넷째, 문제 행동을 더 일찍 찾도록 실시간 감시를 개선한다.
이는 로빈슨이 요구한 방향과 완전히 반대되는 답은 아니다. 회사도 더 강력한 보안과 외부 평가, 중단 가능성이 필요하다는 점을 인정한다. 차이는 현재의 조치가 충분한지, 그리고 제품 출시와 경쟁 압박보다 실제로 우선하는지에 있다.
“필요하면 보류한다”는 원칙은 구체적인 사례가 공개될 때 신뢰를 얻는다. 어떤 기준을 넘으면 훈련을 멈추는지, 누가 최종 결정을 내리는지, 사업 부서와 안전 부서가 충돌하면 어떻게 해결하는지 알 수 있어야 한다. 공개하지 못하는 보안 정보가 있더라도 독립 감사기관이나 규제기관이 확인할 통로는 마련할 수 있다.
외부 평가도 이름만으로 충분하지 않다. 평가자가 출시 일정과 무관하게 충분한 시간을 받는지, 회사가 제공한 시험 환경 밖에서도 검증할 수 있는지, 심각한 문제를 발견하면 공개를 늦출 권한이 있는지 중요하다. 결과 중 좋은 점만 골라 발표한다면 외부 평가의 의미가 약해진다.
소비자와 기업 사용자는 무엇을 확인해야 하나
일반 사용자가 최첨단 모델의 내부 안전 문화를 직접 감사할 수는 없다. 그렇지만 서비스 선택과 사용 범위에서 확인할 질문은 있다. AI가 답변만 만드는지 아니면 실제 행동까지 하는지, 연결된 이메일·파일·결제 정보의 범위가 어디까지인지, 중요한 행동 전에 확인을 요청하는지 살펴봐야 한다.
기업은 “사람처럼 일하는 에이전트”라는 홍보 문구보다 실패했을 때의 통제를 먼저 봐야 한다. 읽기 권한과 쓰기 권한을 분리하고, 테스트 계정에서 시작하며, 한 번에 처리할 수 있는 작업 수와 금액을 제한해야 한다. 모든 행동 기록을 남기고 사람이 쉽게 중단하거나 되돌릴 수 있어야 한다. 모델 공급업체의 안전 약속이 있더라도 고객사의 내부 통제를 대신하지는 못한다.
특히 채용, 대출, 보험, 의료, 법률처럼 사람의 권리와 생계에 영향을 주는 결정은 AI의 추천만으로 끝내지 않아야 한다. 사람이 최종 확인한다는 문구만 붙이는 것도 부족하다. 검토자가 모델의 판단을 실제로 뒤집을 권한과 시간, 필요한 정보를 가져야 한다.
이 사건이 모든 오픈AI 제품을 즉시 중단해야 한다는 근거는 아니다. 로빈슨이 구체적인 취약점 목록이나 독립 감사 보고서를 공개한 것도 아니다. 그러나 제품의 편리함과 별개로 공급업체의 사고 공개, 안전 보고서, 데이터 처리 방식, 중단 절차를 계약과 도입 판단의 일부로 삼아야 한다는 경고로는 충분하다.
내부자 폭로를 읽을 때 구분할 것
첫째, 확인된 사실과 의견을 나눠야 한다. 로빈슨이 사임했고 오픈AI의 안전 보고서 작성 업무를 이끌었다는 점, 공개 글에서 회사 문화를 비판했다는 점, 오픈AI가 공식 입장을 냈다는 점은 보도로 확인됐다. 회사의 문화가 실제로 모든 안전 절차를 무력화했다는 평가는 그의 경험에 근거한 주장이다.
둘째, 강한 미래 예측은 현재 증거와 구분해야 한다. 최첨단 AI가 인류에 극단적인 피해를 줄 수 있다는 우려는 연구와 정책 논쟁의 대상이지만 발생 시기와 확률에 합의가 없다. 막연한 공포만 강조하면 당장 확인할 수 있는 개인정보 유출, 사기, 잘못된 자동 결정, 보안 침해 같은 현실 위험을 놓칠 수 있다.
셋째, 회사의 반박도 검증 대상이다. 보안과 평가를 강화한다는 계획은 긍정적이지만 계획 자체가 효과를 증명하지 않는다. 실제 사고 건수, 중대한 문제를 발견해 출시를 늦춘 사례, 외부 평가 결과, 개선 전후의 차이가 공개돼야 한다.
넷째, 개인의 퇴사에만 초점을 맞추면 구조를 놓친다. AI 기업은 막대한 투자금과 치열한 출시 경쟁 속에서 움직인다. 안전 담당자가 문제를 제기해도 일정과 매출 목표를 바꿀 권한이 없다면 좋은 의도만으로 부족하다. 이사회 감독, 독립 평가, 내부고발자 보호, 사고 보고 의무처럼 반대 의견이 실제 결정에 영향을 주는 구조가 필요하다.
어떤 변화가 신뢰를 만들까
가장 중요한 것은 멈춤 기준의 구체화다. 회사는 어떤 종류의 능력이나 시험 실패가 나오면 훈련·배포를 중단하는지 공개 가능한 범위에서 설명해야 한다. 기준을 바꿀 때는 이유와 승인 절차도 남겨야 한다. 선언만 있고 예외가 계속 생기면 안전 체계는 홍보 문서가 된다.
다음은 사고와 ‘아차 사고’의 공개다. 실제 피해가 없었더라도 보호장치가 뚫릴 뻔한 사건을 기록하면 다른 기업과 연구자가 같은 실패를 피할 수 있다. 항공 업계가 작은 이상 징후를 모아 큰 사고를 예방하는 방식과 비슷하다. 다만 공격자가 악용할 세부 정보는 시차를 두거나 독립기관에 제한적으로 공유할 수 있다.
안전 조직의 독립성도 필요하다. 제품 출시팀과 별도의 보고선을 두고, 심각한 위험이 확인되면 일정 연기를 요구할 권한을 보장해야 한다. 안전 담당자의 성과가 출시 속도나 매출에만 연동되지 않도록 해야 한다. 외부 전문가가 정기적으로 절차를 검토하고 요약 결과를 공개하면 회사의 자기평가 한계를 줄일 수 있다.
마지막으로 안전 문서를 일반인이 이해할 수 있게 써야 한다. 시험 이름과 점수만 나열하지 말고 이전 모델과 무엇이 달라졌는지, 어떤 이용자에게 어떤 위험이 커졌는지, 사용자가 끌 수 있는 기능과 신고 방법은 무엇인지 설명해야 한다. 로빈슨이 맡았던 출시 보고서의 가치도 바로 이런 투명성에 있다.
앞으로 볼 변화
이번 사임은 오픈AI가 위험하다는 최종 판결도, 퇴사자의 우려가 과장됐다는 증거도 아니다. 안전 보고서를 가까이서 만든 직원이 개발 속도와 조직 문화 사이의 충돌을 공개했다는 사건이다. 오픈AI는 훈련 중단과 공개 보류도 가능하며 보안·외부 평가·실시간 감시를 강화하고 있다고 답했다.
독자가 기억할 핵심은 ‘문화’가 추상적인 구호가 아니라는 점이다. 누가 반대할 수 있는지, 어떤 조건에서 출시를 미루는지, 실패를 외부에 알리는지, 안전 담당자가 충분한 시간과 권한을 갖는지가 문화의 실제 모습이다. 다음에는 오픈AI가 구체적인 멈춤 기준과 독립 평가 결과, 사고 대응 변화를 공개하는지 확인해야 한다. 강력한 AI를 빨리 만드는 능력만큼, 필요할 때 늦추고 멈추는 능력이 있는지가 이번 논쟁의 진짜 시험이다.
출처: 데이비드 로빈슨의 애틀랜틱 기고, TechCrunch 보도와 오픈AI 답변, Business Insider 보도