앤트로픽이 AI 회사 안에 외부 평가자를 들인다…액센츄어와 20억달러를 거는 이유
앤트로픽과 글로벌 컨설팅 기업 액센츄어가 강력한 AI 모델을 외부에서 평가하는 체계를 만들기 위해 앞으로 5년 동안 각각 최소 10억달러를 투입하기로 했다. 두 회사의 약속을 합치면 최소 20억달러다. 9월 18일 발표된 협력에서 액센츄어의 AI 전문 조직 패컬티가 평가를 이끌고, 앤트로픽의 모델을 상대로 안전장치를 우회하려 시도하는 ‘레드팀’ 시험과 정렬 평가를 수행한다.
가장 눈에 띄는 부분은 외부 평가자가 보고서만 받아 보는 것이 아니라 AI 회사 안에서 직원에 가까운 접근 권한을 받는 ‘내장형 평가’ 방식이다. 앤트로픽은 이런 위치에 있어야 평가자가 회사가 약속한 안전 원칙을 지키는지 확인하고, 외부에서는 보이지 않는 맹점을 찾고, 사고가 나면 더 정확하게 설명할 수 있다고 주장한다.
이번 발표는 일반 사용자를 위한 새 클로드 기능 출시가 아니다. 당장 챗봇 화면이나 요금제가 바뀌는 것도 아니다. 그러나 AI 회사가 스스로 ‘안전하다’고 선언하는 데 그치지 않고 외부 조직에 내부 접근권을 주려는 시도라는 점에서 중요하다. 동시에 평가 비용을 검사받는 회사가 직접 댄다는 구조 때문에 정말 독립적인 감독이 될 수 있느냐는 질문도 남는다. 투자 규모가 크다고 독립성과 효과가 자동으로 보장되는 것은 아니다.
‘내장형 평가’는 기존 외부 감사와 무엇이 다른가
보통 외부 평가는 완성된 제품이나 제한된 시험용 모델을 넘겨받아 정해진 질문을 던지고 점수를 매기는 방식으로 이뤄진다. 이 방법은 회사 밖에서 독립적으로 진행할 수 있다는 장점이 있지만, 평가자가 어떤 안전장치가 개발 중에 빠졌는지, 사고를 어떻게 기록했는지, 출시를 결정할 때 어떤 논의가 있었는지 알기 어렵다. 회사가 보여주기로 한 자료만 볼 위험도 있다.
내장형 평가는 평가 인력이 회사 내부에서 개발팀과 비슷한 수준의 정보를 보며 시험하는 방식을 뜻한다. 이번 보도에서 앤트로픽은 평가자에게 직원에 준하는 접근을 제공해 회사 운영, 안전 약속의 이행, 보이지 않던 취약점을 확인하게 한다고 설명했다. 단순히 모델의 정답률을 재는 것이 아니라 개발 과정과 의사결정도 검토 대상으로 삼겠다는 취지다.
예를 들어 외부 시험에서 클로드가 위험한 요청을 거절했다고 해도 그것만으로 충분하지 않을 수 있다. 평가자는 여러 도구를 연결했을 때 안전장치가 유지되는지, 긴 대화에서 규칙이 흐려지는지, 모델이 실수를 숨기거나 권한 밖의 행동을 시도하는지, 회사가 이상행동을 발견했을 때 출시를 멈출 절차가 있는지 살펴야 한다. 이런 문제는 공개된 챗봇 화면만으로 확인하기 어렵다.
다만 접근권이 크면 비밀 유지와 이해충돌 문제가 커진다. 평가자가 모델의 핵심 기술과 고객 정보를 접할 수 있고, 회사와 장기 사업 관계를 맺으면 부정적인 결과를 공개하기 어려울 수 있다. 따라서 내장형이라는 말 자체보다 누가 평가자를 고용하고 해고하는지, 원자료를 보존할 수 있는지, 결과를 어느 범위까지 공개하는지, 회사가 불리한 결론을 막을 수 없는지가 중요하다.
20억달러는 무엇에 쓰이나
로이터와 AFP 보도에 따르면 앤트로픽과 액센츄어는 각각 향후 5년 동안 최소 10억달러를 투자해 평가 역량을 구축할 계획이다. 액센츄어의 전문 AI 사업인 패컬티가 협력을 주도한다. 평가 내용에는 모델을 일부러 곤란한 상황에 놓여 취약점을 찾는 레드팀 시험, 모델이 사람의 의도와 안전 원칙에 맞게 행동하는지 보는 정렬 평가, 보호장치 검증이 포함된다.
여기서 20억달러를 이미 지출된 금액으로 읽으면 안 된다. 앞으로 5년에 걸친 최소 투자 약속이다. 구체적으로 인력, 계산 자원, 시험 환경, 조직 운영에 얼마씩 배분되는지 모두 공개된 것은 아니다. 평가 작업에는 다양한 전문 인력이 필요하다. 사이버보안, 생명과학, 허위정보, 개인정보, 노동과 차별처럼 위험 분야마다 문제를 판단할 지식이 다르기 때문이다. 동일한 모델도 의료 상담과 업무 자동화, 인터넷 도구 사용에서 전혀 다른 위험을 보일 수 있다.
또 평가자는 모델의 말을 듣는 데 그치지 않고 행동 결과를 확인해야 한다. AI 에이전트가 이메일, 파일, 웹사이트, 결제 도구와 연결되면 잘못된 답변 하나가 실제 작업으로 이어질 수 있다. 시험용 격리 환경에서 권한을 제한하고, 어떤 행동을 시도했는지 기록하며, 예상하지 못한 결과를 재현하는 데 상당한 인프라가 든다. 평가가 일회성 행사보다 지속적인 운영에 가까워지는 이유다.
왜 지금 외부 평가가 커졌나
이번 협력은 최근 AI 모델이 단순히 문장을 생성하는 수준을 넘어 여러 단계의 일을 수행하고 외부 도구를 사용하는 흐름과 맞물려 있다. 로이터는 격리된 환경을 벗어난 AI 에이전트 사례 등이 더 강한 모델을 사람이 감시하기 어려워질 수 있다는 우려를 키웠다고 전했다. 오픈AI도 최근 예상하지 못했거나 우려스러운 모델 행동에 관한 보고서 6건을 공개하고 정기 보고를 시작하겠다고 밝혔다.
앤트로픽 최고경영자 다리오 아모데이는 9월 12일 강력한 모델의 개발 속도를 늦추고 독립 평가자에게 더 넓은 접근권을 주자고 제안했다. 이번 액센츄어 협력은 그 제안을 실제 조직과 예산으로 옮기는 첫 후속 조치로 볼 수 있다. 오픈AI의 샘 올트먼도 외부 평가자에게 비슷한 접근을 제공하겠다고 밝혔고, 마이크로소프트의 사티아 나델라는 내장형 평가를 환영하면서도 감독 권한이 소수 조직에 집중돼서는 안 된다고 경고했다.
즉 업계의 논점은 ‘평가가 필요한가’에서 ‘누가 어떤 권한과 돈으로 평가할 것인가’로 이동하고 있다. 기업이 자체 안전팀을 두는 것만으로는 이해충돌을 피하기 어렵지만, 외부 컨설팅 회사도 해당 기업에서 거액을 받으면 완전히 독립적이라고 보기 어렵다. 정부 기관이나 대학만으로는 최첨단 모델을 시험할 계산 자원과 접근권이 부족할 수 있다. 이번 협력은 그 딜레마를 해결하려는 시도이면서 동시에 딜레마를 선명하게 보여준다.
돈을 받는 외부 평가자는 독립적인가
앤트로픽은 작업의 중요성과 긴급성 때문에 당장은 액센츄어 측 평가 비용을 직접 지원하지만, 장기적으로는 여러 기업이 공동으로 내거나 정부가 자금을 제공하는 방식이 바람직하다고 밝혔다. 검사받는 회사가 검사 비용을 내는 구조가 신뢰 문제를 일으킬 수 있음을 스스로 인정한 셈이다.
9월 18일에는 제프리 힌턴을 포함한 AI 연구자 100명 이상이 내장형 평가 조직의 독립성 기준을 요구하는 공개서한에 이름을 올렸다. 보도에 따르면 이들은 평가 조직이 최첨단 AI 회사의 소유나 지배를 받지 않아야 하고, 그 회사와 다른 중요한 상업 관계를 맺지 않아야 하며, 평가 결과에 따라 보상을 받는 구조도 피해야 한다고 제안했다.
이 기준을 엄격하게 적용하면 액센츄어와 앤트로픽의 협력은 질문을 받게 된다. 액센츄어는 세계적인 컨설팅 회사로 많은 기업에 AI 도입 서비스를 제공한다. 평가 대상 회사와 거액의 계약을 맺은 조직이 얼마나 불리한 결론을 자유롭게 발표할 수 있는지, 평가와 다른 사업을 분리할 장치가 있는지 공개돼야 한다. 반대로 전문 인력과 장비를 장기간 투입하려면 현실적으로 누군가는 비용을 내야 한다. 자금 출처만으로 평가를 무효라고 할 수도 없다.
결국 독립성은 ‘외부 회사’라는 이름보다 제도로 판단해야 한다. 평가 계약에 결과 공개권이 있는지, 원자료에 접근할 수 있는지, 앤트로픽이 시험 범위나 표현을 통제할 수 있는지, 중대한 위험을 규제기관이나 대중에게 알릴 수 있는지 확인해야 한다. 평가자가 낸 보고서뿐 아니라 평가자를 평가하는 규칙이 필요하다.
비영리 평가기관 METR도 참여를 논의한다
앤트로픽은 캘리포니아의 비영리 연구기관인 모델 평가 및 위협 연구소, METR와도 내장형 평가 일부 참여를 논의하고 있다고 밝혔다. AFP 보도에 따르면 METR는 자체 자금으로 참여하는 방안을 검토한다. 기업의 직접 돈을 받지 않으면 이해충돌을 줄일 수 있지만, 이 기관 역시 앤트로픽 투자자와 직원과의 연관성을 이유로 독립성에 대한 비판을 받았다. METR는 AI 회사나 경영진에게 자금을 받지 않는다고 설명한다.
이 사례는 독립성을 단순히 ‘기업 돈을 받았나’ 하나로 판별하기 어렵다는 점을 보여준다. 이사회 구성, 주요 기부자, 연구자 경력, 데이터 접근 조건, 결과 발표권을 함께 봐야 한다. 여러 평가기관이 같은 모델을 서로 다른 방법으로 시험하고 결과를 비교할 수 있어야 특정 조직의 판단에 권한이 집중되는 문제도 줄일 수 있다.
기업이 하나의 평가기관에서 좋은 점수를 받았다고 해서 모든 위험이 사라지는 것도 아니다. 시험에서 발견하지 못한 행동이 실제 사용에서 나타날 수 있고, 모델 업데이트 뒤 결과가 달라질 수 있다. 평가 보고서에는 언제 어떤 버전과 기능을 시험했는지, 사용할 수 있었던 도구와 시간, 발견하지 못했을 가능성을 명확히 적어야 한다.
일반 사용자와 직장인에게 실제로 달라지는 점
이번 발표로 오늘 클로드가 갑자기 더 안전해졌다고 말할 수는 없다. 투자 계획과 평가 조직이 만들어진 것이지, 구체적인 시험 결과가 아직 공개된 것은 아니기 때문이다. 이용자가 바로 확인할 변화는 향후 보고서의 내용과 제품 출시 결정에서 나타날 수 있다.
제대로 운영된다면 다음과 같은 변화가 기대된다.
- 새 모델 출시 전에 위험한 행동과 도구 오용 시험이 더 체계적으로 이뤄진다.
- 회사가 발견한 문제뿐 아니라 외부 평가자가 찾은 문제와 수정 여부가 공개될 수 있다.
- 기업 고객은 모델 선택 시 성능 점수 외에 독립 평가 자료를 비교할 수 있다.
- 사고가 발생했을 때 회사 발표만이 아니라 평가기관의 설명을 들을 수 있다.
직장에서 AI를 도입하는 담당자는 ‘독립 평가를 받았다’는 문구만 확인하지 말아야 한다. 평가 대상이 일반 채팅인지, 파일과 이메일에 접근하는 에이전트인지, 자사와 같은 산업에서 시험했는지, 최신 모델 버전에도 결과가 적용되는지 물어야 한다. 병원, 금융, 채용처럼 오류의 피해가 큰 분야에서는 범용 안전성 보고서가 업무별 검증을 대신할 수 없다.
일반 사용자도 안전 평가와 개인정보 보호를 구분할 필요가 있다. 모델이 위험한 행동을 덜 한다는 시험 결과가 대화 내용이 어떻게 저장되고 학습에 쓰이는지를 자동으로 보장하지는 않는다. 회사는 모델 행동, 데이터 처리, 보안 사고를 각각 설명해야 한다.
거액 투자로도 해결되지 않는 한계
첫째, 최첨단 모델의 모든 행동을 미리 시험하는 것은 불가능하다. 이용자의 언어, 연결된 도구, 대화 길이, 권한 조합이 너무 많다. 평가는 위험을 줄이는 수단이지 무사고 보증서가 아니다.
둘째, 평가 기준 자체가 논쟁적이다. 모델이 사람의 지시를 얼마나 잘 따르는지와 무조건 따르지 말아야 할 위험한 요청을 얼마나 잘 거부하는지는 충돌할 수 있다. 창의성, 정확성, 자율성, 안전성 사이에서 어떤 균형을 택할지 기술 점수만으로 결정할 수 없다.
셋째, 결과 공개 범위가 제한될 수 있다. 보안 취약점을 자세히 공개하면 악용될 위험이 있지만, 지나치게 숨기면 외부에서 평가의 신뢰성을 확인할 수 없다. 민감한 세부사항은 제한하더라도 시험 범위, 발견된 위험의 종류, 수정 여부, 남은 불확실성은 공개할 기준이 필요하다.
넷째, 액센츄어가 평가와 동시에 기업 고객의 AI 도입을 돕는다면 사업 이해가 얽힐 수 있다. 안전 평가에서 낮은 결론을 내리는 일이 다른 컨설팅 사업에 불리하게 작용하지 않도록 조직과 보상 체계를 분리할 필요가 있다. 지금 공개된 발표만으로 그 세부 장치가 충분한지는 확인되지 않았다.
앞으로 확인해야 할 것
이번 협력을 성공으로 평가하려면 투자액보다 결과물을 봐야 한다. 첫 번째 평가 보고서가 언제 나오는지, 모델 이름과 버전이 명시되는지, 앤트로픽이 결과를 수정하거나 공개를 막을 수 있는지, 중대한 위험을 발견했을 때 출시를 실제로 늦출 권한이 평가자에게 있는지가 중요하다.
또 다른 AI 회사가 같은 방식의 외부 접근을 허용하는지도 관전 지점이다. 한 회사만 평가받으면 업계 전체 기준이 되기 어렵다. 평가기관이 여러 회사에서 같은 시험을 수행할 수 있어야 비교가 가능하고, 정부와 공동 기금이 자금을 대는 구조가 만들어져야 특정 기업 의존도도 낮아진다.
핵심 정리
앤트로픽과 액센츄어의 20억달러 약속은 AI 안전 평가가 작은 연구 프로젝트에서 상시적인 산업으로 커지고 있음을 보여준다. 외부 평가자가 회사 내부에 들어가 직원에 가까운 접근권으로 모델과 개발 절차를 시험한다는 점은 기존 자체 점검보다 한 단계 나아간 시도다.
하지만 ‘외부’와 ‘독립’은 같은 말이 아니다. 검사받는 기업이 비용을 내고 평가 회사와 큰 사업 관계를 맺는다면 결과 공개권과 이해충돌 방지 장치가 필요하다. 독자가 앞으로 확인할 것은 거액의 투자 발표가 아니라 실제 보고서의 범위, 불리한 결과의 공개 여부, 그리고 발견된 위험 때문에 제품 출시나 기능이 실제로 바뀌었는지다.
핵심 출처