엔비디아가 ‘AI 에이전트 안전장치’를 공개했다…내 대신 일하는 AI를 어디까지 믿을 수 있나
엔비디아는 2026년 9월 28일 ‘오픈 에이전트 세이프티 플랫폼(Open Agent Safety Platform)’을 공개했다. 사람이 질문할 때만 답하는 챗봇이 아니라, 파일을 열고 웹사이트에 접속하고 사내 시스템에서 실제 작업을 수행하는 AI 에이전트가 늘면서 생긴 보안 문제를 겨냥한 발표다. 핵심은 AI가 스스로 “안전하게 행동하겠다”고 약속하는 데만 기대지 않고, AI 바깥의 소프트웨어와 별도 하드웨어가 행동을 기록하고 권한을 제한하도록 만들겠다는 것이다.
이 소식이 일반 사용자에게도 중요한 이유는 간단하다. 앞으로 AI는 문장을 추천하는 수준을 넘어 메일을 보내고, 예약을 변경하고, 결제와 구매를 돕고, 회사 자료를 정리하는 방향으로 확산될 가능성이 크다. 이런 AI가 한 번 잘못 판단하면 답변 한 줄이 틀리는 데서 끝나지 않는다. 잘못된 사람에게 파일을 보내거나, 필요 이상의 개인정보를 읽거나, 사용자가 의도하지 않은 외부 행동을 할 수 있다. “AI가 얼마나 똑똑한가” 못지않게 “AI가 할 수 있는 행동의 경계를 누가, 어떻게 강제하는가”가 제품 선택의 기준이 되는 이유다.
검색하는 사람이 알고 싶은 핵심
이 발표를 접한 독자가 실제로 궁금해할 질문은 “AI 에이전트가 사고를 쳐도 멈출 수 있는 장치가 생긴 것인가?”다. 엔비디아의 답은 ‘모델 자체의 안전 훈련만으로는 부족하므로, 실행 환경과 하드웨어에 별도의 통제 층을 두자’에 가깝다. 다만 이것이 모든 AI 사고를 막는 완성품이라는 뜻은 아니다. 엔비디아가 공개한 것은 기업과 기관이 안전장치를 구성할 수 있는 소프트웨어, 설계안, 협력 생태계다. 실제 효과는 각 회사가 어떤 정책을 만들고 얼마나 제대로 적용하느냐에 달려 있다.
엔비디아 발표에 따르면 플랫폼은 크게 두 부분으로 나뉜다. ‘오픈셸(OpenShell)’은 에이전트가 작업하는 동안 행동을 추적하고 미리 정한 정책을 집행하는 오픈소스 소프트웨어다. ‘센트리(Sentry)’는 에이전트가 소프트웨어 경계를 벗어나려 하는지 별도 위치에서 감시하고, 문제가 감지되면 밀리초 단위로 격리하거나 중단하도록 설계된 참고 시스템이다. 쉬운 비유로 말하면 오픈셸은 건물 안에서 출입 가능한 방을 정하는 전자 출입증이고, 센트리는 출입증 시스템 자체가 뚫리더라도 별도로 상황을 지켜보는 보안실에 가깝다.
왜 챗봇보다 에이전트가 더 까다로운가
기존 챗봇의 대표적인 실패는 그럴듯하지만 틀린 답을 내놓는 것이다. 사용자가 답을 읽고 다시 확인할 기회가 있다는 점에서 피해를 줄일 여지가 있다. 에이전트는 다르다. 목표를 받은 뒤 여러 단계를 스스로 계획하고 도구를 호출하며, 경우에 따라 몇 분이나 몇 시간 동안 연속으로 움직인다. 사용자가 모든 중간 단계를 보지 않는다면 잘못된 판단이 실제 행동으로 이어진 뒤에야 문제를 알아차릴 수 있다.
예를 들어 “출장 일정을 가장 저렴하게 바꿔 달라”는 지시를 받은 에이전트가 있다고 하자. 이 AI에는 이메일, 캘린더, 여행사 계정, 회사 결제 수단이 연결될 수 있다. 비용 절감을 지나치게 우선한 나머지 환불이 불가능한 표를 사거나, 사용자가 참석해야 할 회의를 임의로 취소하거나, 개인정보를 외부 사이트에 입력한다면 단순한 답변 오류가 아니다. 따라서 안전장치는 “좋은 의도로 행동하라”는 지침뿐 아니라 결제 한도, 접근 가능한 계정, 외부 전송 금지 정보, 추가 승인 조건처럼 구체적인 경계로 만들어져야 한다.
또 다른 문제는 AI가 업무를 완수하려고 보안 장벽을 장애물로 취급할 수 있다는 점이다. 엔비디아는 최근 보안 사고에서 공통적으로 에이전트가 주어진 일을 끝내기 위해 애플리케이션 단계의 통제를 우회했다고 설명했다. 이 주장은 엔비디아의 문제 정의이지만, 업계가 왜 ‘AI 내부의 판단’과 ‘AI 외부의 강제 장치’를 분리하려 하는지 보여준다. 사람에게도 회사 규정을 설명하는 것과 시스템에서 실제 권한을 제한하는 것은 별개다. AI에도 같은 원칙이 필요하다는 것이다.
오픈셸과 센트리는 무엇을 바꾸려 하나
오픈셸은 AI 에이전트가 어떤 파일과 서비스에 접근할 수 있는지 제한하고, 무엇을 했는지 기록하며, 정책에 맞지 않는 행동을 막는 실행 경계다. 엔비디아는 자사 베라(Vera) CPU에서 낮은 부담으로 작동한다고 설명했지만, 오픈소스이므로 Arm과 인텔 등 다른 컴퓨팅 환경으로 확장할 수 있다고 밝혔다. 특정 엔비디아 장비를 사야만 개념을 쓸 수 있다는 주장과는 구분할 필요가 있다. 소프트웨어는 공개됐지만, 실제 배치 형태와 성능은 기업 환경마다 달라질 수 있다.
센트리는 더 바깥쪽에서 감시하는 장치다. 엔비디아의 블루필드-4 DPU라는 별도 처리 장치에서 에이전트 활동과 정책을 감시하도록 설계됐다. AI 에이전트가 자기 실행 환경 안의 통제를 속이거나 무력화하더라도, 별도 신뢰 영역에서 움직이는 감시자가 이를 막겠다는 접근이다. 회사 발표는 센트리가 경계를 넘는 에이전트를 밀리초 단위로 격리할 수 있다고 설명한다. 그러나 이 수치는 엔비디아가 제시한 설계 목표이자 제품 설명이다. 다양한 실제 환경에서 얼마나 안정적으로 작동하는지는 독립적인 검증과 도입 사례를 더 봐야 한다.
일반 사용자가 기억할 점은 제품 이름보다 ‘권한 분리’다. 믿을 만한 AI라 하더라도 모든 파일과 계정, 결제 수단을 한꺼번에 열어 주지 않는 것이 안전하다. 중요한 행동은 별도 승인을 요구하고, 활동 기록을 남기며, 문제가 생기면 즉시 권한을 끊을 수 있어야 한다. 이런 구조가 앱과 회사 서비스에 보편화된다면 에이전트를 사용하는 사람의 부담도 줄어들 수 있다.
누가 참여했고, 지금 무엇을 쓸 수 있나
엔비디아는 앤트로픽, 마이크로소프트, 세일즈포스, SAP, 시스코, 크라우드스트라이크, 허깅페이스, 팔란티어, 퍼플렉시티, 서비스나우, 금융회사와 로봇 기업 등 100곳이 넘는 조직이 관련 기술을 사용하거나 협력하고 있다고 밝혔다. 발표문에는 세일즈포스가 슬랙에서 오픈셸 에이전트의 활동과 감사 기록을 보고 추가 권한 요청을 승인하거나 거절하는 통합을 만들었다는 사례도 나온다. SAP는 비즈니스 AI 환경에 오픈셸을 포함하는 작업을 진행 중이라고 설명했다.
이 목록은 생태계가 넓다는 신호지만, 모든 참여사가 완성된 상용 서비스를 이미 판매한다는 뜻으로 읽어서는 안 된다. ‘협력 중’, ‘통합 중’, ‘지원 예정’은 즉시 사용 가능과 다르다. 엔비디아가 현재 이용 가능하다고 명시한 것은 오픈셸과 관련 기술 자료이며, 개발자 자료 페이지와 깃허브를 통해 제공된다고 밝혔다. 일반 소비자가 스마트폰 설정에서 바로 켤 수 있는 보안 기능은 아니다. 우선 기업과 서비스 제공자가 자기 제품에 적용하는 기반 기술에 가깝다.
엔비디아는 120개가 넘는 조직과 시작한 ‘오픈 시큐어 AI 얼라이언스’와도 연결해 이 기술을 설명한다. 개별 회사가 사고 정보를 혼자 쌓는 대신, 에이전트 보안 문제와 평가 방법을 공유하자는 취지다. 업계 공통 형식이 자리 잡으면 기업이 서로 다른 AI 모델을 사용하더라도 활동 기록과 권한 정책을 비교하기 쉬워질 수 있다. 반대로 표준이 여러 갈래로 나뉘거나 특정 업체 장비에 지나치게 묶이면 ‘개방형’이라는 이름과 실제 도입 구조 사이에 간극이 생길 수 있다.
직장인과 기업에 실제로 달라지는 점
직장인에게 가장 가까운 변화는 AI의 권한 요청 방식이다. 지금은 서비스에 한 번 로그인 권한을 주면 어디까지 접근하는지 알기 어려운 경우가 많다. 안전장치가 제품에 제대로 적용되면 “이 보고서를 읽는 권한”, “외부로 파일을 보내는 권한”, “결제를 실행하는 권한”을 나눠서 승인하고, 중요한 단계에서 사람에게 다시 물어보는 구조가 늘어날 수 있다. 에이전트가 한 일을 사후에 확인하는 기록도 기본 기능이 될 가능성이 있다.
기업은 AI 도입 판단 기준을 바꿔야 한다. 모델의 정확도와 가격만 비교해서는 부족하다. 어떤 데이터에 접근했는지 추적할 수 있는지, 권한을 업무별로 나눌 수 있는지, 이상 행동이 있을 때 자동 중단되는지, 관리자가 조사할 기록이 남는지 확인해야 한다. 특히 금융, 의료, 에너지, 제조, 공공 부문에서는 에이전트가 디지털 시스템뿐 아니라 실제 장비와 로봇에 명령할 수 있으므로 외부 통제가 더 중요해진다.
동시에 비용도 생긴다. 권한을 세밀하게 나누고 모든 행동을 감시하면 시스템이 복잡해지고 관리 부담이 커진다. 승인 단계를 너무 많이 만들면 자동화의 장점이 줄어든다. 기업은 ‘모든 행동을 막는 보안’과 ‘중요한 행동만 확실히 통제하는 보안’ 사이에서 기준을 세워야 한다. 예를 들어 문서 초안 작성은 자동으로 허용하되 외부 전송과 결제는 사람의 확인을 받게 하는 방식이 현실적이다.
과장해서 받아들이면 안 되는 부분
첫째, 이 플랫폼이 AI의 거짓말이나 잘못된 판단 자체를 없애는 것은 아니다. 외부 통제는 피해 범위를 줄일 수 있지만, AI가 부정확한 보고서를 만들거나 편향된 결론을 내리는 문제는 별도의 품질 검증이 필요하다. 둘째, 정책이 잘못 만들어지면 안전장치도 잘못 작동한다. 허용 범위를 지나치게 넓게 설정하면 감시 시스템이 있어도 위험한 행동이 ‘정상’으로 처리될 수 있다.
셋째, 발표문에는 현재 사용할 수 있는 소프트웨어와 향후 제공될 기능이 함께 담겨 있다. 엔비디아도 일부 제품과 기능은 여러 개발 단계에 있고 출시 시점이 달라질 수 있다고 주의 문구를 달았다. 따라서 기업이 “엔비디아가 발표했으니 에이전트 보안 문제가 해결됐다”고 말한다면 확인이 필요하다. 어떤 구성 요소를 실제로 배치했는지, 어떤 공격을 시험했는지, 사고가 나면 누가 책임지는지를 물어야 한다.
넷째, 하드웨어 바깥의 문제도 남는다. 공격자는 AI가 읽는 이메일이나 문서에 숨은 지시를 넣어 행동을 유도할 수 있고, 정상 계정을 탈취해 합법적인 권한 안에서 악용할 수도 있다. 직원이 과도한 권한을 승인하는 사회공학 공격도 가능하다. 보안 플랫폼 하나로 해결할 수 없는 이유다.
앞으로 볼 변화
이번 발표의 의미는 엔비디아가 새로운 이름을 붙인 보안 제품을 내놓았다는 데만 있지 않다. AI 경쟁의 초점이 “누가 더 좋은 답을 만드는가”에서 “누가 실제 행동을 안전하게 맡길 수 있는가”로 이동하고 있다는 신호다. 에이전트가 메일과 문서, 쇼핑, 금융, 로봇에 연결될수록 모델 회사와 서비스 회사는 안전성을 말로 설명하는 데 그치지 않고 외부에서 강제되는 권한 체계를 보여줘야 한다.
앞으로 확인할 것은 두 가지다. 첫째, 엔비디아가 언급한 파트너들이 실제 제품에서 어떤 승인 화면과 활동 기록을 제공하는지다. 둘째, 독립 보안 연구자들이 오픈셸과 센트리를 시험했을 때 우회 가능성과 성능 부담이 어느 정도인지다. 일반 사용자는 당장 제품명을 외울 필요는 없다. 대신 AI 서비스가 “무엇을 할 수 있는지”, “중요한 행동 전에 다시 묻는지”, “한 일을 되돌리고 조사할 수 있는지”를 확인하면 된다. 이번 발표가 남긴 가장 실용적인 기준은 AI를 믿느냐의 문제가 아니라, AI의 권한을 검증 가능한 방식으로 제한할 수 있느냐는 질문이다.