클로드 소넷 5.5 출시…더 빠르고 싸졌다는 새 모델, 직장인은 무엇이 달라지나
앤트로픽은 2026년 9월 28일 ‘클로드 소넷 5.5(Claude Sonnet 5.5)’를 출시했다. 회사는 이전 소넷 5보다 출력 속도가 30% 이상 빠르고, 같은 일을 처리할 때 비용은 최대 30% 낮아질 수 있다고 설명한다. 소넷 5.5는 클로드 웹과 앱을 포함한 모든 플랫폼에서 제공되며 아마존웹서비스, 구글 클라우드, 마이크로소프트 애저에서도 사용할 수 있다. 회사가 제시한 기본 요금은 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러로 이전 소넷 5와 같다.
가격표가 그대로인데 “더 싸졌다”는 표현이 붙은 이유는 같은 일을 끝내는 데 필요한 글자 처리량과 작업 단계가 줄었다는 회사 측 시험 결과 때문이다. 즉 메뉴의 단가는 같지만 일을 더 적은 단계와 더 짧은 출력으로 끝내면 최종 청구액이 내려갈 수 있다는 논리다. 일반 사용자는 토큰 단가보다 답변을 기다리는 시간, 결과를 다시 고치는 횟수, 유료 사용량 한도에 먼저 체감할 가능성이 크다.
검색하는 사람이 알고 싶은 핵심
이번 발표를 본 독자가 궁금해할 질문은 “최상위 모델이 아닌 소넷 5.5로도 보고서·슬라이드·자료 정리 같은 일상 업무를 충분히 맡길 수 있는가?”다. 앤트로픽은 소넷 5.5를 복잡하고 열린 판단에 강한 오퍼스 5.5의 저렴하고 빠른 보완 모델로 설명한다. 범위가 분명한 일상 업무, 문서와 슬라이드 제작, 버그 수정, 반복 작업에 특히 적합하다는 주장이다.
결론부터 말하면 반복적인 초안과 정리 업무에는 선택지가 좋아졌을 가능성이 크지만, 중요한 판단까지 자동으로 넘길 근거가 생긴 것은 아니다. 회사가 공개한 시험에서 소넷 5.5는 여러 업무 평가에서 이전 모델보다 크게 나아졌고 일부 항목에서는 오퍼스 5.5에 가까웠다. 그러나 벤치마크와 초기 고객 평가는 실제 사용 환경의 모든 오류를 대신하지 못한다. 계약서, 재무 수치, 의료·법률 판단, 대외 발표 자료는 여전히 원문 대조와 사람의 승인이 필요하다.
소넷과 오퍼스는 어떻게 다른가
클로드 모델 제품군에서 ‘오퍼스’는 복잡하고 장시간의 판단이 필요한 상위 모델, ‘소넷’은 성능과 속도·비용의 균형을 노린 주력 모델에 가깝다. 앤트로픽은 소넷 5.5가 잘 정의된 일상 작업, 빠른 반복, 문서·슬라이드·스프레드시트 제작에 강하다고 설명한다. 반면 오퍼스 5.5는 문제 범위가 모호하고 여러 조건을 오래 검토해야 하는 작업에서 여전히 뚜렷하게 강하다고 인정했다.
회사에서 예산안을 정리하는 상황을 생각해 보자. 이미 양식과 자료가 있고 항목을 분류해 표와 설명을 만드는 일은 소넷이 맡기 좋다. 반대로 시장 전망, 조직의 이해관계, 불완전한 자료를 함께 고려해 투자 우선순위를 정하는 일은 더 많은 판단이 필요하다. 이 경우 상위 모델을 쓰더라도 사람이 최종 결정을 내려야 한다. 모델 선택의 핵심은 “어느 모델이 무조건 최고인가”가 아니라 “업무의 모호함과 실패 비용이 얼마나 큰가”다.
소넷 5.5는 이전 모델보다 빠르다는 점을 강조한다. 답변 속도가 30% 이상 높아지면 한 번의 긴 보고서보다 짧은 질문을 여러 차례 주고받는 작업에서 체감이 크다. 문구를 고치고, 표의 구성을 바꾸고, 슬라이드 순서를 다시 짜는 반복 작업은 대기 시간이 짧을수록 흐름이 덜 끊긴다. 반면 복잡한 조사처럼 자료 수집과 검증이 전체 시간을 차지하는 일에서는 모델 출력 속도만 빨라져도 업무 시간이 같은 비율로 줄지는 않는다.
“최대 30% 저렴”을 정확히 읽는 법
앤트로픽의 가격표에서 소넷 5.5는 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러다. 캐시 읽기는 100만 토큰당 0.20달러다. 회사는 이전 소넷 5와 같은 단가를 유지했지만, 같은 작업을 수행하는 데 더 적은 토큰을 사용해 작업당 비용이 최대 30% 낮아진다고 주장한다. ‘최대’라는 표현은 모든 작업에서 30%가 절감된다는 뜻이 아니다.
개인 구독자는 토큰 청구서를 직접 보지 않는 경우가 많다. 이때 효율 개선은 사용량 제한 안에서 더 많은 작업을 하거나, 긴 대화가 덜 끊기거나, 응답이 빨라지는 형태로 나타날 수 있다. 기업 고객은 작업당 평균 토큰, 재시도 횟수, 사람의 검수 시간을 함께 봐야 한다. 모델 비용이 줄어도 오류 수정 시간이 늘면 전체 비용은 오히려 커질 수 있기 때문이다.
예를 들어 고객 문의 1만건을 분류하는 회사라면 답변 한 건당 모델 비용이 조금만 줄어도 합계가 커진다. 반면 한 달에 보고서 몇 건을 작성하는 개인은 30%라는 비율보다 초안 품질과 수정 횟수가 더 중요하다. ‘싼 모델’이라는 광고 문구보다는 내 업무 샘플을 같은 조건으로 시험해 결과 품질과 전체 처리 시간을 비교하는 것이 정확하다.
앤트로픽은 노력 수준을 조절해 속도와 품질을 바꿀 수 있다고 설명한다. 낮은 설정은 빠르고 적은 토큰을 쓰며, 높은 설정은 더 오래 검토한다. 클로드 앱의 기본값은 중간 수준이다. 사용자가 알아야 할 것은 높은 설정이 항상 더 좋은 결과를 보장하지 않는다는 점이다. 작업 범위가 단순한데 지나치게 오래 생각하면 비용과 시간만 늘 수 있고, 평가 기준에 없는 추가 작업을 해 오히려 결과가 나빠질 수도 있다.
직장인이 체감할 가능성이 큰 업무
첫째는 문서와 발표자료 초안이다. 앤트로픽은 소넷 5.5가 문장 표현과 디자인 감각, 슬라이드 템플릿 준수 능력이 개선됐다고 설명한다. 회사 내부 시험에서는 공개 기업의 실적 자료와 통화 기록, 슬라이드 양식을 주고 10장짜리 운영 보고서를 만들게 했으며 전문가 두 명이 첫 초안을 바로 보낼 수 있는 수준으로 평가했다고 밝혔다. 다만 이는 앤트로픽의 자체 사례이므로, 모든 회사 양식과 한국어 발표자료에서 같은 결과가 나온다고 볼 수는 없다.
둘째는 고객 지원과 반복적인 사무 처리다. 초기 시험에 참여한 젠데스크는 실제 지원 사례에서 이전에 사용하던 클로드 모델보다 잘못된 판단이 줄고 티켓 처리 속도가 20% 빨라졌다고 말했다. 슬랙은 기존 프롬프트를 바꾸지 않아도 내부 평가 대부분에서 소넷 5보다 나았고 출력 토큰을 약 14% 적게 썼다고 밝혔다. 이 수치는 각 회사가 제공한 평가이며 독립적인 전체 시장 비교는 아니다. 그래도 기업이 관심을 갖는 지점이 단순 점수보다 처리 시간과 비용이라는 사실은 보여준다.
셋째는 자료에서 숫자와 근거를 찾는 일이다. 박스(Box)는 새 모델이 원문을 다시 확인해 이전 모델이 놓친 오류를 잡았다고 평가했다. 이런 기능이 실제로 안정적이라면 회의록, 계약 자료, 조사 문서에서 근거를 찾아 초안을 만드는 데 도움이 될 수 있다. 하지만 AI가 “원문을 확인했다”고 말하는 것과 실제로 모든 인용이 정확한 것은 별개다. 보고서에 들어가는 숫자와 인용문은 링크와 페이지를 사람이 확인해야 한다.
넷째는 디자인과 콘텐츠 수정이다. 소넷 5.5는 이미지 이해와 시각 자료 처리 능력이 개선됐다고 회사는 주장한다. 웹 화면, 차트, 슬라이드를 보고 수정 방향을 제안하거나 템플릿에 맞춰 자료를 다듬는 작업에 유용할 수 있다. 일반 사용자는 멋진 첫 결과보다 기존 브랜드 규칙을 지키는지, 표의 숫자가 원자료와 일치하는지, 편집 가능한 형식으로 결과가 나오는지를 확인해야 한다.
성능 수치는 어디까지 믿어야 하나
앤트로픽은 소넷 5.5가 실무 작업 평가인 GDPval-AA에서 오퍼스 5.5와 거의 같은 수준을 기록했고, 장시간 지식 업무와 컴퓨터 사용, 차트 인식에서도 소넷 5를 크게 앞섰다고 설명했다. 코딩 평가 수치도 대폭 상승했다고 밝혔다. 하지만 벤치마크는 정해진 과제와 채점 방식 안에서 나온 결과다. 이메일의 애매한 지시, 깨진 문서, 회사 고유의 약어, 최신 정보처럼 현실의 변수를 모두 담지 못한다.
회사도 몇 가지 주의점을 공개했다. 일부 평가는 출시 전 배치에서 구조화된 출력에 영향을 줄 수 있는 오류가 있는 상태로 진행됐으며, 앤트로픽은 그 오류가 점수를 조금 낮췄을 가능성이 있다고 설명한다. 경쟁 모델의 이미지 이해 오류 수정이 비교 점수에 아직 반영되지 않았을 수 있다는 주석도 있다. 이런 설명은 투명성 측면에서 도움이 되지만, 동시에 숫자 하나로 모델 순위를 확정하기 어렵다는 뜻이다.
초기 고객 인용도 참고 자료일 뿐이다. 출시 파트너는 보통 모델을 잘 활용할 준비가 된 회사이고, 성공 사례가 발표문에 선택될 가능성이 높다. 한국어 문서, 국내 회사 양식, 개인 사용자의 불완전한 지시에서 같은 성능이 나오는지는 별도로 시험해야 한다. 가장 좋은 검증 방법은 자주 하는 업무 10~20개를 모아 이전 모델과 새 모델에 같은 자료와 기준을 주고 정확성, 수정 횟수, 처리 시간, 비용을 비교하는 것이다.
안전장치가 강화됐다는 말의 의미
앤트로픽은 약 1,850개 상황을 사용한 자동 행동 감사에서 소넷 5.5가 정렬, 오용 저항, 정직성의 대부분 항목에서 소넷 5와 같거나 개선됐다고 밝혔다. 여기서 정렬은 모델이 사용자의 의도와 안전 기준을 따르는 정도를 뜻한다. 회사는 새 모델이 격리된 실행 환경에서 빠져나가려는 시도를 얼마나 적게 하는지도 시험했으며, 시험한 자사 모델 가운데 컨테이너 한계를 탐색할 가능성이 가장 낮았다고 설명한다.
동시에 앤트로픽은 어떤 평가도 모든 실패를 잡아내지 못하며 발견하지 못한 성향이 있을 수 있다고 적었다. 이 문장이 중요하다. 안전 평가에서 좋은 점수를 받았다는 것은 위험이 0이라는 뜻이 아니다. 특히 소넷 5.5의 사이버 보안 능력이 크게 높아져 회사는 오퍼스 계열과 비슷한 별도 보호 장치를 적용했다. 고위험 요청은 더 제한적인 모델로 전환될 수 있으며, 일반적인 소프트웨어 개발과 버그 수정은 계속 허용된다고 설명한다.
생물학 관련 보호 장치는 소넷 5와 같고, 유해한 요청을 막는 과정에서 일부 정상적인 미생물학·바이러스학 질문이 잘못 제한될 수 있다고 회사는 인정했다. 또 대규모 가짜 계정으로 모델의 추론 능력을 복제하려는 공격을 막기 위한 분류 장치도 추가됐다. 일반 사용자는 대부분 변화를 느끼지 못하겠지만, 연구자와 전문가는 정상 업무가 막힐 때 검증 프로그램과 이의 제기 절차가 실제로 작동하는지 확인할 필요가 있다.
지금 누구에게 제공되나
앤트로픽 공식 발표에 따르면 소넷 5.5는 출시 시점부터 모든 플랫폼에서 사용할 수 있다. 클로드의 소비자용 서비스뿐 아니라 앤트로픽 플랫폼, 아마존웹서비스, 구글 클라우드, 마이크로소프트 애저가 포함된다. 지역과 계정 유형, 회사 관리 정책에 따라 화면에 표시되는 시점은 다를 수 있다. 개인 사용자는 모델 선택 메뉴와 요금제별 사용량 제한을 확인해야 한다.
회사 발표는 소넷 5.5가 ‘제로 데이터 보존’ 옵션을 지원한다고 설명한다. 이는 특정 기업용 설정에서 입력과 출력을 장기 보관하지 않도록 구성할 수 있다는 의미이지, 모든 개인 대화가 자동으로 기록되지 않는다는 뜻은 아니다. 민감한 회사 자료를 넣기 전에는 조직의 계약, 데이터 보존 설정, 학습 사용 여부, 연결된 외부 도구의 정책을 확인해야 한다.
과장과 한계
첫째, “오퍼스에 가까운 성능”은 모든 업무에서 오퍼스를 대체한다는 뜻이 아니다. 앤트로픽 스스로 복잡하고 열린 문제, 오래 지속되는 판단에서는 오퍼스 5.5가 분명히 강하다고 밝혔다. 둘째, “최대 30% 저렴”은 토큰 단가 인하가 아니라 회사 시험에서 작업당 사용량이 줄었다는 주장이다. 실제 절감 폭은 업무와 설정에 따라 달라진다.
셋째, 더 빠른 모델이 더 정확한 모델과 같은 뜻은 아니다. 빠른 초안이 도움이 되더라도 사실 검증과 최종 책임은 남는다. 넷째, 발표 자료의 성능 수치와 고객 평가는 대부분 앤트로픽과 출시 파트너가 제공했다. 독립 평가와 장기간의 실제 사용 자료가 쌓이기 전에는 회사 주장과 검증된 사실을 구분해야 한다.
다섯째, 새 모델이 자료를 더 잘 만들수록 사용자는 결과를 쉽게 신뢰할 수 있다. 문장이 매끄럽고 슬라이드가 보기 좋아도 잘못된 숫자와 존재하지 않는 출처가 숨어 있을 수 있다. 품질이 높아질수록 검수 필요성이 사라지는 것이 아니라, 오류를 발견하기 어려워질 수 있다는 점도 기억해야 한다.
실제로 달라지는 점
소넷 5.5의 가장 현실적인 변화는 ‘최고 성능 모델을 써야만 괜찮은 결과가 나온다’는 비용 부담을 낮추려는 시도다. 문서 정리, 고객 지원, 자료 추출, 슬라이드 초안처럼 범위가 분명한 업무에서 더 빠른 속도와 적은 작업량이 실제로 확인된다면 개인은 대기 시간을 줄이고 기업은 대규모 처리 비용을 낮출 수 있다.
앞으로 확인할 것은 세 가지다. 한국어 문서와 국내 업무 양식에서도 품질 개선이 유지되는지, “최대 30%”라는 작업당 비용 절감이 독립 평가에서 어느 정도 재현되는지, 강화된 안전장치가 정상적인 전문 업무를 과도하게 막지 않는지다. 새 모델을 바로 모든 업무의 기본값으로 바꾸기보다 자주 하는 작업 몇 가지에서 이전 모델과 나란히 비교하는 편이 안전하다. 결과의 정확성, 수정 횟수, 대기 시간, 최종 비용을 함께 보면 광고 문구보다 내 업무에 맞는 답을 얻을 수 있다.