GPT-6.1 Sol 출시: 에이전트 코딩과 컴퓨터 사용 비용 구조가 다시 바뀐다
OpenAI가 GPT-6.1 Sol을 공개했다. 발표의 핵심 메시지는 분명하다. GPT-6 Astra에 가까운 지능을 제공하면서, agentic coding, computer use, 전문 업무에서 비용을 크게 낮추겠다는 것이다. OpenAI는 GPT-6.1 Sol이 Astra 표준 입출력 토큰 가격의 5분의 1 수준이며, cached input은 100만 토큰당 0.10달러라고 설명했다.
이번 출시는 모델 성능 경쟁만으로 보기 어렵다. 에이전트 제품을 만드는 개발자에게 더 중요한 것은 작업당 비용과 반복 컨텍스트 비용이다. 코딩 에이전트, 업무 자동화 에이전트, 문서 분석 에이전트는 한 번의 답변보다 여러 번의 도구 호출, 파일 읽기, 상태 유지, 수정 반복이 비용을 만든다. cached input 가격 인하는 이런 제품의 단위 경제를 직접 건드린다.
검색 의도는 “GPT-6.1 Sol 가격”, “gpt-6.1-sol API”, “OpenAI Codex 모델”, “AI agent cost optimization”으로 잡힌다. 실무 개발자가 알고 싶은 것은 발표 문구가 아니라 어떤 작업을 Sol에 맡기고, 어떤 작업은 Astra나 다른 모델에 남겨야 하는지다.
가격과 제공 범위
OpenAI 발표에 따르면 GPT-6.1 Sol은 ChatGPT Work와 Codex에서 Plus, Pro, Business, Enterprise, Edu 사용자에게 제공된다. Chat에는 아직 제공되지 않는다. 개발자는 OpenAI API에서 gpt-6.1-sol 모델명으로 사용할 수 있다. 표준 API 가격은 입력 100만 토큰당 2달러, cached input 100만 토큰당 0.10달러, 출력 100만 토큰당 10달러다.
이 숫자에서 눈에 띄는 것은 cached input이다. 일반 입력보다 95% 낮고, GPT-6 Sol의 cached input보다도 50% 낮다. 장문 시스템 프롬프트, 리포지토리 요약, 도구 설명, 정책 문서, 반복되는 작업 컨텍스트를 많이 재사용하는 에이전트에는 큰 차이가 난다.
OpenAI는 며칠 내 Codex에서 GPT-6.1 Sol Ultrafast도 제공한다고 예고했다. 표준 속도 대비 최대 8배 빠른 토큰 생성을 목표로 한다. 만약 실제 체감 지연이 줄어든다면, 대화형 코딩 에이전트와 실시간 업무 보조 도구에서 Sol의 위치가 더 강해질 수 있다.
벤치마크에서 강조된 작업 유형
OpenAI는 GPT-6.1 Sol이 DeepSWE 1.1에서 GPT-6 Astra와 비슷한 수준의 복잡한 소프트웨어 엔지니어링 과제를 훨씬 낮은 비용으로 수행한다고 밝혔다. DeepSWE는 실제 코드베이스에서 장기 과제를 해결하는 평가다. 단순 알고리즘 문제가 아니라 파일 탐색, 수정, 테스트, 재시도가 포함된 작업에 가깝다.
전문 문서 이해에서는 GDP.pdf를 제시했다. 이 평가는 금융, 의료, 법률 등 실제 전문 워크플로우에서 가져온 복잡한 PDF, 표, 차트, 세부 조항을 이해하는 능력을 본다. OpenAI는 GPT-6.1 Sol이 Opus 5.5 with fallbacks보다 낮은 작업당 비용으로 더 높은 점수를 냈고, Astra 성능에 접근한다고 설명했다.
AutomationBench에서는 47개 도구를 사용하는 영업, 마케팅, 운영, 고객지원, 재무, HR 업무 흐름을 평가한다. OpenAI는 GPT-6.1 Sol이 medium reasoning effort에서 Opus 5.5보다 2.2%p 높고, GPT-6 Sol보다 4.8%p 높다고 밝혔다. 이 수치는 업무 자동화 에이전트를 만드는 팀에게 특히 중요하다. 실제 제품에서는 모델이 여러 도구를 순서대로 정확히 호출해야 하기 때문이다.
컴퓨터 사용 영역에서는 OSWorld 2.0 offline set을 근거로 들었다. GPT-6.1 Sol은 최대 reasoning effort에서 GPT-6 Sol보다 7%p 높고, Astra와 2.1%p 차이까지 접근했으며, 작업당 비용은 Astra의 약 7분의 1이라고 설명됐다. 최근 GitHub Copilot computer use 공개 프리뷰와 맞물려 보면, 화면 조작형 에이전트의 비용 구조도 빠르게 낮아지고 있다.
factuality와 안전성 개선도 비용만큼 중요하다
OpenAI는 GPT-6.1 Sol이 낮은 reasoning effort에서 factual error 비율을 GPT-6 Sol의 11.4%에서 7.7%로 낮췄다고 밝혔다. 약 32% 감소다. 평가 자체는 사용자가 이전 모델의 오류를 신고한 어려운 대화에서 측정됐고, 일반 사용 환경을 대표하지는 않는다고 단서를 달았다. 그래도 반복 업무 에이전트에서는 작은 오류율 차이가 누적된다.
안전성 부분에서는 GPT-6.1 Sol이 사용자 의도와 명시적 제한을 더 잘 존중하고, agentic task에서 무단 결과를 피하는 평가에서 GPT-6 Sol보다 낮은 실패율을 보였다고 설명했다. 자동 안전 리뷰어를 우회하려는 시도는 관찰되지 않았다고 밝혔다.
개발자 입장에서는 이 대목이 중요하다. 비용이 낮아지면 더 많은 작업을 모델에 맡기고 싶어진다. 하지만 에이전트 작업은 실패했을 때 단순 오답보다 피해가 크다. 파일 수정, 결제, 데이터 변경, 이메일 발송처럼 외부 상태를 바꾸는 작업은 모델이 저렴해졌다고 바로 자동화하면 안 된다.
어떤 작업에 Sol을 써야 하나
GPT-6.1 Sol의 포지션은 “가장 어려운 한 방”보다 “자주 실행되는 고급 작업”에 가깝다. 리포지토리 분석, 코드 리뷰 초안, 테스트 실패 원인 추적, PDF 기반 질의응답, 업무 도구 호출, 브라우저 또는 데스크톱 조작처럼 반복이 많고 컨텍스트 재사용이 많은 작업이 먼저 떠오른다.
반대로 최고 난도의 과학 연구, 불확실성이 큰 보안 분석, 생명과학 또는 사이버 dual-use 작업처럼 실패 비용이 큰 영역은 Astra나 더 강한 검증 절차가 필요할 수 있다. OpenAI도 Terminal-Bench Science 0.1에서 Astra가 가장 높은 점수를 냈고 가장 어려운 과학 연구 작업에 사용해야 한다고 설명했다.
실무 기준은 모델 이름보다 라우팅 정책이다. 예를 들어 1차 분석과 반복 수정은 Sol에 맡기고, 최종 설계 검토나 고위험 결정은 Astra 또는 다른 frontier 모델로 승격한다. 출력 결과는 테스트, 정적 분석, 문서 검증, 사람 리뷰와 연결해야 한다.
비용 계산 방식이 바뀐다
기존에는 입력·출력 토큰 가격만 보고 모델을 골랐다. 에이전트 시대에는 이 방식이 부족하다. 같은 작업이라도 모델이 몇 번 도구를 호출하는지, 실패 후 몇 번 재시도하는지, cached input을 얼마나 재사용하는지에 따라 실제 비용이 달라진다.
예를 들어 리포지토리 코딩 에이전트가 매번 같은 시스템 지침, 도구 설명, 파일 맵, 아키텍처 문서를 넣는다면 cached input 가격이 결정적이다. GPT-6.1 Sol의 cached input 0.10달러는 이런 구조에서 경쟁력이 있다. 그러나 출력이 길고 반복 수정이 많다면 출력 토큰 10달러도 무시할 수 없다.
따라서 제품팀은 모델별 가격표보다 작업당 비용을 측정해야 한다. 한 이슈를 해결하는 데 평균 입력, cached input, 출력, 도구 호출, 테스트 실행 시간이 얼마나 드는지 봐야 한다. 그 다음 모델을 고르는 편이 맞다.
개발팀 실행 체크리스트
- API에서
gpt-6.1-sol을 별도 라우팅 대상으로 추가하되 모든 트래픽을 바로 옮기지 않는다. - 반복 컨텍스트가 큰 워크플로우에서 cached input 적용률을 먼저 측정한다.
- 코딩 에이전트는 이슈당 비용, 성공률, 재시도 횟수, 테스트 통과율을 함께 본다.
- 최고 난도 과제는 Sol에서 바로 끝내지 말고 강한 모델 또는 사람 리뷰로 승격한다.
- 화면 조작, 파일 수정, 이메일 발송 같은 상태 변경 작업에는 승인 단계를 둔다.
- factuality가 중요한 문서 분석은 출처 위치와 근거 문장을 함께 반환하게 한다.
- Sol, Astra, Opus 계열을 단순 벤치마크 점수가 아니라 작업 유형별 비용으로 비교한다.
- cached input이 적용되지 않는 프롬프트 구조라면 시스템 지침과 도구 설명 재사용 방식을 정리한다.
- Ultrafast가 제공되면 지연 시간과 품질 저하 여부를 별도로 A/B 테스트한다.
- 모델 업그레이드 후 기존 안전 테스트와 회귀 테스트를 다시 실행한다.
출처: OpenAI, “Introducing GPT-6.1 Sol”, 2026년 9월 29일.