GPT-6.1 Sol 리뷰
완료한 작업의 품질과 총비용으로 판단하세요.
기존 GPT-6 Sol로 복잡한 코딩이나 반복 수정을 하고 있다면 GPT-6.1 Sol을 우선 비교해 볼 만합니다. 표준 입력·출력 단가는 같고 캐시 읽기 단가는 절반으로 낮아졌습니다. OpenAI가 공개한 여러 평가에서도 성능 개선이 나타납니다. 다만 원인 파악이 어렵거나 재작업 비용이 큰 업무에서는 Astra를 비교 대상에 남겨 두는 편이 합리적입니다.
토큰 단가와 작업을 끝내는 비용은 다릅니다. 공식 코딩 평가에도 새 Sol의 점수가 크게 높아졌지만 작업당 비용은 기존 Sol보다 조금 늘어난 사례가 있습니다. 이 차이를 보면 단순히 ‘Astra를 5분의 1 비용으로 대체한다’는 설명보다 구체적인 판단이 가능합니다.
자료 확인: 2026년 9월 30일 UTC. 공식 문서와 출처를 밝힌 평가 결과를 분석한 리뷰입니다. 독립적인 모델 대조 실험은 실행하지 않았습니다. 비용 예시는 가정한 토큰 수로 계산했습니다. OmniaKey는 이 글을 발행하고 API 게이트웨이를 제공하며, 자체 요금과 OpenAI 직접 API 요금은 구분합니다.
GPT-6.1 Sol에서 달라진 점
공식 API 변경 기록에 따르면 출시일은 2026년 9월 29일이며 모델 ID는 gpt-6.1-sol입니다. 복잡한 코딩, 컴퓨터 사용, 전문 업무를 Astra보다 낮은 비용으로 처리하는 모델로 소개됩니다.
| 항목 | GPT-6.1 Sol |
|---|---|
| 컨텍스트 창 | 1,050,000토큰 |
| 최대 출력 | 128,000토큰 |
| 기본 입력 / 출력 | 텍스트·이미지 / 텍스트 |
| API 추론 강도 | low, medium(기본값), high, xhigh, max |
| 도구 호출 API | Responses |
새 Sol, 기존 Sol, Astra의 컨텍스트와 최대 출력 용량은 같습니다. 이번 변경으로 창이 넓어진 것은 아닙니다. 출력과 추론도 컨텍스트를 사용하며, 용량이 같아도 정보를 찾는 정확도까지 같다는 뜻은 아닙니다. 이 모델은 오디오·비디오를 기본 입출력으로 지원하지 않습니다.
코딩 성능은 같은 추론 강도로 비교
OpenAI 발표의 DeepSWE v1.1 대화형 그래프에서 세 모델의 medium 결과를 확인했습니다. 실제 코드베이스의 복잡한 소프트웨어 개발 작업을 평가한 수치입니다. 비용은 발표자가 측정한 작업당 평균이며, OmniaKey의 실측이나 아래의 가정 계산이 아닙니다.
모델: 모두 medium | DeepSWE v1.1 점수 | 평균 작업당 비용 |
|---|---|---|
| GPT-6.1 Sol | 73.0% | $0.42 |
| GPT-6 Sol | 56.6% | $0.38 |
| GPT-6 Astra | 72.8% | $3.08 |
이 평가에서 새 Sol은 훨씬 낮은 비용으로 Astra에 가까운 점수를 냈습니다. 그러나 0.2%포인트 차이로 전반적인 우위나 통계적 유의성을 주장할 수는 없습니다. 기존 Sol과 비교하면 표준 단가는 같아도 작업당 비용이 $0.38에서 $0.42로 늘었습니다. 실제 토큰 사용량이 중요합니다.
추론 강도를 올린다고 항상 점수가 오르지도 않습니다. 새 Sol은 high에서 75.2%와 $0.65, max에서 71.9%와 $1.57을 기록했습니다. 발표문의 6.4%포인트 개선은 새 Sol의 high와 기존 Sol 최고 점수인 max의 68.8%를 비교한 값입니다. 두 medium 설정의 차이가 아닙니다.
다른 공식 평가에서는 AutomationBench 1.0.6의 medium 점수가 기존 Sol보다 4.8%포인트 높았습니다. OSWorld 2.0의 v2026.08.08 오프라인 세트에서는 max 부분 보상 점수가 기존 Sol보다 7%포인트 높고 Astra 같은 설정보다 2.1%포인트 낮았습니다. 부분 보상을 모든 데스크톱 작업의 완료율로 읽으면 안 됩니다.
영문 발표에 따르면 일부러 고른 어려운 사실성 질문에서, 적어도 하나의 사실 오류가 있는 답변 비율은 low에서 **11.4%에서 7.7%**로 줄었습니다. 일상적인 사용 전체의 오류율은 아닙니다. 같은 발표의 Terminal-Bench Science 0.1에서는 Astra max가 **68.1%**로 가장 높았습니다. 새 Sol을 시험할 근거는 충분하지만 모든 업무에서 Astra를 제외할 근거는 아닙니다.
API 가격과 실제 비용의 차이
아래는 공식 가격표의 OpenAI 직접 API Standard 요금이며, 입력 272K토큰 이하에서 100만 토큰당 미국 달러입니다. 구독 사용량, 게이트웨이 요금, 도구 비용과 세금은 별도입니다.
| 과금 항목 | GPT-6.1 Sol | GPT-6 Sol | GPT-6 Astra |
|---|---|---|---|
| 캐시 미사용 입력 | $2.00 | $2.00 | $10.00 |
| 캐시 읽기 | $0.10 | $0.20 | $1.00 |
| 캐시 쓰기 | $2.50 | $2.50 | $12.50 |
| 출력 | $10.00 | $10.00 | $50.00 |
기존 Sol보다 낮아진 항목은 캐시 읽기뿐입니다. Astra와 비교하면 표준 입력·출력은 5분의 1, 읽기는 10분의 1입니다. 전체 작업 비용이 반드시 같은 비율로 줄어드는 것은 아닙니다.
같은 토큰 수로 네 가지 상황 계산
K는 1,000토큰이고 출력에는 과금되는 추론이 포함됩니다. 세 모델의 토큰 수를 같게 가정했으며 실제 실행량은 달라질 수 있습니다. 읽기 행에서만 유효한 캐시 적중을 가정하고 이전 쓰기 비용은 따로 계산합니다. 도구, 실행 환경, 세금과 게이트웨이 비용은 제외합니다.
| 가정한 사용량 | GPT-6.1 Sol | GPT-6 Sol | GPT-6 Astra |
|---|---|---|---|
| 캐시 미사용 입력 100K + 출력 10K | $0.30 | $0.30 | $1.50 |
| 최초 캐시 쓰기 200K + 미사용 입력 20K + 출력 10K | $0.64 | $0.64 | $3.20 |
| 캐시 읽기 200K + 미사용 입력 20K + 출력 10K | $0.16 | $0.18 | $0.90 |
| 캐시 미사용 입력 300K + 출력 10K, 긴 컨텍스트 요금 | $1.35 | $1.35 | $6.75 |
새 Sol의 읽기 행은 0.20 × $0.10 + 0.02 × $2 + 0.01 × $10 = $0.16입니다. 기존 Sol은 $0.18이므로 **캐시 읽기 단가가 50% 낮아져도 이 요청 전체에서 절약하는 비율은 11.1%**입니다. 최초 쓰기 한 번과 동일한 유효 읽기 열 번을 합치면 $2.24 대 $2.44로 약 8.2% 절감입니다. 공통 접두부가 유효하고 열 번 모두 적중해야 하는 가정입니다.
캐시 문서는 쓰기 요금이 일반 입력에 추가되는 수수료가 아니라고 설명합니다. 입력을 미사용·읽기·쓰기로 나눠 같은 토큰을 중복 계산하지 마세요.
입력 272K를 넘으면 요청 전체에 할증
입력이 272K를 초과하면 요청 전체의 입력·캐시 단가는 2배, 출력 단가는 1.5배가 됩니다. 캐시 입력도 길이에 포함됩니다. 따라서 새 Sol의 300K 예시는 0.30 × $4 + 0.01 × $15 = $1.35입니다.
추론 토큰도 출력 요금으로 계산합니다. Fast 단가는 Standard의 2배, Batch와 Flex는 절반입니다. 가격 배율이 완료 속도의 배율은 아니므로 도구 대기와 재시도 시간도 기록해야 합니다.
기존 Sol에서 옮기기 전 세 가지 확인
GPT-6 가이드에 따라 기존 Agent의 요청을 점검하세요.
- 추론 설정: 기존 Sol은
none을 지원하지만 새 Sol은none과minimal을 지원하지 않습니다. 지원하는 설정으로 변경한 뒤 사용량과 지연을 다시 확인하세요. API 기본값은medium이며 클라이언트 기본값과는 다를 수 있습니다. - 도구 인터페이스: 기존 Sol은
reasoning_effort: "none"일 때만 Chat Completions에서 함수를 호출할 수 있습니다. 새 Sol의 도구 호출에는 Responses가 필요합니다. 도구 없는 Chat Completions 요청은 계속 지원합니다. - 샘플링 매개변수: 추론 사용 시
temperature,top_p같은 미지원 설정을 제거하세요. SDK나 게이트웨이가 자동으로 넣는 값도 확인해야 합니다.
Codex CLI의 공식 선택 명령은 다음과 같습니다.
codex --model gpt-6.1-sol
대화형 세션에서는 /model을 사용합니다. 문서상 안내이며 이번 리뷰에서 계정으로 직접 호출한 결과는 아닙니다.
어디에서 사용할 수 있나
Codex 모델 안내는 출시 대상에 Plus, Pro, Business, Enterprise, Edu의 해당 Work·Codex 환경을 포함합니다. Enterprise와 Edu는 관리자가 활성화해야 하며 Free와 Go는 최초 출시 대상에서 제외됩니다. ChatGPT에서는 출시 시 일반 Chat이 아닌 Work와 Codex에서 제공됩니다. 사용 가능한 속도 모드는 계정·클라이언트·워크스페이스에서 확인하세요.
구독 및 credits 사용량은 API 가격과 다릅니다. Codex credits에는 별도의 캐시 쓰기 요금이 없습니다. 앞의 API 계산을 구독에 포함된 작업 횟수로 바꿔 약속할 수는 없습니다.
기본 모델로 바꿀 가치가 있는지 검증하기
기존 Sol 사용자에게는 같은 표준 단가와 개선된 공식 코딩 결과가 충분한 시험 이유입니다. Astra 사용자라면 자주 실행하고 결과를 명확히 확인할 수 있는 작업부터 비교하고, 실패나 수작업 수정 비용이 큰 업무에서는 대안을 유지하세요.
작은 시험으로 재현된 버그 두 개, 여러 파일을 바꾸는 작업 두 개, 근거가 있는 문서 질문 두 개를 권합니다. 각 모델로 각 작업을 세 번씩 새 작업 환경에서 실행하고 입력·도구·권한·재시도 한도를 고정하세요. 우선 모두 medium으로 비교한 뒤 강도를 조정한 실험은 따로 기록합니다. 이는 제안한 방법이며 이번에 실행한 실험이 아닙니다.
통과 여부, 누락, 전체 시간, 과금 토큰, 실패와 수작업 수정을 기록하세요. 모든 시도의 비용을 통과한 결과 수로 나누되, 성공이 없으면 ‘통과 결과 없음’으로 남깁니다. 작은 시험으로 보편적인 성공률을 추정할 수는 없습니다.
이전 버전의 배경은 기존 GPT-6 Sol 리뷰와 기존 Sol과 Astra 비교에서 볼 수 있습니다. OmniaKey에 표시된 경로와 요금은 모델 목록을 확인하세요. 공식 출시가 특정 게이트웨이의 제공 여부를 보장하지는 않습니다. 본문의 OpenAI 원문 링크는 영어입니다.