오퍼스 5.5 vs 소넷 5.5
검증된 결과와 작업 총비용으로 선택하세요.
클로드 오퍼스 5.5와 소넷 5.5는 작업 완료 품질과 총비용으로 비교해야 합니다. 요구사항과 통과 기준이 명확한 코딩은 소넷을 기준으로 평가하기 좋습니다. 원인 파악이 어렵거나 여러 서비스에 걸친 변경, 잘못된 구현의 수정 비용이 큰 작업은 오퍼스의 추가 비용이 가치가 있는지 확인합니다. 모든 작업에 적용되는 성능 순위는 아닙니다.
Claude Sonnet 5.5의 표준 입력·출력 단가는 Claude Opus 5.5의 절반이지만 캐시 읽기는 같은 가격입니다. 공식 코딩 평가도 한 모델이 전부 이기지 않습니다.
공식 자료 확인: 2026년 9월 29일. 독립적인 모델 대결 실험은 진행하지 않았습니다. 점수는 출처가 있는 공개 결과이고 비용은 토큰 수를 고정한 계산입니다. 이 글을 발행하는 OmniaKey는 API 게이트웨이를 제공하며, 자체 요금은 Anthropic 직결 API 요금과 별개입니다.
오퍼스 5.5와 소넷 5.5의 차이
Opus 5.5는 2026년 9월 22일, Sonnet 5.5는 9월 28일 출시됐습니다. 이전 버전은 Opus 5.5와 Sonnet 5 비교에서 다룹니다.
| 항목 | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Claude API 모델 ID | claude-sonnet-5-5 | claude-opus-5-5 |
| 컨텍스트 / 표준 최대 출력 | 1M / 128K 토큰 | 1M / 128K 토큰 |
| 입력 → 출력 | 텍스트·이미지 → 텍스트 | 텍스트·이미지 → 텍스트 |
| API 기본 effort | high | medium |
| 추론 | Adaptive, between_tools 지원 | Adaptive, 항상 켜짐 |
| 공식 지연 분류 | Fast | Moderate |
| 입력 / 출력 단가 | $2 / $10 | $4 / $20 |
| 캐시 읽기 | $0.20 | $0.20 |
단가는 토큰 100만 개당 USD입니다. 공식 모델 문서의 용량이 같다고 정보 검색 정확도까지 같지는 않습니다. 입력과 출력은 컨텍스트 제한을 함께 지켜야 합니다. 300K 출력은 별도 Batch API 베타 기능이며 일반 동기 호출의 한도가 아닙니다.
코딩 작업에는 어떤 모델을 쓸까
재현 가능한 버그, 테스트가 있는 작은 기능, 범위가 좁은 코드 리뷰, 구조화된 문서 추출부터 소넷을 평가해 보세요. 저렴한 단가가 의미 있으려면 같은 품질 기준을 통과해야 합니다.
서비스 간 원인 불명의 장애, 미묘한 호환 조건이 있는 마이그레이션, 긴 조사는 오퍼스를 평가할 후보입니다. 두 모델에 같은 자료와 통과 조건을 제공하고 수정 작업이 줄어드는지 봅니다. 더 비싸다는 이유만으로 정확하거나 안전하다고 판단하지 않습니다.
긴 문서에서는 출처 인용과 조건 누락을 확인하고, 이미지 작업은 실제 스크린샷·차트로 평가합니다. 이미지 입력은 이미지 생성 기능을 뜻하지 않습니다. 이 글은 비용을 고려한 평가 순서를 제안하지만, Anthropic의 일반 가이드는 대부분의 작업을 Opus 5.5로 시작하도록 권합니다. 품질이 우선이면 그 출발점도 가능합니다. Claude Code 모델 선택 가이드에서 더 넓은 선택지를 다룹니다.
공식 벤치마크에 하나의 승자가 없는 이유
Sonnet 5.5 발표의 동일한 비교 표에서 가져온 수치입니다. OmniaKey가 재실행한 결과가 아닙니다.
| 평가 | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% (max) | 66.4% (xhigh) |
| FrontierCode 1.1 Main | 46.2% (max), 52.1% (xhigh) | 54.4% |
| CursorBench 4.0 | 55.5% | 57.8% |
| GDPval-AA v2.1 | 1844 | 1846 |
시스템 카드 §8.5에 따르면 Terminal-Bench는 66개 작업을 모델마다 5회, 총 330회씩 실행했습니다. 각 시도를 독립으로 가정한 표준오차는 소넷 ±2.5, 오퍼스 ±2.6%포인트입니다. Claude Code --bare 모드와 안전장치가 적용됐고, 일부 요청은 대체 모델로 처리됐습니다. 영향을 받은 시도 비율도 달랐습니다. 4.2%포인트 차이를 모든 코딩 작업의 우위나 통계적 유의성으로 확대해서는 안 됩니다.
FrontierCode에서 소넷의 max는 xhigh보다 낮습니다. 발표 각주는 더 잦은 리뷰 흐름이 일부 분석 사례에서 시간 초과나 범위 밖 수정으로 이어졌다고 설명합니다. 더 많은 추론이 항상 더 좋은 결과를 보장하지 않습니다.
GDPval은 백분율이 아닌 점수입니다. Sonnet의 GDPval-AA·AA-Briefcase 평가에는 이후 수정된 사전 출시 구조화 출력 버그도 관련돼 있습니다. 세부 변화는 Sonnet 5.5 리뷰와 Opus 5.5 리뷰를 참고하세요.
API 가격과 실제 작업 비용
공식 요금표의 글로벌 표준 직결 API 가격입니다. 단위는 USD / 100만 토큰이며 세금, 도구, 지역 옵션 및 다른 플랫폼 요금은 별도입니다.
| 과금 항목 | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| 캐시되지 않은 입력 | $2 | $4 |
| 과금 출력 | $10 | $20 |
| 5분 캐시 쓰기 | $2.50 | $5 |
| 1시간 캐시 쓰기 | $4 | $8 |
| 캐시 읽기 | $0.20 | $0.20 |
과금 출력에는 추론 토큰도 포함됩니다. 최소 캐시 가능 길이는 두 모델 모두 512토큰이지만, 캐시 적중 여부는 usage로 확인해야 합니다. 아래는 토큰 양을 고정한 가상 계산이며, 여러 요청의 합계일 수 있습니다. 각 요청은 개별 용량 제한을 지켜야 합니다.
| 동일한 토큰 작업량 | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| 일반 입력 100K + 과금 출력 20K | $0.40 | $0.80 |
| 위 작업량 + 첫 5분 캐시 쓰기 800K | $2.40 | $4.80 |
| 일반 입력 100K + 유효한 캐시 읽기 800K + 출력 20K | $0.56 | $0.96 |
마지막 행은 소넷이 0.1 × 2 + 0.8 × 0.20 + 0.02 × 10 = $0.56, 오퍼스가 0.1 × 4 + 0.8 × 0.20 + 0.02 × 20 = $0.96입니다. 읽기 단계 차이는 약 1.71배이며 이전 쓰기 비용은 별도입니다. 쓰기 토큰을 일반 입력으로 다시 계산하면 안 됩니다.
실제 작업에서는 사용량과 재시도가 달라집니다. 실패까지 포함한 전체 비용을 검증 통과 결과 수로 나누고, 실제 사람이 고친 시간은 별도로 기록해야 합니다.
속도와 추론 설정
Sonnet 5.5의 출력 30% 이상 가속과 작업 비용 최대 30% 절감은 Sonnet 5 대비 공식 주장입니다. Opus 5.5 대비 수치나 API 단가 인하가 아닙니다. Opus 5.5의 약 40% 작업 비용 절감도 Opus 5와 비교한 것입니다.
소넷은 API에서 high, Claude Code와 앱에서 medium이 기본입니다. 오퍼스 API는 medium입니다. 같은 effort 이름도 같은 계산 예산은 아닙니다. 첫 유용한 출력까지의 시간과 검증 완료까지 걸린 시간을 나누어 봐야 합니다. 빠른 첫 답변 뒤에 수정이 반복될 수 있기 때문입니다.
모델을 바꾸기 전에 확인할 것
Sonnet 이전 문서와 Opus 이전 문서를 함께 확인하세요. Sonnet의 between_tools는 high 이하에서 선행 추론을 끄지만 모든 추론을 없애지는 않습니다. Opus는 adaptive thinking을 계속 사용합니다.
두 모델 모두 강제 tool_choice의 any와 tool을 거부합니다. 엄격한 도구 인자 검증이 도구 호출 자체를 강제하지는 않습니다. 플랫폼별 지원도 확인해야 합니다. Thinking blocks의 모델·계정·대화 보존 규칙을 지키고, 비교는 새 대화에서 시작합니다. 도구 사이 진행 상황이 기본 표시에서 생략되는 thinking blocks로 올 수 있으므로 블록 타입별 파싱과 스트리밍도 점검합니다. 모델 ID만 바꿨다고 모든 SDK·게이트웨이 호환성이 검증되는 것은 아닙니다.
자신의 작업으로 검증하는 방법
결과를 보기 전에 네 범주에서 6개씩 과제를 고릅니다. 명확한 구현, 복잡한 디버깅·리팩터링, 도구 흐름, 문서·시각 작업입니다. 24개 과제 × 2모델 × 3회면 144번의 작업 실행이며 API 요청은 더 많을 수 있습니다. 이 글이 실행한 실험이 아니라 제안입니다.
commit, 프롬프트, 도구, 지역, 권한, 시간·단계 제한과 테스트를 고정하고 매번 작업 공간과 대화를 초기화합니다. 실행 순서를 번갈아 배치하고 명시적 medium 비교와 기본값·고강도 비교를 분리합니다. 실패, 거부, 재시도, 관찰된 fallback, 토큰, 비용, 시간과 실제 수정 시간을 기록합니다. 코드는 숨겨진 테스트로, 문서는 출처로 확인합니다. 3회로 과제별 P95를 정밀 추정할 수 없으며 성공이 없으면 성공당 비용을 0으로 표시하면 안 됩니다.
자주 묻는 질문
소넷 5.5가 코딩에서 더 좋나요?
공개 Terminal-Bench는 소넷이 높고, 표에 있는 FrontierCode와 CursorBench는 오퍼스가 높습니다. 설정과 오차를 고려해 대표 작업으로 판단해야 합니다.
실제 비용도 절반인가요?
일반 입력·출력 단가는 절반이지만 캐시 읽기는 같습니다. 토큰 사용량과 재시도, 도구 및 수정 비용이 전체 금액을 바꿉니다.
Claude Code에서는 무엇을 선택하나요?
명확한 작업은 소넷, 어려운 조사는 오퍼스를 평가할 수 있고 품질 우선이면 오퍼스부터 시작해도 됩니다. 구독과 API 과금은 별개이며 Claude Code 요금 가이드에서 설명합니다.
오퍼스의 컨텍스트가 더 큰가요?
둘 다 1M 컨텍스트와 표준 최대 128K 출력을 명시합니다. 크기보다 정보를 제대로 활용하는지 확인하세요.
현재 모델 정보와 공식 자료
OmniaKey의 현재 경로와 가격은 Sonnet 5.5, Opus 5.5, 모델 목록에서 확인할 수 있습니다. 직결 API 계산은 게이트웨이 견적이나 실제 API 호출 검증이 아닙니다. 본문의 Anthropic 공식 출처는 영어 자료입니다.