Gemini 3.8 Flash API 가격과 에이전트 작업 비용
Google Standard는 현재 입력 100만 token당 $0.75, 출력은 $3.75이며 OmniaKey는 $0.45와 $2.25를 표시합니다. 하지만 통과한 결과의 비용은 재시도와 thinking까지 포함해야 합니다.
Gemini 3.8 Flash API 가격은 Google 유료 Standard API에서 2026년 12월 31일까지 입력 100만 token당 $0.75, 출력 100만 token당 $3.75입니다. Google은 2027년 1월 1일부터 $1.50와 $7.50를 적용한다고 게시했습니다. OmniaKey 모델 페이지의 별도 gateway 가격은 현재 입력 $0.45, 출력 $2.25, 캐시 입력 $0.045입니다.
직접 계약 금액과 날짜는 Google의 현재 Gemini API 가격표에서 확인할 수 있습니다.
token 단가는 에이전트 예산의 출발점일 뿐입니다. 실제로 필요한 값은 성공과 실패를 포함한 전체 지출을 수락 검사를 통과한 작업 수로 나눈 비용입니다. 저렴한 호출이 두 번 실패하면 더 비싸더라도 한 번에 통과한 호출보다 총비용이 커질 수 있습니다.
2026년 9월 20일 기준으로 확인했습니다. Google의 가격, 날짜, token 한도, thinking 단계, 캐시와 Batch 동작은 최신 공식 문서에서 검증했습니다. OmniaKey 수치는 라이브 카탈로그의 독립된 gateway 가격입니다. 이 글은 자료 기반 비용 분석이며 직접 벤치마크나 과금되는 프로덕션 테스트를 실행하지 않았습니다. 또한 모델의 성공률을 주장하지 않습니다.
Gemini 3.8 Flash 가격표
아래 금액은 모두 token 100만 개당 미국 달러입니다. “캐시 입력”은 할인된 읽기 가격이며 Google이 별도로 청구하는 캐시 저장 비용은 포함하지 않습니다.
| 과금 경로 | 입력 | 캐시 입력 | thinking 포함 출력 | 적용 범위 |
|---|---|---|---|---|
| Google Standard, 2026-12-31까지 | $0.75 | $0.075 | $3.75 | 유료 Gemini API 직접 계약 |
| Google Batch 또는 Flex, 2026-12-31까지 | $0.375 | $0.0375 | $1.875 | 지연이나 유연한 처리가 가능한 직접 워크로드 |
| Google Priority, 2026-12-31까지 | $1.35 | $0.135 | $6.75 | 직접 우선 처리 |
| Google Standard, 2027-01-01부터 | $1.50 | $0.15 | $7.50 | 예정된 직접 Standard 가격 |
| OmniaKey 현재 카탈로그 | $0.45 | $0.045 | $2.25 | gateway의 현재 Standard 가격 |
OmniaKey의 현재 가격은 Google의 현재 Standard token 가격보다 40% 낮습니다. 그러나 1월 1일 이후에도 Google 가격의 60%로 유지된다는 보장은 아닙니다. 두 카탈로그는 독립적으로 변경됩니다. 프로덕션 예산을 승인하기 전에 실시간 가격표를 다시 확인하세요.
Google Batch와 Flex는 현재 OmniaKey Standard보다 낮지만 같은 제품 표면이 아닙니다. Batch는 비동기이며 목표 완료 시간은 24시간이고 Google은 이를 generateContent용으로 설명합니다. gateway가 명시하지 않았다면 Google의 Batch, Flex, Priority가 제공된다고 가정하지 마세요.
캐시 저장, grounding, 외부 도구, 브라우저, 데이터베이스, 인프라, 세금과 사람의 검토 비용도 token 표 밖에서 추가될 수 있습니다.
통과한 에이전트 작업당 비용 계산
모델 이름보다 실제 경로를 먼저 계산합니다.
시도당 모델 비용
= 입력 백만 단위 x 입력 가격
+ 캐시 입력 백만 단위 x 캐시 가격
+ 출력 백만 단위 x 출력 가격
시도당 총비용
= 모델 + 도구 + grounding + 인프라 + 검토
통과 작업당 관측 비용
= 성공 및 실패 시도의 전체 지출
/ 수락 검사를 통과한 작업 수
각 시도 비용이 비슷하고 통과 확률을 독립적으로 볼 수 있는 예측에서는 다음을 씁니다.
통과 작업당 기대 비용 = 시도당 비용 / 통과율
마지막 식은 근사치입니다. 실패가 일찍 끝날 수도 있고 더 긴 루프, 다른 도구, 사람의 수정으로 이어질 수도 있습니다. 프로덕션에서는 관측된 전체 지출을 분자로 사용하세요.
“통과”를 테스트 전에 정의해야 합니다. 패치가 unit test를 통과하거나 JSON이 schema에 맞거나, 추출 결과가 검수 라벨과 일치하거나, 답변이 사람의 rubric을 통과하는 식입니다. HTTP 200은 품질 기준이 아닙니다.
계산 예: 입력 20K, 출력 5K, 통과율 70%
한 번의 전체 시도가 캐시되지 않은 입력 20,000 token과 출력 5,000 token을 사용한다고 가정합니다. 출력에는 공급자가 과금한 thinking token이 들어갑니다. 계산을 재현할 수 있도록 도구, 저장, 세금, 사람의 검토는 제외합니다.
| 과금 경로 | 시도당 비용 | 통과율 70%일 때 통과 작업 비용 |
|---|---|---|
| Google Standard, 2026년까지 | 0.02 x $0.75 + 0.005 x $3.75 = $0.03375 | $0.0482 |
| Google Standard, 2027년부터 | 0.02 x $1.50 + 0.005 x $7.50 = $0.06750 | $0.0964 |
| Google Batch/Flex, 2026년까지 | 0.02 x $0.375 + 0.005 x $1.875 = $0.016875 | $0.0241 |
| OmniaKey 현재 카탈로그 | 0.02 x $0.45 + 0.005 x $2.25 = $0.02025 | $0.0289 |
token 사용량이 같다면 Google 직접 Standard 비용은 2027년 1월 1일에 두 배가 됩니다. OmniaKey 행은 현재 가격만 사용하며 미래 gateway 가격을 예측하지 않습니다. Batch/Flex 행은 소비 모드를 구분해야 하는 이유를 보여 줍니다. 지연 가능한 직접 작업은 대화형 gateway 요청보다 token 청구액이 낮을 수 있습니다.
현재 Google Standard에서 $0.03375인 시도는 통과율 90%라면 통과 작업당 $0.0375, 70%라면 $0.0482, 50%라면 $0.0675입니다. 작은 prompt를 줄이는 것보다 통과율 개선이 더 중요할 수 있습니다.
Thinking token이 출력 비용을 좌우할 수 있습니다
Google은 gemini-3.8-flash에 low, medium, high를 지원하며 기본값은 medium입니다. minimal은 지원되지 않아 오류가 납니다. 출력 가격에는 보이는 답변과 thinking token이 모두 포함됩니다.
공식 모델 문서의 한도는 입력 1,048,576 token과 출력 65,536 token입니다. 이는 용량 상한이지 무료 할당량이 아니며 과금 token은 작업 비용에 포함됩니다.
실무 영향은 세 가지입니다.
- 보이는 답변이 짧아도 긴 추론 때문에 출력 비용이 커질 수 있습니다.
max_output_tokens를 너무 낮게 잡으면 추론 도중 끊겨 불완전하거나 빈 결과가 나오면서 이미 생성된 thinking token은 청구될 수 있습니다.high는 통과율 상승이 추가 출력과 지연을 상쇄할 때만 경제적입니다.
같은 작업 세트에서 low, medium, high를 시험하고 prompt, 도구, 권한, 재시도 정책과 수락 명령을 고정하세요. 단순히 텍스트를 반환하는 최저 단계가 아니라 필요한 통과율을 만족하는 가장 저렴한 단계를 선택합니다.
캐시, 재시도와 도구를 한 예산에 넣기
Google은 Gemini 3.8 Flash 암시적 캐시의 최소 적격 prefix를 4,096 token으로 설명합니다. 클라이언트가 prefix를 유지한다면 안정된 지침과 도구 schema를 변경되는 작업 데이터보다 앞에 두고, 공급자가 보고한 캐시 사용량을 확인하세요. 비슷한 텍스트는 캐시 hit의 증거가 아닙니다.
재시도에는 원인을 기록하세요. 전송 오류, 잘못된 도구 인수, 수락 실패, 사람이 요청한 수정은 서로 다릅니다. 무제한 재시도는 분모를 좋아 보이게 하면서 분자를 조용히 키웁니다.
도구 사용 에이전트에서는 최소한 다음을 저장합니다.
- 요청한 모델 ID와 반환된 모델 ID
- 프로토콜이 제공하는 입력, 캐시 입력, thinking, 보이는 출력
- 도구 이름, 도구 비용, turn 수
- 지연, 오류 분류, 재시도 횟수
- 수락 결과와 이를 만든 정확한 검사
- 해당 경로의 최종 청구액
Gemini native와 OpenAI 호환 프로토콜은 usage 필드 이름이 다를 수 있습니다. 다른 공급자의 schema를 가정하지 말고 실제 경로 응답을 OmniaKey 사용량 대시보드와 대조하세요.
Google 직접 계약과 OmniaKey 중 선택하기
| 요구사항 | 먼저 시험할 경로 | 이유 |
|---|---|---|
| 지연 가능한 대량 작업의 최저 공개 가격 | Google Batch | 현재 직접 Batch는 Standard의 50%이며 비동기입니다 |
| Google 전용 grounding이나 소비 제어 | Google 직접 계약 | 직접 계약이 해당 기능을 문서화합니다 |
| 하나의 키와 OpenAI 호환 경로 | OmniaKey | gemini-3.8-flash를 별도 gateway 가격으로 제공합니다 |
| 엄격한 지연 목표가 있는 대화형 에이전트 | 둘 다 측정 | token 가격만으로 대기열, 신뢰성, 통과율을 알 수 없습니다 |
| 2027-01-01 이후 프로덕션 | 둘 다 재확인 | Google 변경은 예정됐지만 미래 gateway 가격은 모릅니다 |
보편적인 순위표가 아닙니다. 데이터 정책, 지역, rate limit, 지원, 라우팅 투명성, 클라이언트 프로토콜에 따라 결론이 달라질 수 있습니다.
OmniaKey에서 Gemini 3.8 Flash 호출하기
실시간 모델 카탈로그에서 gemini-3.8-flash를 확인하고 API 키에서 범위를 제한한 키를 만든 뒤 OpenAI 호환 endpoint를 호출합니다.
curl https://api.omniakey.com/v1/chat/completions \
-H "Authorization: Bearer $OMNIAKEY_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"messages": [
{"role": "user", "content": "Return the riskiest assumption in this rollout plan."}
],
"stream": true
}'
인증과 base URL은 영문 API 빠른 시작 문서를 참고하세요. 실제 키는 환경 변수에 보관하고 소스, prompt, benchmark 로그나 스크린샷에 넣지 마세요.
자주 묻는 질문
Gemini 3.8 Flash API는 얼마인가요?
Google Standard는 2026년 말까지 입력 $0.75, 출력 $3.75/100만 token이며 2027년 1월 1일부터 $1.50와 $7.50입니다. OmniaKey의 현재 별도 가격은 $0.45와 $2.25입니다.
Thinking token도 출력으로 과금되나요?
예. Google은 출력 가격에 thinking token이 포함된다고 설명합니다. 보이는 답변 길이가 아니라 공급자의 usage를 사용하세요.
OmniaKey가 항상 Google 직접 계약보다 저렴한가요?
아닙니다. 현재 Standard끼리는 OmniaKey가 낮지만 적격 워크로드의 Google Batch와 Flex는 더 낮습니다. 접근성, 지연, 프로토콜과 미래 가격은 별도 판단입니다.
왜 통과율로 나누나요?
실패도 비용을 쓰지만 통과 결과를 늘리지 못합니다. 시도 비용이 안정적이면 통과 확률로 나눠 한 건의 통과에 필요한 기대 지출을 구할 수 있습니다. 프로덕션 데이터가 있으면 총지출을 통과 작업 수로 나누세요.
에이전트는 어떤 thinking 단계를 써야 하나요?
범위가 명확하고 검증 가능한 작업은 low부터 시작하고 실패 비용이 높으면 medium과 high를 시험하세요. Gemini 3.8 Flash는 minimal을 지원하지 않습니다. 같은 수락 기준을 안정적으로 통과하는 가장 저렴한 단계가 적절합니다.
1차 출처
- Google Gemini API 가격 문서(영문)
- Google Gemini 3.8 Flash 모델 문서(영문)
- Google thinking 문서(영문)
- Google context caching 문서(영문)
- Google Batch API 문서(영문)
출처와 계산은 2026년 9월 20일 확인했습니다. 가격, 한도와 경로 제공 여부는 달라질 수 있으므로 프로덕션 비용을 확정하기 전에 1차 문서와 OmniaKey 라이브 카탈로그를 다시 확인하세요.