GPT-5.4 및 GPT-5.4 Mini가 단종되었습니다 · 사용 가능한 다른 모델로 전환하세요
블로그
가이드

DeepSeek V4.1 Flash

새 Flash는 더 낮은 가격과 여러 Agent 지표의 상승을 제시하지만, 공식 표도 모든 작업에서 V4 Pro를 이긴다고 말하지는 않습니다.

약 12분OmniaKey
DeepSeek V4.1 Flash모델 리뷰API 가격멀티모달코딩 Agent

DeepSeek V4.1 Flash 리뷰는 새 아키텍처, DeepSeek가 공개한 벤치마크, 그리고 개발자가 API에서 실제로 지정해야 하는 모델 ID를 구분해서 설명합니다.

핵심 결론은 간단합니다. 긴 컨텍스트와 반복적인 도구 호출을 사용하는 Agent라면 V4.1 Flash를 먼저 비교할 만합니다. DeepSeek 직결 API의 비성수기 가격은 캐시 미스 입력 100만 token당 $0.15, 출력 $0.60이며 이미지 입력도 네이티브로 받습니다. 다만 이 글은 독립적인 유료 실행이나 속도 측정을 하지 않았으므로, 모든 업무에서 V4 Pro를 대체한다고 주장하지 않습니다.

사실 확인: 2026년 9월 10일. 이 글은 DeepSeek 릴리스 노트, 가격표, API 가이드, 공개 모델 카드를 바탕으로 한 조사형 리뷰입니다. 모든 점수는 DeepSeek가 제시한 vendor-reported 수치이며 독립 재현 결과가 아닙니다.

먼저 알아둘 판단 기준

V4.1 Flash를 먼저 시험할 만한 경우는 다음과 같습니다.

  • 긴 프롬프트와 도구 루프를 쓰는 코딩 Agent
  • 스크린샷을 읽는 UI 검토와 디버깅
  • 후속 검증 단계를 둔 OCR 또는 문서 추출
  • 처리량과 token 단가가 중요한 대량 자동화

반대로 고정된 모델 동작을 감사해야 하거나, V4 Pro의 특정 동작에 의존하거나, 중요한 이미지와 문서 결정을 내리는 흐름은 회귀 테스트가 먼저입니다. DeepSeek는 deepseek-v4-pro 요청을 2026-09-14 04:00 UTC부터 V4.1 Flash로 라우팅한다고 공지했습니다. ID가 같아도 실제 모델은 바뀝니다.

출시 시점의 확인 정보

항목공식 확인 내용
정식 출시2026-09-10
새 API 모델 IDdeepseek-flash
호환용 기존 IDdeepseek-v4-flash, deepseek-v4-flash-vision-exp
Pro 전환deepseek-v4-pro는 2026-09-14 04:00 UTC부터 V4.1 Flash로 전환 예정
구조552B 파라미터 멀티모달 MoE, Causal Encoder-Decoder
token당 활성 파라미터prefill 8B, decode 16B
용량1M 컨텍스트, 최대 384K 출력
APIChat Completions, Responses API, Anthropic API
라이선스모델과 가중치는 MIT

기존 V4 Flash와 V4 Flash Vision Exp는 종료되었습니다. deepseek-v4-flashdeepseek-v4-flash-vision-exp는 일시적인 호환 경로일 뿐이므로 새 통합에서는 deepseek-flash를 사용해야 합니다.

공식 모델 카드는 압축된 KV Cache도 설명합니다. 전역 KV Cache는 token당 890 bytes이며 기존 V4 Flash의 약 1/4, 영속 저장이 필요한 캐시는 약 1/8이라는 설명입니다. 이는 청구 token이 자동으로 1/4가 된다는 뜻이 아닙니다. 비용은 실제 usage와 공개 요금표로 확인해야 합니다.

DeepSeek V4.1 Flash API 가격

DeepSeek 영어 가격 페이지는 직결 API 가격을 100만 token 기준으로 다음처럼 제시합니다.

과금 항목비성수기성수기
캐시 히트 입력$0.003$0.006
캐시 미스 입력$0.15$0.30
출력$0.60$1.20

성수기는 월요일부터 금요일까지 01:00-04:00 및 06:00-10:00 UTC이며, 다른 시간과 주말은 비성수기입니다. 이 수치는 DeepSeek 직결 API 요금이며 OmniAKey 요금이 아닙니다.

캐시 미스 입력 100,000 token과 출력 20,000 token을 가정하면 다음과 같습니다.

text
V4.1 Flash 비성수기 = 0.1 x $0.15 + 0.02 x $0.60 = $0.027
V4.1 Flash 성수기   = 0.1 x $0.30 + 0.02 x $1.20 = $0.054
V4 Pro 비성수기     = 0.1 x $0.66 + 0.02 x $1.98 = $0.1056
V4 Pro 성수기       = 0.1 x $1.32 + 0.02 x $3.96 = $0.2112

이 token 조합만 보면 V4.1 Flash는 V4 Pro보다 약 74% 낮습니다. 하지만 재시도와 수정까지 포함한 통과 작업 비용이 항상 더 낮다는 품질 주장은 아닙니다. 이전 Pro 요금은 DeepSeek V4 Pro API 가격 가이드(영문)에서 확인할 수 있습니다.

벤치마크가 보여 주는 범위

공식 모델 카드의 같은 표에서는 V4.1 Flash가 여러 Agent 지표에서 V4 Pro보다 높습니다. 하지만 GPQA Diamond와 텍스트 전용 HLE에서는 V4 Pro가 더 높습니다.

벤치마크V4 FlashV4 ProV4.1 Flash
GPQA Diamond89.992.490.9
HLE, 텍스트 전용37.842.739.1
Terminal-Bench 2.182.787.990.6
DeepSWE v1.154.462.774.2
CyberGym76.783.388.1
HLE, 도구 사용51.560.063.9
AutomationBench37.743.254.8

따라서 적절한 결론은 V4.1 Flash가 공개된 코딩, 보안, 자동화, 도구 사용 작업의 일부에서 크게 향상되었다는 것입니다. 모든 업무에서 Pro보다 낫다는 뜻은 아닙니다. 또한 업데이트 로그의 NL2Repo-Bench는 65.4, 라이브 모델 카드 표는 64.0으로 서로 달라 DeepSeek가 설명하기 전까지 이 글의 결론에 포함하지 않습니다.

Agent 프레임워크도 결과를 바꾼다

같은 V4.1 Flash에서 DeepSWE v1.1은 OpenCode 65.5부터 mini-SWE-agent 74.2까지 8.7포인트 차이가 납니다. Terminal-Bench 2.1도 Codex 84.1과 DeepSeek Harness Minimal 90.6 사이에 6.5포인트 차이가 있습니다.

공식 모델 카드는 DeepSWE에 태스크당 N=8, Terminal-Bench에 N=3, 최대 500 Agent 단계와 최대 추론 강도를 사용했다고 밝힙니다. 프롬프트 형식, 도구 루프, 재시도, 컨텍스트 관리가 다르면 결과도 바뀝니다. 실제로 운영할 Agent에서 비교해야 합니다.

이미지 이해와 통합 주의점

V4.1 Flash는 JPEG, PNG, GIF, WebP 이미지를 받으며 base64, 공개 URL, Files API를 지원합니다. Chat Completions, Responses API, Anthropic API에서 이미지 입력을 쓸 수 있고, 자동 크기 조정 뒤 이미지 한 장은 최대 1,024 입력 token입니다.

이 모델은 이미지 생성기가 아니라 이미지 이해 모델입니다. 작은 글자, 촘촘한 표, 중요한 계약이나 재무 필드는 결정론적 검증 또는 사람 검토가 필요합니다. thinking 모드에서 tools를 사용할 때 후속 요청에 전체 reasoning_content를 돌려주지 않으면 400 오류가 난다고 공식 가이드는 설명합니다. FIM 보완은 비사고 모드에서만 지원됩니다.

OmniAKey 이용 전 확인

2026-09-10 확인 시점에 OmniAKey 모델 목록에는 공식 deepseek-flash가 아직 보이지 않았습니다. 따라서 이 글은 OmniAKey의 현재 이용 가능 여부나 가격을 주장하지 않습니다.

정확한 ID가 목록에 표시된 뒤에만 API Keys에서 한도가 있는 키를 만들고, 첫 요청 후 모델명, 입력, 캐시, 출력, 비용을 점검하세요. 투명한 청구 가이드(영문)API 빠른 시작(영문)도 함께 보세요.

V4 Pro 전환 체크리스트

  1. 대표 작업 10-30개와 합격 조건을 고정합니다.
  2. 현재 deepseek-v4-pro의 token, 재시도, 지연, 합격 결과를 저장합니다.
  3. 같은 입력, 권한, 도구로 deepseek-flash를 실행합니다.
  4. highmax를 따로 시험하고, 한 번에 하나의 변수만 바꿉니다.
  5. 긴 도구 루프와 필요한 경우 실제 이미지 작업을 포함합니다.
  6. 한 번의 가격이 아니라 통과 작업당 총비용을 비교합니다.
  7. 9월 14일 전에 allowlist, 모니터링, 감사 라벨을 갱신합니다.

자주 묻는 질문

정식 모델 ID는 무엇인가요?

DeepSeek 직결 API의 새 ID는 deepseek-flash입니다. 기존 deepseek-v4-flashdeepseek-v4-flash-vision-exp는 호환용 ID입니다.

V4.1 Flash가 항상 V4 Pro보다 좋은가요?

아닙니다. 여러 공식 Agent 지표에서는 높지만 GPQA Diamond와 텍스트 전용 HLE에서는 V4 Pro가 높습니다. 실제 Agent와 합격 기준으로 검증해야 합니다.

V4.1 Flash는 오픈 소스인가요?

모델 저장소와 가중치는 MIT 라이선스입니다. 다만 552B MoE를 운영하려면 전문 하드웨어, 올바른 prompt encoding, 운영 검증이 필요합니다.

1차 출처

사실과 계산은 2026년 9월 10일에 확인했습니다. 독립 유료 모델 실행, 속도 시험, 운영 신뢰성 시험은 하지 않았습니다. 도입 전에 모델 ID, 가격, 전환 시각, 게이트웨이 이용 가능 여부를 다시 확인하세요.