Jev 모델이 통합되어 정식 출시되었습니다 · 지금 이용해 보세요
블로그
가이드

DeepSeek V4 Flash Vision Exp

DeepSeek의 실험적인 다중 모드 API 모델은 동일한 가격대에서 V4-Flash에 이미지 입력을 추가합니다. 할 수 있는 작업, 비용, 한계는 다음과 같습니다.

약 12분OmniaKey
DeepSeek V4 Flash VisionVision APIOCRimage input

DeepSeek-V4-Flash-Vision-Exp는 오해하기 쉽습니다. 이는 이미지 생성기도 아니며 단순히 새로운 이름을 가진 일반 V4-Flash 모델도 아닙니다. V4-Flash의 텍스트 기능을 유지하고 이미지 입력을 추가하는 실험적인 멀티모달 API 모델입니다.

8월 21, 2026, 현재 실제 요약은 다음과 같습니다.

  • Model ID: deepseek-v4-flash-vision-exp.
  • 텍스트 동작: 에이전트, 추론 및 세계 지식을 포함하여 DeepSeek-V4-Flash와 일치합니다.
  • Vision: 스크린샷, 차트, 문서 및 시각적 에이전트 워크플로를 위한 혼합 텍스트 및 이미지 입력입니다.
  • 가격: V4-Flash와 동일한 등급이며 피크 요금과 비피크 요금이 있습니다.
  • 상태: 실험적. 프로덕션 기본값으로 만들기 전에 실제 사례와 비교하여 테스트해 보세요.

이 가이드는 개발자가 가장 많이 수행할 검색에 대한 답변입니다. DeepSeek V4 Flash Vision이란 무엇입니까? DeepSeek V4 Flash로 이미지를 볼 수 있나요? DeepSeek 비전 API의 가격은 얼마입니까? 이미지는 어떻게 보내나요? OCR, PDF, Claude Code 또는 Codex를 지원합니까? 그리고 시각적 작업에 있어서 V4-Pro, GPT 또는 Claude보다 실제로 더 나은가요?

DeepSeek 이미지 인식 API, 이미지 분석 API 또는 이미지 입력 엔드포인트를 찾는 사람이라면 이것이 먼저 평가할 모델입니다.

DeepSeek V4 Flash Vision Exp란 무엇입니까?

DeepSeek-V4-Flash-Vision-Exp는 이제 DeepSeek API 플랫폼에 출시되었습니다. 텍스트와 함께 이미지를 받아들인 다음 답변을 반환하거나 도구를 사용하여 에이전트 워크플로를 계속합니다.

DeepSeek는 모델이 텍스트 기능의 V4-Flash와 일치한다고 설명합니다. 다중 모달 에이전트 벤치마크에서 회사는 V4-Flash를 크게 뛰어넘고 Opus-4.8.에 접근한다고 밝혔습니다. 이는 유용한 맥락이지만 여전히 보편적인 순위라기보다는 공급업체 벤치마크 주장입니다. 시각적 벤치마크 결과는 모델이 모든 텍스트, 코딩 또는 도구 사용 작업에 가장 적합한 선택임을 입증하지 않습니다.

공식 모델 페이지에는 1M 토큰 컨텍스트 창과 최대 384K 출력 토큰이 나열되어 있습니다. 사고 및 비사고 모드, JSON 출력, 도구 호출, Responses API 및 Anthropic API를 지원합니다. FIM 완성은 지원되지 않으므로 FIM에 의존하는 코딩 도구는 자동 호환되는 것으로 간주되어서는 안 됩니다.

DeepSeek 하네스 0.1.1는 모델과 같은 날 기본 지원으로 출시되었습니다. 다른 에이전트 프레임워크에는 특히 이미지 콘텐츠 블록 및 도구 결과에 대한 자체 호환성 검사가 필요합니다.

DeepSeek V4 Flash Vision은 무엇을 할 수 있나요?

공식 Vision 가이드에서는 이미지 설명, 스크린샷 텍스트 인식 및 차트 분석을 명명합니다. 실제 개발자 워크플로에서 가장 강력한 사용 사례는 좀 더 구체적입니다.

스크린샷 디버깅 및 UI 검토

모델에 브라우저 스크린샷, 오류 메시지 및 예상되는 동작을 제공합니다. 다음에 사용할 로그나 도구를 결정하기 전에 표시되는 상태를 검사할 수 있습니다. 이는 사람이 이미 문제를 진단한 후에만 이미지를 설명할 수 있는 모델보다 더 유용합니다.

OCR 및 문서 추출

모델은 스크린샷, 스캔, 영수증, 양식, 라벨에서 텍스트를 읽은 다음 구조화된 필드를 반환할 수 있습니다. 해당 출력을 결정적 OCR 결과가 아닌 추출 초안으로 처리합니다. 작은 글꼴, 눈부심, 기울어짐, 흐림, 조밀한 표는 여전히 확인이 필요합니다.

차트 및 대시보드

꺾은선형 차트, 막대형 차트, 테이블 스크린샷 또는 분석 대시보드를 읽고 추세나 이상 현상을 설명할 수 있습니다. 재정적, 의료적, 운영적 결정의 경우 출처 번호를 보존하고 사람이 결론을 확인하도록 하십시오.

시각적 에이전트

모델은 이미지를 도구와 결합할 수 있으므로 브라우저 에이전트, UI 테스트, 시각적 검색 및 화면에 표시된 내용에 따라 작업해야 하는 워크플로에 유용합니다. 중요한 업그레이드는 단순히 "이 사진에는 무엇이 있나요?"라고 대답하는 것이 아닙니다. 작동하는 동안 에이전트에게 시각적 컨텍스트를 제공합니다.

배치 이미지 분류

API는 한 번의 요청으로 최대 600 이미지를 허용합니다. 이는 제품 그룹화, 자산 분류 및 대량 설명에 적합하지만 소규모 배치는 재시도 및 검토가 더 쉽습니다.

DeepSeek V4 Flash에는 비전이 있습니까?

일반적인 deepseek-v4-flash 모델은 텍스트 모델입니다. 이미지를 보내려면 정확한 비전 모델 ID를 사용하세요.

text
deepseek-v4-flash-vision-exp

클라이언트가 V4-Flash 또는 V4-Pro에 이미지를 보내는 경우 API는 model-does-not-support-image 오류를 반환합니다. "V4"라는 단어만으로 시력 지원을 추론하지 마십시오. 모델 ID가 중요합니다.

이미지 생성 모델인가요?

아니요. DeepSeek-V4-Flash-Vision-Exp는 이미지 이해 모델입니다. 이미지를 읽고 텍스트 또는 도구 호출을 생성합니다. 포스터, 아바타, 제품 렌더링 또는 기타 새로운 이미지를 생성하기 위한 올바른 끝점이 아닙니다.

DeepSeek V4 Flash Vision Exp API 가격

공식 영어 가격 페이지에는 1M 토큰당 미국 달러 가격이 나와 있습니다. 비전 모델은 V4-Flash와 동일한 속도를 사용합니다.

청구 항목비수기피크
입력, 캐시 적중$0.007 / 1M 토큰$0.014 / 1M 토큰
입력, 캐시 미스$0.22 / 1M 토큰$0.44 / 1M 토큰
출력$0.66 / 1M 토큰$1.32 / 1M 토큰

피크 시간은 01:00-04:00 및 06:00-10:00 UTC입니다. 그 외 시간은 모두 비첨두 시간이며, 비첨두 요금은 피크 요금의 절반입니다. 공식 페이지는 변경될 수 있으므로 장기 실행 애플리케이션의 예산을 책정하기 전에 다시 확인하세요.

이미지 한 장의 가격은 얼마인가요?

이미지는 크기에 따라 입력 토큰으로 변환됩니다. 현재 상한은 이미지당 384 토큰입니다. 캐시 미스 입력 속도에서 최대 크기 이미지는 대략 다음과 같은 역할을 합니다.

  • 비수기: 384 / 1,000,000 x $0.22 = $0.00008448;
  • 피크: 384 / 1,000,000 x $0.44 = $0.00016896.

이는 이미지 입력 구성요소일 뿐입니다. 텍스트 프롬프트, 출력, 대화 기록, 추론 토큰 및 도구 호출은 별도로 청구됩니다. 상담원 워크플로에서 긴 출력과 반복적인 호출은 일반적으로 이미지 자체보다 비용이 더 많이 듭니다.

파일 API는 파일 업로드 및 재사용에 무료로 사용할 수 있습니다. 그렇다고 해서 모델 추론이 무료로 되는 것은 아닙니다. 이미지를 읽으면 여전히 청구 가능한 입력 토큰이 소비됩니다.

DeepSeek V4 Flash Vision Exp API를 사용하는 방법

API는 세 가지 이미지 입력 방법을 지원합니다.

  1. 로컬 이미지의 Base64 데이터 URL.
  2. 공개 외부 이미지 URL
  3. 대용량 이미지 또는 요청 전반에 재사용되는 이미지를 위한 파일 API입니다.

다음은 공개 이미지 URL을 사용하는 가장 작은 OpenAI 호환 Python 예입니다.

python
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": "Read the error message and suggest the next debugging step.",
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/screenshot.png",
                        "detail": "high",
                    },
                },
            ],
        }
    ],
)

print(response.choices[0].message.content)

예시 URL을 공개적으로 연결할 수 있는 이미지로 바꾸거나 로컬 파일에 Base64 데이터 URL을 사용하세요. Responses API를 통해 동일한 세 가지 입력 방법을 사용할 수 있습니다. Anthropic 호환 메시지 요청은 다른 이미지 콘텐츠 블록 모양을 사용하므로 OpenAI 블록을 변경 없이 Anthropic 요청에 복사하지 마세요.

이미지 세부정보 선택

detail 필드는 image_url 입력에 대한 전처리를 제어합니다.

가치행동다음과 같은 경우에 사용하세요.
low추론 전에 512 x 512로 축소속도가 필요하고 세세한 부분은 중요하지 않습니다.
high원본 이미지를 유지합니다작은 텍스트나 차트 세부정보가 중요합니다.
original원본 이미지를 유지합니다명시적인 전체 세부 동작을 원합니다.
auto현재 original와 동일기본 동작을 원합니다

동일한 이미지를 반복적으로 분석하려면 Files API를 통해 한 번 업로드하고 file_id를 재사용하세요. 일회용 작은 스크린샷의 경우 인라인 이미지나 공개 URL이 더 간단합니다.

DeepSeek V4 Flash Vision 이미지 입력 제한

이러한 제한은 출시 헤드라인보다 프로덕션에서 더 중요합니다.

한도현재 가치
지원되는 형식JPEG, PNG, GIF, WebP
요청당 최대 이미지600
요청 본문48 MiB
Base64 또는 외부 URL을 통한 이미지 1개32 MiB
파일 API를 통한 이미지 1개64 MiB
요청당 총 이미지 크기file_id가 없는 64 MiB; file_id 이미지가 포함된 최대 200 MiB
최대 이미지 크기측면당 8192 px
15 이상의 이미지 포함측면당 4096 px
외부 URL 길이8192 문자
외부 이미지 다운로드60초 내에 완료되어야 합니다.

추론 전에 이미지 크기가 조정됩니다. 작은 이미지는 종횡비를 유지하면서 확대됩니다. 더 큰 이미지는 대략 800 x 800 이미지의 픽셀 수로 축소됩니다. 이것이 모든 이미지에 384 토큰 상한선이 있는 이유이며 작은 텍스트도 주의 깊게 확인해야 하는 이유입니다.

표준 Chat Completions 및 Anthropic 메시지 요청의 경우 이미지는 사용자 메시지에 속합니다. 시스템 또는 보조 메시지의 이미지가 400 오류를 반환합니다. Responses API에는 사용자, 개발자 및 도구 출력 이미지 부분에 대해 문서화된 자체 규칙이 있습니다.

PDF는 지원되는 이미지 형식에 나열되지 않습니다. 입력이 PDF인 경우 먼저 관련 텍스트를 추출하거나 페이지를 JPEG/PNG로 렌더링한 다음 대표 페이지에서 결과를 테스트합니다.

DeepSeek V4 Flash Vision vs V4 Flash vs V4 Pro

작업더 나은 출발점왜?
텍스트 전용 대량 작업 및 저렴한 에이전트V4-Flash이미지 처리 없이 동일한 텍스트 계층
스크린샷, 사진, 차트 및 시각적 도구V4-Flash-비전-ExpV4-Flash 가격대에 이미지 입력 추가
복잡한 텍스트 추론 및 최종 아키텍처 검토V4-프로어려운 텍스트 전용 작업을 위한 더 많은 여유 공간

Vision Exp는 더 비싼 V4-Flash 업그레이드가 아닙니다. Flash 텍스트 계층을 유지하고 시각적 입력을 추가합니다. 작업에 이미지가 포함되어 있지 않으면 모델이 최신이라는 이유만으로 전환할 이유가 없습니다.

또한 V4-Pro 교체가 보장되지 않습니다. 공식 "Opus-4.8에 가깝다"는 성명은 다중 모드 에이전트 벤치마크에 관한 것입니다. 실제 애플리케이션의 경우 동일한 이미지 세트, 프롬프트, 도구, 대기 시간 목표 및 허용 기준의 모델을 비교하십시오. DeepSeek는 이후 새로운 플래시 경로를 출시했습니다. DeepSeek V4.1 플래시 리뷰에는 현재 모델 ID, 기본 비전 계약, 가격 및 별도의 V4 Pro 상태가 포함됩니다.

DeepSeek V4 Flash Vision은 무료인가요? 로컬에서 실행할 수 있나요?

API가 지급됩니다. 입력, 이미지 토큰, 출력 및 도구 호출에 대한 비용이 청구됩니다. 파일 API 업로드 기능은 무료이지만 추론은 무료입니다.

출시 발표에서는 DeepSeek API 플랫폼의 가용성을 확인합니다. 이 실험적 비전 모델이 소비자 웹 또는 앱 인터페이스에서 사용 가능하다고 말하지 않으므로 V4-Pro "전문가 모드" 선택기에 포함되어 있다고 가정하지 마십시오.

로컬 배포를 가정하지 마십시오. DeepSeek는 V4 텍스트 모델에 대한 공개 가중치 정보를 게시했지만 Vision Exp 출시 노트에서는 이 실험적인 API 모델에 대한 공개 가중치를 발표하지 않았습니다. 공식 모델 카드와 라이선스가 제공될 때까지 "API를 통해 사용 가능"과 "로컬 추론을 위해 다운로드 가능"은 다른 주장으로 처리되어야 합니다.

생산 체크리스트

실제 교통에 모델을 사용하기 전에 최소한 20-50 대표 이미지를 테스트하고 다음을 기록하십시오.

  • 실제로 중요한 필드의 OCR 정확도;
  • 차트 및 표 해석 정확도;
  • 이미지 제공 후 도구 호출 성공률
  • 대기 시간 및 시간 초과 동작;
  • 입력, 출력 및 추론 토큰 사용;
  • 실험 모델이 실패할 때의 대체 동작입니다.

검토자가 모델이 실제로 본 것을 볼 수 있도록 원본 이미지와 모델 응답을 함께 유지하세요. 민감한 문서의 경우 호스팅 모델로 보내기 전에 보존을 최소화하고 액세스를 제한하세요.

FAQ

DeepSeek V4 Flash Vision은 이미지를 생성할 수 있습니까?

아니요. 이미지를 이해하고 텍스트 또는 도구 호출을 반환합니다. 새로운 시각적 자산을 위해 이미지 생성 모델을 사용합니다.

DeepSeek V4 Flash Vision은 OCR를 지원합니까?

스크린샷과 문서의 텍스트를 읽을 수 있지만 결정론적 OCR 엔진은 아닙니다. 두 번째 방법으로 작은 텍스트, 회전된 텍스트, 흐릿한 텍스트 또는 위험이 높은 텍스트를 확인하세요.

DeepSeek V4 Flash Vision API 가격은 얼마입니까?

현재 공식 속도는 캐시되지 않은 1M 입력 토큰당 $0.22이고 오프피크 1M 출력 토큰당 $0.66입니다. 최고 요금은 $0.44 및 $1.32.입니다. 캐시 적중 입력이 더 저렴합니다. 이미지 토큰은 동일한 V4-Flash 가격을 사용합니다.

일반 DeepSeek V4 Flash는 이미지를 지원합니까?

아니요. 정확한 deepseek-v4-flash-vision-exp 모델 ID를 사용하세요. 다른 DeepSeek 모델은 이미지 입력을 거부합니다.

Claude Code 또는 Codex와 함께 사용할 수 있나요?

이 모델은 Responses API, Anthropic API 및 도구 호출을 지원하므로 에이전트 워크플로에 적합합니다. 특정 클라이언트가 안정적으로 작동하는지 여부는 이미지 콘텐츠 및 도구 결과 구현에 따라 달라집니다. 프로토콜 호환성이 좋은 사용자 경험과 같다고 가정하기보다는 실제 클라이언트를 테스트하십시오.

DeepSeek V4 Flash Vision은 오픈 소스입니까?

현재 Vision Exp 출시 발표는 개방형 릴리스가 아닌 API 릴리스를 확인합니다. 별도의 V4 텍스트 모델 발표에서 로컬 배포 지원을 추론하지 마세요.

DeepSeek가 이미지를 업로드하지 않거나 텍스트를 놓치면 어떻게 되나요?

파일이 JPEG, PNG, GIF 또는 WebP인지, 크기 제한 내에 있는지, 외부 URL에 연결할 수 있는지 확인하세요. 작은 텍스트의 경우 detail=high 또는 original를 사용해 보세요. 큰 이미지나 재사용할 파일의 경우 파일 API를 사용하세요. 두 번째 방법으로 중요한 필드를 확인하세요.

결론

DeepSeek-V4-Flash-Vision-Exp는 상담원이 브라우저 화면, 차트, 영수증, 스캔한 양식 또는 제품 이미지를 확인해야 할 때 가장 흥미롭습니다. 실용적인 내용은 간단합니다. V4-Flash 텍스트 동작, 이미지 입력 ​​및 V4-Flash 가격입니다.

V4-Pro, GPT, Claude, 전문가용 OCR 또는 이미지 생성 모델에 대한 보편적인 대체품은 아닙니다. 고정 이미지 테스트 세트로 시작하여 정확도와 총 워크플로 비용을 측정하고 모델에 Exp 라벨이 있는 동안 대체를 유지합니다.

내 스택에서는 Claude, GPT 및 Gemini 사용량과 청구를 OmniaKey를 통해 계속 표시하는 동시에 이 DeepSeek 모델을 시각적 전문가로서 별도로 테스트합니다. 이는 출시 발표를 테스트되지 않은 프로덕션 마이그레이션으로 바꾸는 대신 비교를 측정 가능하게 만듭니다.

공식 출처