본문으로 건너뛰기
DeepSeek비전 모델API멀티모달

DeepSeek, 비전 모델 API 가이드 공개...이미지 입력 방식과 제한 조건 명시

DeepSeek가 이미지와 텍스트를 함께 처리하는 비전 모델 'deepseek-v4-flash-vision-exp'의 API 가이드 문서를 공개했다. 이미지를 전달하는 세 가지 방식과 각각의 파일 크기·URL 길이·토큰 계산 규칙을 구체적으로 명시해, 이 모델을 도입하려는 개발팀이 사전에 확인해야 할 기술 조건이 명확해졌다.

확인 출처 1발행 주체 빅시프트

무엇이 바뀌었나

DeepSeek가 비전 모델 'deepseek-v4-flash-vision-exp'에 대한 공식 API 가이드 문서를 공개했다[1]. 이 문서는 이미지를 모델에 전달하는 세 가지 방법인 base64 인라인 삽입, 외부 URL 참조, Files API 참조를 설명하고, 각 방식을 OpenAI 호환 Chat Completions API, Responses API, Anthropic 호환 API(/messages 엔드포인트)에서 어떻게 호출하는지 정리했다[1]. 지금까지 텍스트 위주로 소개되던 DeepSeek API에 이미지 입력 방식이 문서화된 형태로 정리된 것이어서, 멀티모달 기능을 실제 서비스에 붙이려는 개발자 입장에서는 참고할 기준이 하나 늘어난 셈이다.

방식별 제한 조건이 뚜렷하게 갈린다

문서에 명시된 수치를 보면 세 가지 이미지 전달 방식은 제약 조건이 서로 다르다. base64로 이미지를 요청 본문에 직접 인라인하는 경우 전체 요청 본문 크기가 48 MiB를 넘을 수 없다[1]. 외부 URL로 이미지를 참조하는 방식은 파일 자체가 32 MiB 이하여야 하고, URL 문자열 길이는 8192자 이내여야 하며, 서버가 해당 URL에서 이미지를 내려받는 데 걸리는 시간은 60초를 넘기면 실패로 처리된다[1]. Files API를 통해 미리 업로드한 파일을 참조하는 방식은 최대 64 MiB까지 지원해 세 방식 중 가장 큰 파일을 다룰 수 있다[1]. 이미지 하나당 소비되는 토큰은 최대 384 토큰으로 고정되어 있고, 작은 이미지는 약 384×384 픽셀 수준까지 업스케일되며 큰 이미지는 약 800×800 픽셀 수준으로 다운스케일된 뒤 처리된다[1].

실무에서 확인할 조건

이 수치들은 대량의 이미지를 배치로 처리하거나 고해상도 이미지를 그대로 넘기려는 서비스 설계에 직접 영향을 준다. 예를 들어 사용자가 업로드한 원본 이미지 용량이 크거나 외부 CDN에서 이미지를 가져오는 구조라면, 32 MiB나 8192자 URL 길이 제한, 60초 다운로드 시간 제한에 걸리지 않는지 사전에 검증할 필요가 있다[1]. 반대로 다수의 이미지를 한 번에 처리해야 하는 경우 이미지당 384 토큰이라는 고정 소비량을 기준으로 전체 요청의 토큰 예산과 비용을 미리 계산해두는 편이 안전하다[1]. 세 가지 API 호환 방식(OpenAI, Responses, Anthropic)을 모두 지원한다는 점은 기존에 특정 SDK나 클라이언트 라이브러리를 써온 개발팀이 마이그레이션 비용 없이 DeepSeek 비전 모델을 붙여볼 수 있다는 의미로 볼 수 있다[1].

확인되지 않은 부분

공개된 문서에는 deepseek-v4-flash-vision-exp 모델의 정식 출시일이나 공개 발표 시점이 명시되어 있지 않다. 모델명에 포함된 'exp' 표기로 미루어 실험적 단계의 모델일 가능성이 있으나, 정식 버전 전환 일정이나 가격 정책에 대한 구체적인 안내는 현재로서는 확인되지 않는다.

확인한 출처

관련 AI 뉴스

AI BRIEFING/

에이전틱 AI가 만든 CI 병목, 테스트 셀렉션으로 대기시간 90% 이상 줄인 사례

1인 엔지니어가 운영하는 약 50만 줄 규모 프로젝트에서 코딩 에이전트 사용으로 코드 변경 속도가 빨라지면서 CI 파이프라인이 병목현상을 일으켰다. 변경된 파일과 관련된 테스트만 선택적으로 실행하는 방식을 도입해 CI 대기시간과 실행시간을 크게 줄였다는 사례가 공개됐다.

CI/CDGitHub ActionsAI 코딩 에이전트
읽기
AI BRIEFING/

Frigade, 9개월 쓴 Grafana 대시보드를 Claude Code 스킬로 하루 만에 교체

스타트업 Frigade가 24개 그래프로 구성된 멀티리전 Grafana 대시보드를 read-only Postgres 복제본을 조회하는 단일 Claude Code 스킬로 바꿨다. 9개월간 운영해온 모니터링 스택을 하루 만에 대체했다는 점에서, 정형화된 대시보드 대신 자연어 질의로 지표를 확인하는 방식이 실제 운영 환경에서도 통할 수 있음을 보여주는 사례다.

FrigadeClaude CodeGrafana
읽기
AI BRIEFING/

AI 에이전트용 회귀 테스트 도구 'AgentCheck' 공개, CI 파이프라인 통합 겨냥

GitHub 저장소 AgentCheck가 Hacker News에 소개되며 AI 에이전트의 동작 변화를 YAML로 정의하고 LLM이 심사해 pass/fail을 판정하는 회귀 테스트 도구로 주목받았다. 프롬프트 수정이나 모델 교체가 잦은 에이전트 개발 환경에서 CI에 바로 끼워 넣을 수 있다는 점이 특징이지만, 실제 사용 데이터나 로드맵 이행 여부는 확인되지 않았다.

AgentCheckAI 에이전트회귀 테스트
읽기