DeepSeek-V4-Flash와 대화하기

AI ChatDeepSeek-V4-Flash

DeepSeek-V4-Flash란?

DeepSeek는 저비용 추론과 에이전트 작업을 위한 총 284B, 활성 13B 파라미터의 텍스트 모델로 2026년 4월 24일 V4 Flash Preview를 공개했습니다. 7월 31일에는 구조, 크기, API 이름을 유지한 채 추가 사후 학습을 거쳐 DeepSeek-V4-Flash-0731을 공개 베타로 출시했습니다. 2026년 9월 8일 확인 기준 `deepseek-v4-flash`는 0731을 가리킵니다. 이 업데이트는 Flash API에만 적용됐고 당시 App/Web 모델은 바뀌지 않았다고 DeepSeek가 밝혔습니다. 현재 API는 Pro-0813을 별도로 표시하며 `deepseek-v4-flash-vision-exp`도 독립된 실험 모델입니다. 일반 Flash는 텍스트 전용이므로 Vision의 이미지 입력 기능을 적용하면 안 됩니다. 이 페이지는 Ottermind Studio로 프롬프트를 넘길 뿐, 계정의 모델 제공 여부를 보장하거나 DeepSeek를 자동 선택하지 않습니다.

컨텍스트, 출력, 제어 방식

  • 긴 텍스트 지원, 이미지 입력은 미지원: 현재 모델 표에는 100만 토큰 컨텍스트, 최대 38만4천 토큰 출력과 JSON, 도구 호출, Responses API, Anthropic API 지원이 나옵니다. 이는 API 한도이지 긴 입력의 모든 세부 내용을 정확히 기억한다는 보장이 아닙니다. 이미지는 별도 Vision 실험 모델의 기능입니다.
  • API 피크 및 비피크 요금: 피크 시간 Flash 요금은 100만 토큰당 캐시 적중 입력 0.014달러, 캐시 미적중 입력 0.44달러, 출력 1.32달러이며 비피크에는 절반입니다. 피크는 UTC 월요일부터 금요일 01:00-04:00 및 06:00-10:00이고 나머지는 비피크입니다. DeepSeek API 요금이며 Ottermind 가격이 아니고 바뀔 수 있습니다.
  • 작업에 맞게 사고 강도 선택: 사고 모드 안내에 따르면 사고는 기본 high로 켜지며 현재 low, high, max를 선택합니다. medium과 xhigh는 high로 매핑됩니다. 사고 모드에서 temperature와 top-p는 적용되지 않고 도구 대화는 이전 reasoning_content를 정확히 돌려줘야 합니다. 인터페이스마다 제어 항목은 다를 수 있습니다.

Ottermind에서 이어갈 네 가지 작업

가장 작은 유용한 텍스트와 합격 조건 하나로 시작하세요. Studio는 대화를 이어가지만 파일이나 특정 모델은 선택한 인터페이스가 실제로 제공할 때만 사용하세요.

  • 범위를 넓히지 않고 버그 하나 수정

    오류가 발생한 함수, 오류, 인접 테스트를 Ottermind에 붙이고 유지할 동작을 명시해 최소 패치를 요청합니다. 테스트를 실행하고 diff를 검토하세요. 정확한 실패 내용이나 불필요한 줄만 Studio에 돌려보내 그 차이만 고치도록 요청합니다.

  • 도구를 반복 호출하는 에이전트 추적

    익명화한 도구 호출, 응답, 도구 스키마를 붙이고 인수가 사라졌거나 반복이 시작된 지점을 묻습니다. 모든 주장을 추적 기록과 대조한 뒤 첫 불일치 이벤트를 Studio로 보내 수정 호출과 회귀 테스트를 요청합니다.

  • 긴 정책 문서의 두 버전 비교

    안정된 절 번호와 함께 신구 조항을 붙이고 원문 인용, 영향, 미해결 모호성을 담은 변경표를 요청합니다. 인용을 원문에서 확인하세요. 근거 없는 행만 Studio에서 다시 쓰거나 확인된 변경을 담당자와 기한 목록으로 바꿉니다.

  • 회의 기록을 담당자가 있는 할 일로 정리

    회의록 구간, 화자 표시, 담당자·행동·날짜·근거 필드를 붙이고 빠진 값은 null로 요구합니다. 화자와 날짜를 원문에서 확인한 뒤 잘못된 행을 Studio로 돌려보내 없는 약속을 만들지 않고 해당 행만 수정하게 합니다.

이 작업에는 Flash와 Pro 중 무엇이 맞을까?

판단 항목DeepSeek-V4-FlashDeepSeek-V4-Pro
현재 API 버전DeepSeek-V4-Flash-0731DeepSeek-V4-Pro-0813
피크 입력: 캐시 적중 / 미적중100만 토큰당 0.014 / 0.44달러100만 토큰당 0.044 / 1.32달러
피크 출력100만 토큰당 1.32달러100만 토큰당 3.96달러
유용한 선택 시험범위를 제한한 코드 또는 정보 추출 작업으로 수정 횟수, 지연, 총 토큰 측정같은 어려운 사례를 실행하고 재시도 감소나 경계 조건 개선이 비용 차이를 정당화할 때만 선택

낮은 토큰 비용을 실제 가치로 전환

활용해 볼 만한 작업

  • 작은 수정과 테스트를 반복하기: 작은 패치와 명확한 테스트는 에이전트 지향 학습에 맞으면서 통제권을 유지합니다. 승인한 코드는 남기고 넓은 작업을 재시작하는 대신 실패 사례 하나만 되돌려 주세요.
  • 안정된 위치 표시가 있는 긴 텍스트: 100만 토큰 한도는 큰 텍스트 묶음을 허용하지만 절 ID, 원문 인용, 필수 필드가 있어야 결과를 감사할 수 있습니다. 중요한 주장마다 출처 위치를 요청하세요.

신중해야 할 곳

  • 규칙은 실행 가능한 검사로 바꾸기: 긴 지시는 빠질 수 있습니다. 핵심 규칙을 짧은 체크리스트, 테스트, 엄격한 스키마로 바꾸고 프롬프트에 적었다는 이유만으로 준수를 가정하지 마세요.
  • 컨텍스트 길이는 정확도가 아님: 큰 입력에서도 조건을 놓치고 화자를 혼동하며 근거 없는 결론을 낼 수 있습니다. 관련 원문을 확인하고 재시도까지 총비용에 포함해 Flash, Pro 또는 다른 모델을 고르세요.

두 출시 단계에서 나온 사용자 경험

서로 다른 인터페이스와 배포의 개인 경험이며 통제된 벤치마크가 아닙니다. 4월은 Preview, 이후 보고는 0731에 관한 것으로 현재 API 지연이나 사용자의 결과를 예측하지 않습니다.

도구 사용은 호평, 속도는 작업에 따라 다름

4월 24일 개인 개발자 시험에서 Comfortable-Rock-498은 자체 Cline 브랜치와 공식 API로 Preview가 대규모 코드 변경의 여러 도구 호출을 정확히 처리했지만 생성이 느리고 사고에 수분이 걸렸다고 했습니다. 0731 이후 한 VS Code Copilot 사용자는 복잡한 프로젝트에서 이탈이 줄고 첫 시도 정답이 늘었다고 했습니다. 환경과 작업이 달라 직접 비교할 수 없습니다.

지시 및 사무 문서 오류는 여전히 가능

0731 이후 Juulk9087은 로컬 완전 정밀도 환경이 프로젝트 규칙을 무시했다고 했으며 글에는 다른 API·로컬 경험도 있습니다. 또 다른 LocalLLaMA 보고는 회의 요약에서 문맥 누락과 화자 혼동을 보였습니다. 개인 로컬 사례이므로 자신의 자료로 시험하세요.

프롬프트에서 검증된 결과까지

1

자료와 작업 범위 정하기

오류가 발생한 함수, 표시된 문단, 익명화한 추적 중 하나로 시작합니다. 기대 출력, 보존할 사실, 실제 실행할 검사를 적으세요.

2

Studio에서 계속하기

Ottermind Studio를 열고 필요하면 로그인합니다. 계정이 제공할 때만 DeepSeek-V4-Flash를 선택하세요. 전달되는 것은 프롬프트뿐이며 파일 업로드, 모델 자동 선택, API 접근 증명은 하지 않습니다.

3

정확한 차이만 되돌리기

테스트를 실행하거나 인용, 담당자, 날짜를 원문과 대조합니다. 실패 항목만 붙이고 승인한 부분을 유지하는 집중 수정을 요청하세요.

DeepSeek-V4-Flash 자주 묻는 질문

API는 어떤 DeepSeek-V4-Flash 버전을 사용하나요?

2026년 9월 8일 기준 `deepseek-v4-flash`는 DeepSeek-V4-Flash-0731을 가리킵니다. DeepSeek는 7월 31일 버전을 Preview와 같은 구조·크기에 추가 사후 학습을 한 공개 베타 API 업데이트라고 설명했습니다. App/Web은 당시 바뀌지 않았으므로 그곳의 0731 제공을 증명하지 않습니다.

DeepSeek-V4-Flash가 이미지를 읽나요?

일반 `deepseek-v4-flash`는 텍스트 전용입니다. 이미지 입력은 별도 실험 모델 `deepseek-v4-flash-vision-exp`의 기능입니다. 이 페이지는 이미지를 올리거나 모델을 바꾸지 않습니다. 인터페이스가 Vision을 명시하지 않으면 텍스트 설명을 쓰세요.

DeepSeek API 요금은 얼마인가요?

Flash의 현재 피크 요금은 100만 토큰당 캐시 입력 0.014달러, 미캐시 입력 0.44달러, 출력 1.32달러이고 비피크는 절반입니다. 피크는 UTC 월요일부터 금요일 01:00-04:00 및 06:00-10:00입니다. DeepSeek API 과금이며 Ottermind 가격이 아닙니다.

low, high, max 중 무엇을 쓰나요?

DeepSeek는 low, high, max를 제공하고 기본은 high입니다. 제한된 정보 추출에는 low, 보통 에이전트 작업에는 high로 시작하고 어려운 작업은 품질, 지연, 출력 토큰을 측정한 뒤 max를 선택하세요. 채팅 제품의 제어 항목은 API와 다를 수 있습니다.

검증할 수 있는 결과 하나를 가져오세요

원자료, 기대 결과, 합격 조건을 Ottermind Studio로 가져가세요.