與 DeepSeek-V4-Flash 對話

AI ChatDeepSeek-V4-Flash

DeepSeek-V4-Flash 是什麼?

DeepSeek 在 2026 年 4 月 24 日推出 V4 Flash 預覽版。這款純文字模型的總參數為 284B,每次啟用 13B,主打低成本推理與代理程式工作。7 月 31 日,官方在架構、規模與 API 名稱維持不變的前提下重新進行後訓練,並以公開測試形式推出 DeepSeek-V4-Flash-0731。截至 2026 年 9 月 8 日,`deepseek-v4-flash` 這個 API 名稱會使用 0731。該次更新僅適用於 Flash API;DeepSeek 當時明確表示 App 與 Web 版模型並未更新。 目前 API 另列 Pro-0813,而 `deepseek-v4-flash-vision-exp` 也是不同的實驗型號。一般版 Flash 只接受文字,不能把 Vision 型號的圖片輸入能力套用到它身上。本頁只會把提示詞帶入 Ottermind Studio,不代表你的帳戶一定能使用這個模型,也不會自動選取 DeepSeek。

上下文、輸出與控制方式

  • 可容納大量文字,不接受圖片: 最新模型表列出 1M token 的上下文與最高 384K token 的輸出,並支援 JSON 輸出、工具呼叫、Responses API 與 Anthropic API。這些是 API 上限,並不保證長篇輸入中的每項細節都能正確重現。圖片輸入屬於另外的 Vision 實驗型號。
  • API 尖峰與離峰價格: 尖峰時段的 Flash 費率為:每百萬 token 的快取命中輸入 0.014 美元、未命中輸入 0.44 美元、輸出 1.32 美元;離峰時段各項減半。尖峰時段是 UTC 週一至週五 01:00-04:00 與 06:00-10:00,其餘皆為離峰。這是 DeepSeek API 費率,不是 Ottermind 的定價,而且日後可能調整。
  • 依照工作難度調整思考強度: 思考模式指南指出,思考模式預設開啟並採用 high,目前可設定 low、high 或 max;medium 與 xhigh 都會對應到 high。思考模式下 temperature 和 top-p 不會生效;使用工具的多輪對話也必須正確回傳先前的 reasoning_content。各種介面提供的控制項可能不同。

可在 Ottermind 繼續完成的四項工作

先提供範圍最小但資訊足夠的文字,以及一項明確的驗收方式。Studio 能延續對話;只有當所選介面確實支援時,才使用檔案或指定模型。

  • 只修一個錯誤,不擴大改動範圍

    把發生錯誤的函式、錯誤訊息與相鄰測試貼到 Ottermind,要求提供最小幅度的修補,並列出不可改變的既有行為。執行測試並檢查 diff;如果仍有問題,就把確切的失敗訊息或不必要的變更帶回 Studio,只請它修正該項落差。

  • 找出代理程式重複呼叫工具的起點

    貼上去識別化的工具呼叫、回傳內容與工具 schema,請模型指出參數在哪一步遺失,或迴圈從哪個事件開始。逐項對照原始軌跡;再把第一個不一致的事件帶回 Studio,要求修正呼叫方式並補上一項迴歸測試。

  • 比較兩個版本的長篇政策文件

    貼上新舊條款並保留穩定的章節標記,要求整理成包含原文引句、影響與尚未釐清事項的變更表。回到原始文件查核每段引句;接著在 Studio 中只重寫缺乏依據的那一列,或將確認過的變更整理成負責人與截止日期清單。

  • 把會議記錄整理成有負責人的待辦

    貼上逐字稿片段與說話者標籤,並指定負責人、行動、日期、證據四個欄位;資料缺漏時必須填入 null。對照原文查核說話者與日期,再把任何有誤的資料列帶回 Studio,要求定點修正且不得杜撰承諾。

這項工作適合 Flash 還是 Pro?

考量DeepSeek-V4-FlashDeepSeek-V4-Pro
目前 API 版本DeepSeek-V4-Flash-0731DeepSeek-V4-Pro-0813
尖峰輸入:快取命中 / 未命中每百萬 token 0.014 / 0.44 美元每百萬 token 0.044 / 1.32 美元
尖峰輸出每百萬 token 1.32 美元每百萬 token 3.96 美元
實用的選擇測試執行範圍明確的程式碼或擷取工作,記錄修正次數、延遲與總 token用相同難題測試;只有在重試較少或邊界案例涵蓋更完整時,額外費用才有價值

讓低 token 成本帶來實際效益

值得嘗試的方式

  • 可逐步檢查的程式碼迭代: 小幅修補搭配明確測試,既符合模型針對代理程式的訓練方向,也能讓你保有控制權。留下已接受的程式碼,只回傳一個失敗案例,不必重新提出範圍寬廣的工作。
  • 以穩定標記整理長篇文字: 1M token 上限能容納更大的文字集合,但章節 ID、原文引句與必填欄位才能讓結果可供查核。請模型為每一項重要結論指出來源位置。

需要審慎的地方

  • 重要規則要能實際驗證: 模型仍可能遺漏冗長指示。把關鍵規則改寫成簡短清單、測試或嚴格 schema;不符合就退回結果,不要只因為規則寫進提示詞,就假設模型一定遵守。
  • 上下文很長,不代表理解一定準確: 大量輸入仍可能造成限定條件遺漏、說話者判斷錯誤或缺乏證據的結論。重新閱讀相關原文,並把重試算進整體工作成本,再決定採用 Flash、Pro 或其他模型。

使用者在兩個版本階段的回饋

這些是不同介面與部署方式下的個人經驗,並非受控基準測試。4 月的內容談的是 Preview,後續內容談的是 0731;兩者都不能預測目前 API 的延遲或你的工作結果。

工具使用有所改善,速度仍取決於工作內容

在 4 月 24 日的一次個人開發者測試中,Comfortable-Rock-498使用自行開發的 Cline 分支與官方 API,表示 Preview 能準確完成大型程式碼變更中的多次工具呼叫,但文字生成較慢,思考也會持續數分鐘。0731 更新後,一位 VS Code Copilot 使用者表示,複雜專案中偏離目標的情況減少,也有更多工作能在第一次嘗試時正確完成。由於環境與工作不同,不能把兩者當成直接的前後比較。

仍可能忽略指示或誤解一般辦公文字

0731 更新後,Juulk9087表示,本機全精度部署會忽略專案規則;同一討論也包含不同的 API 與本機使用經驗。另一篇 LocalLLaMA 回饋則展示了會議摘要遺漏語境與混淆說話者的案例。這些仍是個別本機經驗,請用自己的樣本與驗收條件測試。

從提示詞到查核完成的結果

1

提供證據並劃定範圍

從一個發生錯誤的函式、附有標記的段落或去識別化軌跡開始。寫明預期輸出、必須保留的事實,以及你確實能執行的查核方式。

2

前往 Studio 繼續

開啟 Ottermind Studio,必要時先登入。只有帳戶實際提供時才選擇 DeepSeek-V4-Flash。這項交接只帶入提示詞,不會上傳檔案、自動選取模型,也不代表你已有 API 權限。

3

只回傳確切的落差

執行測試,或逐項對照引句、負責人與日期。只把失敗項目貼回對話,要求針對該處修訂,並保留已經接受的內容。

DeepSeek-V4-Flash 常見問題

API 目前使用哪個 DeepSeek-V4-Flash 版本?

截至 2026 年 9 月 8 日,API 名稱 `deepseek-v4-flash` 指向 DeepSeek-V4-Flash-0731。DeepSeek 將 7 月 31 日版本描述為經過重新後訓練的公開測試 API 更新,架構與規模和 Preview 相同。公告明確表示 App 與 Web 當時沒有更新,因此不能據此判定 0731 已在這些產品中提供。

DeepSeek-V4-Flash 可以讀取圖片嗎?

一般版 `deepseek-v4-flash` 只接受文字。圖片輸入屬於另外命名的實驗型號 `deepseek-v4-flash-vision-exp`。本頁不會上傳圖片或切換模型;除非所選介面明確提供 Vision,否則請改用文字描述。

DeepSeek API 如何計費?

Flash 目前尖峰時段的每百萬 token 費率為:快取輸入 0.014 美元、未快取輸入 0.44 美元、輸出 1.32 美元;離峰時段減半。尖峰時段是 UTC 週一至週五 01:00-04:00 與 06:00-10:00。這是 DeepSeek API 計費,不是 Ottermind 的價格或訂閱承諾。

應該使用 low、high 還是 max?

DeepSeek 提供 low、high、max,並以 high 為預設值。範圍明確的擷取或格式整理可先試 low,日常代理程式工作可使用 high;困難工作則應先衡量品質、延遲與輸出 token,再決定是否採用 max。聊天產品提供的控制項可能與 API 不同。

帶來一項能夠驗證的結果

把原始資料、預期結果與驗收條件帶入 Ottermind Studio。