与 DeepSeek-V4-Flash 对话

AI ChatDeepSeek-V4-Flash

DeepSeek-V4-Flash 是什么?

DeepSeek 于 2026 年 4 月 24 日发布 V4 Flash 预览版:这是一款总参数 284B、激活参数 13B 的纯文本模型,面向低成本推理和智能体任务。7 月 31 日,官方在保持架构、规模和 API 名称不变的情况下重新后训练,并以公测形式发布 DeepSeek-V4-Flash-0731。截至 2026 年 9 月 8 日,`deepseek-v4-flash` 指向 0731。此次更新只升级 Flash API;DeepSeek 当时明确表示 App/Web 模型没有变化。 当前 API 单独列出 Pro-0813,`deepseek-v4-flash-vision-exp` 也是独立的实验型号。普通 Flash 仅处理文本,不能把 Vision 的图片输入能力套用过来。本页只把提示词带到 Ottermind Studio,不代表你的账户一定提供该模型,也不会自动选择 DeepSeek。

上下文、输出与控制项

  • 大文本窗口,不是图片输入: 当前模型表列出 1M token 上下文和最大 384K token 输出,并支持 JSON、工具调用、Responses API 与 Anthropic API。这些是 API 上限,不保证长输入里的每个细节都能准确复现。图片输入属于独立的 Vision 实验型号。
  • API 峰时与谷时价格: 峰时每百万 token 的 Flash 价格为:缓存命中输入 0.014 美元、未命中输入 0.44 美元、输出 1.32 美元;谷时全部减半。峰时为 UTC 周一至周五 01:00-04:00 与 06:00-10:00,其他时间均为谷时。这是 DeepSeek API 价格,不是 Ottermind 定价,且可能调整。
  • 按任务选择思考强度: 思考模式指南说明思考默认开启且强度为 high,当前可选 low、high、max;medium 和 xhigh 会映射为 high。思考模式下 temperature 与 top-p 不生效,工具会话还必须正确回传此前的 reasoning_content。不同界面提供的控制项可能不同。

在 Ottermind 继续完成的四项任务

先提供最小但足够的文本材料和一个验收标准。Studio 用于延续对话;只有所选界面实际支持时,才使用文件或指定模型。

  • 只修一个 bug,不扩大改动

    把报错函数、错误信息和相邻测试粘贴到 Ottermind,要求最小补丁并明确哪些行为必须保留。运行测试、检查 diff;若失败,把准确错误或多余改动带回 Studio,只要求修正这一个差异。

  • 定位智能体重复调用工具的起点

    粘贴脱敏后的工具调用、返回值和工具 schema,询问参数从哪里丢失或循环从哪里开始。逐条对照原始轨迹;然后把第一个不一致事件带回 Studio,要求改正调用并补一条回归测试。

  • 比较两版较长的政策文件

    粘贴新旧条款并保留稳定的章节编号,要求输出包含原文引句、影响和未决歧义的变更表。回到原文核对每个引句;再在 Studio 中只重写没有证据的一行,或把确认的变更整理成负责人和截止日期清单。

  • 把会议记录整理成有负责人的待办

    粘贴逐字稿片段、说话人标签,并指定负责人、行动、日期、证据四个字段;缺失值必须写 null。对照原文检查说话人和日期,再把错误行发回 Studio,要求定点修正且不得虚构承诺。

这项任务该选 Flash 还是 Pro?

考虑因素DeepSeek-V4-FlashDeepSeek-V4-Pro
当前 API 版本DeepSeek-V4-Flash-0731DeepSeek-V4-Pro-0813
峰时输入:缓存命中 / 未命中每百万 token 0.014 / 0.44 美元每百万 token 0.044 / 1.32 美元
峰时输出每百万 token 1.32 美元每百万 token 3.96 美元
有用的选择测试运行范围明确的代码或抽取任务,记录修改次数、延迟和总 token运行同一难例;只有重试更少或边界覆盖更好时,额外费用才值得

让低 token 成本转化为实际价值

适合尝试

  • 可检查的代码迭代: 小补丁配合明确测试,既契合智能体训练方向,也让你保留控制权。保存已经接受的代码,只反馈一个失败用例,不要重新发起宽泛任务。
  • 用稳定锚点处理长文本: 1M token 上限允许更大的文本集,但章节 ID、原文引句和必填字段才能让结果可审计。要求每条重要结论都指出来源位置。

需要谨慎

  • 关键规则要能执行检查: 长指令仍可能被跳过。把关键规则变成短清单、测试或严格 schema;不合格就拒绝结果,不要因为写进提示词就默认模型遵守。
  • 上下文长度不等于上下文准确度: 长输入仍可能漏掉限定词、弄错说话人或给出无证据结论。回看相关原文,并把重试成本计入总任务成本,再决定选 Flash、Pro 还是其他模型。

两个版本阶段的用户反馈

这些来自不同界面和部署方式的个人体验,不是受控基准。4 月反馈针对 Preview,后续反馈针对 0731;它们都不能预测当前 API 延迟或你的任务结果。

工具使用表现不错,但速度取决于任务

在 4 月 24 日的一次个人开发者测试中,Comfortable-Rock-498使用自建 Cline 分支和官方 API,称 Preview 能准确完成大型代码改动中的多工具调用,但生成较慢,思考持续数分钟。0731 更新后,一位 VS Code Copilot 用户称复杂项目中跑偏更少、首次尝试成功更多。环境和任务不同,不能直接做前后对比。

忽略指令和办公文本错误仍可能发生

0731 更新后,Juulk9087称本地全精度部署会忽略项目规则;讨论中也有不同的 API 与本地体验。另一篇 LocalLLaMA 反馈展示了会议摘要漏掉语境和混淆说话人的例子。这些仍是个人本地案例,应使用自己的样本和验收标准。

从提示词到核查后的结果

1

带上证据并划定边界

从一个报错函数、带标签的段落或脱敏轨迹开始,写明预期输出、必须保留的事实和你确实能执行的检查。

2

前往 Studio 继续

打开 Ottermind Studio,必要时登录。仅在账户实际提供时选择 DeepSeek-V4-Flash。跳转只携带提示词,不会上传文件、自动选择模型或证明 API 权限。

3

只反馈准确差异

运行测试,或逐项核对引句、负责人和日期。只把失败项粘贴回对话,要求定点修订并保留已经接受的部分。

DeepSeek-V4-Flash 常见问题

API 当前使用哪个 DeepSeek-V4-Flash 版本?

截至 2026 年 9 月 8 日,API 名称 `deepseek-v4-flash` 指向 DeepSeek-V4-Flash-0731。DeepSeek 将 7 月 31 日版本描述为重新后训练的公测 API 更新,架构和规模与 Preview 相同。公告明确 App/Web 当时未更新,因此不能据此证明 0731 已在这些产品中提供。

DeepSeek-V4-Flash 能读图片吗?

普通 `deepseek-v4-flash` 仅处理文本。图片输入属于单独命名的实验型号 `deepseek-v4-flash-vision-exp`。本页不会上传图片或切换模型;除非所选界面明确提供 Vision,否则请给出文字描述。

DeepSeek API 如何收费?

Flash 当前峰时每百万 token 为:缓存输入 0.014 美元、未缓存输入 0.44 美元、输出 1.32 美元;谷时减半。峰时是 UTC 周一至周五 01:00-04:00 和 06:00-10:00。这是 DeepSeek API 计费,不是 Ottermind 价格或订阅承诺。

应该用 low、high 还是 max?

DeepSeek 提供 low、high、max,默认 high。范围明确的抽取或格式化可先试 low,日常智能体任务用 high,困难任务测量质量、延迟和输出 token 后再用 max。聊天产品提供的控制项可能与 API 不同。

带来一个能够验证的结果

把原始材料、预期结果和验收标准带到 Ottermind Studio。