值得尝试的理由
- 适合评估连续工具调用: 评估一个完整循环:阅读证据、选择工具、检查返回结果、继续修改。即使 token 单价更高,需要人工纠正的提示更少也可能划算。记录最终结果和干预次数,而不只看首条回复的速度。
- 将不同格式的证据放在一起: 发票图片、PDF 采购单和文本政策可以共同支撑同一次核对。为每份资料使用固定名称,并要求说明每个结论的依据。较大的输入额度便于集中证据,却不保证模型会毫无遗漏地关注全部内容。
Gemini 3.5 Flash 是 Google 面向多步骤工具任务和反复代码迭代的稳定版模型,于 2026 年 5 月 19 日发布。当任务需要依据测试结果逐次尝试,而非只要一段流畅回答时,它值得纳入评估。 截至 2026 年 9 月 8 日核查,准确的 API ID 为 gemini-3.5-flash,停用时间表尚未公布其关停日期。它并非最新的 Flash:API 发布记录已经列出 Gemini 3.8 Flash。本页只介绍 3.5 Flash,不代表已确认 Ottermind 接入,也不会自动选择该模型。
先选择规模小、具有代表性且结果可核验的任务。以下场景将工具调用和多模态阅读落实到具体工作。
提供失败的 CSV、导入程序和一份成功样例。在支持工具的环境中,让模型提出不同解释、构造最小复现并做局部修复。要求对两份文件都进行回归检查,让每次尝试检验一个假设,而不是重写整个导入程序。
上传扫描发票及对应采购单,要求整理编号、数量、总额和差异,并为有争议的字段标注来源页码。无法辨认的值应标为未知,总额应另行复算,核对完毕后再交由相关人员批准付款。
提供样本文档、允许使用的分类及固定输出结构,让模型提取供应商名称、日期、缺失字段,并建议每份文件的目标位置。用重复文件和工具调用失败的情况进行测试,在允许移动文件前先审阅对应关系。
把复合增长课程做成可调整假设的小计算器。先要求明确公式和边界情况,再处理视觉效果,并测试零增长及周期变化。确认方案后,可在 AI 网站构建器中继续完善。
| 选择依据 | Gemini 3.5 Flash | Gemini 3 Flash Preview | Gemini 3.1 Flash-Lite |
|---|---|---|---|
| 值得评估的原因 | 反复编程与依靠工具结果推进的修改 | 已有预览版流程,且能做回归测试 | 输出规则清晰的常规信息提取 |
| 标准输入/输出,每百万 token | 1.50/9 美元 | 0.50/3 美元;音频输入 1 美元 | 0.25/1.50 美元;音频输入 0.50 美元 |
| 发布状态 | 稳定版;未公布关停日期 | 预览版;应查看迁移指引 | 稳定版;最早关停日期为 2027 年 5 月 7 日 |
| 应该衡量什么 | 包含思考消耗的完整运行能产出多少合格修复 | 增加重试后,低单价是否仍有优势 | 字段准确率及需要人工处理的异常 |
以下是个人使用经历,并非社区共识或受控对比。产品工具、思考设置和额度限制都会影响结果。
在一则 6 月讨论中,ibrahim_build 认为 high 档位的 3.5 Flash 比 3.1 Pro 更理解任务。一名回复者提到提取流程中的函数调用更稳定。双方都指出 token 消耗高;发帖者还使用了约束较强的仓库规则,因此这不是隔离其他变量的模型测试。
Mycrene 的帖子批评回答冗长、文档工作性价比和可视化效果,同时肯定代理任务及 Canvas。该帖混合了不同产品体验和模型,也没有可复现的账单对比。可据此设计自己的报告与图形测试,但不能认定模型普遍退步。
在上方输入范围明确的任务,写清原始文件、目标输出和判断是否有用的检查项。提取任务应附上结构定义,并示范未知值应如何表示。
继续进入 Studio,按需登录。若账号可用,可选择 Gemini 3.5 Flash,也可以选用其他可用模型。期待执行操作或处理文档前,先确认文件和工具支持。
将提取字段与原文核对、运行复现步骤,或实际操作原型。保留有用的结果及证据,再要求针对性修正,避免每次都从头重做。
应用发布记录于 5 月宣布 3.5 Flash,7 月又介绍了 3.6 Flash 选择入口。这不能证明当前账号仍提供 3.5 Flash,请以模型选择器为准。若要精确评估 API,应使用 gemini-3.5-flash,而非会变化的 latest 别名。
不是,gemini-3.5-flash 是稳定版。gemini-3-flash-preview 是另一个较早的预览版 ID。Flash-Lite、Flash Image 和 Flash Cyber 也分别指不同模型,不能把它们的价格和能力套用到本型号。
本模型输出文本,不支持原生图片生成、音频生成或 Live API。读取图片、音频与生成它们是两回事。Gemini 应用的某些功能可以调用其他模型,并不会改变这个 API 的能力范围。
Google 列出了免费 API 层级,但受可用性和速率限制约束。它与付费 Standard 用量、Gemini 订阅及 Ottermind 访问权限分别计算。本页不承诺 Studio 内的 Gemini 3.5 Flash 免费或不限量。
不是。保留推理有助于连续调试,也可能延续错误假设。某个假设被否定后,应重述已核实事实、保留来源引用并检查 token 消耗。集成工具时,还需保留思考签名,并匹配函数响应的 ID、名称和数量。
把原始资料和验收标准带到 Ottermind Studio,查看可用模型,逐步得到能够检查的结果。