值得评估 Luna 的原因
- 价格接近,更值得实测: GPT-5.4 nano 文档列出的标准输入费率相同,输出费率略高。Luna 的上下文更大,但默认推理档位不同,同一提示词不一定产生相同账单或响应时间。
- 便于接入审核流程的结果: 支持结构化输出与函数调用。可以定义包含类别、证据和审核状态的记录,检查必填字段,再抽样与原文核对。符合数据结构有助于系统接入,但不能证明判断正确。
GPT-5.6 Luna 是 OpenAI 于 2026 年 7 月 9 日发布的 GPT-5.6 系列中注重成本的型号。截至 2026 年 9 月 8 日,API 模型文档列出的标识为 gpt-5.6-luna,没有带日期的快照。本页只介绍 Luna;OpenAI 其他型号的更新不改变 Luna 自身的规格。 当前 ChatGPT 帮助页说明,Luna 正逐步成为 Free 和 Go 的默认模型,也用于 Think。ChatGPT、Codex 与 API 各有使用条款。这些产品的上架信息均不能证明 Ottermind 已接入 Luna。
从自己能够判断对错的样本开始。以下是供评估的工作方式,并非针对你的数据测得的效果保证。
提供匿名化工单、各队列的定义,以及类别交叉的例子。要求每条工单给出一个去向和引用原文的理由,无法确定时标记升级处理。在结果影响真实客服队列之前,先检查分错的案例。
提供一组评论和固定主题列表,让 Luna 输出主题标签、代表性原话,并将新问题单独归档。用原始记录核对数量,让高频投诉保持可见,同时避免重复评论夸大某项需求。
提供预期行为、涉及的函数和现有测试,要求补充边界用例并完成小范围实现,再独立运行测试。架构决定要说清楚;如果反复修补耗掉一天,第一次生成便宜也就失去了意义。
提供清晰的设置页截图和需要的字段,要求列出可见值、对应位置,并把遮挡内容标为未知。亲自对照图片检查后,再将提取出的设置视为可信清单。
| 选择依据 | GPT-5.6 Luna | GPT-5.4 nano |
|---|---|---|
| 标准 API 每百万 token 输入/输出价格 | USD $0.20 / $1.20 | USD $0.20 / $1.25 |
| 上下文窗口(token) | 1,050,000 | 400,000 |
| API 默认/最高推理档位 | medium / max | none / xhigh |
| 适合何时评估 | 证据材料更多,或需要更多推理档位的任务 | 已有稳定效果、只需少量推理的分类或提取流程 |
这些报告对应具体使用环境,适合用来设计评估,并不代表共识,也不能预测你的结果。
在一项单题对比中,Luna XHigh 和 Max 都提交了通过 LeetCode 的解答,那次运行中 XHigh 更快、更便宜。作者指出,题目可能出现在训练数据里,没有真实仓库上下文,API 估算也未包含缓存写入。评论者有人反馈真实项目中错误更多,但个人经历不能推导出失败率。
一位核查提交说明生成费用的 Zed 用户报告了大量缓存写入,实际收费高于新的直连 API 费率。回复讨论了托管供应商和加价。这段历史讨论不能证明 Zed 今天的价格;应核对自己实际使用的供应商、缓存计费和账单。
附上原始材料、预期字段和几个正确示例,说明哪些情况下应该保留未知值或请求人工审核。
进入 Studio,按需登录。如果你的账户可用,选择 GPT-5.6 Luna,再检查工具和使用条款。本页不会自动选中该模型。
检查错误与遗漏,记录时间和费用,并保留一小套评估样本。样本达到验收标准后,再扩大处理范围。
不是。OpenAI 将 Luna 大致定位在早期 nano 档位,但 gpt-5.6-luna 是独立型号。它的上下文大小和默认推理设置与 GPT-5.4 nano 不同;迁移前要测试,不应只替换模型标识。
原生支持文本输入和输出,以及图片输入,不原生支持音频或视频。连接的工具可以补充图片生成等能力;实际可用工具取决于托管平台和账户。
不能把 token 费率直接换算成订阅限制。7 月更新涉及 API 和积分价格;ChatGPT、Codex 的使用规则由产品和套餐决定,第三方平台也可能采用不同计费方式。
没有适用于所有任务的结论。对固定分类任务,应使用同一批样本比较准确性、等待时间和总 token 数。选用能达到质量标准的最低档位,并审核它无法判断的案例。
把证据与示例带到 Ottermind Studio,在核对过的结果上继续工作。