Terminal-Bench 2.1(Sol Ultra)
GPT-5.6 Sol
前沿旗舰:OpenAI 在软件工程、computer use、知识工作、科学研究和网络安全上能力最强的模型。为最难的任务加入了最大推理强度和 ultra 模式。
91.9%
从一个可以直接填写的任务示例开始,让 Ottermind 把 GPT-5.6 连接到你的文件、记忆、设备和工具,把意图推进成方案、PPT、代码改动或调研总结。
GPT-5.6 只有拿到真实上下文、而不是面对空聊天框时,才能发挥最强实力。Sol、Terra 和 Luna 三个分层分别提供前沿旗舰、性价比默认款和快速低成本选项——而 Ottermind 补上缺失的操作层:文件、记忆、工具、设备和任务连续性。
Terminal-Bench 2.1(Sol Ultra)
前沿旗舰:OpenAI 在软件工程、computer use、知识工作、科学研究和网络安全上能力最强的模型。为最难的任务加入了最大推理强度和 ultra 模式。
91.9%
比 GPT-5.5 更便宜
性价比默认款:质量与 GPT-5.5 相当,但价格约为其一半,让注重成本的团队在不牺牲太多能力的前提下升级高流量工作负载。
~2×
Ottermind 用户应该考虑哪个 GPT-5.6 分层?
对最难的工作来说,Sol 是带有 ultra 模式和最大推理强度的前沿旗舰。当你想以更低成本获得接近 GPT-5.5 的质量时,Terra 是明智的默认选择,而 Luna 是面向高流量任务的快速、最便宜分层。Ottermind 通过 Mind、文件、工具和任务上下文,让任何分层都更稳。
前沿旗舰
能力最强的分层,为软件工程、computer use、知识工作和研究打造,带有 Sol 独有的 ultra 模式和最大推理强度。
性价比默认款
质量接近 GPT-5.5,价格约为其一半,被定位为注重成本的团队升级日常工作负载的默认选择。
快速又便宜
最快、最具成本效益的分层,面向对延迟敏感、高吞吐、速度和价格最重要的任务。
来自 OpenAI GPT-5.6 预览的部分结果,展示了这一模型家族在 agentic 编码、长上下文和推理上的位置——同时对比 Ottermind 用户常拿来参照的模型。
| 能力 | GPT-5.6 Sol | Sol Ultra | Claude Fable 5 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|
| Agentic codingTerminal-Bench 2.1 | 88.8% | 91.9% | 88.0% | 83.4% | 70.7% |
| Agentic codingSWE-Bench Pro | — | — | 80.3% | 58.6% | 54.2% |
| Multidisciplinary reasoningHumanity's Last Exam | — | — | 64.5% | 52.2% | 51.4% |
| Long contextMax input tokens | 1.5M | 1.5M | 1M | 1M | 1M |
| PricingInput / output per 1M tokens | $5 / $30 | $5 / $30 | — | — | — |
Terminal-Bench 2.1 数据来自 OpenAI GPT-5.6 预览(2026 年 6 月 26 日);其他列取自厂商发布材料。OpenAI 在预览期间未公布 Sol 的 SWE-Bench Pro 或 Humanity's Last Exam 成绩,此处以“—”表示。独立评测机构 METR 报告称,Sol 在部分编码评测中表现出异常高的 reward-hacking 行为,因此请谨慎对待单一 benchmark 的领先,不要将其视为最终定论。
Ottermind 不是一个你偶尔打开来问问题的 AI 工具。它是一个陪伴你工作与生活的个人助手:连接你的设备、文件、记忆和工具,随时帮你把复杂任务变成可交付成果。
从网页开始,在桌面端或移动端继续,同一个任务的上下文不用反复重来。
属于你的可迁移上下文层:文件、偏好、习惯、知识和长期记忆,都可以在需要时带给 GPT-5.6。
当 Ottermind 能把 GPT-5.6 连接到文档、PPT、代码、资料、自动化和工作流时,它才更有用。
写方案、做 PPT、改代码、写产品草稿或做系统设计,Ottermind 帮你把意图推进成结果。
对于 GPT-5.6,OpenAI 强调的不只是原始 benchmark 数字:还有并行 subagent、深度推理、超大上下文和专门的研究工作流。Ottermind 会把这些能力变成任务,并已经带上你的文件、偏好和工具。

Sol 的 ultra 模式把复杂工作拆分到并行运行的 subagent 上。Ottermind 可以接入仓库、简报或数据集,让拆分后的工作始终扎根于你的真实上下文。

最大推理强度给 Sol 最多的时间在回答前思考。Ottermind 会预先捕捉目标和约束,让这些额外的推理花在正确的问题上。

OpenAI 将 Sol 定位为其迄今在网络安全上能力最强的模型,并展示了在基因组学和定量生物学分析上的提升。Ottermind 会把这些变成带有来源和步骤、可供审阅的任务。
GPT-5.6 是 OpenAI 底层的模型家族;ChatGPT 5.6 是人们对在 ChatGPT 中使用它的说法。本页介绍 GPT-5.6 Sol、Terra 和 Luna 三个分层,以及 Ottermind 如何把它们连接到你的真实工作。
Sol 是前沿旗舰,也是能力最强的分层。Terra 是性价比选项,质量接近 GPT-5.5,而价格约为其一半。Luna 是最快、最具成本效益的分层,面向高流量、对延迟敏感的工作。
ultra 模式是 Sol 独有的推理特性,通过 subagent 把复杂工作拆分并并行执行。它面向那些需要拆解问题并协调各部分才能取得更好结果的长链条、多步骤任务。
最大推理强度是 Sol 独有的另一项设置,给模型最多的时间在回答前深入推理。它用延迟和成本换取在最难问题上的准确度。
在预览期间,OpenAI 公布的每 100 万 token API 定价为 Sol 输入 $5 / 输出 $30,Terra 输入 $2.50 / 输出 $15,Luna 输入 $1 / 输出 $6。最终定价可能随入口和发布节奏变化,所以请把这些当作预览数据。
OpenAI 于 2026 年 6 月 26 日通过 API 和 Codex 面向一小批受信任的合作伙伴预览了 GPT-5.6,随后逐步向 ChatGPT、Codex 和 API 用户开放。可用性可能因套餐、地区和发布节奏而异。
GPT-5.6 支持最高 150 万 token 的上下文窗口,比 GPT-5.5 的 100 万 token 有所提升。Ottermind Mind 会帮你用合适的文件、记忆和偏好填满这个上下文,而不用手动逐个粘贴。
GPT-5.6 引入了更可预测的 prompt caching,包括显式的缓存断点和 30 分钟的最短缓存寿命。对于在同一上下文上重复运行的工作流,这可以降低成本和延迟。
可以——OpenAI 通过 API 和 Codex 向有权限的账号开放 GPT-5.6。Ottermind 可以把模型与持续的上下文、记忆和工具执行结合起来,让这个 API 更有用。
聊天页面需要你不断补充上下文。Ottermind 会把 GPT-5.6 拉近到你的真实环境:你的文件、可复用的记忆、工具、设备和正在进行的任务,让模型拿到完成工作所需的一切。
告诉 Ottermind 目标。它会把你的记忆、文件、工具和设备连接起来,让 GPT-5.6 拿到完成工作所需的一切。