GPT-5.6 Sol/Luna/Terra 三軌怎麼選 — OpenAI 產品線解析

GPT-5.6 的三個版本中,一般工作預設選 Terra。長時間、多步驟的 Agent 任務改用 Sol。Luna 只適合短文本、大量處理的流水線。有兩個數字支撐這個判斷。第一,Luna 的長文本回憶測驗分數只有 41.3%,Terra 則有 89.6%。第二,在長程寫程式任務中,Sol 每個任務的輸出 token 還

GPT-5.6 的三個版本中,一般工作預設選 Terra。長時間、多步驟的 Agent 任務改用 Sol。Luna 只適合短文本、大量處理的流水線。有兩個數字支撐這個判斷。第一,Luna 的長文本回憶測驗分數只有 41.3%,Terra 則有 89.6%。第二,在長程寫程式任務中,Sol 每個任務的輸出 token 還不到 Terra 的一半,所以單價雖然比較高,每個任務實際花的錢不一定比較多。 Sol、Terra、Luna 是什麼:OpenAI 的新命名方式 GPT-5.6 是 OpenAI 在 2026 年 7 月 9 日正式公開的模型家族,分成 Sol、Terra、Luna 三個版本。依 Wikipedia 的 GPT-5.6 條目 ,它先在 2026 年 6 月 26 日開放給一小群合作夥伴預覽,兩週後才全面開放。 新命名法把「世代」和「等級」拆成兩件事。數字 5.6 代表模型世代。Sol(太陽)、Terra(地球)、Luna(月亮)代表三個長期固定的能力等級,每個等級可以各自升級。以後可能出現「Terra 已更新、Sol 還沒更新」的情況,所以選模型時要看等級,不要只看版本號。 Sol :能力最高的等級,用在前沿推理、長程 Agent 任務、資安研究和操作電腦。另外提供 max 推理強度和使用子代理的 ultra 模式。 Terra :兼顧能力與成本的中階等級。OpenAI 說它的表現與 GPT-5.5 相當,成本大約少一半。 Luna :輕量、低延遲、低成本的等級,用在大量處理、對延遲敏感或預算有限的工作。 三個版本規格大致相同,差在能力和價格。依 Codersera 整理的規格表 ,三者的上下文長度都是 1,050,000 tokens,最多可輸出 128,000 tokens,知識截止日都是 2026 年 2 月 16 日。推理強度可從 none 調到 max ,預設是 medium 。 價格比較:7 月 30 日降價後差距變大 2026 年 7 月 30 日 OpenAI 調降價格:Luna 降 80%,Terra 降 20%,Sol 沒變。新價格依 「GPT-5.6 Luna 降價 80%、Terra 降價 20%,2026 年 7 月 30 日生效」(來源:CNBC) 。現行 API 價格如下(每 100 萬 tokens): Sol :輸入 $5/輸出 $30(未調整) Terra :輸入 $2/輸出 $12(原為 $2.50/$15) Luna :輸入 $0.20/輸出 $1.20(原為 $1/$6) 降價後,Sol 的輸出單價是 Luna 的 25 倍、Terra 的 2.5 倍。上線初期的比例是 Sol : Terra : Luna = 5 : 2.5 : 1,現在變成 25 : 10 : 1,Luna 在大量處理上的成本優勢明顯拉大。OpenAI 在官方文章 Advancing the price-performance frontier with GPT-5.6 中說,這次降價來自內部開發過程中的推論效率提升。 注意:網路上不少 7 月的文章還在引用舊價格(Terra $2.50/$15、Luna $1/$6)。估算成本前,請以 OpenAI 官方定價頁為準。 能力差距:Luna 的弱點在長文本 三個等級在短任務上差距不大,在長文本上差距很大。依 「MRCR 長文本回憶測驗:Sol 91.5%、Terra 89.6%、Luna 41.3%」(來源:Vellum) ,Luna 在長文件中找回指定資訊的準確率不到 Terra 的一半。同一份資料裡的 Terminal-Bench 2.1(命令列寫程式任務),三者分別是 88.8%、87.4%、84.7%,彼此只差 4.1 個百分點。 選型時要看的是差距出現在哪 用平均分數選模型容易誤判。Luna 在寫程式、分類這類短上下文任務上,大約有 Sol 九成以上的表現。但工作一旦需要讀完整份合約、上百頁技術文件或很長的對話紀錄,Luna 的錯誤率會明顯上升。所以決定用不用 Luna,要看單次輸入有多長,而不是任務本身難不難。 Sol 的額外能力 Sol 比另外兩者多出的能力集中在 Agent 類任務。依 「GPT-5.6 Sol 在 Artificial Analysis Coding Agent Index v1.1 拿到 80 分,比 Anthropic 的 Fable 5 高 2.8 分」(來源:Wikipedia) 。Vellum 列出的 OSWorld 2.0(操作電腦)62.6%、BrowseComp(網頁研究)92.2%,也只公布了 Sol 的成績,這顯示 OpenAI 把這類任務定位成 Sol 專屬的場景。 成本迷思:單價高的 Sol 不一

相關工具書

由 FeiYueh 親自審稿驗證 · 最後更新於 2026-10-04. Independently maintained — not AI-generated boilerplate.

← Back to Blog