愛好 AI Engineer 電子報 🚀  OpenAI GPT-5.6 發布 #40

歡迎訂閱 📬 愛好 AI Engineer 電子報 過往期數點這 📚

Hello! 各位 AI 開發者大家好 👋

最近我開始升級到 OpenAI GPT-5.6 API 了。這次不只是模型能力升級,也帶來不少值得 Agent 開發者關注的 API 更新。

首先,GPT-5.6 分成三種型號:Sol 是能力最強的旗艦模型,適合複雜 coding、研究與專業任務;Terra 在能力、速度與價格之間取得平衡;Luna 則主打低成本與高流量工作。

有趣的是,從官方公布的 Artificial Analysis Coding Index 可以看到,隨著 reasoning.effort 提高,Luna 或 Terra 可以超越高一級模型的低推理設定。模型選擇因此變成兩個維度:要選多大的模型,以及願意讓它思考多久。這也讓多模型調度更有發揮空間。如果是非用戶即時的任務 latency 不重要時,可以考慮多用 Luna 模型把推理程度調高,以此來節省成本。

Prompt Caching

這次另一個重要改變是 Prompt Cache 開始區分 Explicit 和 Implicit 模式,並開始收取寫入費用。

如果把一般 input (無快取寫入)費率視為 1 倍,快取命中的 input 是 0.1 倍,會寫入快取的 input 則是 1.25 倍。注意,這三種 input 情況是三擇一。

預設是用 Implicit 模式,會自動在最新一則 user 或 tool message 放置快取斷點,適合使用者會繼續對話的 Agent 場景。

如果是不會延續對話的 Workflow 場景,我建議使用 Explicit 模式,自行明確指定快取斷點,或乾脆不做快取寫入,來最佳化成本。

官方文件:Prompt Caching

Programmatic Tool Calling

另一個很值得研究的是 Programmatic Tool Calling,簡稱 PTC。

PTC 讓模型產生一段在 OpenAI 託管環境中執行的 JavaScript,並在程式裡使用平行呼叫、迴圈與條件判斷來呼叫 tools。

假設 Agent 要連續執行數十次操作、查詢資料,以前每次工具呼叫與結果都要經過模型,所有中間結果也都會進入 context。現在可以先在程式裡平行查詢、過濾和彙整,最後只把程式執行結果送回模型。

PTC 特別適合搭配許多小粒度的 tools 進行動態編排、平行查詢,以及處理工具輸出很大,或控制流程可以直接用程式表達的任務。相較於準備一個完整沙箱讓 Agent 執行程式,PTC 的 V8 執行環境非常輕量。它沒有檔案系統、套件安裝與直接網路存取,因此啟動與執行速度都很快。

官方文件:Programmatic Tool Calling

OpenAI Agents SDK 也已經支援,用起來非常簡單:Agents SDK Programmatic Tool Calling,你可以指定哪些 tools 使用 function calling 呼叫、哪些使用 PTC 呼叫,或兩種方式都可以。

這個概念最早可以追朔自 CodeAct 論文,可以參考我之前整理過的 從 Code Act 到 Claude Code Dynamic Workflows 深度技術解析

Persisted Reasoning

最後還有一項不太顯眼但對長時間執行的 Agent 很重要的改變:Persisted Reasoning。

GPT-5.6 以前的模型預設使用 current_turn,只會把目前 turn 的 reasoning items 放進模型 context,先前回合的 reasoning items 即使仍保留在 API 的對話紀錄中,也不會放進模型 context。這裡的 turn 是指從一次 user 輸入開始,到那次 AI 完成輸出,期間可能包含多次 function calling,以及相應的 function call、function output 和 reasoning items。OpenAI 有篇 Cookbook 透過完整範例與圖解說明了這個概念:Better performance from reasoning models using the Responses API

GPT-5.6 則改成預設使用 all_turns,會把先前回合的 reasoning items 延續到下一輪,改善多輪任務的推理連續性與快取效率。原先 current_turn 的好處是可以減少 context window 用量,不過近期 Claude 模型也採取類似的跨回合保留 thinking 設計。為了讓 Agent 預設取得較好的多輪表現跟 Benchmark 分數,這個改變也算合理。

官方文件:Preserve reasoning across calls

GPT-Live

OpenAI 也發表了新的語音模型 GPT-Live,目前已經用在新版 ChatGPT Voice。

GPT-Live 可以持續聆聽並同時說話,不再需要把語音對話切成一輪一輪。使用者停頓時,它可以繼續等待;也能在適當時機回應、暫停、插話或呼叫工具,互動方式更接近真人對話。遇到搜尋、深度推理或複雜任務時,它可以把工作委派給背後的 frontier model,自己則繼續維持對話。

這跟我之前在這期電子報介紹的 Interaction Models 很像:一個模型負責即時互動,另一個模型負責深度工作。沒想到 OpenAI 這麼快就做出來並正式上線了。

目前已經開放給 ChatGPT 使用者,但還沒有開放 API 可以使用,還要再等等。

⬇️ 以下是自上期以來,使用 AI 整理生成的文章 ⬇️

內容很多,我就不一一點評摘要了,特別推薦的我放個 👍


希望你會喜歡這集內容!有任何想跟我分享的事情,也歡迎直接回覆這封信給我。

– ihower

發佈留言

發表迴響