
Hello! 各位 AI 開發者大家好 👋
最近我開始升級到 OpenAI GPT-5.6 API 了。這次不只是模型能力升級,也帶來不少值得 Agent 開發者關注的 API 更新。
首先,GPT-5.6 分成三種型號:Sol 是能力最強的旗艦模型,適合複雜 coding、研究與專業任務;Terra 在能力、速度與價格之間取得平衡;Luna 則主打低成本與高流量工作。

有趣的是,從官方公布的 Artificial Analysis Coding Index 可以看到,隨著 reasoning.effort 提高,Luna 或 Terra 可以超越高一級模型的低推理設定。模型選擇因此變成兩個維度:要選多大的模型,以及願意讓它思考多久。這也讓多模型調度更有發揮空間。如果是非用戶即時的任務 latency 不重要時,可以考慮多用 Luna 模型把推理程度調高,以此來節省成本。
Prompt Caching
這次另一個重要改變是 Prompt Cache 開始區分 Explicit 和 Implicit 模式,並開始收取寫入費用。
如果把一般 input (無快取寫入)費率視為 1 倍,快取命中的 input 是 0.1 倍,會寫入快取的 input 則是 1.25 倍。注意,這三種 input 情況是三擇一。
預設是用 Implicit 模式,會自動在最新一則 user 或 tool message 放置快取斷點,適合使用者會繼續對話的 Agent 場景。
如果是不會延續對話的 Workflow 場景,我建議使用 Explicit 模式,自行明確指定快取斷點,或乾脆不做快取寫入,來最佳化成本。
官方文件:Prompt Caching
Programmatic Tool Calling
另一個很值得研究的是 Programmatic Tool Calling,簡稱 PTC。
PTC 讓模型產生一段在 OpenAI 託管環境中執行的 JavaScript,並在程式裡使用平行呼叫、迴圈與條件判斷來呼叫 tools。
假設 Agent 要連續執行數十次操作、查詢資料,以前每次工具呼叫與結果都要經過模型,所有中間結果也都會進入 context。現在可以先在程式裡平行查詢、過濾和彙整,最後只把程式執行結果送回模型。
PTC 特別適合搭配許多小粒度的 tools 進行動態編排、平行查詢,以及處理工具輸出很大,或控制流程可以直接用程式表達的任務。相較於準備一個完整沙箱讓 Agent 執行程式,PTC 的 V8 執行環境非常輕量。它沒有檔案系統、套件安裝與直接網路存取,因此啟動與執行速度都很快。
官方文件:Programmatic Tool Calling
OpenAI Agents SDK 也已經支援,用起來非常簡單:Agents SDK Programmatic Tool Calling,你可以指定哪些 tools 使用 function calling 呼叫、哪些使用 PTC 呼叫,或兩種方式都可以。
這個概念最早可以追朔自 CodeAct 論文,可以參考我之前整理過的 從 Code Act 到 Claude Code Dynamic Workflows 深度技術解析 。
Persisted Reasoning
最後還有一項不太顯眼但對長時間執行的 Agent 很重要的改變:Persisted Reasoning。
GPT-5.6 以前的模型預設使用 current_turn,只會把目前 turn 的 reasoning items 放進模型 context,先前回合的 reasoning items 即使仍保留在 API 的對話紀錄中,也不會放進模型 context。這裡的 turn 是指從一次 user 輸入開始,到那次 AI 完成輸出,期間可能包含多次 function calling,以及相應的 function call、function output 和 reasoning items。OpenAI 有篇 Cookbook 透過完整範例與圖解說明了這個概念:Better performance from reasoning models using the Responses API。
GPT-5.6 則改成預設使用 all_turns,會把先前回合的 reasoning items 延續到下一輪,改善多輪任務的推理連續性與快取效率。原先 current_turn 的好處是可以減少 context window 用量,不過近期 Claude 模型也採取類似的跨回合保留 thinking 設計。為了讓 Agent 預設取得較好的多輪表現跟 Benchmark 分數,這個改變也算合理。
官方文件:Preserve reasoning across calls
GPT-Live
OpenAI 也發表了新的語音模型 GPT-Live,目前已經用在新版 ChatGPT Voice。
GPT-Live 可以持續聆聽並同時說話,不再需要把語音對話切成一輪一輪。使用者停頓時,它可以繼續等待;也能在適當時機回應、暫停、插話或呼叫工具,互動方式更接近真人對話。遇到搜尋、深度推理或複雜任務時,它可以把工作委派給背後的 frontier model,自己則繼續維持對話。
這跟我之前在這期電子報介紹的 Interaction Models 很像:一個模型負責即時互動,另一個模型負責深度工作。沒想到 OpenAI 這麼快就做出來並正式上線了。
目前已經開放給 ChatGPT 使用者,但還沒有開放 API 可以使用,還要再等等。
⬇️ 以下是自上期以來,使用 AI 整理生成的文章 ⬇️
內容很多,我就不一一點評摘要了,特別推薦的我放個 👍
- Marc Andreessen:AI 是 80 年的一夜成功,而真正的阻力不是技術
- 你的 Prompt 通得過 The Mom Test 嗎?如何避免 LLM 的迎合問題
- Claude Fable 5 的 Prompting 要點:該刪的比該加的多
- 如何萃取老師傅的知識做成 Agent Skill?六條路線的方法論框架
- 為什麼 context window 會卡在 1M 很多年?SemiAnalysis 談 40 年一遇的記憶體短缺 👍
- Agents’ Last Exam:測 AI Agent 能不能真的上工,順便盤點還沒飽和的 Agent benchmark
- LLM-as-Judge 與其打總分,不如拆解成 Yes/No 檢核清單 👍
- 倢愷 Oscar 的 Agent Harness 四部曲導讀:從 function call 到 LLM Wiki 👍
- Matt Pocock 的 Agent Skill 設計哲學
- 2026 年的 RAG 最新發展:瓶頸不在模型,也不在檢索,在文件解析 👍
- 「很難 eval」是產品設計的警訊:讓 AI 輸出可驗證、可信任的 UX 設計 👍
- Hex 怎麼做資料 Agent:難的不是寫 SQL,是沒辦法驗證答案對不對 👍
- Agent Eval 怎麼做?2026 兩大方法論的交鋒與共識 👍
- AI-enabled、AI First、AI Native: 一份 Excel 週報看懂五個階段 👍
希望你會喜歡這集內容!有任何想跟我分享的事情,也歡迎直接回覆這封信給我。
– ihower