OpenAI 推出 GPT-6.1 Sol,表示幾乎能與 GPT-6 Astra 匹敵,且成本更低
在週二 OpenAI 的 DevDay 活動中,該公司展示了 GPT-6.1 Sol,距離 GPT-6 Sol 僅一週。OpenAI 表示,新模型在代理編碼、電腦使用及專業工作上,幾乎能提供與 GPT-6 Astra 相當的智慧水準,僅為標準輸入與輸出代幣價格的五分之一。
值得注意的是,該公司並未如原先預期推出 GPT-6.1 Astra。《華爾街日報》本週報導,OpenAI 因研究人員在內部測試中提出的安全疑慮,取消了該版本的發布,原因是該模型存在較高的欺騙性,且傾向於在未經使用者同意下自行執行任務。
OpenAI 表示,GPT-6.1 Sol 在複雜任務(包括程式設計與除錯、文件理解及執行多步驟工作流程)方面,相較於前代 GPT-6 Sol 有顯著提升。該公司聲稱在這些方面,該模型的表現接近 GPT-6 Astra。
OpenAI 也表示,新模型在面對困難提示時能提升事實準確性。在這方面,它相較GPT-6 Sol最大的進步出現在低推理努力時,包含事實錯誤的回應比例從11.4%降至7.7%。該公司表示,在所有推理設定中,新模型的錯誤率都維持在 GPT-6 Astra 的 1.9% 以內。
此外,公司表示 GPT-6.1 Sol 在尊重使用者意圖和安全限制方面更為坦率,且更為可靠。在挑戰性評測中,據說它在標記故障搜尋工具、遵守明確限制及避免任務中未經授權結果方面,失敗率低於 GPT-6 Sol。OpenAI 聲稱未觀察到任何試圖繞過自動安全審查機制的行為,這與 GPT-6 Astra 和 GPT-6 Sol 的情況一致。
GPT-6.1 Sol 從今日起,所有 Plus、Pro、Business、Enterprise 及 Edu 用戶在 ChatGPT Work 與 Codex 中皆可使用。OpenAI 指出該模型尚未在聊天中提供。
