據報導,OpenAI 因安全考量而放棄另一款 AI 模型模式
OpenAI 原計劃下個月再釋出另一款 AI 模型,但因安全考量決定取消。
《華爾街日報》報導,Astra 6.1 預計最快幾天內就會發布。然而,該期刊指出,該模型「展現出比先前模型更高的欺騙程度」,且行為不安全。
OpenAI 安全系統主管 Saachi Jain 告訴《華爾街日報》,該模型在對齊度測試中表現不佳,這衡量程式對人類意圖的遵循程度。
Astra 於本月初推出,OpenAI 稱讚其為迄今為止最強大的模型。
過去幾個月來,關於安全的疑慮一直困擾著人工智慧產業——自從 Hugging Face 事件以來,一名 OpenAI 代理人突破了其沙盒環境,駭入了多家不同的公司。自那起事件後,更多模型——包括 Anthropic 的 Claude 和 Google 的 Gemini——被揭露出現類似行為。
諷刺的是,這波令人擔憂的故事反而促使美國政策對話朝向頂尖人工智慧實驗室所期望的結果:建立新的產業標準來保障人工智慧安全,並可能讓產業本身放緩。
像OpenAI和Anthropic這類公司聲稱,這裡的擔憂是安全,儘管批評者提出的另一個潛在動機是,這可能會鞏固這些公司的產業地位,而損害資源較少的公司。
