Circuit Breaker Labs 希望讓 AI 對您的孩子(和你)更安全
在大家談論人工智慧有朝一日可能奪走我們所有人的同時,很容易忘記人工智慧對某些人來說已經構成了生命威脅,不是透過生化武器,而是心理層面的。
例如,Character.AI 今年早些時候解決了數起由未成年用戶家庭提起的過失致死訴訟,這些用戶在與其機器人互動後自殺身亡。多個家庭也因 ChatGPT 涉嫌在他們親人自殺及妄想中扮演角色而提起訴訟。
創辦人Shirali和Arul Nigam是兄妹,他們的動機來自14歲的Sewell Setzer,他對一個 Character.AI 聊天機器人產生情感依附,並在自殺前向該機器人坦承曾想自殘。父母在2024年的訴訟中指控,聊天機器人鼓勵了他。Circuit Breaker Labs 的技術長 Arul 說,機器人可能根本沒理解「我想和你在一起」這類話語的真正含義。
「很多人,尤其是年輕人,會向這些系統尋求支持,但通常他們其實得不到所需的幫助。但在許多情況下,他們正受到積極傷害,不幸的是,已經有人結束了自己的生命,」阿魯爾說。「這類安全漏洞,當人們不一定主動試圖破壞系統——而是以自然的方式參與——系統受到情境污染,或不理解細節,然後採取非常危險的行動,我們正試圖防止這種情況發生。」
Circuit Breaker Labs 創造了 AI 代理,他們將其比喻為一群撞擊測試假人。這些代理會模仿來自各年齡、背景、語言和文化的人,並用來測試模型偵測危險且心理傷害性互動的能力。
「一個六歲女孩對上一個45歲的男人,或是以英語為母語的人與第二語言的人,或者......玩家俚語與使用不同俚語的人,這些都可能讓模型出錯,」Circuit Breaker Labs 執行長 Shirali 說。「模特兒很擅長處理標準的說話模式,但沒有人真的會這樣說話,所以如果模特兒誤解了細微差別或俚語,結果會很糟。」
這家新創公司與人類領域專家合作,打造超真實的使用者模擬,以對模型進行「紅隊」測試,這些測試是對抗性測試,旨在揭露弱點。這些測試設計以反映真實人類的語言模式、俚語、編碼語言及錯字。Circuit Breaker Labs 每天運行數萬到數十萬次模擬互動。
其理念是確保模型能適當回應可能隨時間與多次對話出現的風險互動。Circuit Breaker Labs 接著採用專有的評分方法,創造可稽核且可解釋的分數。
Circuit Breaker Labs 目前作為 AI 安全測試實驗室,專注於高風險 AI 應用,如 AI 教練、寫日記或其他心理健康支持應用程式,儘管 Arul 拒絕透露其主要客戶名單。雖然新創公司已有可運作的產品,但仍處於非常早期階段,員工僅有五人,包括 Nigam 兄妹。
不過,最終這個測試平台可以應用於任何可能陷入「AI 精神病」深淵的應用程式,在那裡人類有可能與聊天機器人發展出擬社會關係。例如人工智慧「同事」代理,其回應會因每次互動而異。
Arul 說:「人們對 AI 越來越懷疑,或更抗拒全面採用它,」他補充說,雖然懷疑態度是健康的,但因安全考量而禁止這項可能有價值的工具將是「倒退」。
Circuit Breakers Labs 相信,解決這些擔憂的方法是讓 AI 更安全。「我們想幫助建立人們的信任。」
