Opus 5.5 喜歡告訴你「這很重要」(其他 AI 寫作也會告訴你)
現在 LLM 生成的散文無處不在,人類渴望找到方法來嗅出它。雖然早期的破折號和「挖掘」等特徵早已消失,但研究人員表示,AI 模型在撰寫散文時仍會依賴許多明顯的習慣。
行銷公司Graphite的一項新研究探討了前沿模特兒的書寫習慣,並找出每位模特最喜愛的單字與片語。雖然像 em-dash 這類舊有的特徵已被淘汰,但模型仍回歸強烈對比度的結構,每個版本都有其獨特的怪癖。最大的驚喜是徵兆的範圍竟然如此廣泛。Graphite 發現 13,000 個短語在 AI 內容中至少是人類內容的兩倍——這正是他們對「tell」的定義。
「事實證明,Claude 模型隨著時間推移,實際上正越來越接近人類字的分布,」Graphite 首席 AI 官 Greg Druck 說:「而對於GPT模型來說,情況越來越遠了。」
大規模研究 AI 生成的寫作需要謹慎的研究設計。Graphite 起初擁有一個包含 10,000 篇文章的語料庫,這些文章在 ChatGPT 推出前就已發表,作為人類生成的對照組。接著研究人員讓不同的 AI 模型根據摘要重寫文章,希望盡可能消除來源偏見。透過人類與各模型的匹配樣本,他們能比較某些詞彙和片語在 AI 寫作中的出現頻率,以及句子結構中的更廣泛模式。
根據Graphite的結果,Claude Opus 5.5中最大的特徵是「可靠」這個詞,這個詞的出現頻率是人體樣本的23倍。雖然Opus 5.5現在避免了「不是X,是Y」的句子結構,但它仍傾向於說「不只是X,是Y」。
最重要的是,Opus 喜歡告訴你為什麼事情重要,他使用「這很重要」這句話的頻率是人類寫作的 116 倍,而「為什麼 X 重要」則是 92 倍。
OpenAI 的 Astra 則提供了不同的線索。這個模型喜歡描述它所談論事物的「另一個維度」,並傾向於透過「可能提供」或「能提供」特定利益來對沖主張。它最大的特徵是 Graphite 所謂的「修正框架」,即將主題定義為「不只是 X」或作為替代方案,而是「依賴 X」。根據石墨的研究,這些結構在阿斯特拉生成的散文中比人類文字多出一百倍以上。
值得注意的是,所有 Frontier 實驗室似乎都回應了模型過度使用長短線的想法。在 Graphite 的樣本中,作品 5.5 使用標點符號的頻率比作品 5 少 99%。Astra 現在比人類樣本少用 88%,而 Gemini 3.1 Pro 幾乎完全取消了 em-dash 這個字。
雖然個別數據有所變動,Graphite表示整體數字大致保持穩定。「並不是說這些跡象減少了,」Druck 說:「他們正在清除最明顯的徵兆,但其他徵兆還是會冒出來。而且每個型號都有自己的版本。」
令人驚訝的是,實驗室專注於類似人類的寫作風格,這些暗示竟然如此持續存在。在 Opus 5.5 版本中,Anthropic 自豪地表示該模型「比先前的模型更自然地溝通」,並表示早期使用者「發現其文字更清晰且更容易理解」。
OpenAI 在發布 GPT-6 版本的 Sol 和 Luna 時也曾提出類似說法,表示用戶「可以期待看到更清晰的文字、更少的行話,以及更少的奇怪措辭」。
但 Druck 對實驗室能做多少完全消除明顯的結構或片語持懷疑態度。
「我有一個普遍的假設,實驗室對這些東西的控制能力比你想像的還要差,」Druck說。「這些是擁有數十億參數的巨大模型。他們能做的測試數量有限,結果還是會漏掉。」
