AI RACE— 每日追蹤 AI 競爭賽局
Language Models

研究指出:儘管極力消除,前沿模型仍存在標誌性語言破綻

行銷公司 Graphite 的一項研究識別出超過 13,000 個現代大型語言模型異常偏好的片語,顯示雖然模型已逐步淘汰長破折號等舊習,但新的文風癖好仍不斷冒出。

2026/10/02 00:50
Language Models

生成式 AI 語言指紋的新樣貌

即使如長破折號(em-dash)與「delve」(深入探討)等早期人工智慧寫作標記已逐漸淡出視野,最先進的語言模型仍持續依賴獨特且重複的語言習慣。行銷公司 Graphite 進行的一項研究分析了主流前沿模型的文筆,以找出區分機器生成文本與人類產出內容的片語和句型結構。

為了獨立分離出這些模式,Graphite 建立了一個由 10,000 篇在 ChatGPT 推出前發表的人類撰寫文章所組成的對照資料集。研究人員隨後指示多款頂尖人工智慧系統僅根據摘要重寫這些文章,以盡可能減少繼承自原始文本的偏差。在分析這些成對的產出內容時,Graphite 鎖定了大約 13,000 個在機器生成文本中出現頻率至少是人類基準兩倍的片語——該公司將此頻率作為判定「破綻」(tell)的基準定義。

研究結果凸顯出不同模型家族隨著時間推移在模仿人類文筆方面的分歧。Graphite 人工智慧長 Greg Druck 向 TechCrunch 表示:「事實證明,隨著時間演進,Claude 模型的用詞分布實際上越來越接近人類。而對 GPT 模型來說,距離卻越來越遠。」

Opus 5.5 與 Astra 如何在字裡行間露出破綻

研究發現,各個模型展現出極為鮮明的風格特徵。例如 Anthropic 的 Claude Opus 5.5 經常倚賴「dependable」(可靠的)一詞,其使用頻率比人類作者高出 23 倍。雖然該模型已大致揚棄了經典的「it's not X, it's Y」(不是 X,而是 Y)對比句型,但它換上了另一種對比公式,頻繁宣稱某件事物「is more than an X, it's a Y」(不只是 X,更是一個 Y)。Opus 5.5 還表現出強烈強調重要性的傾向:精確片語「this matters」(這至關重要)出現的頻率比人類對照組高出 116 倍,而「why X matters」(為什麼 X 很重要)的出現頻率也高出 92 倍。

相較之下,OpenAI 的 Astra 模型呈現出截然不同的詞彙偏好。Astra 極為偏好「another dimension」(另一個維度)這個片語,並經常使用「may provide」(可能提供)或「can provide」(能夠提供)等推測性緩和詞來弱化論述強度。它最明顯的破綻是 Graphite 所謂的「矯正性框架」(corrective framing)——即將主題框架為「not simply X」(不僅僅是 X)或提出替代方案如「rather than relying on X」(與其仰賴 X,不如……)的句型結構。Graphite 記錄到這類矯正模式在 Astra 的文本中出現的次數,比人類寫作高出 100 倍以上。

各模型在標點符號的習慣上也出現了全面性的大幅轉變。為了回應外界對過度使用長破折號的廣泛批評,前沿人工智慧實驗室顯然調整了模型以減少該符號的使用。Opus 5.5 使用長破折號的頻率比其前身 Opus 5 減少了 99%。Astra 使用該標點符號的頻率比人類基準低 88%,而 Google 的 Gemini 3.1 Pro 更是幾乎完全將長破折號從其文章中剔除。

從龐大模型中清除破綻的難題

儘管各家進行了針對性的更新以消除那些廣為人知的風格破綻,Graphite 發現人工智慧特徵破綻的總量基本上仍維持一致。這些破綻並未消失,而只是隨著新架構與微調資料集的部署而不斷輪替。Druck 表示:「這並不是說破綻在減少。他們確實設法清除了最著名的破綻,但新的又會冒出來。而且每個模型版本都有屬於自己的特色。」

這些習慣的持續存在,與主要人工智慧實驗室的市場定位背道而馳——這些實驗室一再將新版本宣傳得更加流暢與自然。Anthropic 在宣傳 Opus 5.5 時,強調早期測試人員認為其行文更清晰易懂;而 OpenAI 也在 GPT-6 版本 Sol 與 Luna 上做出類似承諾,保證減少行話與古怪的措辭選擇。

Druck 指出,要完全消除風格上的怪癖,可能超出了現有訓練技術的能力範疇。Druck 表示:「我的一個總體假設是,實驗室對某些事情的控制能力可能比大家想像的要低。這些是擁有數十億參數的龐大模型。他們能執行的測試數量有限,難免會有所疏漏。」

◗ 參考來源

TechCrunch10/02

相關文章