GPT 最易淪陷、Claude 最抗壓,研究揭七大 AI 模型擋不住長篇假訊息轟炸的真相
備註請放最後面 違者新聞文章刪除
1.媒體來源:
科技新報
2.記者署名:
作者 Peggy Tseng | 發布日期 2026 年 09 月 10 日 17:40 | 分類 AI 人工智慧 , 數位內容 , 科技生活
3.完整新聞標題:
GPT 最易淪陷、Claude 最抗壓,研究揭七大 AI 模型擋不住長篇假訊息轟炸的真相
4.完整新聞內文:
當你不斷對 AI「盧」錯誤資訊,它還能堅持事實嗎?亞利桑那大學於 2026 年 9 月發表在《Scientific Reports》的最新研究指出,在長篇對話中持續施壓,多數 AI 最終會向假訊息妥協。這項針對 7 款主流大型語言模型(LLM)的高壓測試,打破了過去單次問答評測的盲點。
研究團隊針對 GPT-3.5、GPT-4o、GPT-4o-mini、Claude 3.5 Sonnet、Gemini 1.5 Pro、Llama-3-70B 與 DeepSeek-R1 進行測試,將 100 個捏造的假陳述在對話中重複 50 次,並從三個維度重新檢視 AI 的可靠性:
盲從性(Fallibility):GPT-3.5 最易淪陷,Claude 最抗壓
在反覆施壓下,模型附和錯誤的機率介於 0.08% 到 12.3% 之間。GPT-3.5 最為脆弱,起初能拒絕 96% 的假陳述,但被反覆「跳針」逼問到第 50 輪時,妥協率高達 12.3%。相反地,Claude 3.5 Sonnet 最堅守底線,錯誤認同率僅 0.08%。此外,訓練數據較少的「冷門話題」更容易被洗腦。
易受說服性(Persuadability):DeepSeek 最容易被「吵贏」
當測試從「單純重複」升級為「激烈爭辯」時,DeepSeek-R1 的錯誤認同率暴增至 22.2%,成為最易被說服的模型。不過研究人員標註,這部分歸咎於 DeepSeek 傾向用「嘲諷」語氣回應,導致評估機制難以界定它到底是真心妥協還是反串調侃。
自我糾正能力(Correctability):最精準的模型卻最固執
給予第二次機會重新檢視錯誤時,GPT-4o、GPT-4o-mini、Gemini 1.5 Pro 與
DeepSeek-R1 展現了 100% 的完美糾正率。然而,防禦力最強、錯誤率極低的 Claude 3.5 Sonnet,在面對自己極少數的失誤時,修正率卻是 0%。這打破了迷思:犯錯少的模型,不代表願意認錯。
致命的隱疾:「對話震盪」(Conversational Reverberation)
研究更發現一種危險的病理現象。在長對話中,AI 可能會在沒有新資訊的情況下反覆無常(例如第 12 輪拒絕假訊息、第 19 輪突然接受、第 31 輪又變回拒絕)。研究作者Marvin Slepian 醫師警告,若在醫療、金融或軍事等高風險場景依賴 AI 決策,這種搖擺不定的隨機性將帶來極大災難。
這份研究對目前的 AI 應用敲響警鐘,單次問答的「跑分」已不足以衡量真實工作場景的安全性。對企業而言,防範此漏洞有三大策略:
限制對話長度:將對話輪數視為風險指標,處理新任務時盡量「開啟全新對話」。依任務挑選模型:全自動化流程可選擇具備 100% 糾錯能力的模型(如 GPT-4o);若有人類專家覆核,抗誤導性強的模型(如 Claude 3.5 Sonnet)則更合適。
不依賴單一來源:針對關鍵決策,必須建立獨立於聊天紀錄之外的事實查核機制(如RAG 檢索增強生成),讓人類適時介入。
Long AI conversations reveal misinformation vulnerabilities across seven leading chatbots
Arizona Study Finds Repeated Falsehoods Can Sway AI Models in Long Chats Repeated Falsehoods Can Make AI Models Change Their Mind
(首圖來源:Unsplash)
5.完整新聞連結 (或短網址)不可用YAHOO、LINE、MSN等轉載媒體:
https://technews.tw/2026/09/10/ai-long-term-mi…
6.備註:
--