AI會寫程式卻不會看時間?時鐘答對率僅38.7% 研究揭露空間推理弱點
1.媒體來源:
ETTODAY
2.記者署名:
記者吳立言/綜合報導
3.完整新聞標題:
AI會寫程式卻不會看時間?時鐘答對率僅38.7% 研究揭露空間推理弱點
4.完整新聞內文:
人工智慧(AI)能寫程式、生成圖片與文字,但一項研究發現,當 AI 被要求從類比時鐘判讀時間,或根據日期推算星期時,表現卻相當有限。研究測試顯示,AI 讀對時鐘的比例僅 38.7%,日曆題正確率更只有 26.3%。
研究測試多款 AI 模型
研究團隊在 2025 年國際學習表徵會議(ICLR)發表相關結果,並於 3 月 18 日將研究發布至 arXiv;目前研究仍屬預印本,尚未經過同儕審查。測試對象包括 Meta 的Llama 3.2-Vision、Anthropic 的 Claude 3.5 Sonnet、Google 的 Gemini 2.0,以及OpenAI 的 GPT-4o。
看懂時鐘需要空間推理
研究人員認為,問題不只是辨識圖片中的「時鐘」,而是必須進一步判斷指針的位置、計算角度,並處理不同鐘面設計。這涉及空間推理能力,因此模型可能知道眼前是一個時鐘,卻無法準確讀出時間。
日期計算同樣容易出錯 AI 並非真正按照規則計算
日曆相關測試也呈現類似情況。例如要求 AI 判斷一年中的第 153 天是星期幾時,模型同樣頻繁答錯。研究指出,閏年等較少出現的情況,以及需要結合計算與推理的日期問題,可能是造成錯誤的原因之一。
研究人員指出,傳統電腦執行算術時可以依照明確演算法運算,但大型語言模型主要是根據訓練資料中的模式預測答案,因此即使偶爾能答對數學或日期問題,也不代表每次都能以一致的規則完成推理。
時間敏感應用仍需人工確認
研究認為,這項結果凸顯 AI 在結合視覺辨識、精確計算與邏輯推理的任務上仍存在限制。若應用於排程、自動化或輔助工具等需要精確時間資訊的情境,仍需要充分測試、備援機制,以及必要的人工作業確認。

▲研究揭露 AI 在空間推理的弱點。(圖/達志影像/美聯社)
5.完整新聞連結 (或短網址)不可用YAHOO、LINE、MSN等轉載媒體:
https://ai.ettoday.net/news/3222195
6.備註:
--