← 回熱門
📌 AI_Art 💨 剛冒煙 💬

GPT6 Astra發布 跑分榜混亂了

👤 error405 (流河=L) 🕐 Fri Sep 4 07:43:18 2026
▲ 7 推 ▼ 0 噓 → 14 回應
分享
🔔 追這個瓜,別錯過後續
挑下面的關鍵字追蹤——只要 爆了有後續延燒,第一時間通知你

https://x.com/OpenAI/status/2095595741528125780

https://x.com/ArtificialAnlys/status/209559548…

GPT-6 Astra 是 OpenAI 於 2026 年 9 月 3 日正式發布的新一代旗艦模型(model ID:gpt-6-astra),被官方定位為「世界上最智能且最對齊(aligned)的模型」。它強調可執行電腦上幾乎任何操作(computer use),並在瀏覽、軟體工程、網路安全、科學與專業工作等領域達到新 SOTA。

核心特點與能力

電腦使用與代理能力**:能自主操作桌面、瀏覽器、填表、更新 CRM、排程、研究、生成文件/簡報/試算表、PCB 設計(KiCad)、3D 建模(Blender → Unreal)、遊戲開發等。OSWorld 2.0 得分約 72.6%(比前代 GPT-5.6 Sol 的 65.7% 高,且時間約少 47%)。Agents’ Last Exam、AutomationBench、ScreenSpot Pro 等均達 SOTA。

科學與數學**:FrontierMath Tier 4 約 97.6–98%、ARC-AGI-3 約 99.9%、

Terminal-Bench Science 0.1 等領先;已協助解決多個長期未解數學問題。

軟體工程與編碼代理**:Artificial Analysis Coding Agent Index 得分約 67,與Claude Fable 5 相當,但 token 效率大幅提升(約為前代的 1/3),成本效益更好。網路安全**:達到 OpenAI Preparedness Framework 的「Critical」級別(首個達此門檻的模型),ExploitBench 100%。進階 exploit 能力初期受限於 Daybreak 等防禦用途計畫。

對齊與安全**:意圖理解大幅提升、越權行為大幅下降(新評估中 0% 越權 vs 前代約48%)、抗 jailbreak/prompt injection 更強、幻覺率顯著降低(AA-Omniscience 從約 92% 降至 51%)。同時加強內部監控與部署防護。

其他規格**:支援文字 + 圖像輸入、文字輸出;context window 約 1.05M tokens;推理等級含 low / medium / high / xhigh / max;支援 async tool calling、computer use 等。知識截止約 2026 年 4 月。

定價**(API):輸入 $10 / 百萬 tokens、輸出 $50 / 百萬 tokens(約為前代

GPT-5.6 Sol 的 2.5 倍),cached input 有折扣。因 token 效率提升,部分任務實際成本可能仍具競爭力。

推出時程**:2026 年 9 月 3 日先向有限組織/Trusted Access / Daybreak 開放;之後數日陸續對 ChatGPT Plus、Pro、Business、Enterprise 用戶,以及 OpenAI API 與AWS 開放。建議搭配 ChatGPT 桌面版以獲得最佳體驗。

優點

電腦使用與多步驟代理工作流程表現突出,速度與準確度兼具,適合專業/知識工作自動化。意圖理解與對齊大幅改善,較少越權或產生破壞性行為,長對話連貫性更好。

數學、科學、網路安全、CAD、專業基準多項 SOTA,token 效率高(尤其編碼代理)。幻覺減少、準確度提升,產出更實用(文件、簡報、程式等更貼近商業標準)。

支援多 agent 協調(如 Manager Loop),長程任務能力提升。

缺點

價格較高**:每 token 價格明顯上漲,雖然效率提升可部分抵消,但高強度使用成本仍可能更高(Artificial Analysis 指出 Intelligence Index 任務成本約貴 75%)。部分基準表現混合:Intelligence Index 與前代相近(約 61),落後 Claude Fable 5.1 等;某些長程知識工作或特定評估有回退。

速度可能偏慢(大模型特性),視覺品味/設計類任務仍可能輸給 Claude。

進階網路安全能力初期受限,長程完全自主仍需良好 prompt 與協調設定。

剛發布,廣泛真實用戶回饋有限,部分功能仍在逐步開放。

目前網路評價(截至 2026 年 9 月 3 日發布當天)

獨立分析機構 Artificial Analysis 指出:編碼代理指數大幅進步、token 效率高、成本效益佳(可媲美或優於 Fable 5),幻覺大幅下降;但 Intelligence 指數與前代持平,價格上漲抵消了效率優勢。

早期使用者與評測(如 Something Big、Latent Space、Box 等):

普遍稱讚為「日常主力推薦」、意圖理解優秀、工程與電腦使用可靠,甚至被形容為「可僱用的 AI 工程師」(低於每小時 $6 的有效成本)。

企業複雜多文件任務準確率提升(如 Box 測試 77% vs 前代 74%)。

有人覺得「慢一點但更聰明可靠」、視覺設計仍偏好 Claude;也有人直接抱怨「貴得誇張」。社群氣氛以興奮為主,同時關注安全與推出節奏;部分人等待更廣泛開放後再深入比較。

整體而言,GPT-6 Astra 被視為電腦使用與代理能力的代際躍升,尤其適合需要實際操作電腦、長程專業工作與高對齊需求的場景。若你主要做日常聊天或成本敏感任務,可能需權衡價格;若重視自動化與可靠代理,則是目前的強勢選項。建議關注官方 rollout 進度與更多獨立評測。

--

Grok整理

最新最強的GPT跑分榜居然輸給祖克伯 現在不少人變成開始質疑榜單可信度了

https://x.com/zephyr_z9/status/209559919959339…

https://x.com/DanDr1s/status/2095616597419528426

另外Arc-AGI3小遊戲測試拿到滿分也有不少人討論

https://x.com/fchollet/status/2095598451115614…

(顯然很多人不知道先前模型設定改一改也能拿個90%以上)

--

看 PTT 原文 ↗ 接著看下一篇 ▶ GPT6 Astra發布 跑分榜混亂了 📌 AI_Art · ▲7看下一篇 →

📚 本系列文章

共 3 篇・依時間排序
9/04 [閒聊] GPT6 Astra發布 跑分榜混亂了 ▲7 9/04 Re: [閒聊] GPT6 Astra發布 跑分榜混亂了 ▲5 9/05 Re: [閒聊] GPT6 Astra發布 跑分榜混亂了 ▲8

🍉 更多相關的瓜

同板/同主題,繼續吃
📌 AI_Art GPT6 Astra發布 跑分榜混亂了 ▲5 📌 LoL 2026 LPL Split 3 季後賽 敗部第一輪 ▲325▼13 ⚾ 棒球 MLB 國民 vs 道奇 Kent-Snell ▲611▼4 🍵 八卦 陳其邁女兒傳「父親欄留空」 隱瞞身分應徵鄭運鵬團隊!妻揭原因 ▲286▼124