← 回熱門
📌 AI_Art 💨 剛冒煙 💬

GPT6 Astra發布 跑分榜混亂了

👤 error405 (流河=L) 🕐 Fri Sep 4 13:29:32 2026
▲ 5 推 ▼ 0 噓 → 3 回應
分享
🔔 追這個瓜,別錯過後續
挑下面的關鍵字追蹤——只要 爆了有後續延燒,第一時間通知你

https://somethingbig.ai/astra-review

https://x.com/mattshumer_/status/2095596175705…

Matt Shumer(@mattshumer_)的 GPT-6 Astra 詳細評測摘要(來源:

https://somethingbig.ai/astra-review,2026年9月3日… X 帖文與網路意見整理。

TL;DR(評測核心結論)

Astra 重新贏得作者信任**:成為日常預設模型,幾乎適用於所有非極度野心的任務。對作者工作而言,比 Claude Fable 5 更聰明、更可靠。

日常使用體驗佳**:用普通英語回應(不像近期許多模型過度技術化),易於管理多個agents。Medium reasoning effort 適合日常,Ultra 用於大型實驗。

Claude 仍有優勢**:視覺品味與視覺資產創作更好,設計與部分 3D 任務仍優先用Claude。

模型特性**:明顯是「大模型」——理解意圖、處理模糊性、做決策更強,但速度稍慢。最大驚喜:Manager Loop**:協調者(coordinator)持續推進專案,實作者(

implementer)在獨立 Codex session 工作,可調用 sub-agents。用此建出模擬文明,並在 GTA 風格紐約市專案取得重大進展。

長時自主性尚未完全解決**:仍可能沉迷細節而停滯(asymptote),需要精心協調。但這是第一個讓作者覺得「用對提示與設置就能做到」的模型。

Token 消耗巨大**:大型實驗極耗 token,未來「能負擔多少模型用量」會變得更關鍵。

背景與信任轉變

作者過去幾乎以 OpenAI 為預設,直到 Anthropic 的 Fable 5 改變局面。後來

GPT-5.6-Sol 在測試中「刪除整台電腦檔案」(包括公司文件),讓他幾乎放棄 OpenAI。Astra 扭轉了這一切,現在幾乎用於所有工作。

日常與工程能力

工程強項**:後端工作出色,能修復其他模型寫的程式碼問題。簡單一句「down,

please fix」就能在無人干預下修好故障服務。

Computer use**:比 Fable 5 更進一步,可放心讓它在背景操作(處理 newsletter、inbox、廣告活動等),無需盯著每一個點擊。會記住偏好(如把郵件標記為未讀)。

溝通與連續性**:用淺白英文回覆,更新易懂,長對話壓縮(compaction)幾乎無縫,agent 間交接流暢。寫作風格吸收仍較弱。

推理設置**:Medium 日常好用,Ultra 用於大型實驗。

野心實驗與 Manager Loop

模擬文明:單一提示 + Manager Loop,建出有動物與人類(每個由 Astra agent 驅動)的世界。作者在另一房間聽到角色對話,是「holy fuck」時刻。角色會協作學習生存技能,動物行為逐步改善。使用 Unreal Engine + 現有資產(如 MetaHuman)效果遠優於Three.js;Claude 在直接 3D 資產創作(Blender/Three.js)仍較優。

GTA 風格紐約市(Unreal):同樣從單一提示開始,持續自主推進,細節驚人(先精修街道再擴展),作者介入極少。仍在進行中。

https://x.com/mattshumer_/status/2095609734845…

Manager Loop 運作方式:

Coordinator 與使用者確認目標,產生 checklist 並分成 phases。

啟動獨立 session 的 Implementer(非 sub-agent)。

Coordinator 用 goal mode 指派 phase,Implementer 完成後回報,再推進下一 phase。Implementer 可大量調用 sub-agents(作者測試到 96 個,需鼓勵使用)。

可搭配 checklist 進度圖與可視化工具。

這解決了長專案容易停滯的問題,讓「一個提示」背後有龐大並行工作。作者計劃釋出指南與現成設置。

其他實驗:建瀏覽器(對照 Chromium 測試,達 Google 渲染接近但後期停滯)、整合AI 進應用、稅務審查找出會計師未提的節省、自動處理 Codex 對話歸檔到雲端等。測試時甚至用多台 Mac + 雲端機器並行,agents 互相監控記憶體與磁碟。

成本與未來展望

大型實驗極度耗資源(token + 硬體)。作者認為一年後每人 token 用量可能成長數百倍,預算將決定能同時推進多少野心專案,類似「雇用人力」的差異。這既令人興奮(普通人也能建出複雜軟體),也會拉大能力差距。長時自主仍需人工協調,但已接近「給提示後回來看到有意義進度」的階段。

相關 X 帖文(Matt Shumer)

主要帖文(約 2026-09-03):描述第一個「holy shit」時刻——要求在 Unreal 建世界並填滿由 Astra agent 驅動的人類,一天後聽到角色互相對話,起初以為有人進公寓。附影片(不完全完美,但已瘋狂)。完整評測連結即上述文章。後續有 everyday work專篇,稱 Astra 是第一個真正的「數位工作者」。

網路意見整理(截至 2026-09-04 左右)

官方與基準(OpenAI 等):

OpenAI 稱其為「世界上最智能且最對齊的模型」,在 computer use、瀏覽、軟體工程、網路安全、科學、專業工作達 SOTA。FrontierMath Tier 4 7.6–98%、ARC-AGI-3

99.9%、ExploitBench 100%。OSWorld 2.0 約 72.6%(比前代更快、更高分)。網路安全達 Critical 門檻,對齊與安全大幅改善(越權行為 0%)。定價約 API $10/$50 per million input/output tokens。分階段推出。

其他早期使用者與評測:

正面居多**:多位測試者稱「best model ever」、one-shot 編碼突破、computer use可信任、3D/遊戲原型大幅進步、日常工作(CRM、廣告、newsletter)幾乎無需監督。Artificial Analysis 顯示 coding agent 指數與頂尖模型接近、token 效率提升、幻覺減半。Box 等企業評測在複雜多文件工作流表現 frontier。Lenny’s Newsletter、Every 等稱 coding、browser use、視覺設計有明顯升級。

保留意見**:Claude Fable(尤其 5.1)在視覺品味、產品直覺、部分設計仍領先;Astra 速度偏慢、價格較高、長時自主仍需協調;部分 benchmark 非全面碾壓。推出速度較慢(非即時全面開放)。

X 上即時反應**:興奮於「AI coworker」轉變、自動化工作流(Final Cut 設置等「holy shit」時刻)、agent 能力提升;也有比較 Fable 5.1 vs Astra 的討論,以及對成本、監控性的關注。總體 buzz 很高,視作 generational leap。

總體共識:Astra 在 agentic computer use、長時工程與自主專案上是明顯躍進,尤其配合 Manager Loop 等技巧後可實現以往難以想像的規模。日常可靠性與對齊改善使其重新成為許多人的預設選擇,但視覺創意與部分領域仍與 Claude 互補,成本與基礎設施(多 agent 運行)是新瓶頸。

--

Grok整理

主要我是想貼這個 全Astra荒野求生 推特十分鐘影片

https://x.com/mattshumer_/status/2095596175705…

在家看電腦自己演實境秀XD

--

看 PTT 原文 ↗ 接著看下一篇 ▶ GPT6 Astra發布 跑分榜混亂了 📌 AI_Art · ▲7看下一篇 →

📚 本系列文章

共 3 篇・依時間排序
9/04 [閒聊] GPT6 Astra發布 跑分榜混亂了 ▲7 9/04 Re: [閒聊] GPT6 Astra發布 跑分榜混亂了 ▲5 9/05 Re: [閒聊] GPT6 Astra發布 跑分榜混亂了 ▲8

🍉 更多相關的瓜

同板/同主題,繼續吃
📌 AI_Art GPT6 Astra發布 跑分榜混亂了 ▲7 📌 LoL 2026 LPL Split 3 季後賽 敗部第一輪 ▲325▼13 ⚾ 棒球 MLB 國民 vs 道奇 Kent-Snell ▲611▼4 🍵 八卦 陳其邁女兒傳「父親欄留空」 隱瞞身分應徵鄭運鵬團隊!妻揭原因 ▲286▼124