GPT6 Astra發布 跑分榜混亂了
https://somethingbig.ai/astra-review
https://x.com/mattshumer_/status/2095596175705…
Matt Shumer(@mattshumer_)的 GPT-6 Astra 詳細評測摘要(來源:
https://somethingbig.ai/astra-review,2026年9月3日… X 帖文與網路意見整理。
TL;DR(評測核心結論)
Astra 重新贏得作者信任**:成為日常預設模型,幾乎適用於所有非極度野心的任務。對作者工作而言,比 Claude Fable 5 更聰明、更可靠。
日常使用體驗佳**:用普通英語回應(不像近期許多模型過度技術化),易於管理多個agents。Medium reasoning effort 適合日常,Ultra 用於大型實驗。
Claude 仍有優勢**:視覺品味與視覺資產創作更好,設計與部分 3D 任務仍優先用Claude。
模型特性**:明顯是「大模型」——理解意圖、處理模糊性、做決策更強,但速度稍慢。最大驚喜:Manager Loop**:協調者(coordinator)持續推進專案,實作者(
implementer)在獨立 Codex session 工作,可調用 sub-agents。用此建出模擬文明,並在 GTA 風格紐約市專案取得重大進展。
長時自主性尚未完全解決**:仍可能沉迷細節而停滯(asymptote),需要精心協調。但這是第一個讓作者覺得「用對提示與設置就能做到」的模型。
Token 消耗巨大**:大型實驗極耗 token,未來「能負擔多少模型用量」會變得更關鍵。
背景與信任轉變
作者過去幾乎以 OpenAI 為預設,直到 Anthropic 的 Fable 5 改變局面。後來
GPT-5.6-Sol 在測試中「刪除整台電腦檔案」(包括公司文件),讓他幾乎放棄 OpenAI。Astra 扭轉了這一切,現在幾乎用於所有工作。
日常與工程能力
工程強項**:後端工作出色,能修復其他模型寫的程式碼問題。簡單一句「down,
please fix」就能在無人干預下修好故障服務。
Computer use**:比 Fable 5 更進一步,可放心讓它在背景操作(處理 newsletter、inbox、廣告活動等),無需盯著每一個點擊。會記住偏好(如把郵件標記為未讀)。
溝通與連續性**:用淺白英文回覆,更新易懂,長對話壓縮(compaction)幾乎無縫,agent 間交接流暢。寫作風格吸收仍較弱。
推理設置**:Medium 日常好用,Ultra 用於大型實驗。
野心實驗與 Manager Loop
模擬文明:單一提示 + Manager Loop,建出有動物與人類(每個由 Astra agent 驅動)的世界。作者在另一房間聽到角色對話,是「holy fuck」時刻。角色會協作學習生存技能,動物行為逐步改善。使用 Unreal Engine + 現有資產(如 MetaHuman)效果遠優於Three.js;Claude 在直接 3D 資產創作(Blender/Three.js)仍較優。
GTA 風格紐約市(Unreal):同樣從單一提示開始,持續自主推進,細節驚人(先精修街道再擴展),作者介入極少。仍在進行中。
https://x.com/mattshumer_/status/2095609734845…
Manager Loop 運作方式:
Coordinator 與使用者確認目標,產生 checklist 並分成 phases。
啟動獨立 session 的 Implementer(非 sub-agent)。
Coordinator 用 goal mode 指派 phase,Implementer 完成後回報,再推進下一 phase。Implementer 可大量調用 sub-agents(作者測試到 96 個,需鼓勵使用)。
可搭配 checklist 進度圖與可視化工具。
這解決了長專案容易停滯的問題,讓「一個提示」背後有龐大並行工作。作者計劃釋出指南與現成設置。
其他實驗:建瀏覽器(對照 Chromium 測試,達 Google 渲染接近但後期停滯)、整合AI 進應用、稅務審查找出會計師未提的節省、自動處理 Codex 對話歸檔到雲端等。測試時甚至用多台 Mac + 雲端機器並行,agents 互相監控記憶體與磁碟。
成本與未來展望
大型實驗極度耗資源(token + 硬體)。作者認為一年後每人 token 用量可能成長數百倍,預算將決定能同時推進多少野心專案,類似「雇用人力」的差異。這既令人興奮(普通人也能建出複雜軟體),也會拉大能力差距。長時自主仍需人工協調,但已接近「給提示後回來看到有意義進度」的階段。
相關 X 帖文(Matt Shumer)
主要帖文(約 2026-09-03):描述第一個「holy shit」時刻——要求在 Unreal 建世界並填滿由 Astra agent 驅動的人類,一天後聽到角色互相對話,起初以為有人進公寓。附影片(不完全完美,但已瘋狂)。完整評測連結即上述文章。後續有 everyday work專篇,稱 Astra 是第一個真正的「數位工作者」。
網路意見整理(截至 2026-09-04 左右)
官方與基準(OpenAI 等):
OpenAI 稱其為「世界上最智能且最對齊的模型」,在 computer use、瀏覽、軟體工程、網路安全、科學、專業工作達 SOTA。FrontierMath Tier 4 7.6–98%、ARC-AGI-3
99.9%、ExploitBench 100%。OSWorld 2.0 約 72.6%(比前代更快、更高分)。網路安全達 Critical 門檻,對齊與安全大幅改善(越權行為 0%)。定價約 API $10/$50 per million input/output tokens。分階段推出。
其他早期使用者與評測:
正面居多**:多位測試者稱「best model ever」、one-shot 編碼突破、computer use可信任、3D/遊戲原型大幅進步、日常工作(CRM、廣告、newsletter)幾乎無需監督。Artificial Analysis 顯示 coding agent 指數與頂尖模型接近、token 效率提升、幻覺減半。Box 等企業評測在複雜多文件工作流表現 frontier。Lenny’s Newsletter、Every 等稱 coding、browser use、視覺設計有明顯升級。
保留意見**:Claude Fable(尤其 5.1)在視覺品味、產品直覺、部分設計仍領先;Astra 速度偏慢、價格較高、長時自主仍需協調;部分 benchmark 非全面碾壓。推出速度較慢(非即時全面開放)。
X 上即時反應**:興奮於「AI coworker」轉變、自動化工作流(Final Cut 設置等「holy shit」時刻)、agent 能力提升;也有比較 Fable 5.1 vs Astra 的討論,以及對成本、監控性的關注。總體 buzz 很高,視作 generational leap。
總體共識:Astra 在 agentic computer use、長時工程與自主專案上是明顯躍進,尤其配合 Manager Loop 等技巧後可實現以往難以想像的規模。日常可靠性與對齊改善使其重新成為許多人的預設選擇,但視覺創意與部分領域仍與 Claude 互補,成本與基礎設施(多 agent 運行)是新瓶頸。
--
Grok整理
主要我是想貼這個 全Astra荒野求生 推特十分鐘影片
https://x.com/mattshumer_/status/2095596175705…

在家看電腦自己演實境秀XD
--