GPT6 Astra發布 跑分榜混亂了
---
1. GPT 6 Astra Intro (00:00 - 00:50)
操作與介面:除了線上聊天介面外,更推薦使用 ChatGPT 桌面應用程式(前身為 CodeX),其具備 Agent(代理)功能,可同步在電腦本地的多個專案與持久檔案中運行任務。
---
2. Physics and Ray Tracing (00:50 - 04:30)
測試任務:要求 AI 完全不使用任何外部 Web 函式庫(如 Three.js),從頭編寫一個子彈穿透水氣球的光線追蹤(Ray Tracing)與物理模擬程式。
Prompt 技巧:設計多 Agent 迴圈提示詞:
1. 建立生成專案的 Builder Agent。
2. 搭配獨立的 Critic Agent 截圖進行 0–10 分的逼真度與物理準確度評分。
3. 若低於 8 分則提供改進清單並重試(最多 3 輪)。
執行成果:
第一輪:評分 4.7 分,提出改進建議。
第二輪:評分 6.0 分。
第三輪:評分 6.5 分(達到設定最大輪數終止)。
最終成果:成功生成包含完整 UI 控制面板的應用程式,可調整子彈速度、氣球直徑、重力、表面張力、光照強度與方向,並可隨時凍結時間與切換多角度視角(側面、上方、下方)查看穿透與水滴灑落畫面。
資源消耗:該任務運行約 32 分鐘,推估約消耗 Pro 方案週額度的 3%–4%。
---
3. Unreal Video Game (04:30 - 09:40)
測試任務:在 Unreal Engine 中程序化生成 3D 遊戲,包含第三人稱角色移動、關卡與動畫控制。
執行過程與架構:
資產與動畫:從 Sketchfab 匯入 3D 角色模型,並利用 Playwright 瀏覽器擴充套件於 Mixamo 抓取並映射衝刺與跳躍動畫。
場景建構:透過連結至本地連接埠的 Blender MCP(Model Context Protocol)程序化生成古代中國宮殿場景資產,並於 Unreal Engine 中彩現。
批評代理機制:設定 Critic Agent 以 8.5 分為 3A 級標準進行評價。經過首輪 4 輪循環(最高分 6.3 分)後,補充 Prompt 要求改善關節與動作流暢度(前傾忍者跑、加速跳躍、連續空跳、鏡頭晃動與動態模糊、環境風霧等)。
最終成果:總計運行約 4 小時後,成功生成可在 Unreal Engine 中運行的完整遊戲,包含流暢的衝刺、空中連跳、相機動態效果及收集漂浮圖示的遊戲機制,線框圖與光照模型複雜度極高。
資源消耗:推估約消耗 Pro 方案週額度的 10%。
---
4. Drawing Things (09:40 - 10:44)
測試任務:測試 GPT-6 的 Computer Use(電腦操作)能力。
執行過程與成果:控制瀏覽器開啟 Photopea(線上版 Photoshop),以游標一筆一畫手繪還原參考圖片(非透過程式碼生成,而是直接操作 UI 與畫筆工具),耗時約 20 分鐘。
---
5. Sprite Animation (10:44 - 11:39)
測試任務:提高 Computer Use 難度,要求於像素畫線上工具中根據角色參考圖,逐格繪製 Sprite 精靈動畫。
執行成果:耗時約 40 分鐘,成功逐格繪製出奔跑(Running)、跳躍(Jumping)與揮劍(Slashing sword)三個各包含 4 幀的動作,並匯出為 GIF 檔案。
---
6. Composing and Playing Piano Solo (11:39 - 13:54)
測試任務:控制線上虛擬鋼琴。
1. 將鍵盤顯示數量設為最大值。
2. 作曲一首約 1 分鐘、蕭邦風格的快節奏鋼琴獨奏曲。
3. 實時彈奏:直接透過點擊線上鋼琴鍵盤,依正確時間節奏實時演奏出來。
執行過程與成果:AI 先花了幾分鐘測試鍵盤操作與錄音機制,隨後進行 7 分鐘的演奏,產出具備古典古典鋼琴獨奏水準的音樂。
---
7. Luma (13:54 - 15:27)
贊助商介紹:介紹代理型 AI 工作空間 Luma。
主要特點:
將創作流程整合至單一工作空間,理解動作、物理與 3D 空間。
Luma Skills:可建立可重複使用的自動化工作流(例如:輸入產品照片自動生成 UGC網紅宣傳影片,或自動產生產品落水動態)。
---
8. Full Song Composition (15:27 - 18:00)
測試任務:於 Waveform DAW 軟體中,利用 VST 插件與 Samples 編寫與製作完整的Eurodance EDM 電音歌曲,包含聲道自動化、Rise、Drop 等效果與混音母帶處理。執行過程與成果:
首版(15 分鐘):成果過於基礎。
二次提示:授權 AI 自行至 samplefocus.com 搜尋免費音效 Sample 並豐富旋律。最終成果(再運行 20 分鐘):成功調製出風格道地且高質感的完整 EDM 樂曲。
---
9. VR Real Estate (18:00 - 18:48)
測試任務:輸入隨機的日本 Airbnb 豪宅刊登網頁圖片(包含斜角牆面、泳池、客廳特殊木質裝飾、浴室與外觀),要求透過 Blender MCP 重建完整的 3D 建築與室內場景,並設定鏡頭導覽軌道。
執行成果:運行 1 小時 12 分鐘(約耗費 5%–10% 週額度),在 3D 場景中構建了數千個元件,完成客廳、主泳池、圓形泳池與浴室的空間還原與運鏡彩現。
---
10. Product Commercial (19:50 - 21:18)
測試任務:輸入 Amazon 上的抹茶品牌頁面,要求 AI 擔任導演,連結 Higsfield MCP控制多個影音生成模型,製作一段 30 秒的產品廣告影片。
執行成果:耗時約 20 分鐘,成功產生包含高品質分鏡、文字旁白與音效剪輯的完整抹茶廣告,品質顯著優於 Claude Fable 5.1。
---
11. Math Explainer Video (21:18 - 23:22)
測試任務:製作一段約 1 分鐘、黑底白字極簡風格的數學動態圖像(Motion Graphics)解說影片,主題為「古人如何測量地球周長」。文字轉語音(TTS)部分則指定調用Gemini TTS。
執行過程與成果:
第一輪(14 分鐘):成果普通。
Critic Agent 介入:加入評分機制(需達 8 分以上)並要求旁白文字更貼近高中生理解邏輯。
最終成果:清晰呈現埃拉托斯特尼(Eratosthenes)利用夏至正午影子角度(7.2°,即圓周的 1/50)計算出地球周長約 40,000 公里的數學幾何推導過程。
---
12. Finding the Frog (23:22 - 24:27)
測試任務:測試 GPT-6 的視覺辨識極限——經典的「找青蛙(Frog Bench)」測驗。上傳隱藏青蛙的高難度照片,要求 AI 圈出青蛙的位置。
執行成果:
思考 6 分 50 秒後宣告失敗,誤將環境辨識為響尾蛇。
進行多張不同青蛙測試圖重試,仍無法準確定位圈出青蛙。顯示即使是 GPT-6 Astra 也尚未通過青蛙視覺測驗。
---
13. Identifying Cancer (24:27 - 25:12)
測試任務:提供 6 張包含不同類型腦腫瘤的 CT/MRI 腦部掃描圖,要求辨識每張圖片中的腫瘤類型。
執行成果:運行 2 分半鐘,6 張僅答對 1 張(左上角的腦膜瘤 Menioma)。雖然準確率低,但與 Kimi、GLM 等模型並列該測驗的最高分。
---
14. Deep Research (25:12 - 26:05)
測試任務:針對阿茲海默症中 Beta 類澱粉蛋白與 Tau 蛋白的傳播機制進行深度研究與分析,並比較相關三期臨床試驗成果。
執行成果:表現優異,輸出內容極為精簡且資訊密度高。文章包含詳細的機制對比表格、流程圖、三期試驗數據表以及自訂程式碼繪製的圖表,且引用資料完整。
---
15. Ideation (26:05 - 27:10)
測試任務:要求提出了結目前技術與 AI、能顯著改善工廠化養殖動物生活品質的三個高影響力且低成本的新構想。
執行成果(思考 8 分 35 秒):
1. 雞隻休息區 AI 保護系統:自動維護與優化雞隻休息空間。
2. 動態適應型肉豬娛樂豐富化裝置:根據競爭與需求自動調整。
3. 相容性族群管理軟體:在日常轉移中維護和諧的豬隻社交群體。
---
16. Specs and Benchmarks (27:10 - 28:44)
官方公佈基準測試成績:
Frontier Math:高達 98%,幾乎刷滿困難數學基準。
Terminal Bench 4(編程代理)與 Automation Bench(多步驟業務工作流):得分均為業界最高,超越 Claude Fable 5。
Computer Use(電腦操作):被稱為史上最強 Computer Use 模型,在 Agents Last Exam、OS World 等測試中名列第一。
3D 重建與音樂理解:在 3D 視覺構建與弦樂四重奏聽寫(Audio to Sheet Music)測試中優於前代。
---
17. Leaderboards and Achievements (28:44 - 32:21)
亮眼定性成就與社群榜單:
遊戲通關:首個成功通關 3D 解謎遊戲《Portal》(傳送門)的通用 AI Agent;僅用18 小時 12 分鐘通關《寶可夢 火紅》,且正在直播挑戰《寶可夢 水晶》。
ARC-AGI 3 榜單:在未曾見過的新環境推理測試中取得 60%+ 得分(加裝 Harness 可近 100%),遠超其他模型(<10%)。
VoxelBench(3D 體素動畫):評分領先 Opus 5 近 400 分。
Frontier Math Eerish(未解數學難題):唯一得分大於 0% 的模型。
IBench(視覺推理):取得 95% 接近滿分的霸榜成績。
綜合排名與成本:在智力指數上微幅落後 Claude Fable 5.1 排第 2,但每任務呼叫成本顯著低廉,且幻覺率(Hallucination Rate)低於 Claude Opus 5 與 GPT-5.6。在LMSYS WebDev 盲測榜單中名列第一。
---
18. Availability (32:21 - 33:33)
開放權限與額度限制:
已向所有 ChatGPT 付費方案(Plus 及 Pro)全面推送。
線上網頁版需切換至 Work Tab 才能使用 GPT-6;亦可於桌面版 App(CodeX)呼叫。用量提醒:Pro 5X 方案下執行 1 小時的複雜長任務約消耗 5%–10% 週額度,Plus 方案用戶額度消耗速度會快上許多。
--
Gemini整理 慣例的評測
把製作3D動作遊戲變成測試這不是拉高標準了嗎 以後其他模型怎麼活
--