← 回熱門
📌 AI_Art 💨 剛冒煙 💬

Astra,Fable5.1,Gemini3.8..本週AI新聞

👤 error405 (流河=L) 🕐 Sun Sep 6 12:56:42 2026
▲ 5 推 ▼ 0 噓 → 2 回應
分享
🔔 追這個瓜,別錯過後續
挑下面的關鍵字追蹤——只要 爆了有後續延燒,第一時間通知你

00:00 AI news intro(本週 AI 新聞開場與總覽)

開場概述:AI 領域本週發展速度極快,各大巨頭與開源社群均釋出重磅新模型與工具。重點發布陣容:

DeepSeek 推出具備視覺能力的最新模型。

阿里巴巴 釋出最新且最強大的 Qwen 模型。

Anthropic 發布 Claude Fable 5.1(當時的世界最強模型)。

Google 推出 Gemini 3.8 Flash 模型。

Meta 釋出 Muse Spark 1.3 模型。

OpenAI 發布萬眾矚目的 GPT-6 Astra,性能大幅超越其他模型。

其他亮點:包含多款開源影像生成/編輯器、讓 Minimax 影片模型實現即時運行的優化方案、Google DeepMind 的實用模型以及畫質極高(Pixel Perfect)的世界模型(World Model)。

---

01:00 H3 World(互動式世界模型引擎)

核心功能:基於開源影片生成模型 Minimax H3,將其轉換為互動式遊戲引擎。

運作機制:使用者可透過提示詞(Prompt)結合按鍵輸入控制影片生成過程。系統並未建立全新的控制架構,而是將按鍵操作轉譯為簡短英文描述,傳送至 Minimax 的語言理解層,並精準鎖定指令對應的影片動作時間點。

開源與部署:已在 GitHub 開源,提供本地部署下載教學及訓練腳本(Training Script)。

---

02:02 SolarWM(長時效互動式世界模型框架)

核心功能:同樣將影片生成模型轉換為即時互動世界。

主要優勢:解決了多數世界模型運行數分鐘即崩潰的問題,能夠持續穩定生成長達 1 小時以上的世界畫面。

相容性與數據:

支援多種影片模型,包含 5B、114B、LTX 2.5 以及 Minimax H3。

團隊使用了包含 130 萬個影片片段、高達 25 TB 的資料集進行訓練。

全面開源:訓練資料集、數據處理流程(Pipeline)、訓練配方(Recipes)與預訓練模型權重均已免費開源。

---

03:33 TimesFM(Google 時間序列基礎模型)

模型簡介:Google Research 釋出的 open-source 時間序列基礎模型 TimesFM 3,用於預測數值型時間序列資料(如零售、醫療、天氣、股市圖表等)。

技術亮點:

支援多變量(Multivariate)預測,可同時參考多個相關訊號進行分析。

支援零樣本預測(Zero-shot),面對未曾見過的新預測問題無須重新訓練即可進行預測。規格與效能:模型體積極小,僅 3.3 億(330M)參數(約 1.32 GB),但基於超過 1兆個時間點的巨量資料進行預訓練。在 Gifty、ValvBench 等評測基準中位居時間序列模型第一名。可在 Hugging Face 下載並於消費級設備本地運行。

---

05:03 Lucida(三維場景重構與編輯 AI)

核心功能:由 ByteDance(字節跳動)推出的 AI 系統,能將雜亂的真實房間照片轉換為可獨立編輯的 3D 模擬場景。

三步驟運作原理:

1. 解析場景:分析房間照片並辨識出單一物體。

2. 補全 Asset:即便物體在原圖中被部分遮擋,也能生成完整的 3D 網格(Mesh)資產。3. 精準擺放:透過 Gizmo-act 預測原位置,將物件放回場景中。

應用價值:場景中的每個物件都是獨立的 3D 網格,方便使用者進行搬移、縮放或進一步編輯。目前已發表技術論文。

---

06:07 VideoDeltaNet(影片生成模型加速技術)

核心功能:一種開源加速方案,旨在大幅提升 Minimax H3 的生成速度(甚至超越即時),同時維持高品質畫面。

技術細節:

解決瓶頸:原版 Minimax H3 中,注意力機制(Attention)佔用了高達 85% 的運行時間。混合機制:近距離影格(Nearby frames)採用精準但昂貴的注意力計算;遠距離影格(Faraway frames)則採用計算成本極低的線性注意力(Linear Attention)。

結合 Optimized kernels、Parallelism 和 8 步蒸餾(Distillation),顯著降低計算資源消耗。

效能表現:若配置 8 張 NVIDIA B200 GPU,可在 11 秒內生成 14 秒的影片(超越即時運行)。對一般消費級 GPU 也有明顯加速效果,且畫質損失極小。已開源並支援

ComfyUI 自訂節點。

---

08:25 LLaDA image(影像生成與編輯模型)

核心功能:開源影像生成與編輯模型(60 億參數,6B)。

特色功能:

能生成高度真實的照片,以及包含大量文字與元素的海報、資訊圖表(Infographics)。具備強大的圖像編輯能力:可更改角色姿勢與表情、替換畫面元素、修改文字或進行照片上色。

發布版本:

Base 模型:需 50 個採樣步驟,適合訓練或生成更高品質圖像。

Turbo 模型:只需 4 個步驟,生成速度極快。

均提供 BF-16 與 FP8 版本(FP8 Turbo 模型變壓器權重僅約 6.7 GB,適合消費級 GPU)。

---

09:56 Deepseek v4 flash vision(視覺語言模型)

核心功能:DeepSeek 釋出的實驗性視覺模型(Deepseek V4 Flash Vision

Experimental)。

效能表現:表現優於先前無視覺能力的 V4 Flash,整體表現可媲美 Claude Opus 4.8。規格與開源:模型參數量為 3,050 億(305B),整體檔案大小約 168 GB,已在

Hugging Face 完整開源供免費本地部署。

---

10:38 Qwen 3.8 0902(阿里巴巴旗艦模型升級)

模型更新:阿里巴巴升級其最強模型 Qwen 3.8 Max,最新版本命名為 max0902(代表9 月 2 日更新)。

架構與訓練:維持 2.4 兆(2.4T)參數與 100 萬 Token 的上下文視窗,重點針對寫程式(Coding)與協同工作(Co-work)進行後訓練(Post-training)優化。

基準測試表現:

在代理寫程式(Agentic Coding)基準測試中,表現比數週前的原版大幅提升,部分項目成長超過 10 個百分點。

在多項知識工作與代理評測中,表現甚至超越 Opus 5 與 GPT 5.6 Sol。

開放形式:目前尚未開源,使用者可透過 Qwen Cloud API 進行體驗。

---

11:37 Claude Fable 5.1(Anthropic 最新旗艦模型)

主打特長:官方宣稱在代理科學研究(Agentic Scientific Research)、代理編程與知識工作方面表現卓越。

排行榜成績:在獨立排行榜中超越 Opus 5 與 GPT 5.6,評分居於榜首。

爭議與缺點(Red Flags):

價格極其昂貴:任務成本比 GPT 5.6 Max 貴上 3.7 倍以上。

用量限制極嚴:即便是 Max 付費方案,輸入 1-2 個簡單提示詞就會耗盡 5 小時的配額,幾乎無法實用。

提示詞退化(Reversion):在執行深度研究或醫療提示時,模型常拒絕調用 Fable 5.1,直接退回較舊的 Opus 5 運行。

#1gbtO0zX

---

12:58 Higgsfield(創作者專用 AI 平台,本集贊助商)

平台定位:專為創作者打造的一站式 AI 創作平台,整合全球頂尖模型(如 Cedance 2.5 1080p 影片模型、GPT Image 2 圖像模型)。

核心功能模組:

Supercomputer:通用型 AI 代理,輸入 Prompt 即可協助全流程創作(發想創意、產品概念、品牌方向、視覺生成與宣傳影片)。

MCP:可將平台的內容生成能力連接至 GPT 或 Claude 等 AI 代理,由後者規劃思考,Higgsfield 負責執行生成。

Marketing Studio:貼上產品連結或圖片即可一次生成多種廣告格式(UGC 影片、教學、開箱、評測等)。

Cinema Studio:端到端的 AI 影視製作管線,支援分鏡規劃、鏡頭控制、角色固定與場景一致性。

---

14:41 Gemini 3.8 Flash(Google 高效能輕量模型)

效能突破:雖為 Flash 輕量級模型,但在金融、法律與代理終端寫程式(Agentic Terminal Coding)領域超越了 Claude Opus 5 與 GPT 5.6 Sol。

多模態與 Agent 冠軍:

在理解科學圖表、長影片理解(Humanity's Last Exam)以及生物資訊學上達到 SOTA(頂尖水平)。

在長程代理軟體工程(DeepSW Benchmark)評測中登頂第一名,且平均成本遠低於其他前沿模型。

速度與特化版本:

生成速度極快,可達 348 Token/秒。

Gemini 3.8 Flash Cyber:防禦性資安特化版,在 Chrome 漏洞修復測試中產生的正確補丁數量是大型商業模型的 2.6 倍。

整合生態:已透過 API、Anti-Gravity 寫程式 harness、AI Studio 釋出,並整合至Gemini App、Google Search AI 模式及 Sheets 中。

#1gcCnxhu

---

18:28 Muse Spark 1.3(Meta 最新代理模型)

主打核心:專為處理長程複雜作業(Long Messy Jobs)與多任務處理(Multitasking)設計,而非僅回答單一問題。

工作流能力:給定開放式目標、多個檔案與工具後,能自主收集資訊、規劃步驟、自我修正並交付最終成品。在同一對話中執行多項任務時不會產生指令混淆。

基準表現:在 DeepSuite 與 SUI Atlas 評測中超越 GPT 5.6 Sol。目前已在 Muse Code 平台與 Meta Model API 上線。

#1gcD4BLV

---

19:38 GPT 6 Astra(OpenAI 旗艦模型)

電腦操作與真實任務能力:

具備極強的電腦與 Cursor 直接操作能力,在 OSWorld(真實電腦介面操作)與

Benchcad(3D 重建)基準測試中奪冠。

可自動將電路圖轉為可製造的 PCB 板、自動操作 Excel、在 Unity 中從零構建 3D 城市、在 FreeCAD/Blender 中製作並演示汽車變速箱動畫,以及自動填寫報稅單。

全方位 SOTA 表現:

程式與資安:Terminal Bench 4 奪冠;在 Exploit Bench 資安漏洞利用測試中取得100% 完美滿分。

推理與數學:在 ARC-AGI 3 測試(適應全新遊戲環境)中,最高思考模式下得分超過60%(搭配 harness 接近 100%,其他模型均低於 10%);在 Frontier Math 未解數學難題中,是唯一得分高於 0% 的模型。

音樂與遊戲:能精準將音訊轉為樂譜;在 Twitch 直播中完全自主通關《寶可夢 火紅版》,耗時創下史上最短紀錄。

開放狀況:已向 Plus 與 Pro 付費使用者推出,後續將釋出專題評測。

#1gcWOVao

---

24:50 WeatherNext 3(Google 氣象預報系統)

核心功能:Google DeepMind 發布的最新 AI 氣象預報系統。

重大升級:

放棄傳統數小時前的氣象模擬數據,改為直接分析最新衛星觀測資料,每小時提供全新的全球氣象預報。

解析度提升 5 倍:前代 WeatherNext 2 的網格解析度為 25 公里/6 小時,

WeatherNext 3 提高至 5 公里解析度(可預測地表溫度與濕度),大幅提升山脈、海岸線及局地強降雨的預測準確度。

在衛星降水基準測試中,預測能力比前代提升高達 60%。

再生能源與應用:可精準預測風力發電機組高度的風速及太陽能電廠的日照量。目前已整合至 Google 搜尋、Gemini App、Google 地圖、API 及 Google Earth Engine 中。

---

26:28 Fly brain(雄性果蠅神經網絡地圖)

專案成就:Google Research 成功繪製出雄性果蠅完整的腦部與中央神經系統電路圖,為目前史上最龐大的生物神經網絡連接圖(Wiring map)。 數據規模:包含超過 16.6萬個神經元及約 1.25 億個神經突觸。繪製範圍涵蓋腹神經索(類似人類脊髓),使科學家能追蹤視覺、嗅覺、聽覺訊號如何透過大腦控制果蠅身體運動。

技術細節:將神經系統切成極薄的切片,經電子顯微鏡拍照後,利用 AI 與計算技術將2D 影像重構成 3D 神經元連接。

未來意義:人類大腦約有 860 億個神經元,目前技術尚無法完全解構,但此果蠅圖譜能幫助神經科學家理解腦電路運作,並為 AI 系統與機器人設計提供啟發。

---

28:40 Atlas(World Labs 3D 世界模型)

團隊背景:由 AI 飛躍發展關鍵人物李飛飛(Fei-Fei Li)創立的 World Labs 所推出的世界模型(World Model)。

多模態輸入與運作:支援文字提示詞、單張/多張圖片、影片或 3D 資訊等多種輸入方式,可建構或重構完整的 3D 世界。

主要亮點:

鏡頭路徑控制:輸入影片後手動繪製鏡頭移動軌跡,Atlas 能生成長達 1 分鐘、1440p高畫質且視角切換流暢、極具像素級一致性(Pixel Perfect)的影片。

幾何資產生成:能直接輸出高精度 3D 幾何結構(如點雲 Point Clouds 或高斯潑濺Gaussian Splats),可用於房地產 VR 或機器人合成訓練數據(Synthetic training data)。

#1gbv3O0N

---

30:15 Intern Lumina U2(擴散語言模型)

核心功能:開源的多模態影像生成、編輯與理解模型(Diffusion Large Language Model)。

多功能特性:

圖像生成與精準編輯:支援多種藝術風格,並能理解複雜語義進行編輯(例如:「僅旋轉圖中的橘色正方形」或局部替換/擦除)。

強大視覺理解:作為擴散語言模型,它能分析醫療掃描圖(如檢測神經元遷移缺陷)、辨識藝術畫作作者,甚至讀懂極其複雜的 ER 實體關係圖。

開源進度:已公開部署程式碼,模型權重正在等待上傳至 Hugging Face。

---

31:44 Viggle Animate(角色動作替換 AI)

核心功能:僅需編輯影片的首張影格(換成新角色),即可自動將原影片中人物的動作動態套用至新角色上。

技術優勢:無需進行複雜的姿態估計(Pose estimation)、圖像分割或面部追蹤;適用於各式不同比例或繪畫風格的角色(不限於真實人類)。

架構與模型:基於 Minimax H3 進行微調與蒸餾(Distillation)。官方已釋出 66 GB的完整微調模型與僅 2.5 GB 的 LoRA 模型。

---

33:00 GWM 2(RunwayGLM Worlds 2 實時互動世界)

核心功能:Runway 推出可即時生成的互動式虛擬世界,支援第一人稱或第三人稱視角自由漫步與互動。

互動與生成能力:給定一張初始圖片或文字描述即可建立世界。使用者可輸入指令控制角色移動(如前進)、改變天氣,或控制場景中其他角色的行為。

技術規格:以 720p、24fps 實時串流生成影片與音訊。採用自迴歸擴散模型(

Autoregressive Diffusion Model),能持續預測下一個畫面,實現無最大時間限制的無限漫遊。目前僅提供研究預覽(Research Preview)申請。

--

Gemini整理

補充 Gemini的音樂生成Lyria 3.5更新:

https://x.com/GoogleAIStudio/status/2095905336…

Astra用著類似人類的方式操作工具軟體也能做出勉勉強強甚至驚艷的成果了

這能力再強一點那某些AI工具也不用玩了

至於Google 做的事尺度越來越廣了

預測天氣 預測股票 解析大腦 有點那種天網感

--

看 PTT 原文 ↗ 接著看下一篇 ▶ [Vtub] Hololive 晚間直播單 (1150907) 🎮 C洽 · ▲609看下一篇 →

🍉 更多相關的瓜

同板/同主題,繼續吃
⚾ 棒球 U18亞青 韓國 vs 台灣 ▲709▼5 ⚾ 棒球 CPBL #304 中信兄弟 vs 台鋼 @澄清湖 ▲346▼3 📈 股票 2026/09/07 盤後閒聊 ▲823▼128 📌 LoL 2026 LPL Split 3 季後賽 勝部決賽 ▲485▼13