Qwen3.8-27B Heretic (Agent & Claude Code
這是Qwen3.8的Heretic量化版本(Q4_K_M) 支援多模態視覺化
詳細可看網頁說明
https://ollama.com/jacokon/qwen3.8-27b-heretic…
為什麼要做這個呢?
因為在ollama的qwen3.8頁面中雖然有提示claude code的啟動指令:
ollama launch claude --model qwen3.8
實際上啟動後是完全無法用的
換成我的版本就可以用了:
ollama launch claude --model jacokon/qwen3.8-27b-heretic-ara
這是可以瑟瑟的版本,編譯成多模態,預設ctx為65536,不夠可再自己調整
我自己通常是用16萬,可以做長任務或一口氣輸出幾萬字中文小說
就看自己的VRAM到哪裡
claude code光是prefill就超過33000ctx, 所以65536只是堪用而已
那為什麼要用claude code載入呢?
如果你只需要用到聊天視窗, 這個就不是你要的東西可以左鍵離開了
用claude code主要是可以載入skills, 例如最近的MMH3應用例
介面和tools完整,有auto mode
如果真的不喜歡claude code的話,用opencode載入也是可以的
以生成H3 prompt為例,告訴qwen3.8去載入H3 skills,接著參考你的workflow
或是讀取你之前的工作記憶,再交代他要生成總長度例如3分鐘的影片,
以5-10秒來分拆切片,劇情大約是怎樣的,最後生成可執行的batch檔案
讓你可以自己手動執行
產出: python程式 x 1, prompts_seg x 18
離開claude code釋放掉顯存佔用, 打開comfyUI
執行該python batch, 一口氣產出18段劇情連貫影片, 以及串接好的3分鐘影片
以CK Attention加速為例, 生成10秒影片約1分鐘, 總耗時18分鐘
這樣做的好處是不用重複載入以及釋放, prompt生成階段單獨處理
Q4_K_M版本除了我還有另一個人也有做,但他沒有寫任何說明我寧可用自己的
算起來最好有24G VRAM, 16G的話勉強可執行? 但我沒有16G的卡可以測試
如果真的執行不起來可以留言說一聲,我再做個Q3_K_S版本
Q3_K_S在ollama上查詢過目前沒有人做
但對VRAM不足的情況來說,這是比較合理的選擇,
雖然無法全速執行,但可以有比較長的上下文
--
有人問就試著做了... 雖然我自己可能用不到
--