[開箱] 3080 20G
大概誰也沒想到
當年民用分散式計算節點(aka 礦場)的主力型號能在6年後以另一種姿態就業
卡面

卡背

貼絕緣的NVLINK接口

導熱墊

後IO,Blower風格

12v輸入,採雙6+2Pin

FFXIV DWT Benchmark 1080p全開 - PL75% (240W)

數字基本上和巴哈集中跑分串上差不多(見60樓)
https://forum.gamer.com.tw/C.php?bsn=17608&snA…
Vulkan VRAM 測試
240W大概就650GB/s的頻寬

LLM測試的部分
推理框架: llama.cpp b10636 (4d19b287691e)
後燃器: PL75% (240W), Clock +0Mhz, Mem +0Mhz
模型: Qwen3.8-27b-UD-Q4_K_S
$ ./llama-bench -ngl 99 \
-m /e/Qwen3.8-27B-UD-Q4_K_S.gguf \
-p 128,512,2048,4096 \
-n 64,128,512,1024
| test | t/s |
| --------------: | --------------------: |
| pp128 | 961.25 ± 25.86 |
| pp512 | 1063.68 ± 8.02 |
| pp2048 | 1053.04 ± 1.42 |
| pp4096 | 1039.57 ± 1.65 |
| tg64 | 34.67 ± 0.07 |
| tg128 | 34.80 ± 0.06 |
| tg512 | 34.97 ± 0.06 |
| tg1024 | 34.75 ± 0.03 |
llama-ui測試User Prompt (前陣子脆上讓部分人自我懷疑的貼文):
朋友來我店裡買衣服
卻忘了帶錢,
只好先跟我借了 5000元結帳。
他回家馬上轉了 5000元給我,錢是對了~
可我總覺得哪裡好像怪怪的。
我想不明白
有誰知道嗎?
llama-server FA=1 NGL=99
$ ./llama-server -ngl 99 -m /e/Qwen3.8-27B-UD-Q4_K_S.gguf -fa 1
prompt eval time = 797.12 ms / 436 tokens
( 1.83 ms per token, 546.97 tokens per second) eval time = 243755.63 ms / 8037 tokens
( 30.33 ms per token, 32.97 tokens per second) total time = 244552.75 ms / 8473 tokens

llama-server FA=1 NGL=99 KV量化=Q8 NP=1 CTX=84000 投機=MTP 投機MaxT=3 停用mmap 停用系統記憶體
$ ./llama-server -ngl 99 -m /e/Qwen3.8-27B-UD-Q4_K_S.gguf -fa 1 \
--spec-type draft-mtp --spec-draft-n-max 2 \
-ctk q8_0 -ctv q8_0 \
--no-mmap --mlock \
-c 84000 -np 1
prompt eval time = 893.56 ms / 436 tokens
( 2.05 ms per token, 487.94 tokens per second) eval time = 205425.75 ms / 9541 tokens
( 21.53 ms per token, 46.44 tokens per second) total time = 206319.31 ms / 9977 tokens

總結區
1. 推薦買嗎?
但凡你有這問題一率不推薦
這張卡存在下列隱患:
* 小做坊產物
* 核心的上一份工作大機率為礦卡
* GDDR6X,不熟悉這顆粒的可以看 #1W4yTN2j (PC_Shopping)
本質上買這張的要能接受 3400RMB~=台幣16k 可能隨時進水溝的風險 (張哥: 你好)
2. 其他3080 20G的數據
支乎
https://zhuanlan.zhihu.com/p/2029188132206035598
Reddit小論文
https://www.reddit.com/r/LocalLLaMA/comments/1…
3. LLM情境下單使用者速度和Context尺寸普通
稠密模型MTP下 pp 900t/s 和 tg 46t/s 只能說是勉強能用的層級(玩具)
開滿240k大Context必須依賴系統記憶體或更高的量化
當作Sub-agent跑雲端上不給跑的任務還行(如逆向工程)
最近內地發布新的MoE(3.8-next與5.3-flash),搞128G DDR4 + 24G VRAM的玩法
輸出狀況有機會比現在好,但128G DDR4要合理價格勢必得往Xeon/EPYC平台找
4. MiniMax H3 沒測,但就目前看起來搭配Offload是能玩的
之後Comfy能摸出點心得再到AI_Art分享
--