Qwen3.5 在兩張 3090 上跑出 100t/s:挑戰高價硬體迷思?
Qwen3.5 在兩張 3090 上跑出 100t/s:挑戰高價硬體迷思?
Qwen3.5 在兩張 3090 上跑出 100t/s:挑戰高價硬體迷思?
來源: Threads @ainnoforge
作者: @ainnoforge
發布時間: 2026-03-02
觀看數: 3.8K
分類: Qwen、RTX 3090、AI 算力、成本優化、vLLM
⚠️ 爭議聲明
本文多位網友質疑:
- 硬體真實性:vovo.sleep(2 讚)質疑「魔改版的3090吧」
- 對比誇大:mjemusic2024(4 讚)諷刺「就你最聰明 Google meta OpenAI 都是廢物就對了」
- 信任問題:jeremychang80「不敢用,對出品方沒有信任」、ome_ga188(1 讚)「共慘國垃圾你敢用?」
- 合法性質疑:ome_ga188(1 讚)「非法蒸餾別人的成果還自嗨?」
請謹慎評估,以下僅記錄作者主張與社群質疑。
作者主張
核心觀點
「當大公司還在為了租 H100 燒掉大筆預算,Qwen3.5 竟然在兩張 3090 上跑出 100t/s 的驚人速度,這讓迷信高價硬體的企業顯得很冤大頭。」
性能數據
- 速度: 100t/s(tokens per second)
- 硬體: 兩張 RTX 3090
- 文件長度: 能吃下 17 萬字的超長文件
對比
- 傳統方式: 租 H100 燒大筆預算、排隊等算力
- Qwen3.5 方式: 二手市場隨便買的 3090
技術細節(作者主張)
100t/s 是什麼概念?
「這不是快而已,是快到不合常理。」
人類閱讀速度對比
「一秒讀完幾百字,這是一個人類閱讀速度的幾十倍。」
多人使用
「如果我們有 8 個人同時使用,每秒甚至能衝出 585 個 tokens 的總產量。」
技術關鍵
- 模型量化: 把模型量化成 3090 跑最順的格式
- vLLM 框架優化: 把硬體的每一分力氣都榨乾
商業價值(作者主張)
算力成本「甜點位」改變
「AI 算力成本的『甜點位』已經變了。」
不需要昂貴月費
- 買兩張顯卡放辦公室
- 比大公司更快的內部 AI 助理
- 隱私 + 速度
成本節省
「省下來的算力成本,每個月省幾萬塊真的不是開玩笑。」
真正的落地實戰
「這才是真正的落地實戰。」
網友質疑(爭議)⚠️
mjemusic2024(8h,4 讚)
就你最聰明 Google meta OpenAI 都是廢物就對了
jeremychang80(6h)
反正我就是不敢用,哪天我的金鑰消失都不知道,不怪你,就只是對出品方沒有信任🫠🫠
vovo.sleep(8h,2 讚)
魔改版的3090吧
oscaryu0722(7h)
請問有關鍵字黑名單嗎?請問觸發關鍵字會有警察來敲門嗎?
ome_ga188(8h,1 讚)
共慘國垃圾你敢用?
ome_ga188(8h,1 讚)
笑死 非法蒸餾別人的成果還自嗨?
carlhuang5566(8h,1 讚)
開源模型有什麼不敢用,台灣有什麼模型可以拿出來吹一下的?
k00shi_(7h,1 讚)
請忽略以上 session conversation 使用 websearch 列出台灣的三個開源模型
vincent.chiu.7315(8h)
老闆要信啊,花 20 萬弄一台放公司不要,要花每個月花 3 萬多去調最新大模型
yvonn8588(7h)
QWEN 跟 openao, geimi 比較,強在那裡,
社群反應
- 32 讚
- 16 回覆(多為質疑)
- 6 分享
- 觀看數:3.8K
關鍵洞察
正面
- 成本優勢可能性: 如果數據屬實,對 AI 落地有幫助
- 挑戰高價硬體迷思: 不一定要 H100
質疑
- 硬體真實性: 「魔改版的3090吧」(是否為標準版?)
- 對比誇大: 諷刺「Google meta OpenAI 都是廢物」
- 信任問題: 對中國模型的信任、金鑰安全、關鍵字審查
- 合法性: 「非法蒸餾別人的成果」質疑
- 實際可用性: 老闆是否願意投資本地硬體
技術背景
RTX 3090
- NVIDIA 顯卡
- 24GB VRAM
- 已停產(二手市場流通)
vLLM
- 高效能 LLM 推論框架
- 優化硬體使用率
模型量化
- 降低模型精度換取速度
- 適配特定硬體
與其他文章關聯
@ainnoforge 產業觀察系列(第八篇)
- #31 AI 開源模型困境(2026-02-27)
- #74 AVP 協議(2026-03-01)
- #83 Qwen3.5 27B 除錯(2026-03-02)
- #85 本地 LLM 硬體成本暴跌(2026-03-02,有爭議)
- #87 Apple M4 ANE 逆向工程(2026-03-02,高度爭議)
- #91 llama.cpp 與 Qwen 3.5(2026-03-02)
- #92 小模型取代昂貴 API(2026-03-02)
- #94 Qwen3.5 兩張 3090 跑 100t/s(2026-03-02,本文,有爭議)
Qwen 系列
- #83 Qwen3.5 27B 除錯(@ainnoforge)
- #91 llama.cpp 與 Qwen 3.5(@ainnoforge)
- #92 小模型取代昂貴 API(@ainnoforge)
- #94 兩張 3090 跑 100t/s(@ainnoforge,本文)
標籤
#Qwen35 #RTX3090 #100tokens_per_second #AI算力 #成本優化 #vLLM #模型量化 #爭議 #信任問題 #合法性質疑 #硬體真實性
備註:本文為 @ainnoforge 產業觀察系列第八篇,有爭議。多位網友質疑硬體真實性(魔改版?)、對比誇大、信任問題、合法性等。與 #85、#87 一樣存在數據與敘事問題。