2 hours ago 在 GPT6 的帮助下 Qwen3.8 Flash 从30tps提高到50 (54G显存 Q2KL 量化)🌐 链接: https://linux.do/t/topic/2918926🔍 关键词: #gpt🏷️ 分组: LinuxDo论坛🕒 时间: 2026-09-18 16:26:54 LINUX DO 在 GPT6 的帮助下 Qwen3.8 Flash 从30tps提高到50 (54G显存 Q2KL 量化) 背景 上次部署了 Qwen3.8 Flash IQ3,后来没怎么用了,因为DeepSeek V4 Flash Vision Exp暂时满足我的需求了 然而最近拉闸了,都换成 → V4.1 Flash了,甲太厚了 受不了了,重操就业 本地部署了 因为我是不对称双卡,又有usb4这种低宽带的,跑不了vllm或者sgland 继续llama.cpp了,但是之前的输出速度我并不满意, Prefill 300-600 tps 20-30 于是想到了,直接让GPT6 Astra看llama.cpp给出优化,给出方案后让gemini…