V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  SSang  ›  全部回复第 1 页 / 共 13 页
回复总数  245
1  2  3  4  5  6  7  8  9  10 ... 13  
4 天前
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
哦,酒馆的话,decode 速度可能就还蛮重要的,特别是那些用 html 的本。
4 天前
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
统一回复一下:

1. --parallel ,这个会直接平均分配你的上下文窗口,需要考虑清楚,如果你的上下文已经不够了,不建议开
2. 我认为 256k 是能让主 Agent 达到生产可用的基线,可以根据实际情况降低一点,但不能太少。
3. v100 的 kv 用 q8_0 ,prefill 速度降低将近 10 倍,我觉得已经不可用于生产了( q4 劣化是不可避免的,社区普遍认为会损失 20% 左右智商,而 q8 一般被认为是几乎不损失)
4. dflash, mtp, ngram 这些投机解码技术实际上很吃场景,如果用过小米的那个 ultraspeed 就知道了,最开始几轮都能达到 1000toks/s ,但随着上下文增加或任务变得复杂,采纳率会大幅降低,最后也拉不开太大差距了。还有资源的可以考虑开一开(所以目前我都不太研究投机解码技术,而且实际干活的时候我更关心 prefill 我的场景,prefill 基本要占用总耗时的 80%)。
5. turbo 量化看起来是社区版本,一猫的那个我之前也有关注,我可能等过段时间有空了,再研究研究吧,现在他稳定跑着我有点找不到时间停机测试(我的用量还蛮大的)。


> PS:我这里的达到生产可用指的是能作为主 Agent ,执行一般复杂的任务(即实现某个功能/调研某个产品/输出某个分析等的 AgentLoop ,而不是简单的修改/整理文件工作或 Chat ),并且不会有长时间的等待(常规任务 Prefill 最多不能超过 30s ,或者至少 500tok/s 左右; Decode 至少 10tok/s 吧)。

> 如果你只是想要玩一玩 Chat ,或者作为 Subagent 执行一些简单任务,比如搜索,整理文件,提交代码,生成 Changelog 等,则一般 32-64k 已经非常足够(通常 Agent 的初始上下文会有 4-16k ,简单任务一般不会超过 32k )。玩酒馆的话一般还是建议至少 128k 以上的上下文。写代码我觉得至少 200k 吧,不然就一直在压缩。
8 月 27 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
不对,我重新又试了一下,关掉 `--split-mode tensor` prefill 速度其实也是 600tok/s 。

他除了能让我两张卡同时跑满之外,没有任何提升(笑哭),甚至还有些许下降我觉得。估计是 PCIe 拖累了。
8 月 27 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
我发现了一个新的参数 `--split-mode tensor` 之前我用 row 一直报错 not support split buffers ,我以为不能并行,但是用 tensor 又能并行了,很神奇。

然后没有 nvlink 的话可能要加环境变量 NCCL_P2P_DISABLE=1 。

开了这个之后我的 prefill 速度大概到了 600tok/s 了
8 月 27 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@ljian6530 T4 我觉得,不然你拿去玩 Minimax H3 吧(狗头),kvq4 这个 prefill 速度,没有优化的空间了。你就算 8 卡速度 x4 ,也才 280tok/s
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@zzutmebwd 有些过于富有了,只能说玩 V100 的都是穷人
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@strobber16 主要不是显存不够,是 prefill 太慢了
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@paranoiagu 他这个是用来跑原生 tensor 模型的,好像最少也得 64G 显存吧。玩不起,32G 还是老老实实 gguf 吧
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@catazshadow 噢噢,就是直接 pcie 拆分 4 卡的是吧。确实 pcie 也听够了,我之前搞过一个 pcie x1 拆分 4 卡的,当时也测不出有什么差距,但后来不知道被我丢哪去了。
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@lyonll 我有空也测测 turbo3 ,但其实 q4 我觉得就已经有些不太行了。

我就是体感劣化,有的是很明显的劣化的,就是很简单的任务,比如我让他改一个前端展示从 ID 改成获取名称展示,改了量化之后他直接开始一直循环不输出结果,这种就是明显的劣化了。

我 q8 跑就是很慢,但是基本上任务都能完成,但是 q4 还是会有概率出现乱回答或者死循环。

---

然后还有就是我个人感觉本地部署 prefill 速度比 decode 速度重要,decode 只要有 10tok/s 就有一点安慰作用了,但是我要是等几分钟他还在那转圈,就会开始怀疑是不是模型挂了还是报错了。

(我之前其实是有算过的,特别是长上下文编码的场景,prefill 速度会很大程度决定任务的总耗时,100k 左右的上下文,基本上要缓存命中到 98% 以上,decode 速度才会对总耗时有些影响)
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@GuardX 反正我看了其他的帖子基本上也是这个结论:「 Q4 及以上质量良好,Q4 以下断崖式下降」
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@GuardX 12G 能跑 q2 吧,上下文应该能到 128k ,不行就将降低到 64k ,kv 应该也只能跑 q4 ( q8 理论占用就要 8G 显存了),但我觉得 q2 写代码的话还是不太行的,你日常对话玩玩还行。
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@catazshadow hh ,我也在考虑,但是现在好像 nvlink 都还是挺贵的状态。

这个 T10 是 Tesla 还是 Turing 啊?
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@jhytxy 是 gemma4-31B 吗?我看 AA 上面的 Intelligence Index 还蛮低的,满血才 30 分,上一代的 qwen3.6-27B 满血都有 38 分了。他的 Q4 的会比 Qwen3.8-27B 的 Q8 量化还厉害吗?

上一代的 Qwen3.6-27B-Q4 对我来说也是不可用的状态。3.8 我这几天用下来感觉是达到可用水平了。
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@realJamespond udq6kl,kvq8,mtp3,c64k 这个配置你主要是用在什么场景?

我这里的话 c64k 太小了,写代码一直在那 compact ,然后 kvq8 100tok/s 的 prefill 速度我写代码平均 ttft 都要 100 多秒,有点难受。
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@catazshadow 确实是这样。V100 Q4 有时候也能 1000 多,应该不是算错,感觉是合理峰值。Q5 性能确实比 Q8 还更差,Q8 偶尔还能上 100.
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@chengsitom 一天 4 度左右吧
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
我觉得 V100 用 Q4 KV 就是极限了,只有用 Q4 能到 500 左右的 prefill 速度,Q5 开始就几乎上不了 3 位数了。
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@catazshadow prefill 的速度怎么样
8 月 26 日
回复了 SSang 创建的主题 程序员 32G 显存 Qwen3.8-27B-GGUF 配置分享
@paranoiagu 这个 chat template 你用的是哪个。有用吗,我还没自己测这块,之前 Qwen3.6 的时候调了半天,最后发现调的乱七八糟的。
1  2  3  4  5  6  7  8  9  10 ... 13  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   3448 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 13ms · UTC 04:34 · PVG 12:34 · LAX 21:34 · JFK 00:34
♥ Do have faith in what you're doing.