V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  slowgen  ›  全部回复第 1 页 / 共 29 页
回复总数  575
1  2  3  4  5  6  7  8  9  10 ... 29  
5 天前
回复了 Need4more 创建的主题 Local LLM mac 本地部署 llm 不是最佳选择
你假设的数据让你得到了错误的结论,因为你假设的 token 处理量太低了,当然如果你每天就用那么多,那确实回本周期慢。

我用 4 卡 RTX Pro 6000 跑 Qwen3.8 Flash Next NVFP4 ,现在一天最多是跑 54 亿 token(有峰谷,不均匀),还是因为 SM120 在新模型 Day 0 支持不给力,降级到了 marlin 的 backend 数据,要是用新内核估计处理能力还能提升 20%。

结合 Deepseek Harness 一个/goal 开放式任务可以跑 20 小时以上,最近我做了 xterm.js 移植到 dart 和 CSharp 的测试,然后用 Flutter 和 Avalonia 复刻 tabby ,并且自我迭代优化,几乎是每小时跑 1 亿 token 输入,25 到 30 万的 token 输出,缓存命中率一般在 98%~99%。按照 Qwen 官方定价每小时大概消耗 12~13 元。

现在我的 M2 Ultra 跑 Qwen3.8 Flash Next 的 4bit 量化,短的上下文时,prefill: 538.1 token/s, decode: 55.2 token/s ,长任务会衰减,假设这个数据在 M5 Ultra 上不衰减(因为增强了 AI 部分计算性能),根据 M5 Ultra 对比 M2 Ultra 的带宽差异计算,decode 的 token/s 大概在 80 ~ 100 ,prefill 速度估计可以 x10 ,这个意义在与有 KV Cache 的部分不用重复 prefill ,跑 Agent 新追加的上下文一般是并发读文件,追加的文件到上下文里几乎秒处理完,保守点的估计每小时 3000 万到 5000 万的 token 应该有,对比官方定价每小时消耗 6 元,一个月是 4320 元,M5 Ultra 256G 的 24 期免息分期费用每个月是 3615 元。
今晚 Qwen3.8-Flash-Next 发布,和 Ling-3.0-Flash 差不多大小,125B A6B ,如果性能追上 DeepSeek v4 Flash 0731 的话,其实 256GB 就够。

人的欲望总是随着新模型的发布不断上涨,买 512GB 赌的是未来这个容量可以跑下更大更 SOTA 的开源模型,赌 Fable 5 级别的模型很快就可以跑在个人设备上。
unsloth 的 NVFP4 没什么问题,反而是 SGLang 用 RadixArk 的那个 NVFP4 + DSpark 有大问题,给了 85G 显存还会 OOM 。
LMCache 记得用,冷对话的 KV Cache 可以转移到内存,避免时间太久对话被丢掉需要重建 KV Cache ,从而又走一遍 prefill 阶段。

同时今天出 Dflash 2 ,加速效果比 DSpark 还猛,可以继续测了。

我这几天用 DeepSeek Harness 跑 DeepSeek-V4-Flash-0731 和 Qwen3.8 27B ,都是 NVFP4 ,跑了几亿 token 做测试,结果在做 GUI 方面 Qwen3.8 很亮眼,在移植 tabby 项目到 tauri2 + rust 的测试中,有以下难点:
1.我在虚拟机里跑的 Linux Mint ,GPU 是虚拟的,可能用不到加速,运行过程中可能黑屏白屏、帧数低等问题;
2.rust 编程能力的问题
3.e2e 测试的问题,自动化界面点击测试

Qwen3.8 27B 全面领先,毕竟有视觉能力,一路高歌猛进,/goal 设定目标就可以了,虚拟机丢旁边看着它一直推进,SFTP 面板都在做 GUI 的冒烟测试。构建完成后空载内存只有 39MB ,看到原子弹爆炸了。
就是中间有一个 bug ,反馈给它后,它自己用了插桩、探针、前端 SPY 、hook 多种手段来调试,花了 5100w 的 token ,修了一行代码,再次看到原子弹爆炸,xhigh 真就是用电力换能力了。
8 月 15 日
回复了 majuzhang 创建的主题 Local LLM 公司本地部署开源模型
如果 MiniMax M2.7 级别的模型能满足你,那么今天 Qwen3.8-27B 的能力就超越了 M2.7 ,还是多模态,你只需要 5090 就可以了,使用 SGLang 的方案在单个 5090 上,结合 NVFP4 和 DSpark ,解码速度达 206.1 tok/s https://docs.sglang.io/cookbook/autoregressive/Qwen/Qwen3.8-27B ,随着人数的增加来加卡就行。

如果你想要更好的模型能力,那么用 DeepSeek V4 Flash 0731 的 NVFP4 量化也行,RTX Pro 6000 现在涨价厉害可以退一步买 RTX Pro 6000D 这个被砍一刀的卡,2 张有点吃紧但是能跑,4 张就最好,我这里 4 张卡一天跑 20 亿 token 没问题,最大的问题就是这个成本对比买 API 哪一个划算,哪一个符合你们要求。

用多台 DGX-Spark 串联跑,也 ok ,https://github.com/MiaAI-Lab/DeepSeek-v4-Flash-DSpark-2x-DGX-Spark

最好使用 LMCache 来把 KV Cache 转移到内存,这样显存放模型,内存放 KV Cache ,速度也不会慢多少,显存容量的要求也降低,可以让更多的大上下文进来,工程上都是这么玩的。
结合好的 Agent 比如最近的 DeepSeek Harness ,缓存利用率大部分都是 95%~99%,对 prefill 速度友好。
7 月 30 日
回复了 davinci21s 创建的主题 分享发现 想做 AI 漫剧/沙雕动画,第一步就卡住了
@davinci21s 迁移动作才占你视频的百分之多少?不都是先做分镜图然后图生视频吗?你可以租个 5090 到 RTX Pro 6000 这个级别的显卡,配合 NVFP4 跑,刷新一下认知。反正我们做 5s 的 720p 视频一个就几十秒
7 月 30 日
回复了 davinci21s 创建的主题 分享发现 想做 AI 漫剧/沙雕动画,第一步就卡住了
谁告诉你本地模型几秒钟的视频要半小时?你的数据来源都是错的
鸡腿肉丁一样低脂又便宜,口感比鸡胸肉好多了。
光是油这一样就占了很多因素了,饭店的油有点水平都自己调配过,加了增香的料进去炸过
7 月 2 日
回复了 maliaosaide1 创建的主题 问与答 请警惕账号 w1573007 发布的开源项目 Termo
198 一个号,这个价格比很多网游账号的价值都高啊
本地跑大模型还得是 Blackwell 架构的 RTX Pro 6000 ,直接上 NVFP4 量化,真的就一代架构一代神
从 CTO 角度来说难度可能不大,比如用绞杀者模式逐步替换 API ,结合流量镜像方案把生产流量同时导入测试环境的新老系统看数据对比来验证防止翻车等,手段很多。

如果是从培养你角度让你直接参考 https://typescript-is-like-csharp.chrlschn.dev/pages/intro-and-motivation.html 这种方便 TypeScript 熟练工快速学习 C# 的文档两天就能上手读懂项目,渐进式重构问题也不大。

但是选择的方案这么激进,对你来说难度就很大了,起码出一个风险应对方案来,除非业务规模很小,项目也不大。

同样是选择 AI 方案,还不如先让 AI 把当前系统优化好。
6 月 11 日
回复了 addou 创建的主题 生活 家里有蛇,怎么办
最好确认是什么蛇,我之前在农村路骑车的时候碰到一条好大的蛇,作死上去拍了点视频,发群里了才知道是剧毒的银环蛇
6 月 6 日
回复了 suckinbottle 创建的主题 职场话题 纯吐槽公司技术团队现状
你们少了一个技术能力过硬的架构师,而且你们后端太菜了,不然的话让后端从 PHP 转 Node 没毛病很顺利的。

我以前带团队就是从 PHP 转 Node 的,把语言特性、相似函数、相似库、各 Web 框架相似性等细节全部拉出来对比讲透,不用 3 天大家就可以开干了,然后过程中跟进代码和 review 就完事了。有 AI 之后更方便,现在技术栈我都换了几轮了。

用渐进式重构方案,一部分接口替换完之后流量重定向到新代码,要是有问题就把流量切回去,都是一套工程化体系的东西,要是基建水平不行那还得把基建搞好。

说白了你们后端的连 AI 都比不过,原地踏步,一潭死水,不过也不奇怪,毕竟现在还在坚守用 PHP 的公司绝大部分也就这样了,就连百度早在多年前就禁止新项目使用 PHP 了。
5 月 31 日
回复了 rivercherdeeeeee 创建的主题 生活 家用落地扇推荐
别买小米,24 小时开机的坏了 2 个了,都是过保就坏
提供一个思路:找有垃圾分类而且底商有钱大妈这种菜市的小区,员工有概率在晚上 10 点半拖着卖不出的菜连包装都不拆丢进厨余垃圾桶里,捡到就是零成本
5 月 11 日
回复了 davidyin 创建的主题 Local LLM 想折腾一个 AI 主机,请行家出手
预算鸡肋不如买 api ,而且你低估了 Mac Studio 在跑大模型这件事上是极致性价比,官方翻新的 Mac Studio 库存已经 3 个月没补过货了,坐等 M5 Ultra 是最好的选择,因为曾经的 prefill 短板已经不短了。

跑大模型不是说你现在部署了之后就不动了,非要选择方案,当前性价比最高的是 DFlash + Qwen3.6 27B 方案,人家在单张 3090 上优化到极致跑的,直接抄作业就行。

但是,如果 2 个月之后出了一个开源模型,能力比你现在跑的模型提升 20%~ 30%,部分能力追平 Opus 4.7 ,体积在 40 ~ 60B 这个尺寸,你手头的硬件跑不动了,升级空间也没了,你怎么想。
很遗憾,现在的模型就是月更,你无法预计到下一个月有什么模型出现,它们的能力又达到了什么程度。

而且从已有的信息来看,你对模型类型( Dense / Moe 和显存带宽 or 内存带宽的关系是如何影响到 token/s 的)、prefill 速度取决于什么、模型尺寸和不同的量化方案( Q4_K_M/Q4_K_X_L/NVFP4/MXFP4/Q5/Q6/Q8/FP8 的差异)和上下文大小对于显存占用是如何计算的,这些信息你都没有任何概念。
更别说评估你的任务需要注意模型 benchmark 分数的哪几项指标,同时这些指标在能选的模型里哪个最好。

当你解了之后,你的结论就回到了我这条评论的第一句话了。
@mewking 就是这个啊 https://huggingface.co/unsloth/Qwen3.6-27B-UD-MLX-NVFP4
从命名风格来说 UD 就是动态量化,带 MLX 的就是用 Apple 的 MLX 跑的,NVFP4 作为压缩保存的格式。
这个测试也太不严谨了。

开源模型的参数是有推荐的,不同的模型对于不同的任务场景,temperature 、top_p 、top_k 、min_p 、presence_penalty 、repetition_penalty 的数值都不同,你用网页版都不知道人家默认是针对什么场景配置的,做测试对比是要根据你自己的任务场景去设置的。

甚至是量化部署方案,比如同样 NVFP4 的量化,还要看用了什么数据集校准。

我就这么说吧,我本地部署的 MiniMax M2.7 ( nvidia 放出的 NVFP4 量化)和 Qwen 3.6 35B-A3B ( RedHatAI 放出的 NVFP4 量化)、Qwen 3.6 27B ( mlx-community 的 NVFP4 量化和 unsloth 的 UD + NVFP4 ),分别按照各模型文档的参数推荐来用对话模式按照你那一句话 prompt ,写出来的 html 都和你提到能上桌的模型都差不多。
1  2  3  4  5  6  7  8  9  10 ... 29  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2928 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 31ms · UTC 08:10 · PVG 16:10 · LAX 01:10 · JFK 04:10
♥ Do have faith in what you're doing.