Chihaya0824

Chihaya0824

🏢  雑魚
V2EX member #432561, joined on 2019-07-28 21:24:43 +08:00
Today's activity rank 8729
Per Chihaya0824's settings, the topics list is only visible after you sign in
Deals info, including closed deals, is not hidden
Chihaya0824's recent replies
@should 不想付这个税直接转交给用户呗(
@should 网页引导不行的,至少不能跳转那些的,但是如果用户是在网页里开完了继续用会员的话好像是 OK 的?
反正跳转确实是审核直接不让过
@Chihaya0824 游戏显卡少 2 倍的 tensor core 性能的 “游戏显卡的 2 倍的 tensor core 性能的” 打错了不好意思
@Gnnbb BF16 over TF32 accumulation 怀疑是有 5090 一样的游戏显卡的非解锁算力,总之就是很慢
pro 卡一般是和同 die 的游戏显卡少 2 倍的 tensor core 性能的
@yiranw09 是,没有 matmul 加速导致的,但是 m5 也并没有解决什么问题,目前只支持 fp16/bf16/int8 的加速,不恰当的例子你可以理解为他停留在 sm80(A100)时代
@yiranw09 不是,Mac 带宽可以的,我说的是 prompt processing 慢,就是你给他大量长文本的时候你要等很久才会开始吐字,以及并发使用的时候会很慢
还有别买 pro 6000D ,一买一个不吱声
别买 mac, PP 拉完了,同理由不推荐 dgx spark/AI max 395 ,除非是愿意等那其实 ok ( 395 问题更大,fp8 都不支持)
正经用就是最低 2 个 pro 6000 或者 4 个多人大 context
如果电够多也可以选择 8 个 5090 的方案也行

@vandort 靠谱,sm80 系列其实就是会有不支持 fp4 的问题,就是没办法跑原版(
Jul 30
Replied to a topic by aimuz DeepSeek DeepSeek 4 正式版是不是鸽了
@Yadomin 你是天才吗
@Maerd
试一下 https://docs.vllm.ai/en/stable/features/kv_offloading_usage/
我是觉得超过 256K 输出就没那么可用了,所以我一直都管理到 256k 以下(
如果实在是想要再多一点的话可以把 cuda graph 关掉,应该能更多一点
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   929 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 10ms · UTC 21:22 · PVG 05:22 · LAX 14:22 · JFK 17:22
♥ Do have faith in what you're doing.