BingoXuan

BingoXuan

V2EX member #170096, joined on 2016-04-22 13:23:09 +08:00
Today's activity rank 4161
Per BingoXuan's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
BingoXuan's recent replies
@midasplus
理论上是的,早上还是没睡醒啊
@XTTX
plus 由 5 小时限制,有充值卡也很憋屈
2 days ago
Replied to a topic by murongxdb OpenAI 我 chovy, GPT 20x 的额度是不是砍了
这两天用了 16 亿 Token ,大部分时候都是 sol high/xhigh plan + luna max sub agent ,体感上确实消耗更快
Aug 31
Replied to a topic by Kakarrot 配件 MacBook Air M5 扩展坞推荐
雷电一转多下行 hub ,走雷电原生 dp 信号
Aug 29
Replied to a topic by andie 程序员 想看看各位使用 Pi 的姿势
在做一个 web ide (核心是 pi )让团队的硬件工程本地跑个 mcp 服务就可以让 ai 云端生成固件烧录控制硬件加速开发(其实就是硬件版的 lovable )
@lgc931018
我有观察 usage 的,看起来并没有 reset 。刚刚开了 sol high+luna max 的子 agent 讨论了大规模重构方案,我驳回了 2 次才消费了 6%。我的场景是本地长期 2 个处理 repo ,偶尔有 1-2 个 repo 偶尔需要修改,每个 repo 不超过 3 个 thread ,网页版隔离上下文讨论其他方案。我不确定其他不使用 sub2api 同样遇到额度快速消耗的场景是怎么样。btw ,我的账号都是走一个固定 ip 的,虽然是机房 ip ,但是纯净度还 ok 。
我昨天没有收到重置,今天用 luna max 跑了好几个任务,额度还是卡在 72%
@sentinelK
sglang 推荐 nvfp4 量化是 RadixArk/Qwen3.8-27B-NVFP4 版本。unsloth 家的 nvfp4 量化可能还不如自家的 gguf 。NVIDIA 的 3.6 27B 的 nvfp4 量化明显比 unsloth 好得多。qwen3.8 的 kv cache 量化最多只能去到 fp8 ,到目前 nvfp4 的 kv cache 量化各家支持还是半残废。Blackwell 的硬件潜力还没有完全挖掘出来。
等 Qwen3.8 35BA3B 吧。3.8 27B 最大问题不是权重。而是 kv cache 。q8 量化跑满 262k 上下文要 8-9G 显存。开 turbo quant 有损失。即使是 Blackwell 显卡,vllm 和 sglang 都还没支持完整的 nvfp4 kv cache 支持
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   1156 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 11ms · UTC 18:09 · PVG 02:09 · LAX 11:09 · JFK 14:09
♥ Do have faith in what you're doing.