yjhatfdu2's recent timeline updates
yjhatfdu2

yjhatfdu2

V2EX member #457268, joined on 2019-12-04 10:30:20 +08:00
Today's activity rank 3649
yjhatfdu2's recent replies
@sentinelK 我现在用的是最新的 vllm ,改了一下 jinja ,基本上没有遇到这些问题,但是有个偶现的 GPU 报 Xid 31 导致奔溃的问题,可是 flashinfer 的 B12x 内核在长上下文、高并发、MTP 下的 bug ,就先凑合着用吧,codex 跑几个小时可能会遇到一次
@wcwcxiaobin 你可以试试呢,muse 大部分的局部注意力,长上下文也有可能不集中
@catazshadow 开 128K 和能力有什么关系? Qwen3.8 估计关掉 thinking 都可以把 muse 吊起来打,所有的客观测试分数都相差两代的水平了,AA 比开了 reasoning 的 Qwen3.6 27B 都低三分,也就比 Qwen3.6 35B 好一点,真的是拉大了。
@sentinelK 这个应该是因为 qwen3.8 只有几个有限的思考等级,和 codex 的那几个不匹配,需要改 jinja 模版做映射
@yjhatfdu2 我是 PRO 6000 ,感觉现在 sm120 架构还是支持有限
@catazshadow 规模更大,所有评测都落后一大截,AA 更是 35 比 52 ,这怎么叫打的有来有回呢?应该是全方位无死角吊打。Qwen 你也可以开 128k 上下文
sglang 在 codex 上遇到了不少微妙的问题,包括但不限于 codex 的扩展工具类型支持问题(比如 mcp 相关、工具检索等),开启 EAGLE 后 xgrammar 进行 tool call 受控采样时会偶然遇到 triton kernel 的问题导致奔溃,加入多模态会导致输出长度可能超过模型上下文限制导致报错,加入图片偶现 prefill cuda graph 问题,SMG 对于 codex 的很多扩展的 responses 协议字段强校验通不过报错。修了半天算了还是换 vllm 吧,不过 vllm 也遇到了非常偶现的 cuda 内存越界,真是服了
Jul 29
Replied to a topic by whetherTsmile macOS mac mini m4 GPU 性能支撑不住 4K
@rm2788 粘滞可能是蓝牙鼠标延迟的问题,用有线或者 2.4G 的无线毫无问题
城市>学校>专业
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   1075 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 13ms · UTC 23:02 · PVG 07:02 · LAX 16:02 · JFK 19:02
♥ Do have faith in what you're doing.