fcten

fcten

V2EX member #7940, joined on 2011-04-13 23:42:32 +08:00
Today's activity rank 19359
Per fcten's settings, the topics list is hidden
Deals info, including closed deals, is not hidden
fcten's recent replies
16h 34m ago
Replied to a topic by webhub123 程序员 这个 Transformer 的网页互动效果太好了
https://bbycroft.net/llm 这个 3D 版的
https://leaderboard.cn/

自己做的大模型排行榜。
这几天用这个项目深度体验了一下 Kimi K3 的前端能力,确实比 GPT 强多了。
AI 难道是产品做出来的吗?如果你的 技术人才 是指 CRUD Boy ,那其实没有 AI 之前也是这样,大部分普通公司里都是产品掌握话语权。
个人评价 K3 > GPT > Gemini
我已经开始无限 429 了,我服了。

Error: [provider.rate_limit] 429 The engine is currently overloaded, please try again later
真的慢。体感只有 20 ~ 30 token/s 。而且即使这么慢的情况下,99 套餐单任务开发也只能撑 2 小时不到。已升级 199 套餐。
效果还可以,让它帮我把项目的前端优化一下,找出来的问题基本都对,解决方案也不错。准备拿它辅助 Codex 一起用一段时间看看。
为啥开季度会员获得的积分比月度会员少
9 days ago
Replied to a topic by mingtdlb Local LLM 跑本地大模型 电费要多少?
@mingtdlb 比较的是输出相同 token 的能耗。N 卡的推理速度是 Mac 是好几倍。

服务器虽然散热好,但是单机要塞下 8 卡,分给每张卡的散热功率就非常有限了。
9 days ago
Replied to a topic by mingtdlb Local LLM 跑本地大模型 电费要多少?
RTX PRO 6000 ,Qwen3.5-35B-A3B 大概一度电能输出 68.8 ~ 86.7 万 token (已计算整机功耗),或者说每百万 token 约 1.14 ~ 1.45 度电。

Qwen3.5 27B 一度电大约能输出 13.3 万~ 19.5 万 token ,或者说每百万 token 5.1 ~ 7.5 度电

注意这是 FP16 全精度+ 不开 MTP 的推理消耗,如果 量化 + MTP 的话,推理速度能到 2 ~ 3 倍,功耗则不会有太大变化。

其实 N 卡的单位 token 电力成本是要比 Mac 低的。

而且这还是工作站显卡,如果是服务器计算卡的话电力成本会更低。因为计算卡需要考虑电力成本,会尽量设置在功耗-性能相对均衡的甜点区域,不会为了性能极限拉频率。

另外,增加并发也会增加 N 卡的优势。因为 N 卡的算力优势在低并发下基本浪费了。

(当然服务器有额外的运行/散热成本,但是假如数据中心用 Mac 的话也一样有这些成本,要注意为了提供相同的服务容量,Mac 会消耗更多电力,也就会产生更多热量)

ds v4 flash 激活只有 13B ,叠加上 dspark 、ds 本身的工程优化,粗略估计电费成本在每百万 token 0.5 ~ 1 度电。
9 days ago
Replied to a topic by semistack 问与答 Codex 重置卡未到账调查
新号注册才半个月已经收到两张了。美区 apple 礼品卡订阅 20x 。
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3681 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 17ms · UTC 05:07 · PVG 13:07 · LAX 22:07 · JFK 01:07
♥ Do have faith in what you're doing.