V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  BingoXuan  ›  全部回复第 1 页 / 共 158 页
回复总数  3148
1  2  3  4  5  6  7  8  9  10 ... 158  
6 小时 59 分钟前
回复了 Leon6868 创建的主题 程序员 多端 GUI 真的没有银弹吗
@Leon6868
skill+多模态+playwright 能加速回环。小模型可以用来验证流程和细节提供相关信息,大模型负责实现。
10 小时 29 分钟前
回复了 Leon6868 创建的主题 程序员 多端 GUI 真的没有银弹吗
@Leon6868
去年就用 webgl shader 实现了一个实时波形渲染,300 个信号,信号长度 2k ,120fps 点毫无压力。web 反馈回环非常快,AI 很擅长的。如果 AI 就是一个 compiler ,那么任何框架都不重要
R.I.P. 也许写信个 tim cook 更有效,但前提是怎么这台手机是你妻子购入或者所有的
@JimLee0921
完全是过度优化了。fastapi 性能没那么不堪,而且 agent 都是重 io 的。套一层 go 并不会提高性能。反而降低了可观察性。有这个时间应该把 fastapi 的可观察性提高,确认性能瓶颈和找 bug 而不是盲目换语言。如果架构足够清晰,第一点既不是问题。llm 返回的流如何缓存,用户网络抖动断开重连如何恢复等细节都会处理好。换语言不影响架构,尤其现在 LLM 重写有太多成功例子。
1. llm 返回的流数据可以传给任何流,你可以选用 NATS 或者其他消息队列,返回给用户时候变成 SSE
2. agent 生成的东西不应该保存到数据库,而是考虑保存到 S3 这类存储服务
3. 我看完了也没搞清楚 go 部分到底要干嘛?如果本身功能角色不清晰,和任何系统对接都会变成一坨不可名状的东西
12 天前
回复了 mingtdlb 创建的主题 Local LLM 跑本地大模型 电费要多少?
@mingtdlb

显存够用那就直接原版 fp8 ,我用 nv 的 nvpf4 量化,体验比 unsloth 的好

podman run -d --rm \
--name vllm-qwen36-27b \
--device nvidia.com/gpu=all \
--ipc=host \
-p 8000:8000 \
-v $HOME/work/models/Qwen3.6-27B-NVFP4:/models:ro \
vllm/vllm-openai:latest \
--model /models \
--served-model-name qwen3.6-27b \
--dtype bfloat16 \
--kv-cache-dtype fp8_e4m3 \
--max-model-len 147456 \
--max-num-batched-tokens 4096 \
--max-num-seqs 4 \
--enable-chunked-prefill \
--enable-prefix-caching \
--enable-auto-tool-choice \
--tool-call-parser qwen3_xml \
--reasoning-parser qwen3 \
--gpu-memory-utilization 0.95 \
--trust-remote-code \
--attention-backend FLASHINFER \
--override-generation-config '{"repetition_penalty": 1.05}' \
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'
13 天前
回复了 mingtdlb 创建的主题 Local LLM 跑本地大模型 电费要多少?
@mingtdlb
27B 是 dense ,比起 3.6 的 35B MoE 在代码上还是强得多,体验过就知道了。我测试 llm 都是让 llm 使用 webgpu 实现虚拟示波器。27B 可以实现,需要多跑几轮和更多思考 token 。deepseek v4 flash 甚至第一轮就开始各种报错。这几个月体验下来,27B 可以应付 10k 的小项目。小需求改动或者找 bug 甚至比起 codex 降智的 5.4 要好用(比 copilot 的 5.4 强不少,主要 copilot harness 不行,现在还贵)。最重要是无限输入,等于无限制用 llm 进行索引

@imruiming
是的。但我跑本地模型更多是为了验证没有网络情况下,用本地小模型能节省多少资源和提高多少效率。
13 天前
回复了 mingtdlb 创建的主题 Local LLM 跑本地大模型 电费要多少?
不算输入,只有 216k 输出,0.25 度电,按视频 6 毛钱一度电来算,7 毛 5 每百万 token 。配置铭凡 7455hx+crucial 64G + rtx pro 4500 。模型用的是 Nvidia/Qwen3.6-27B-NVFP4 ,按照平均生成速度 60tokens/s 。
15 天前
回复了 Folder 创建的主题 问与答 2026 年的 ARM 开发平台选择
rootfs 哪里来的? glibc 用的是哪个版本?这两个都是巨坑。用 conan 配合 docker 交叉编译非常方便,远程 debug 也方便。
上单条 D5 ,不然买板子非常受限。现在我的主机用的是 22/23 年买的 2x32G 笔记本 D5 (迷你主机),主板只能选铭凡的 modt 。只有一条 pcie 5.0x16 。想再多加一块显卡也不行
19 天前
回复了 Bullish 创建的主题 汇丰银行 汇丰 ➡️ 会疯!
最后一次 ATM 大额取款是否再检视前不久进行?是否有设立定期存款?是否在一周内进行资金出和入?
6 月 28 日
回复了 DearFox 创建的主题 生活 你们做的噩梦,是基于现实的?还是抽象的?
@leena
就三个,其中两个都成了噩梦/doge/
6 月 24 日
回复了 DearFox 创建的主题 生活 你们做的噩梦,是基于现实的?还是抽象的?
@leena
几乎所有前女友都成了我的噩梦,还是不要梦见好
6 月 24 日
回复了 DearFox 创建的主题 生活 你们做的噩梦,是基于现实的?还是抽象的?
现实,梦见前女友
1. 有些青菜需要焯水,有些炒的时候不能乱翻。青菜我都是随便炒,能吃就行。我是没学完我妈那堆技巧。
2. 调味都是靠感觉,生抽可以最后放。广东人表示在家做为什么放蚝油
3. 还是靠感觉,多做就好了。煎/焗就在锅热火猛时候加点盐水
4. 大火烧热油,放入蒜粒,爆炒几下马上下青菜。
6 月 15 日
回复了 admin948 创建的主题 程序员 Github Copilot 计费方式修改后的受害者来了
完全放弃 copilot 了,又蠢又贵。自部署的 27B 体验良好,轻量工作完全没有压力,无限 token 完全不焦虑。66 token/s 体验非常良好。
6 月 15 日
回复了 femsdfq 创建的主题 汇丰银行 香港汇丰崩了吗
@femsdfq
汇丰最近也在裁员,搞末位淘汰,又是降本增笑了
1  2  3  4  5  6  7  8  9  10 ... 158  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3222 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 66ms · UTC 13:12 · PVG 21:12 · LAX 06:12 · JFK 09:12
♥ Do have faith in what you're doing.