V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  CFM880  ›  全部回复第 2 页 / 共 21 页
回复总数  408
1  2  3  4  5  6  7  8  9  10 ... 21  
❮ ❯
@KaiWuBOSS 我试了一下 codex cli 中对话 OK 了,但是 agent 调用工具不行(比如读文件),应该我模型不行吧
■ unexpected status 404 Not Found: 404 page not found, url: http://127.0.0.1:11435/responses
PS C:\Users\cfm880\Downloads> kaiwu run .\Qwen3-Coder-30B-APEX-I-Quality.gguf

██╗ ██╗ █████╗ ██╗██╗ ██╗██╗ ██╗
██║ ██╔╝██╔══██╗██║██║ ██║██║ ██║
█████╔╝ ███████║██║██║ █╗ ██║██║ ██║
██╔═██╗ ██╔══██║██║██║███╗██║██║ ██║
██║ ██╗██║ ██║██║╚███╔███╔╝╚██████╔╝
╚═╝ ╚═╝╚═╝ ╚═╝╚═╝ ╚══╝╚══╝ ╚═════╝
本地大模型部署器 vv0.1.6 · llama.cpp b8864
by llmbbs.ai · 本地 AI 技术社区

[1/6] Probing hardware...
GPU: NVIDIA GeForce RTX 3080 Laptop GPU (SM86, 16384 MB VRAM, 760 GB/s)
RAM: 63 GB DDR4
OS: windows amd64
⚠️ CUDA 13.2 detected — known bug with low-bit quantization
If you see garbled output, downgrade driver to CUDA 13.1

[2/6] Selecting configuration...
Model: Qwen3-Coder-30B-A3B-Instruct (moe, 22B total / 1B active)
Quant: Q6_K (18.1 GB)
Mode: moe_offload (experts on CPU)
Accel: Flash Attention

[3/6] Checking files...
Using bundled iso3 binary: llama-server-cuda.exe
Binary: llama-server-cuda.exe [cached]
Model: Qwen3-Coder-30B-APEX-I-Quality.gguf [cached]

[4/6] Preflight check...
✓ VRAM sufficient

[5/6] Warmup benchmark...
Probe 1: ctx=128K ... 13.6 tok/s (< 18, too slow)
Probe 2: ctx=64K ... 14.6 tok/s (< 18, too slow)
Probe 3: ctx=32K ... 15.7 tok/s (< 18, too slow)
Probe 4: ctx=16K ... 14.8 tok/s (< 18, too slow)
Probe 5: ctx=8K ... 13.8 tok/s (< 18, too slow)
Tune ubatch: ub=128 → 14.5 tok/s; ub=512 → 14.6 tok/s;
✓ 14.6 tok/s @ 32K ctx
Saved profile: C:\Users\cfm880\.kaiwu\profiles\qwen3-coder-30b-apex-i-quality_sm86_16384mb_ddr4.json
✓ 14.6 tok/s

[6/6] Starting server...
Waiting for llama-server to be ready (port 11434)...
llama-server started (PID 17428, port 11434)
Kaiwu proxy started (port 11435)

┌─────────────────────────────────────────────────┐
2026/04/25 14:35:09 Kaiwu proxy listening on :11435 → llama-server :11434
│ Ready — Qwen3-Coder-30B-A3B-Instruct @ 14.6 tok/s │
│ API: http://127.0.0.1:11435/v1/chat/completions │
│ 模型文件夹: C:\Users\cfm880\.kaiwu\models │
└─────────────────────────────────────────────────┘

运行 kaiwu inject 接入 IDE · Ctrl+C 停止
─ 实时监控 · 空载 ─────────────────── 每 2s 刷新 ─
reuse:1024 · KV:f16 · 32K ctx · ub512 · mlock
速度 显存 内存 GPU 温度
— tok/s 6.4/16 GB 30.4/64 GB 0% 50°CC
[..........] [====......] [====......] [..........] [=====.....]
─────────────────────────────────────────────────────────
上下文 [....................] 0.0K / 32K 余 32.0K
2 月 12 日
回复了 rcj6056 创建的主题 › Android › 学习 systrace 分析
放 android studio 里,看火焰图,找最耗时的函数,看看调用栈,还有就是调用最多次数的函数
小米平板 5
判决书里应该有这么一条,如果未按本判决指定的期间履行给付金钱义务,应当依照《中华人民共和国民事诉讼法》第二百六十四条之规定,加倍支付迟延履行期间的债务利息。加倍部分债务利息:法定固定标准为日万分之一点七五(年化约 6.3875%),相当于定期存款呗,不用着急;大家都慢慢耗着就是了。
使用 Process Explorer ,View-->System Infotmation--> CPU Tab ,这里记录了应用程序 CPU 占用率的时间轴
2025 年 12 月 9 日
回复了 Sunyin 创建的主题 › Linux › 准备 Linux desktop 当主力一段时间试试 有推荐的么
debian 吧,包更新频率不高,十分稳定,包也多,不用使用 snap ,flathub 包管理器即可安装绝大部分软件,没有 ubuntu pro 的终端广告
买一个货架,五层货架,拼多多 73 块,要打 3x8x5=120 颗螺丝;我因为买货架,买了电转,装了得有 3~4 个货架了吧
2025 年 10 月 14 日
回复了 lovedebug 创建的主题 › V2EX › 建议站长增加育儿节点
附议
VMRACK 上新 cn2 三网精品线路
2025 年 9 月 23 日
回复了 isno 创建的主题 › 程序员 › [盖楼抽奖] 新书上市,《深入高可用系统原理与设计》
求中
2025 年 9 月 8 日
回复了 ChainLock 创建的主题 › C++ › 交叉编译 asop android adb 最新版的问题
小米平板 5 的 archlinuxarm
2025 年 9 月 5 日
回复了 ChainLock 创建的主题 › C++ › 交叉编译 asop android adb 最新版的问题
那下载这个吧

https://archlinuxarm.org/packages/aarch64/android-tools

下载下来解压就有了

我试了这个可以
1  2  3  4  5  6  7  8  9  10 ... 21  
❮ ❯
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2481 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 44ms · UTC 07:32 · PVG 15:32 · LAX 00:32 · JFK 03:32
♥ Do have faith in what you're doing.