V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  coefu  ›  全部回复第 1 页 / 共 68 页
回复总数  1345
1  2  3  4  5  6  7  8  9  10 ... 68  
我有一个超越时代的 agent 理论还在完善,并且能工程实践。二者互为支撑。

同时满足 temporal cogation & initiative 。
7 小时 4 分钟前
回复了 Yuki321 创建的主题 职场话题 裁员问题求助!
评论区一转话锋了,放一年前 都是劝争取 2N 的。
11 小时 46 分钟前
回复了 zzutmebwd 创建的主题 Local LLM pro6000 部署 Qwen 3.8 flash next nvfp4
@zzutmebwd 🦀,bro 。

不用参考了。我自己长期处于 decode < 10 tok/s 的环境。看你这个只让我更伤心,💔,😭
22 小时 37 分钟前
回复了 idblife 创建的主题 Local LLM qwen3.8 本机部署后搭配什么搜索工具呢?
@wises 喷错了,我掌嘴我自己,对不起,bro 。😂
22 小时 39 分钟前
回复了 idblife 创建的主题 Local LLM qwen3.8 本机部署后搭配什么搜索工具呢?
@wises 不用再回复我了,你什么段位,什么德行,我一清二楚了,已经进入我的 block ,不再见。
22 小时 40 分钟前
回复了 idblife 创建的主题 Local LLM qwen3.8 本机部署后搭配什么搜索工具呢?
@wises 那你适合花钱搞,这种免费的满足不了你的需求。

不是 searxng 不行,是你的深度需求,在 searxng 上很难免费实现。你应该在 主题,就附上自己的需求,而不是含糊不清。
22 小时 42 分钟前
回复了 MaskerPRC 创建的主题 程序员 做了大半年 Agent 架构,越做越觉得是在「人研究人」
“想听听各位在做 Agent / LLM 应用工程时,记忆和可控性这两个坑是怎么处理的。”

因为你们没有靠谱的理论深度,都是自己想当然的工程搞法。
22 小时 47 分钟前
回复了 idblife 创建的主题 Local LLM qwen3.8 本机部署后搭配什么搜索工具呢?
@wises 我刚才说了啊,就上面的操作,关了所有 engine ,只留 bing ,baidu ,google ,duckduckgo ,每次 5 条足矣,你要是觉得不够 10 条,完全够了。
22 小时 57 分钟前
回复了 zzutmebwd 创建的主题 Local LLM pro6000 部署 Qwen 3.8 flash next nvfp4
@catazshadow 这只是 idea ,我没去实践过,理论上看起来能跑通。
22 小时 58 分钟前
回复了 idblife 创建的主题 Local LLM qwen3.8 本机部署后搭配什么搜索工具呢?
@wises 怎么还花钱了,用 searxng 就是因为可以不花钱啊。

你部署了之后,没有改配置?
23 小时 34 分钟前
回复了 zzutmebwd 创建的主题 Local LLM pro6000 部署 Qwen 3.8 flash next nvfp4
@wises 再贵,贵的过 pro6000 ?用它五分之一的价格,跑个 10tok/s ,值不值?
23 小时 35 分钟前
回复了 idblife 创建的主题 Local LLM qwen3.8 本机部署后搭配什么搜索工具呢?
@wises 我用的起飞,丝毫没感觉到,你要选 engine ,bro 。国内的只留 bing 和 baidu 。Google ,duckduckgo 。然后选 5 条足矣。
23 小时 37 分钟前
回复了 zzutmebwd 创建的主题 Local LLM pro6000 部署 Qwen 3.8 flash next nvfp4
@wises 64G,4 通道,8 条插槽,每条 8G 。你硬件这块要补习啊,bro 。v100 32G 现在贵了,之前 3000 左右能搞到。
1 天前
回复了 zzutmebwd 创建的主题 Local LLM pro6000 部署 Qwen 3.8 flash next nvfp4
@zzutmebwd 不是人人都买得起 pro6000 ,🦀,bro 。
1 天前
回复了 zzutmebwd 创建的主题 Local LLM pro6000 部署 Qwen 3.8 flash next nvfp4
蟹,bro 。

老师傅给你们一个便宜方案,有点 hack 。

找个 双 pcie 主板,最好能四通道,2*v100 32G ,m.2 16G 傲腾 M10 ,64G mem 。

1w 以内的解决方案。

绝招:装 Linux ,把傲腾 m10 映射成 vram cache ,v100 支持 GPUDirect Storage ,可以走 pcie 直接 读傲腾,绕过 cpu/mem 搬运。pcie3.0x16 30GB/s ,傲腾 16GB 容量。因为 傲腾夸张的 4k 随机读写和 mem 一个性能,所以,可以把 kvcache ( Q8 量化,1M context ) offload 到 M10 。engram offload 到 mem ,64G vram 放模型权重。

挤一挤,也能用。😂
1 天前
回复了 zzutmebwd 创建的主题 Local LLM pro6000 部署 Qwen 3.8 flash next nvfp4
有个 64G vram 的,也能跑个 Q4.

https://github.com/FlashML-org/FreeToken

把 engram offload 到 mem 。
@yodi 你一不留神,它们之间框框就能把你 api 订阅拉爆。
自己写插件不就行了,类似于实现一个群聊,但是只怕你的 api 订阅遭不住。因为 user<->model 的时候,是 1 对 1 ,可以完全结束。但是 多对多的时候,它们怎么知道你是 user ,你说停,它们会鸟你?所以,群聊还得实现管理员。
OP 这只是一个自我安慰罢了,你们这都要戳破。
这波大学科班,让用 chatgpt ,是最大的教育失败。

蟹,bro ,毕设就好好自己思考,这是你最后免费锻炼能力的机会了。
1  2  3  4  5  6  7  8  9  10 ... 68  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2982 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 22ms · UTC 14:50 · PVG 22:50 · LAX 07:50 · JFK 10:50
♥ Do have faith in what you're doing.