V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  sentinelK  ›  全部回复第 1 页 / 共 89 页
回复总数  1764
1  2  3  4  5  6  7  8  9  10 ... 89  
@aukw 我理解是依赖发语音消息的人的特点是比较自我。

1 、他发语音,说明他的场合是适宜语音消息这个场景的,但是他不考虑接收方是否合适阅览。
2 、语音是一种“模拟”信息,不是精确的结构化信息,难追溯,难索引,发起方有一定主动的自由解释权。
3 、语音信息往往是口语化的,逻辑弱,信息密度低,相当于把信息提取的压力转移给了接收方。
我理解其实人的能力是有一定的通用性的:集中力、精力、抗干扰能力、认知能力、判断力都算。
打错字我认为就是典型的缺乏以上能力的表现。

缺乏以上能力,人优秀的概率我自认为非常低。
多 LLM 参考,是不需要并行讨论的。只需要 MOA 就好了。

就是一个 session 负责汇总,其他 session 就是把你的问题每个模型问一遍。
但是 artificialanalysis.ai 的分数只是和 Opus5 相当。
1 天前
回复了 AkinoKaedeChan 创建的主题 iDev BYOK 的 AI 应用如何合规中国区 App Store
反而其实 openAI API 类似这种描述非常奇怪,因为 openAI 有两套 API 格式。
1 天前
回复了 AkinoKaedeChan 创建的主题 iDev BYOK 的 AI 应用如何合规中国区 App Store
如果知道 BYOK 是什么,那他一定认识 Chat Completions/Responses/Messages 这三种 API 格式。
1 天前
回复了 ldm0 创建的主题 Local LLM 2 台 DGX Spark 上运行的本地 LLM 横向对比
@heyjei 相对而言 dsh 这种比较开放的 harness 更方便实现全工具能力。可以靠插件,可以靠 skill 。
Codex 和 Claude Code 都是依赖 API 来提供 web_search 的,所以一般只能安装第三方 MCP 来实现。

@qazwsxkevin 抱脸的量化方在文档中都会着重体现自己的量化方案的损失,关键词是 KDL 以及 Top 1%正确率。通常来讲,优秀的 4bit 量化的 top 1%大概在 95%~97%。比如 unsloth 就以量化损失小著称。他们会公布热门产品的量化损失曲线。
额度不明+闭源专用 Agent+1.5 倍额度放大。完全没 get 到 copilot 目前的意义在哪里。

而且你要知道,之前 copilot 的 harness 逻辑是针对每次请求收费优化的。
@shitshit666 没错,但是很多维度的体验是跑分没法告诉你的。

比如更小体量的模型,因为缺知识量,所以直觉更差,就需要更多的重试次数。
比如为了能力更好,越小的模型性格越偏激,必须要拿到真凭实据(收敛到极致),导致 thinking 起来完全停不下来。
1 天前
回复了 zencitta 创建的主题 程序员 对大厂来说, Vibe Coding 是不是伪需求?
@zencitta 我理解这也是一种机会。越庞大的组织结构越天生有排异性。所谓船大难掉头。

现有的既定结构裹挟太多既得利益了,很难合理响应市场和技术的革新。

没一个组织能完美跨周期停留在头部的。要么直接断臂求生,要么直接名存实亡。
1 天前
回复了 rich1e 创建的主题 程序员 DeepSeek Harness 能开箱即用吗?
从某种角度上讲,我认为这也是 deepseek 的一种策略。

其实 dsh 的底层是比较完备的,他故意给人一种百废待兴的包装,然后利用自己的号召力和品牌影响力让生态主动补全产品体验的部分。这样比较省人力,他们的精力也可以更集中在核心部分。
1 天前
回复了 rich1e 创建的主题 程序员 DeepSeek Harness 能开箱即用吗?
@rich1e 如果说从 ReAcT 底层完成度上讲,其实 dsh 和 openCode 没本质区别。
只是观感不好。

如果说“替代”只是能跑好 loop 的话,其实所有的 Agent 都可以。
1 天前
回复了 zencitta 创建的主题 程序员 对大厂来说, Vibe Coding 是不是伪需求?
所以这跟 vibeCoding 有什么关系……

吃冰棍吃拉稀了你说冰箱是伪需求吗……
1 天前
回复了 rich1e 创建的主题 程序员 DeepSeek Harness 能开箱即用吗?
@rich1e 如果说要求原生安装后功能完全对等,目前是不行的。因为实现思路不同。
但是大体上给 LLM 提供的 tool 是全的。

目前社区插件主要解决的是第三方 provider 的兼容性问题以及 UI 问题为主。
1 天前
回复了 rich1e 创建的主题 程序员 DeepSeek Harness 能开箱即用吗?
先定义一下什么是“开箱即用”?
你如果只看跑分的话,qwen3.8-27B 的 xhigh 跑分,也可以和 flash-0731 有来有回。甚至吊打上 T 规模的老模型。

但是这是春秋笔法,没意义。
2 天前
回复了 1300296933 创建的主题 职场话题 大厂滤镜破碎
@Rat3 当年也是神,有三个“尧舜禹”,两男一女。一个搞物理转模型,一个搞软件工程,女的不知道是什么行业。
3 天前
回复了 1300296933 创建的主题 职场话题 大厂滤镜破碎
所以大厂的社招,几乎只挖几个竞品大厂员工。
反过来也如此,大厂员工也不爱去小厂。

名义上都是开发,但其实大厂员工和小厂员工是完全两个模式与行业。
3 天前
回复了 1300296933 创建的主题 职场话题 大厂滤镜破碎
软件工程角度,大厂小厂和餐饮很像。大厂就像西贝,小厂像你楼下的苍蝇馆子。

大厂未见得比小厂更有锅气,更合你的口味,甚至基于其业态,其菜品菜色是一定不如苍蝇小馆的。
但大厂能保证你吃不病、毒不死。

现在在 Gemini 的“尧舜禹”在访谈中就表达过,他认为他做的工作任何一个本科学历的人都能做。
这个要取决于大模型的心情。tool 都摆在那里,他决定用工具就会用,否则就是概率累计。

概率推算确实不精准,比如之前很流行的 9.9 和 9.11 谁大。
但是目前据我观察,即便是概率硬猜也没再出现那种初级错误了。

估计是后训练有一些针对性优化。
1  2  3  4  5  6  7  8  9  10 ... 89  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   2835 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 426ms · UTC 04:45 · PVG 12:45 · LAX 21:45 · JFK 00:45
♥ Do have faith in what you're doing.