而是一个名不见经传的个人开发者推出的,你怎么评价它
而是一个名不见经传的个人开发者推出的,你怎么评价它
1
ATKLLL 6h 15m ago
实在找不到角度了吗?你不可能做到基于对事物的绝对了解,进而去评价它。
还有什么叫“打着 DeepSeek 的旗号”? 这不是 DeepSeek 团队开发的吗? |
2
leihaibo1992 OP @ATKLLL 看下眼科
|
3
ATKLLL 6h 4m ago @leihaibo1992 你需要看下脑科
|
4
leihaibo1992 OP @ATKLLL 顺便脑科也挂个号,免得跑两趟
|
5
germain 6h 3m ago
做一个思想实验,如果 WeChat 是你开发的,你会有多少亿用户?
|
6
leihaibo1992 OP @germain 哥,咱能分享下实际体验和真实看法吗,我挺想知道的,顺便混点铜币
|
7
tt83 5h 33m ago 其实大部分的事情都是这样的,你相信它是好的它就是好的,从古至今从从宗教到产品都是这样;做过独立开发会对这件事深有体会,大量好的产品是无人问津的。
|
8
DefoliationM 5h 20m ago via Android 又一个 agent 而且,现在 agent 都发展的挺成熟了,大家都大差不差,vibe 时代更是随便就能给开发一个给自己用的 agent 。
|
9
leihaibo1992 OP @germain 另外,我是觉得社交软件的粘性和工具软件的粘性天壤之别,没啥可比性
|
10
foryou2023 4h 56m ago
会无人理,社区的代表 pi 已经发展的很好了,一些优秀的地方可能会成为 pi 的养分。
|
11
PopRain 4h 54m ago 做个抬杠实验....
|
12
sentinelK 4h 25m ago
同意#7 的思路。
其实社会对于某个“作品、品牌、产品”的看法,只存在两个维度,即正向循环和死亡螺旋。不存在中间态。 只要多数人认为“好”,只要作者不做出太出格的举动,这个市场惯性是非常大的。 反之亦如此,某个品牌、产品舆论上不看好,你想扭转多数人的看法,你就需要一个、甚至多个决定性领先的产品。 这也就是锚定效应。 大众集团做了那么多年的垃圾,依然屹立不倒。甚至整个德国汽车行业都自成了一套价格歧视体系。 不也是在国产多年的跨级别价格、性能碾压时,才口碑崩塌的么。 反过来也是,当初国产车为什么搞价格配置碾压?不就是因为口碑不如德日,逼不得已么。 所以这种假设其实是不成立的。换句话说,如何及时且适当的利用好自己的口碑舆论优势,来推行最适宜的产品,才是最好的方式。 推出产品时,不能只看产品是不是全行业领先。要判断这个产品是不是最契合企业需要的当下的风格、调性、舆论、定位。 |
13
leihaibo1992 OP @sentinelK 确实,一个产品的号召力足够大时,生态能够快速繁荣起来。不过话说回来,openclaw 刚出来时也是如日中天,现在不也一地鸡毛。现在趁热度,捧臭脚的太多了,过一段时间再看看。
|
14
ndxxx 4h 12m ago via Android
社区消融实验揭秘:DeepSeek V4 Pro 严重依赖首轮工具锚定,两阶段插件成功复现高分能力
DeepSeek V4 Pro 正式版发布后,因实际表现不及灰度测试预期而引发社区争议。近日,开源社区通过消融实验探针对其进行了深入分析,揭示了其性能波动的底层机制并给出了解决方案: V4 Pro 对首轮请求中可见的 API 工具目录( Schema Surface )极度敏感。在暴露完整 25 个工具的 Standard 模式下,模型易陷入低效的 “Let me...” 思维链( CoT )轨迹,Project2 评分仅为 9192 分;而在仅提供 Shell 和 Read 的 Minimal 模式下,模型能被激活为灰测时的 “We need...” 推理轨迹,基准分回升至 9699 分。 针对 Minimal 模式缺失高级工具的问题,社区开源了 dsh-anchored-standard 插件。该方案采用“首轮锚定 + 动态晋升”策略——首次请求仅暴露 2 项核心工具以锚定优质推理轨迹,一旦模型发起首次 Tool Call ,立即在后续轮次解锁全部 25 项标准工具。 在 Windows 原生 Project2 测试中,该方案连续跑出 98 、99 的高分,成功进入 Fable 等前沿模型分数带。该实验表明,V4 Pro 的核心能力并未丢失,但可能在强化学习( RL )后训练阶段对特定的 Harness 脚手架与工具暴露环境存在显著过拟合。 参考:microblock_pub 、DeepSeek V4 Pro / Flash 轨迹触发机制实验 、dsh-anchored-standard DSH 其实就是 deepseek 新模型重要的一个训练工具。另外也相当于官方告诉你这个东西就是他家的官方 harness 骨架。个人开发者拿什么背书这些东西呢😅 |
15
leihaibo1992 OP @ndxxx 看这段描述,我只能得出他们的模型拉了这个结论
|
16
iTYC 3h 49m ago
首先 deepseek 我从来没有看好过,但假如抛开这种铺天盖地的 zzzq 宣传,那估计没什么人会用,大众评价也只会更差
|
17
nevin47 3h 44m ago 有空可以去看一下 DSH 伴随发布的 88 页的那篇<A Programming Paradigm for Spatiotemporal Composability>
这是我看过的第一篇这么完备的用形式化证明的方式把想要构建的 Agent 的方法论讲清楚了的论文 如果社区里面出现一个新的 Agent ,也通过严格的形式化方式对设计理论和核心理念进行了剖析和证明,我觉得一样可以很快出圈 |
18
nguoidiqua 3h 0m ago
个人做的不会评价,DeepSeek 做的同样不会评价。没什么好评价,因为作为没有影响力的个体,评价也没什么影响力。
作为个体我只考虑想不想用,目前完全没兴趣,无论它是谁做的都没兴趣。没有看到有什么独特的功能,也没有看到有什么特别优势。开发语言是 TypeScript 估计体积和占用不会小,如果是 C Rust 之类写的,只有十几 M,说不定会有点兴趣。甚至界面也没啥特别,不像 TUI 之类起码看上去比较炫。哪天经过大量应用证实它有不可替代的优势,才会有兴趣。 话说回来,人对事物的看法是流动的。如果是无名开发者开发,但配上孤军奋战式煽情宣传,它可能会增大吸引力。而打着 DeepSeek 旗号,也未必是好的,这取决于旗号本身的受欢迎程度。如果大家对 DeepSeek 本身颇有微词,那自不必说。现在由于 DeepSeek 风头正盛,让它一时吸睛、名声大振,但热度能持续多久也是个问题。有时候来得快,去得也快,如果没有特别的优势,那大部分人只是跟风 Star,并不等于真的关注、使用乃至添砖加瓦,甚至以后就算真有了什么优势,可能那些人也会因为初期不及预期而懒得再试了。 |
19
jujusharp 2h 59m ago
纯个人观点,如果你单纯的就事论事,不要写暗示性的标题,你直接单纯的讨论从技术和架构的角度,dsh 的架构到底怎么样我觉得都不会有让人反感。但你偏偏用打着旗号这种标题,我不知道该怎么客观评价了
|
20
leihaibo1992 OP @nevin47 论文比代码还长
|
21
leihaibo1992 OP @jujusharp 它的架构,它的特性聊的人已经太多了,不差我这一个。
“一切都是 xxx ,太叼啦, agent 执行 trace 真牛逼啊,agent 预设太新颖啦, 100%缓存利用率太震撼啦,速度真快呀,眼睛都看不清了” 我听的耳朵都起茧了 |
22
jujusharp 2h 20m ago
@leihaibo1992 从你贴的引用的内容能感受到你对这些至少是有不认可的地方,那么你可以聊你对技术架构甚至方案的不同看法不是很好么?
|
23
jujusharp 2h 17m ago 如果你从技术,架构上指出它设计哪里有问题,哪里值得借鉴,哪里是底层无法通过优化解决的垃圾。我认为大家还可以客观讨论下,但你讨论的内容是一个不存在的事实,就意味着这里面太多主观推测的内容了,只会带来各种情绪的碰撞
|
24
leihaibo1992 OP @jujusharp 好吧,确实是我考虑不周
|
25
stardust21 51 mins ago
@iTYC 你算老几,你看好有什么用,你不看好 ds 会死么? ds 不是因为便宜才用的人多么,靠宣传就有人长期用不是把大家当傻子,在这里存粹输出情绪没什么意义
|
26
nevin47 42 mins ago
@leihaibo1992 我今天上午整体的看完了第二遍,非常经典,很建议想做 Agent 的同学去读。但是门槛确实很高,形式化证明这套理论还是十年前研一选修课学的东西了,想不到居然现在派上用场
|