crackidz's recent timeline updates
crackidz
ONLINE

crackidz

V2EX member #624177, joined on 2023-04-14 21:14:51 +08:00
crackidz's recent replies
1 day ago
Replied to a topic by fankcoder 程序员 大模型排行榜到底哪个权威?
@OumaeKumiko 这个其实算是比较准的了,虽然实际体感略有出入,但不会很大:比如两个模型只差小几分或者零点几分,可能体感不太能区分出来
1 day ago
Replied to a topic by fankcoder 程序员 大模型排行榜到底哪个权威?
这几个都不准,基本上看看差不多

DeepSWE 相对比准一点点,但是不是全部

大模型的评测现在仍旧是一个复杂的评测过程,我建议你看的时候需要根据不同的能力:比如逻辑推理能力、代码编写能力、写作能力等分开进行对比。这些每一个侧重点都不一样,在不同场景会影响大模型在总体中的排名
Jul 16
Replied to a topic by x177plus 程序员 现在哪个 ai agent 性价比比较高
@neteroster pi 最大的问题是需要自己攒很多东西,不算开箱即用
Jul 12
Replied to a topic by burnsby 程序员 grok-4.5 真的比 gpt-5.6 sol 好用吧
grok 就是当 executor 特别合适的模型
是最喜欢的纯傻 X 无脑相信 AI 的环节
5.5 降智,到 5.6 就不降智啦?
本质上只能趁着不降智的时候使劲蹬
如果你去地震吧,你会发现很多人可以精准预测地震 2333
Jul 7
Replied to a topic by ysz1121 OpenAI 有人用上。gpt-5.6 了吗?
发布了吗?
Jul 7
Replied to a topic by DisastrousNet 程序员 试用 hy3,感觉不错
@o0 很不幸,这可能不是国内模型的问题,只是国内模型表现的更明显一点。实际上 opus 4.7/4.8 新模型出来的时候大家也批量遇到过 Edit 报错问题,哪怕是现在也会偶尔遇到,基本都是模型本身的问题。Armin Ronacher 也写了一个文章专门来说这个问题,比如 A➗ 刻意的只增强自家工具的效果,削弱其他编程 agent 的工具调用效果
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   5484 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 15ms · UTC 07:32 · PVG 15:32 · LAX 00:32 · JFK 03:32
♥ Do have faith in what you're doing.