比如 codex ,一个 5.6 就好几个版本,推理强度还搞好几个梯度。 Claude 的话模型少一点,一般就 opus 系列开 medium ,不知道是否有更精细化的用法。 大家都是怎么分配这些模型和任务呢,最常用哪种。
比如 codex ,一个 5.6 就好几个版本,推理强度还搞好几个梯度。 Claude 的话模型少一点,一般就 opus 系列开 medium ,不知道是否有更精细化的用法。 大家都是怎么分配这些模型和任务呢,最常用哪种。
1
passive 18h 58m ago via Android
本地 deepseek v4 flash 默认 thinking 一把嗦。Depseek 搞不定的,换个模型或者加强 thinking 也只是赌概率,还不如手工介入或者引导 agent plan 出正确的计划更有效率。
|
2
zemin 17h 36m ago
|
3
canyue7897 17h 30m ago
如果对成本不是很敏感的话,就选最贵的那个最高档次的模型。如果说对成本特别敏感的话,那就只能选择大家认为合适的。但是大家认为合适的可能不太适合你的工作流,这个需要自己一个一个测试。
|
4
maolon 17h 18m ago
这个没有定论的,都是看你的任务来决定,
方法论基本就是:时间,成本,质量这三个条件来权衡, 时间是平均完成一个任务所需的时间而不是 tps , 成本也是平均完成一个任务所需的成本,比如你的 plan 的 quota 消耗或者直接就是 api 的价格, 质量就是能不能满足你对项目的需求。 一般对于普通编程任务来说,推理强度是有一个上限的,旗舰模型( sol,opus,fable )最高的那一档思考强度一般是给科研用的,如果编程使用就会出现很明显的慢,过度思考,以及比次一档贵一倍的价格。但是次旗舰模型以及国产最好的模型一般都可以使用最高一档强度。 最后你可以参考 deepswe,或者 aa 的帕累托前沿来选择模型和强度,我一般参考 deepswe 多一些 |
5
kamisamayo OP @maolon 感谢详细解答
|
6
maemolee 16h 50m ago
VibeCoding 一直选最贵的,实际业务要调用 LLM 的话,不追求最佳效果,只追求及格线+成本尽量低。
比如说我,Vibe 的时候目前默认 GPT5.6-Sol-极高,但是我的实际业务要用图像识别,是 doubao-seed-2.0-mini/lite ,我的音频视频识别业务用的是 mimo-v2.5😂 |
7
xqk111 16h 9m ago
平常开发使用的是 cursor ,一般都是用的 composer 2.5 fast 。最近一段时间用了 grok 的 4.5 、4.6 ,能力强了,但是感觉速度也慢了。日常工作,composer 2.5 已经能满足我的开发了,除非是疑难问题,我才会让 gpt 5.6 sol 去排查
|
8
xqk111 16h 8m ago
还有就是 composer 量大管饱,luna 也是量大管饱,日常开发更爱用这种模型。
|
9
coldmonkeybit 15h 54m ago
一直用 cursor 选 Auto balance ,不关心用的啥
|
10
prosgtsr 10h 7m ago
都选你习惯用的比较高的就行,比如我就是 sol high
我问 ai 了,如果一个会话切换模型,缓存会失效的,所以假如你一开始用 luna ,然后发现 luna 搞不定,换成 sol ,这个时候 sol 重新读取一遍是没有缓存的,走的不是 cache input 的价格,就很贵。所以折腾半天不如直接用 sol ,实在不够就加钱。 |