1
happy99 1 day ago
噱头比较多一点吧! 暂时观望
|
2
andrew2558 1 day ago
google 吹牛是第一
|
3
maolon 1 day ago
那 muse spark 1.3 还 75 分 deepswe 脚踢 3.8 flash 呢,
deepswe 现在不推出新版本测试就是下一个 livebench 了,很快就无人在意,已经被这些新模型玩坏了 |
4
Tumblr 1 day ago
Gemini 这玩意儿差点把我心态搞崩!
我问它我的法师在游戏里的木桩输出是什么水平,它告诉我单目标 116k 是 very low ,5 目标 350k 是 quite low ,给出的平均数据是单目标 320-350k ,5 目标是 950-1100k~ PS 魔兽世界里的日怒奥法师 |
5
evilHa 1 day ago
gemini 算了,事实错误太多了,用 google.com 直接问能更准点,搜索的资料多,能弥补事实错误。
|
6
bush911 1 day ago
不懂这些评测
|
7
miniliuke 1 day ago AI 跑分已经被玩坏了,含金量堪比安兔兔
|
8
f10w 1 day ago
早上起来打开 agy ,看到 Gemini 3.8 flash 了
|
10
zsxzy 1 day ago
用来做 Android app 开发挺好用的, 知识是最新的
|
11
keenkiller 1 day ago
刷分刷的
|
12
docx 1 day ago via iPhone
过不了一周又要拉了
|
13
ryougifujino 1 day ago
DeepSWE 越来越像个笑话了,从 Opus5 全方面碾压 Fable5 就能看出来
|
14
Felldeadbird 1 day ago
诚然 gemini 很强,但是 3.5 后 额度消耗那么快,同比其他家,你再强额度太快也遭不住啊。
|
15
dingwen07 1 day ago
@zsxzy Android App 开发,只要装了 Android CLI 的 Skill ,AI 就能够直接自主查询 Android Developer 文档
|
16
gpt5 1 day ago
手机有跑分模式,模型也有跑分模式。
算力给够了都贼拉猛。 |
17
zuosiruan 1 day ago
@Felldeadbird 啊?你是真心觉得很强的吗?
|
18
kindjeff 1 day ago
|
19
Felldeadbird 1 day ago
@zuosiruan 要看哪方面啊。UI 设计我觉得 gemini 是这么多家最好看的。出图一致性比 openai 好。 其他方面就见仁见智。但是额度消耗太高了,没几个羊毛号用不起。
|
20
wowo243 1 day ago
为什么知乎上都是说刷分的
|
21
mogutouer 1 day ago
这个榜单 fable 比 opus 分数还低,是怎么回事,这个成绩还可用吗,实际体感上 fable 比 opus 出品好多了
|
22
we1w3i 1 day ago
就算他模型很强,实际使用算力也不会给那么足给你
|
23
Maboroshii 1 day ago
这个榜单应该是写代码的榜吧
|