如图 
1
mk3s 17h 8m ago
agi 有那么容易就实现?就前夕了? 2030 能 agi 能出来不?
|
2
tianhehechu 16h 53m ago
确实前夕,缺少一样东西,我不说。
|
3
maolon 15h 32m ago
99.9 是 oai 用专门针对 arc agi 的 harness 做到的,arc agi 自己得分是 62%(虽然也很高)
|
4
sillydaddy 14h 50m ago
@maolon 这么说不太公允:
62%是每次 API 调用,只允许大模型记笔记,下一轮喂给它的只有题目和之前记的笔记。 99%是允许多轮之间保留模型内部的推理 token 。我们平时用的 Agent 都是这种模式。还有包括上下文会自动压缩,也是允许的。 换句话说,99%完全就是我们平时使用 Agent 的模式。 而 62%是失忆症的模式,有点像电影《记住》( Remember ,2015 ),每次睡醒都会忘记之前的事,只有纸条上的谜题和记下的线索。 |
5
maolon 14h 12m ago
@sillydaddy #4 我是这么看,你可以觉得 arc agi 的 bench 方式不合理,但是分数对比应该是 apples to apples 的,因为其他分数没有用这个 harness 尤其是 opus 。
另外之前也有其他 harness 取得 99 的成绩,这个 bench 本来 harness 的影响就非常大 |
6
sillydaddy 14h 7m ago
@maolon GPT Sol 好像之前的分数 8%左右也是用的 ARC-AGI 的官方 harness ,而这次的 Astra 是 62%。Opus 的分数 30%好像也是吧。
不过不管了,看到 X 上有玩过 ARC-AGI-3 的人说“真的感受到 AGI 来临了”,我准备再去玩一下 ARC-AGI-3 的题目了,上次就玩了第 1 个,好像是越到后面,题目越难: /t/1189306 |