• 请不要在回答技术问题时复制粘贴 AI 生成的内容
yohjisakamoto
V2EX  ›  程序员

有人有感觉 gpt5.6 sol 的 token 消耗特别大吗?可以看下这个帖子能在长任务中节省 60%-80%

  •  
  •   yohjisakamoto · 13h 16m ago · 579 views
    其实主要问题在 gpt5.6 比 5.5 更喜欢阅读整个文件导致上下文膨胀严重。而且高 reasoning 又忒喜欢反复思考原地踏步。其实主要问题都是 codex 本身的问题。我自己弄了个 harness 。
    这个想法其实非常简单。假设 Codex 需要修改文件并运行测试,通常需要经历以下流程:
    第 1 轮——应用补丁(修改 package 文件)
    第 2 轮——应用补丁(修复 Bug )
    第 3 轮——应用补丁(修改测试脚本)
    第 4 轮——执行构建
    第 5 轮——运行测试和代码检查
    第 6 轮——如果使用 Playwright ,Codex 还需要额外一轮读取截图等媒体文件
    我们的思路是使用宏命令,将整个流程放入一个 RAG 中,从而在单轮内完成。例如:
    步骤 1:检查运行环境
    步骤 2:应用补丁(修改 package 文件)
    步骤 2:应用补丁(修复 Bug )
    步骤 2:应用补丁(修改测试脚本)
    步骤 3:执行构建
    步骤 4:运行测试和代码检查
    步骤 5:读取媒体文件
    我使用 Codex 和 GPT-5.6-Sol High 对这种方式进行了测试。结果显示,它可以减少约 40%–80% 的大模型交互轮次,同时节省接近相同比例的 Token 。
    具体实现和测试基准可以在项目的 Markdown 文档中找到。我使用 DeepSWE 任务和完整代码仓库重写任务进行了测试:repo: https://github.com/Tura-AI/tura
    benchmark 文档: https://turaai.net/docs#benchmark-current-test-set-record
    No Comments Yet
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   986 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 25ms · UTC 22:09 · PVG 06:09 · LAX 15:09 · JFK 18:09
    ♥ Do have faith in what you're doing.