大家好,我们最近在考虑做一个面向 AI 中转站的模型对比和评测网站。
现在市面上的中转站越来越多,各家的线路、价格、倍率和使用规则也不太一样。很多信息只看宣传页面很难判断,往往要实际充值、连续使用一段时间后,才能知道高峰期稳不稳定、响应速度怎么样、扣费是否清楚。
所以我们想尝试做一个相对公开、持续更新的评测网站,让大家在选择和充值之前,能先看到一些真实的测试数据,也能对比不同模型在真实使用场景下的输出效果。
目前初步想到的评测方向包括:
稳定性:请求成功率、超时率、429/5xx 错误率、高峰期表现
响应速度:首 Token 延迟、完整响应时间、输出速度
价格与扣费:公开价格、实际扣费、Token 统计是否一致
功能表现:上下文长度、缓存、流式输出、工具调用、多模态等
能力一致性:同一模型在不同时段的表现是否存在明显波动,以及是否存在掺水情况
兼容性:Claude Code 、Codex 、Cherry Studio 、CC Switch 等工具的接入体验
服务体验:文档完整度、故障公告、客服响应和退款规则
用户反馈:真实使用评价、常见问题和踩坑记录
不过这些暂时都只是我们的初步想法。与其闭门造车,我们更想先听听真正使用中转站的朋友们怎么说:
选择中转站时,你最看重哪三项指标?
有哪些数据是你希望评测网站长期自动监测的?
你曾经踩过哪些坑,希望评测网站能提前发现?
你更想看综合排名,还是稳定性、速度、价格等分类排行?
第一批希望评测哪些站点、模型或线路?
除了评测之外,你还希望网站提供什么功能?
可以直接自由回复,也可以参考下面的格式:
最关注的指标:
踩过的坑:
其他建议:
另外,这个网站如果由 TrueSOTA 发起,大家可能会担心“既当选手又当裁判”,这个问题我们也提前考虑到了。
如果项目落地,TrueSOTA 自己也会放进同一套规则里接受测试。我们希望尽量采用自动化监测,公开测试方法、测试时间和原始数据,避免由我们主观打分;被测站点如需对异常数据进行说明,相关记录也会公开保留。
这次主要想向大家收集需求:你最关心什么、踩过什么坑,都欢迎直接说。我们会整理评论区的高频建议,作为第一版评测方案的参考。