体感如何?是不是真的很有实力
体感如何?是不是真的很有实力
101
Rust2015 1 day ago
先试一个月,再说
|
102
toexplore 1 day ago
上一个是 qwen
|
104
Genshin2020 1 day ago
尝试了,跑分没输过,干活没赢过,不仅仅是 MiMo v2.6 ,Grok 4.7 也是路边一条
gpt 5.6 路边一条 乱七八糟的模型“保智期”都短的离谱,9 月份真的是黑暗的一个月 还好我能手搓代码 |
105
chaoming 1 day ago
跑分没输过,体验没赢过!
|
107
DOOMS 1 day ago
我在用 MiMo 开放平台,体验小米顶尖模型 MiMo V2.6 等。通过我的邀请码注册:双方各得 ¥10 API 体验金 + 首单 9 折。邀请码:CKV3TT 。注册: https://platform.xiaomimimo.com?ref=CKV3TT (注册后自动填入 · 体验金 40 天有效) 我来填写个羊毛
|
108
evr 1 day ago via Android
搞不出大模型的主板机大厂又急坏了吗
|
109
jeffqiu 1 day ago
高分低能,写代码不行,不如 glm5.2
|
110
ashuai 1 day ago
什么时候小爱同学不制杖了,我就相信雨田君可以了。
|
111
pandaex 1 day ago |
112
magicfield 1 day ago
|
113
zuokanyunqishi 1 day ago
小 mi 现在管大模型的事哪个佬?
|
114
codehz 1 day ago 不太好用,尤其是 flash ,上下文不到 100k 就开始循环工具调用,直接打爆了 opencode 的进程,什么叫 10 秒 2000 个搜索,一直打到输出最大 token 才中断,然后继续又开始循环(另外我发现 opencode 2 在工具调用循环的时候,你实际上没法中断这个会话,esc 键按两下没用,彻底退出进程重启后会话又会继续,然后又卡住,只有手动清理会话才能恢复)
|
115
jwlovetea 1 day ago
试用了下 MiMo Desktop 感觉还可以, 感觉不比 4.1 差..
|
116
JerryZhi 1 day ago
大模型领域遍地 benchmark ,甚至可以说就是面向 benchmark 做优化的,楼里的人是怎么能说出“大模型谁看跑分”这种话的。。。
|
117
Ashe007 1 day ago
@JerryZhi 你这个是事实,特别是国内的 ai model 完全针对 benchmark 做特调,黄仁勋就在采访中说过这个问题,拿一个没有公开过的评测集做测试,中国的 ai model 得分就会偏低了。今年听了好多次赢了的新闻,deepseek 又超越了,glm 又第一了,跑分这一块有点像以前手机的安兔兔,电脑的鲁大师,图一乐
|
118
flynaj 1 day ago via Android
为了合规,在聪明,也阉割成残废。
|
119
wm5d8b 21h 56m ago via Android
写代码路边一条,鹈鹕画不好,别的没测不好评价
|
120
sevenzhou1218 21h 12m ago
遥遥领先
|
122
xiaofeixiang 20h 21m ago
用过 opencode 的 2.6 flash ,体感离 ds4.1 有不小的差距,中间有一段循环 read file ,给我电脑都快整卡死了
|
123
cj941030 20h 14m ago
小米的优势项是硬件参数性价比。软件和算法方面。。。emm ,跑分还是很强的
|
124
jackf199 18h 37m ago
用了 opencode 上免费的 2.6flash 只能说很拉,非常容易死循环,还喜欢大量读文件,代码解读都解读不明白
|
125
jo32 14h 20m ago 补一个 Flash 的浏览器任务实测。先说明,我用的是 DeepDeck ,这次用的是小米官方 API ,没测 Pro ,也没测 Coding Plan 。
从 49 题里取同一组 43 道可比题,开启 WebMCP ,按实际 token 用量、包含缓存折扣估算,统一美元: MiMo V2.6 Flash:$0.187 ,37 分钟 GPT-5.6 Luna:$0.314 ,23 分钟 DeepSeek V4.1 Flash:$0.249 ,20 分钟(按当时低谷价) 关闭 WebMCP 时,三者分别用了 43 、35 、27 分钟。开启后,执行轮次分别少了 6%、22%、14%。 我比较在意工具使用这一块:MiMo 调 WebMCP 121 次,比 Luna 的 80 次还多,但没省下那么多步骤。所以这轮看下来是成本够低,速度慢一些,工具用得还不够高效。调用多不等于利用得好。 这些是中低难度浏览器任务,用来观察体验,不能直接当编程能力排名。每题每个开关条件只跑一次,接口、运行版本也有差异,先供大家参考。 逐题结果和费用计算都在这里: https://deepdeck.getmegaportal.com/zh/benchmarks#results |