• 请不要在回答技术问题时复制粘贴 AI 生成的内容
rizon
V2EX  ›  程序员

这里为什么感觉没人讨论国产模型。我发现 qwen 和豆包系列模型问题好多,生产直接没法用

  •  
  •   rizon ·
    othorizon · 9h 35m ago · 2619 views
    对话类产品。
    生产环境过去一直在用豆包,但是豆包 ttft 越来越大已经没法用了,所以想换 qwen 。
    而且豆包还有概率出现脱靶问题和工具调用幻觉问题

    结果 qwen3.7 plus 输出总是半截就中断,概率非常大没法用。
    换成 3.8 max ,先是专属 endpoint 输出内容缺少 role ,这事我就排查了很久。
    然后换成 dashscope 域继续用想着没事了,结果发现模型带图时输出质量严重下滑,区分不出注释内容和对话内容的角色概念。

    搞得我现在一个没得用。做角色扮演对话还有什么好的选择吗
    Supplement 1  ·  5h 48m ago
    最新进展。刚才实测终于排查出来。
    qwen3.7 plus 在有 tools 的情况下存在输出被截断的 bug 。
    Supplement 2  ·  5h 47m ago
    看回复大家都是 AIcoding 的场景,不是 AI 产品的开发。所以确实不在乎这些。但是做国内 AI 产品只能选这些国产模型。
    感觉 AI 时代即使大厂出品的品控也在下滑
    46 replies    2026-09-09 21:01:49 +08:00
    rizon
        1
    rizon  
    OP
       9h 31m ago
    好吧,这会排查到原因了 。
    thinking:{type:disabled} 关闭思维链会导致思维链进入正文。
    hhsd
        2
    hhsd  
       8h 15m ago
    能上 v2 的 谁手上还没有个 gpt 了 再不济也有中转 图豆包会流口水么
    catinsides
        3
    catinsides  
       8h 11m ago   ❤️ 3
    部分国产模型向来是跑分没输过,体验没赢过,一用一个不吱声。以前好歹便宜量大,现在定价比国外的还贵,几个问题就用完 5 小时额度,让我再买是不可能了。
    lmmlwen
        4
    lmmlwen  
       8h 1m ago   ❤️ 2
    羊粪蛋子表面光,比如城市下水道,比如甲醛大白菜,比如 ChinaGT 也与老大爷救援人员
    7gugu
        5
    7gugu  
       7h 54m ago
    国产模型推荐 GLM 5.3 ,比肩 5.6 terra ,ttft 也更快
    yyttrr
        6
    yyttrr  
       7h 50m ago
    一直用 deepseek,平时 flash,负责紧急问题开一下 pro,也够用了,而且响应速度很快.最大的方便是每个月报销的时候直接能开发票,财务报销流程效率很多,其他同事用 claude 或者 gpt 的没发票流程复杂一些
    justxwy
        7
    justxwy  
       6h 24m ago
    qwen 3.8 max 我和我同事都非常好评啊,写代码很厉害。
    kimhooo
        8
    kimhooo  
       6h 20m ago
    “生产直接没法用”——谜底就在谜面上
    ebushicao
        9
    ebushicao  
       6h 14m ago
    国产模型只需要看 glm 、kimi 、deepseek ,图像和视频方面倒是可以看豆包。
    FreshOldMan
        10
    FreshOldMan  
       6h 13m ago
    能用最好的,肯定不用排第二的啊
    wat4me
        11
    wat4me  
       5h 59m ago
    国产只看 glm kimi DeepSeek ,qwen 的优势是小模型厉害,可以在特定领域微调
    mechunjun
        12
    mechunjun  
       5h 58m ago
    因为不在意,因为不在乎
    mechunjun
        13
    mechunjun  
       5h 57m ago
    来自 claude max 20x 和 chatgpt pro 20x 双持用户
    wang9571
        14
    wang9571  
       5h 55m ago
    喜欢什么用什么呗,有什么好讨论的
    jacketma
        15
    jacketma  
       5h 54m ago
    一言难尽吧,算力和算法都有差距,主要还是有参照物,如果没有海外模型的能力对比,国模也挺好的
    rizon
        16
    rizon  
    OP
       5h 49m ago
    @justxwy 常规使用没问题,但是在一些细节上 bug 挺多。也不知道为什么,是上线前测试 case 没覆盖吗。感觉 AI 时代各种大厂产品的可靠性都在下降。

    比如已经和 售后确认过的 qwen3.8max 的 maas endpoint 确实有某些情况下输出缺失 role 字段的 bug 。
    maocat
        17
    maocat  
       5h 40m ago
    使用的问题,openai 这些模型是不吐思考内容的,所以用他们的框架没问题,模型在进步,框架也在变,虽然明着说支持 openai sdk 格式,qwen ,ds 或多或少都有些问题,比如 ds 要求执行 tool 带上思考内容,或者每次执行都会先吐一段思考内容,再执行工具,这些 case
    latifrons
        18
    latifrons  
       5h 30m ago
    因为没法用,所以没人讨论
    rizon
        19
    rizon  
    OP
       5h 22m ago
    @maocat 是这样的,国内想找一个真的能用的模型其实选择范围非常小。看着百花齐放,但是线上产品想要换个模型的时候真能换的基本没有。

    而且因为参数兼容和模型内部的一些各自特性换模型时还很容易出事故。

    为此我专门做了一模型 api 兼容性测试网站: https://llmapicheck.dev/
    maocat
        20
    maocat  
       4h 59m ago
    @rizon #19 你这个工具。。。我得打击你一下,有很多服务商不允许跨域调用的
    dryadent
        21
    dryadent  
       4h 58m ago
    因为我没在生产环境用啊,gpt 6 都一堆问题,更何况这些蒸馏的
    crackself
        22
    crackself  
       4h 56m ago via Android
    v 友要生产力的,逗乐子看郭德纲于谦比国模更具性价比
    rizon
        23
    rizon  
    OP
       4h 51m ago   ❤️ 1
    @maocat 哈,是有这个问题,所以按说还得加自定义代理功能。另外我后面打算支持在服务器终端上跑,这样延迟测试也更准一些
    rizon
        24
    rizon  
    OP
       4h 49m ago
    @dryadent
    @crackself 哎,没得选啊,实时对话产品延迟敏感, 还有成本问题。如果有好的低延迟、低成本的 gpt 模型选择就好了。
    pmer
        25
    pmer  
       4h 46m ago
    要区分下具体模型,至少 seedance2.0/2.5 能打的,它是属于豆包系列模型(对外品牌名称)
    ReinXD
        26
    ReinXD  
       4h 45m ago
    @rizon 那也应该选 deepseek 不是 qwen ,qwen infra 水平真得不敢恭维
    ovtfkw
        27
    ovtfkw  
       4h 44m ago via iPhone
    k3 呢 直接不是说吊打 opus 吗 现在如何了
    f1ynnv2
        28
    f1ynnv2  
       4h 29m ago
    豆包只在用语音识别
    alsas
        29
    alsas  
       4h 24m ago
    因为默认不能用
    lovelive1024
        30
    lovelive1024  
       4h 23m ago
    如果是角色扮演用 ds 啊,那些玩酒馆的人很多都是用 ds
    qaq13037
        31
    qaq13037  
       4h 4m ago
    评论区怎么那么多崇洋媚外的,2026 年 9 月了,还搁这国模不可用呢? glm 、kimi 、deepseek 最新模型哪个不比你们当年吹的 opus4.6 强一个档?当年吹的像神一样的东西,放到国产上就成屎了对吗?
    wy315700
        32
    wy315700  
       4h 0m ago
    国产模型这么多,你好歹用几个能打的啊,用 qwen 和豆包干活是几个意思
    suxiaozi
        33
    suxiaozi  
       3h 38m ago
    我也是做 AI 产品的,这些模型已经让我泣不成声!😮‍💨
    tianjiyao
        34
    tianjiyao  
       3h 21m ago
    我用 DeepSeek 的 API 感觉还是挺稳定的,qwen 的用过质量一般般。豆包的就是搞笑的。。。上不了台面
    NQ
        35
    NQ  
       2h 47m ago
    用国模不如直接把钱丢水里,后者最多是短痛😁
    rizon
        36
    rizon  
    OP
       2h 14m ago
    @ReinXD
    @lovelive1024
    ds 是纯文本模型,不是多模态的。这就导致图像类的请求我得路由到其他模型或者图片转文字(损失细节)。所以只能说没什么更好的选择的话只能考虑 ds 了。
    rizon
        37
    rizon  
    OP
       2h 13m ago
    @wy315700 可以给推荐一下。ttft 足够低,最好是支持视觉理解的。
    rizon
        38
    rizon  
    OP
       2h 12m ago
    @suxiaozi
    @tianjiyao
    看到大家都是这个共识我就放心了,我一直以为是自己工程上做的还是不够好。不然怎么一直没看到人说国产不好,我一度怀疑是自己的问题
    sommio
        39
    sommio  
       2h 0m ago
    @rizon deepseek-v4.1-flash-expires-on-0910 和 deepseek-v4-flash-vision-exp 都支持多模态,明天 v4.1-flash 就要发正式版 + 降价了, 而且 ttft 都在 1s 以内;
    sommio
        40
    sommio  
       1h 56m ago
    role-play 要做好点还是得靠自托管微调模型吧?
    常规模型感觉最好还是 DeepSeek 了
    rizon
        41
    rizon  
    OP
       1h 34m ago
    @sommio 我看看 4.1 这个。 确实微调最好。但是 GPU 成本感觉有些高,一个 27b 以上模型满足并发和 ttft 需求的话 gpu 成本也不低
    lovelive1024
        42
    lovelive1024  
       1h 31m ago
    @rizon #36 ds 有多模态模型啊,而且明天出 4.1 也支持多模态
    garinluo
        43
    garinluo  
       1h 30m ago
    正常,看模型的投入就知道了。
    rizon
        44
    rizon  
    OP
       1h 13m ago
    @sommio 谢谢推荐 ds ,没想到都出了 vision 版了。明天做一下线上 case 回归看看。

    视觉版本的结构化输出支持上不完善。不过倒不是很大的问题。
    rizon
        45
    rizon  
    OP
       1h 12m ago
    @lovelive1024 嗯嗯,谢谢,看到了。明天试试。不知道它的视觉版内部怎么实现的,结构化输出支持的不太完善,倒不是太大问题。
    yungo8
        46
    yungo8  
       1h 6m ago via Android
    3.8max 还行,其它就差点意思,主要问题是高峰期时额度烧的太快了
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   3158 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 102ms · UTC 14:08 · PVG 22:08 · LAX 07:08 · JFK 10:08
    ♥ Do have faith in what you're doing.