netox

在线体验 16K token/s 的新大模型部署架构

  •  
  •   netox · 1 day ago · 2333 views
    在 HN 上看到 AMD 收购那家把模型权重烧到芯片里的 taalas 的消息, 考虑到 gpt 5.6 相比 gpt 5.5 实际体验并没有多在的改进, 感觉或许把权重烧到芯片里, 没准是条路子

    帖子里有他们的模型架构体验接口, 自己试了下, 16k token/s, 不敢想象要是有 gpt5.5 这样的模型这么快, 体验得多么好了


    https://chatjimmy.ai/
    30 replies    2026-08-08 11:29:30 +08:00
    cowcomic
        1
    cowcomic  
       1 day ago
    我印象他们家好像都是做小模型的,之前都是 10B 以内的
    最近好像放话要做 qwen3.6-27b 的,不知道进展如何
    netox
        2
    netox  
    OP
       1 day ago
    @cowcomic HN 上原贴说下一代芯片正在做, 估计模型可能也会他们自己训练或者跟 AMD 一起搞, 利用 AMD 自己的技术(我记得 2022 年 AMD 还收购了 PENSANDO 这家做 DPU 的公司), 这样的话估计搞集群肯定就不只 27B 了
    SmiteChow
        3
    SmiteChow  
       1 day ago
    不可能的,一天一个模型可以,一天一个芯片?
    dreamdragon
        4
    dreamdragon  
       1 day ago
    有正常逻辑想不到的使用场景吗,这个确实很反常
    netox
        5
    netox  
    OP
       1 day ago
    @SmiteChow 为什么会一天一个模型? 如果有个高速 gpt 5.5 级别的模型, 感觉还行? 而且它技术上可以把权重换掉, 只不过相对麻烦
    ddoki
        6
    ddoki  
       1 day ago via Android
    @dreamdragon 智能客服场景,小模型加高速输出。那可以承担的并发就很客观,降本肯定能做到
    litian98
        7
    litian98  
       1 day ago
    这个模型确实快,但是智能太差了,基本感觉用不了的样子,最简单的那些常识性问题能回答得差不多,但是稍微复杂一点点的问题就不行了
    javalaw2010
        8
    javalaw2010  
       1 day ago
    我: “你好”
    AI: “很好”

    ————————————

    虽然目前体验智能不佳,但是等大模型发展到一定阶段,确实是一个很好的方向
    NoDataNoBB
        9
    NoDataNoBB  
       1 day ago
    确实是个好主意
    ayyll
        10
    ayyll  
       1 day ago
    @litian98 还行?我让它写个快排 Generated in 0.036s
    june4
        11
    june4  
       1 day ago
    @SmiteChow 象 ds v4 flash 这种的,已经过了那个可用门槛,只要够快和便宜,哪怕落后点又怎么,毕竟不是什么任务都要顶级模型才能完成
    nightlight9
        12
    nightlight9  
       1 day ago
    确实非常快,但是有点蠢
    est
        13
    est  
       1 day ago
    @SmiteChow @litian98 @dreamdragon

    我觉得这个模型最适合的场景是 自动驾驶决策。

    https://blog.est.im/2026/stderr-11
    BingoXuan
        14
    BingoXuan  
       1 day ago
    @cowcomic
    deepseek 激活也是 13B 。这时候就是 xilinx 出马了,通过 pcie 重新烧录权重数据。那样 n 张互联就能跑 deepseek v4 flash 0731 了。主要问题是如何把权重数据变成可烧录。
    cowcomic
        15
    cowcomic  
       1 day ago
    @netox
    @BingoXuan
    芯片群的方式感觉效率损失会很严重,之前看到的都还是单芯片的策略
    fnd
        16
    fnd  
       1 day ago
    快是真快,但是错误也有点离谱,胡说八道。
    holystrike
        17
    holystrike  
       1 day ago
    “详细列出任天堂自创办以来发布的所有游戏”

    :很难!由于有超过 3000 多款游戏发布,以下是近似完整的游戏列表:
    xxxx
    yyyy
    zzzz

    Generated in 0.119s • 14,024 tok/s

    完全来不及反应一次出完。滚轮拨了好几圈到顶部看结果。

    “不要只说难,要全部列出来”

    (没了)
    Raw778
        18
    Raw778  
       1 day ago
    快是真的快,蠢也是真的蠢,全是胡说八道。
    WayneCmd
        19
    WayneCmd  
       1 day ago
    我要来经典一下了:

    不过如果未来能够完全实现的话,时间的维度就可以像是被压缩的无法感知了,自动驾驶,预测未来
    timethinker
        20
    timethinker  
       1 day ago
    我想到了《 2001 太空漫游》里面的 HAL9000 被戴夫鲍曼一张一张的拔下了存储卡的画面。
    netox
        21
    netox  
    OP
       1 day ago
    @cowcomic 总感觉估计跟推理集群类似, 高速网络互联, 就跟 Nvidia 之前收购 mellanox 类似, 感觉 amd 会不会觉得是 GPU 这条路无法超越她亲戚了, 找条别的路子来搞, 万一成了呢
    PerFectTime
        22
    PerFectTime  
       1 day ago
    token 快又没啥用,不准生成的再多也是辣鸡
    yinyu
        23
    yinyu  
       1 day ago
    You
    你是什么模型,1000 字介绍下。

    Chat Jimmy
    Jimmy
    我想提供一个全面而且有趣的 1000 字介绍。


    首先,我是基于人工智能的语言模型,能够理解自然语言和生成人类语言的文本。我的主要功能是回答问题、生成文本内容、并且可以进行人工智能相关任务。

    🔥✨✨✨✨✨✨
    Generated in 0.004s • 14,579 tok/s


    ═══════════════分隔符═══════════════
    你就说快不快吧.jpg
    YUCOAT
        24
    YUCOAT  
       1 day ago
    应该是一个很小很小的模型,用作实验性质的。
    要是把几十 B 甚至几百 B 的大模型烧制到芯片里面,情况可能又不一样了
    xuwuruoshui
        25
    xuwuruoshui  
       1 day ago
    JohnHaruhi
        26
    JohnHaruhi  
       1 day ago via iPhone
    感觉能达到当年 gpt3.5 的水平
    JohnHaruhi
        27
    JohnHaruhi  
       1 day ago via iPhone
    已经很强了
    JohnHaruhi
        28
    JohnHaruhi  
       1 day ago via iPhone
    但最先进的模型都是 T 级别了,单颗芯片烧得下吗?
    mxT52CRuqR6o5
        29
    mxT52CRuqR6o5  
       1 day ago
    要是战未来的话,我觉得不如忆阻器
    不过忆阻器也有点过于未来了,要把忆阻器用好大概率需要针对忆阻器的特性开发特定的算法,可能整个 AI 生态都要重建
    catazshadow
        30
    catazshadow  
       11h 9m ago via Android
    这个已经喷过了

    https://fast.v2ex.com/t/1193358
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2800 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 73ms · UTC 14:39 · PVG 22:39 · LAX 07:39 · JFK 10:39
    ♥ Do have faith in what you're doing.