山东 「切换城市」

请选择您所在的城市:

    热门
    城市

    12GB显存也能跑125B大模型 Qwen3.8搭配Strata单张RTX 5070达94词元每秒

    来源:网络

       阅读:2250

       发布时间:2026-10-07 09:11:47

    [摘要] 科技媒体 gigazine 今天(10 月 6 日)报道,报道称开发者 Niko1221 开源推出 Strata 引擎, 可以在 12GB 及以上显存的消费级显卡上,运行量化的 Qwen3.8-Flash-Next 模型(1250 亿参数)。IT之家注: Qwen3.8-Flash-Next 模型是阿里巴巴 Qwen 团队于 2026 年 8 月推出的多模态混合专家(MoE)模型的压缩版本 ,配

    科技媒体gigazine于10月6日发布报道称,开发者Niko1221已开源推出Strata引擎。该引擎能够在显存为12GB及以上的消费级显卡上运行量化版Qwen3.8-Flash-Next模型,该模型参数规模达1250亿。

    据IT之家了解,Qwen3.8-Flash-Next是阿里巴巴Qwen团队在2026年8月推出的多模态混合专家(MoE)模型的压缩版本,拥有125B参数,并额外包含51B参数的n-gram嵌入表,原生支持262K token的上下文长度。

    为减少显存占用,Strata主要运用了两项核心技术:第一,将MoE模型整体加载至RAM中,仅把频繁调用的专家模型载入VRAM;第二,借助轻量模型执行投机解码,通过预测下一个Token来加快推理速度。

    在硬件需求上,运行Qwen3.8-Flash-Next的最低配置为:12GB以上显存的NVIDIA或AMD显卡、32GB以上内存、80GB以上存储空间(建议使用SSD),以及Windows 10/11或Linux操作系统。

    性能表现方面,在NVIDIA GeForce RTX 5070(12GB显存)、Ryzen 5 7600、64GB内存的配置下,2比特量化版Q2_0的推理速度达到94词元/秒,3比特量化版IQ3_S则为53词元/秒。在AMD Radeon RX 9070 XT(16GB显存)环境下,Q2_0版本达到60词元/秒。

    英伟达主机性能表现:

    硬件配置:NVIDIA RTX 5070(12 GB显存),AMD Ryzen 5 7600,64 GB系统内存。

    AMD主机性能表现:

    硬件配置:AMD RX 9070 XT(16 GB显存),AMD Ryzen 9 3900X,47 GB内存。

    文中“写答案”指的是生成回复(输出)的速度,“阅读提示”则对应处理输入prompt(上下文)的速度。

    参考

    点此前往GitHub体验Strata

    关键词: 显存 也能 大模型 Qwen3.8 搭配 Strata 单张 词元

    论坛热帖

    温馨提示:本文内容转载自各网络平台,仅作正能量信息传播、公益宣传使用。转载不代表本站观点,内容版权归原发布方所有。若涉及版权、内容异议,请联系我方及时处理,QQ:303378055

    精彩评论文明上网理性发言,请遵守评论服务协议

    共0条评论
    加载更多

    在线投稿

      入驻商铺