12GB显存也能跑125B大模型 Qwen3.8搭配Strata单张RTX 5070达94词元每秒
|
科技媒体gigazine于10月6日发布报道称,开发者Niko1221已开源推出Strata引擎。该引擎能够在显存为12GB及以上的消费级显卡上运行量化版Qwen3.8-Flash-Next模型,该模型参数规模达1250亿。 据IT之家了解,Qwen3.8-Flash-Next是阿里巴巴Qwen团队在2026年8月推出的多模态混合专家(MoE)模型的压缩版本,拥有125B参数,并额外包含51B参数的n-gram嵌入表,原生支持262K token的上下文长度。 为减少显存占用,Strata主要运用了两项核心技术:第一,将MoE模型整体加载至RAM中,仅把频繁调用的专家模型载入VRAM;第二,借助轻量模型执行投机解码,通过预测下一个Token来加快推理速度。 在硬件需求上,运行Qwen3.8-Flash-Next的最低配置为:12GB以上显存的NVIDIA或AMD显卡、32GB以上内存、80GB以上存储空间(建议使用SSD),以及Windows 10/11或Linux操作系统。 性能表现方面,在NVIDIA GeForce RTX 5070(12GB显存)、Ryzen 5 7600、64GB内存的配置下,2比特量化版Q2_0的推理速度达到94词元/秒,3比特量化版IQ3_S则为53词元/秒。在AMD Radeon RX 9070 XT(16GB显存)环境下,Q2_0版本达到60词元/秒。 英伟达主机性能表现: 硬件配置:NVIDIA RTX 5070(12 GB显存),AMD Ryzen 5 7600,64 GB系统内存。 AMD主机性能表现: 硬件配置:AMD RX 9070 XT(16 GB显存),AMD Ryzen 9 3900X,47 GB内存。 文中“写答案”指的是生成回复(输出)的速度,“阅读提示”则对应处理输入prompt(上下文)的速度。 参考 点此前往GitHub体验Strata |
论坛热帖
在线投稿
-
相关阅读
-
莫氏鸡煲为养好鸡暂缓开店,品质优先获食客支持
-
金正恩致电普京祝贺生日 强调始终坚定支持俄罗斯
-
物理诺奖得主用南极冰造望远镜 开启中微子天文学新时代
-
古代未婚妻被贬为妾犯法吗?明朝强奸未婚妻直接绞死,清朝却只赔钱
-
古代对女子的35种称呼,你知道几种?
-
缅北电诈主犯落网后反问民警杀人要什么感受 视生命如无物
-
宝藏小城藏不住了 独特魅力吸引众多游客关注
-
韩国拟调整运动员艺人免兵役政策 相关言论引发争议
-
入驻商铺
-
精彩图片
-
医生提醒:哈兰德狂人食谱不适合普通人,别盲目模仿
-
严重污染!印度首都河面漂浮大量有毒泡沫
-
金饰价格突破800元/克大关
-
绝美!北京朝霞遇到平流雾
-
美国给以色列派先遣队,援助的“萨德”也将启用?
-
以总理住宅遭无人机袭击 以方反应强烈
-
美政府紧急调查以色列报复伊朗计划外泄事件
-
以军袭击加沙地带北部拜特拉希亚地区已致73人死亡
-
新帖速递
-
莫氏鸡煲为养好鸡暂缓开店,品质优先获食客支持
-
金正恩致电普京祝贺生日 强调始终坚定支持俄罗斯
-
物理诺奖得主用南极冰造望远镜 开启中微子天文学新时代
-
古代未婚妻被贬为妾犯法吗?明朝强奸未婚妻直接绞死,清朝却只赔钱
-
古代对女子的35种称呼,你知道几种?
-
缅北电诈主犯落网后反问民警杀人要什么感受 视生命如无物
-
宝藏小城藏不住了 独特魅力吸引众多游客关注
-
韩国拟调整运动员艺人免兵役政策 相关言论引发争议

精彩评论文明上网理性发言,请遵守评论服务协议
共0条评论