前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9467
  • Agentic AI 需要元过滤器而非传统 Guardrails:安全架构新思路
  • 2026 开发者调查:AI 编程助手日活高但信任度低
  • GitLab AI Gateway 高危漏洞让我重新审视自建 Agent 权限控制
  • Mistral Large 4 发布:剑指闭源与开源竞品
  • Mistral Large 4:万亿参数主打安全合规
  • Stack Overflow 2026 开发者调查报告发布
  • Mistral Large 4 公开预览:1万亿参数、月底开源
  • Google Gemini 免费版大幅缩限:Flash Lite 限免,Pro/Deep Think 需付费
  • 上线 LLM 功能不死机的工程检查清单
  • AI代理能识别工具失效但仍持续调用,核心问题在于判断与行为的断裂
  • 给Claude Code开发Mod插件:实现额度用量条与项目待办面板
  • LLM 访问控制与监控的实战避坑指南
  • 企业 RAG 实战:混合搜索与重排序的核心差异
  • 日本开发者给 Claude Code 的 Awwwards 级前端 prompt
  • Reflection发布Beam:非中国最强开源模型,编程推理对标GLM
  • Codex CLI vs Claude Code:相同任务实测成本公开
  • Google Docs原生支持Markdown,AI Agent协作成亮点
  • Meta、微软要求员工少用Claude节省成本
  • DeepSeek Harness:24 万 stars 的插件化 AI 工具链
  • 如何给AI编程助手提供正确上下文
  • 12GB显卡跑125B大模型:Strata引擎开源
  • AI 指令遵循失效的深层原因:语义理解≠可靠执行
  • ML 系统上线前的设计审计五问
  • 本地 AI Agent 组织化管理:带预算与汇报链的开源框架
  • LangGraph 替代指南:六大框架实际解决的不同痛点
  • llama-server 推测解码时 logprobs 为假值
  • Reflection AI 开源 Beam:23B 活跃参数的 MoE 编程模型
  • Agent CLI 真实故障:会话消失、幽灵项目、重复条目
  • 发版日 CI 暴露绿灯测试掩盖的五大问题
  • 退款重复处理:分布式事件幂等性实战分析
  • Vercel如何用AI自动化Inbound流程
  • Anthropic推出云端Cowork:AI推理全上云,本地只做文件访问
  • 自建 SearXNG 为 LLM Agent 省钱:缓存 + 限流 + 引文校验
  • GLM 5.3 登陆 Amazon Bedrock:753B 编程专家模型
  • 前端后端错误追踪关联实战:用 trace_id 串联浏览器异常与 API 失败
  • LoreConvo:为 AI 编程工具注入会话记忆,告别每次从零开始
  • DevFest 演讲实录:如何客观评估 AI 辅助开发体验
  • Together Link:一条命令让Claude Code用上Kimi K3、GLM 5.3等开源模型
  • PewDiePie用OpenAI数据微调本地模型反被封号
  • MCP协议存在Agent间恶意Prompt传播风险
  • 某MCP服务器启动前消耗18000 tokens:问题与解决方案
  • Reflection AI开源501B MoE模型Beam,专攻代码生成
  • Google展示生产级AI数据层实战:语义搜索+RAG+AlloyDB集成
  • Reflection AI发布Beam:主打企业AI工厂概念
  • Meta和微软削减Claude预算,转向自研AI工具
  • 笔记本即可运行的 AI 安全检测,效果逼近 350 亿参数模型
  • Reka 发布 Rho-1:统一处理文本/图像/视频/机器人控制的 19B 多模态模型
  • OpenAI在欧盟对ChatGPT和Codex启用文本水印
  • OpenAI文本水印欧盟强制落地,全球API用户可自主选择
  • Claude Code 登陆 AWS GovCloud,支持受监管工作负载
  • AWS SageMaker 为编程 Agent 上线 AI 推理优化技能
  • 已加载 51 / 9467
8.0
热点
AI SCORE
开源项目2026-10-06 15:45

12GB显卡跑125B大模型:Strata引擎开源

IT之家#大模型推理#本地部署#开源
Editor brief · 编辑速览

Strata将MoE专家模型分层加载(RAM+VRAM混合)+投机解码,实测RTX5070上Q2_0量化达94 token/s,AMD 9070 XT达60 token/s。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

科技媒体 gigazine 报道,开发者 Niko1221 开源推出 Strata 引擎,可以在 12GB 及以上显存的消费级显卡上,运行量化的 Qwen3.8-Flash-Next 模型(1250 亿参数)。

文章配图

IT之家注:Qwen3.8-Flash-Next 模型是阿里巴巴 Qwen 团队于 2026 年 8 月推出的多模态混合专家(MoE)模型的压缩版本,配有 125B 参数,另含 51B 参数的 n-gram 嵌入表,原生支持 262K token 上下文长度。

文章配图

Strata 为了降低显存占用,主要采用两项关键技术:其一是将 MoE(混合专家)模型整体载入 RAM,仅将高频使用的专家模型载入 VRAM。其二使用轻量模型进行投机解码,预测下一 Token 以加速推理过程。

硬件要求方面,运行 Qwen3.8-Flash-Next 需满足最低配置:12GB 以上 VRAM 的 NVIDIA 或 AMD 显卡、32GB 以上 RAM、80GB 以上存储空间(推荐 SSD)、Windows 10/11 或 Linux 系统。

性能方面,在 NVIDIA GeForce RTX 5070(12GB VRAM)、Ryzen 5 7600、64GB RAM 配置下,2 比特量化版 Q2_0 达到 94 词元 / 秒推理速度,3 比特量化版 IQ3_S 为 53 词元 / 秒。AMD Radeon RX 9070 XT(16GB VRAM)环境下,Q2_0 版本达到 60 词元 / 秒。

文章配图

硬件配置: NVIDIA RTX 5070(12 GB 显存),AMD Ryzen 5 7600,64 GB 系统内存。

硬件配置:AMD RX 9070 XT(16 GB 显存),AMD Ryzen 9 3900X,47 GB 内存。

这里的"写答案"对应生成回复(输出)的速度,"阅读提示"对应处理你输入的 prompt(上下文)的速度。

点此前往 GitHub 体验 Strata

点此前往 GitHub 体验 Strata

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家包含外链的文章均包含本声明。

软媒旗下网站: IT之家 最会买 - 返利返现优惠券 iPhone之家 Win7之家 Win10之家 Win11之家

软媒旗下软件: 软媒手机APP应用 魔方 最会买 要知

Original source

本文由 AI 翻译整理自 IT之家,原文版权归原作者所有。

阅读英文原文
上一篇
如何给AI编程助手提供正确上下文
下一篇
AI 指令遵循失效的深层原因:语义理解≠可靠执行