Cantina Security 基于 GLM-5.3-Flash 微调出专门用于漏洞研究的开源模型 apex-flash-1,MIT 许可,可部署在 vLLM/SGLang,但需要约 640 GB GPU 显存。
Cantina Security 联手 Yeta Labs 发布了 apex-flash-1,这是一款专门针对漏洞研究训练的开放权重模型。它是对 Z.ai 的 GLM-5.3-Flash 进行强化学习微调后的产物,以 MIT 协议发布在 Hugging Face 上。
能部署吗?可以。MIT 权重支持在 vLLM、SGLang 或 Transformers 上运行,但 BF16 精度大约需要 640 GB 的 GPU 显存。
根据 Hugging Face safetensors 元数据,apex-flash-1 共有 321.3B 参数。GLM-5.3-Flash 基座是一个 MoE(混合专家)模型,激活参数为 18B。
Cantina 使用 GRPO 训练,辅以 rank-256 LoRA 和选择性全参数训练。数据涵盖由 50 个真实漏洞案例构建的 150 个任务。
每个案例有 3 种变体:引导式白盒、聚焦白盒和聚焦黑盒。
授权、身份和作用域缺陷占案例的 72%。账务和数值精度 bug 占 18%。时间验证、业务规则和 SSRF 覆盖其余部分。
根据 HF 上的模型卡,RL rollout 在类生产软件和协议环境中的 Codex agent 框架内运行。
Cantina 用 20 个留出的漏洞案例生成了 60 个任务来评估模型。每个模型运行一次,费用按提供商定价估算。
apex-flash-1:40/60 解决(66.7% pass@1),约 2.38 美元
GLM-5.3-Flash(基座):36/60 解决(60.0%),约 4.56 美元
Claude Opus 5 High:43/60 解决(71.7%),约 74.68 美元
Opus 多解决了 3 个任务,但每次运行成本大约是 apex-flash-1 的 31 倍。apex-flash-1 每个已解决任务约 0.06 美元,而 Opus 约 1.74 美元。这些是公司在内部基准上报告的数字。
Cantina 将 apex-flash-1 定位为由更大模型编排的 worker。模型卡列出了代码阅读、工具使用、漏洞利用开发和验证作为目标技能。
一个实验性的 apex-flash-1-abliterated 变体随修改后的拒绝行为一起发布,没有被单独评估。
Cantina 的理由是:防御者需要他们能够在本地运行和控制的能力模型。
| Feature | apex-flash-1 | Aikido Altar-1 | Cisco Foundation-Sec-8B-Reasoning | GLM-5.3-Flash |
|---|---|---|---|---|
| Developer | Cantina Security + Yeta Labs | Aikido Security | Cisco Foundation AI | Z.ai |
| Base model | GLM-5.3-Flash | GLM-5.3 (pruned) | Llama 3.1 8B | Own pretraining |
| Size | 321.3B total, BF16 328 GB, INT4 (W4A16) | 8B | 320B total, 18B active | - |
| License | MIT | Inherits GLM-5.3 license | Custom (see NOTICE.md) | MIT |
| Security method | GRPO RL on 50 real vulnerability cases | Expert pruning (REAP) + quantization | Instruction tuning + RLHF on security QA | General-purpose base |
| Primary use | Agentic vuln research worker | Air-gapped autonomous pentesting | SOC triage and threat defense | General coding and agents |
| Hardware | Multi-GPU node (~642 GB BF16 weights) | 4x H200 with vLLM | Single GPU | Multi-GPU node |
| Published security result | 66.7% pass@1, 60 tasks | 60.4% recall, 32-CVE internal set | Cisco-reported security benchmarks | 60.0% on Cantina's set |
Sources: Cantina, Aikido, Cisco, Hugging Face model cards. © Marktechpost
apex-flash-1 是一款 MIT 协议的 321.3B 开放权重安全模型。
GRPO 训练基于 50 个真实漏洞案例,生成了 150 个任务。
在 60 任务集上得分 66.7% pass@1,Claude Opus 5 High 为 71.7%。
运行 60 任务花费约 2.38 美元,而 Opus 约 74.68 美元。
BF16 需要多 GPU 节点;社区已有 4-bit 量化版本。