前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9375
  • Harness决定AI Agent能力:同模型不同表现
  • Claude Code权限绕过:Read拒绝后Bash仍可读取
  • 生产级Agent系统实战:LLM路由、Prompt合约与PR安全审查
  • LCLM:16倍压缩的潜在上下文语言模型
  • Claude Code mods解析:何时需要构建插件
  • Linus确认Linux内核进入「AI新常态」
  • 如何验证Agent实际完成了它声称的任务
  • Claude Code /compact 后哪些内容真正存活
  • 开源安全模型 apex-flash-1:60 个遗留 Bug 任务解出 40 个
  • yOGI Neural Grid:强制验证模型引用来源的工程实现
  • 美团开源LongCat-Video:13.6B参数统一视频生成模型
  • Agent技能需要包管理器而非仅靠Prompt
  • n8n AI Agent 生产环境失败根因与修复方案
  • 565 行 Python 从零实现编程智能体
  • 四大前沿模型横向评测:Astra擅计算机使用、Argon强法律金融、Sol价格最优
  • 本地RAG开发113个评估问题后的实战总结
  • AI重写让我重新审视运行时成本:Node.js转Go/Rust的算账
  • MCP工具超90个时的平台化架构设计
  • Homa:专为AI集群设计的TCP替代网络协议栈
  • 我为编码Agent的测试篡改问题做了个AdversaryGate
  • SaaS支持文档检索应选语义嵌入而非关键词
  • AI 审核员知道太多会变差:验证者应不知情
  • 长文档JSON提取超时?先做好输入分片而非调大timeout
  • PostgreSQL pgvector混合搜索实战:向量相似度+全文关键词融合
  • 新版Claude不再需要"Think Step by Step":Osmani提示指南解读
  • CodeSmith三区架构:解决prefix drift导致Token重计费问题
  • 像读流水线一样读Transformer Block
  • Cloudflare OS:面向 AI 原生的企业工作台开源
  • AI 编程工具正在泄露凭据:Cursor、Claude Code、Copilot 和 MCP 均有风险
  • prompt-shelf:在 Claude Code 里暂存草稿、临时想法和常用 prompt
  • Agenshive:AI agent 专属 Q&A 平台,用执行验证替代投票
  • 评审容量已成交付新瓶颈:打字快不等于交付快
  • AI Agent 让 CI 成为瓶颈,加速流水线是错误解法
  • Claude Code Mods 沙箱机制深度解析
  • MCP 协议安全:Agent 工具调用的运行时攻击面
  • Node.js多LLM提供商集成实战:统一输出契约与回退策略
  • Google RRSI 方法:防止自改进 AI Agent 记忆测试任务
  • DeepSeek Harness v0.2支持Claude Code Mods兼容层
  • MCP协议深度解析:AI工具集成标准现状与局限
  • 已加载 39 / 9375
8.0
热点
AI SCORE
开源项目2026-10-05 09:47

开源安全模型 apex-flash-1:60 个遗留 Bug 任务解出 40 个

MarkTechPost#安全研究#漏洞挖掘#开源模型
Editor brief · 编辑速览

Cantina Security 基于 GLM-5.3-Flash 微调出专门用于漏洞研究的开源模型 apex-flash-1,MIT 许可,可部署在 vLLM/SGLang,但需要约 640 GB GPU 显存。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Cantina Security 联手 Yeta Labs 发布了 apex-flash-1,这是一款专门针对漏洞研究训练的开放权重模型。它是对 Z.ai 的 GLM-5.3-Flash 进行强化学习微调后的产物,以 MIT 协议发布在 Hugging Face 上。

能部署吗?可以。MIT 权重支持在 vLLM、SGLang 或 Transformers 上运行,但 BF16 精度大约需要 640 GB 的 GPU 显存。

根据 Hugging Face safetensors 元数据,apex-flash-1 共有 321.3B 参数。GLM-5.3-Flash 基座是一个 MoE(混合专家)模型,激活参数为 18B。

Cantina 使用 GRPO 训练,辅以 rank-256 LoRA 和选择性全参数训练。数据涵盖由 50 个真实漏洞案例构建的 150 个任务。

每个案例有 3 种变体:引导式白盒、聚焦白盒和聚焦黑盒。

授权、身份和作用域缺陷占案例的 72%。账务和数值精度 bug 占 18%。时间验证、业务规则和 SSRF 覆盖其余部分。

根据 HF 上的模型卡,RL rollout 在类生产软件和协议环境中的 Codex agent 框架内运行。

Cantina 用 20 个留出的漏洞案例生成了 60 个任务来评估模型。每个模型运行一次,费用按提供商定价估算。

apex-flash-1:40/60 解决(66.7% pass@1),约 2.38 美元

GLM-5.3-Flash(基座):36/60 解决(60.0%),约 4.56 美元

Claude Opus 5 High:43/60 解决(71.7%),约 74.68 美元

Opus 多解决了 3 个任务,但每次运行成本大约是 apex-flash-1 的 31 倍。apex-flash-1 每个已解决任务约 0.06 美元,而 Opus 约 1.74 美元。这些是公司在内部基准上报告的数字。

一个 Worker 模型,而非编排器

Cantina 将 apex-flash-1 定位为由更大模型编排的 worker。模型卡列出了代码阅读、工具使用、漏洞利用开发和验证作为目标技能。

一个实验性的 apex-flash-1-abliterated 变体随修改后的拒绝行为一起发布,没有被单独评估。

Cantina 的理由是:防御者需要他们能够在本地运行和控制的能力模型。

交互式解说

Feature apex-flash-1 Aikido Altar-1 Cisco Foundation-Sec-8B-Reasoning GLM-5.3-Flash
Developer Cantina Security + Yeta Labs Aikido Security Cisco Foundation AI Z.ai
Base model GLM-5.3-Flash GLM-5.3 (pruned) Llama 3.1 8B Own pretraining
Size 321.3B total, BF16 328 GB, INT4 (W4A16) 8B 320B total, 18B active -
License MIT Inherits GLM-5.3 license Custom (see NOTICE.md) MIT
Security method GRPO RL on 50 real vulnerability cases Expert pruning (REAP) + quantization Instruction tuning + RLHF on security QA General-purpose base
Primary use Agentic vuln research worker Air-gapped autonomous pentesting SOC triage and threat defense General coding and agents
Hardware Multi-GPU node (~642 GB BF16 weights) 4x H200 with vLLM Single GPU Multi-GPU node
Published security result 66.7% pass@1, 60 tasks 60.4% recall, 32-CVE internal set Cisco-reported security benchmarks 60.0% on Cantina's set

Sources: Cantina, Aikido, Cisco, Hugging Face model cards. © Marktechpost

apex-flash-1 是一款 MIT 协议的 321.3B 开放权重安全模型。

GRPO 训练基于 50 个真实漏洞案例,生成了 150 个任务。

在 60 任务集上得分 66.7% pass@1,Claude Opus 5 High 为 71.7%。

运行 60 任务花费约 2.38 美元,而 Opus 约 74.68 美元。

BF16 需要多 GPU 节点;社区已有 4-bit 量化版本。

Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
Claude Code /compact 后哪些内容真正存活
下一篇
yOGI Neural Grid:强制验证模型引用来源的工程实现