Google 分享了 Agent Skills 项目的开发模式:通过编码领域知识到结构化指令中,减少幻觉并强化 agent 的最佳实践执行。
AI Agent 的能力上限,取决于你为它提供的指令和上下文。推出 Google Agent Skills 时,我们的目标很简单:把 Google Cloud 的领域知识编码为结构化、开源的指令,让 AI 编码 Agent 变得显著更智能、更安全,也更准确。
今天,我想带你深入了解 Google Agent Skills 的幕后故事。作为直接参与这些 Skill 开发的团队成员,我将分享这个项目如何起步、我们如何规模化地维持质量,以及如何治理公开和内部使用的 Skill。
Google Agent Skills 项目并非凭空诞生。它始于 Google Cloud Next 2026 大会前夕一场快节奏的“集群式协作”。
一支由 Developer Advocate 和 Technical Writer 牵头的跨职能特别团队聚集在一起,目标非常明确:将 Google Cloud 的领域知识封装为结构化、Agent 可读取的指令。
官方的 Google Agent Skills 发布文章正式宣布了这一项目。社区最初的反响远超我们的预期,GitHub Star 数量突破了 15,000!

当 Google 内外的开发者和工程团队看到 Skill 能如此有效地引导 AI Agent——减少幻觉并强制执行最佳实践——许多团队都希望参与进来。很快,大量产品团队开始希望为自己的 Google 服务贡献 Skill,而且不限于 Cloud,例如 Ads。
受欢迎也带来了一个重大挑战:质量控制。
当不同团队共同贡献 Skill 时,维持统一标准会变得非常困难。一份编写糟糕的 Skill,如果包含模糊的指令、失效的链接或遗漏的边界情况,就会降低整个 Agent 的使用体验。
为了让各个团队能够发布 Skill,同时保护开发者体验,我们必须设定极高的质量门槛。
这意味着流程至关重要。如果没有明确的标准和自动化治理,开源 Skill 仓库很快就会陷入混乱。
接下来,让我们深入了解随着规模扩大,我们是如何维持质量的。
为了让众多 Google 服务中的 Skill 保持一致,每个 Skill 都遵循标准化的仓库布局:
{skill-name}/
├── SKILL.md # Required: Main instructions & frontmatter metadata
├── OWNERS # Required: Skill maintainers (kept internal)
├── EVAL.yaml # Required: Evaluation prompt suites & rubrics (kept internal)
├── reference/ # Optional: In-depth technical docs & schemas
├── scripts/ # Optional: Executable helper scripts
├── assets/ # Optional: Static resources & diagrams
└── _internal/ # Optional: Test mocks & internal data (kept internal)
设计 Skill 时,我们遵循的指导原则是:只要条件允许,就引用远程 Model Context Protocol(MCP)工具;只有在确有必要时,才退而使用 CLI 或 API 调用。远程 MCP Server 非常适合 Agentic 工作负载,它既能提供工具,也具备内置的身份验证和 IAM 治理能力。
我们首先在内部构建并评估 Skill,确保它们能够正常工作并经过充分验证。准备公开发布后,我们会使用自动化导出规则将其发布到 GitHub。这样既能保持公开仓库整洁,也能移除内部资产、所有权信息和评估套件。
任何 Skill 在进入仓库之前,都必须通过自动化 CI/CD Pipeline:
Linters: 我们会验证 frontmatter 元数据、行数、目录布局以及严格的命名约定。
Link Checkers: 我们使用链接检查工具测试每个 URL,在合并前消除 404 和由幻觉产生的链接。提示:如果你正在构建类似的解决方案,我建议尝试一下 lychee。
AI-Assisted Checklists: 我们使用自动化验证检查,确认指令符合规定的结构模式和 guardrail。
虽然我们的开发工作依赖 Google 内部工具,但公开的开源 Skill 仓库可以使用标准 GitHub Actions 实现 CI/CD。
如果你在 GitHub 上维护自己的 Skill 库,linting 应当作为更大规模检查套件的一部分,用来维持较高的质量门槛。下面的 GitHub Action 配置演示了如何使用 skills-ref,在仓库中自动执行 Skill 验证:
name: 'Validate Skills'
on:
push:
branches: ['main']
pull_request:
branches: ['main']
workflow_dispatch:
defaults:
run:
shell: 'bash'
jobs:
validate:
runs-on: 'ubuntu-latest'
permissions:
contents: 'read'
steps:
- name: 'Checkout repository'
uses: 'actions/checkout@34e114876b0b11c390a56381ad16ebd13914f8d5' # ratchet:actions/checkout@v4
- name: 'Set up Python'
uses: 'actions/setup-python@a26af69be951a213d495a4c3e4e4022e16d87065' # ratchet:actions/setup-python@v5
with:
python-version: '3.12'
- name: 'Install skills-ref'
run: |
python3 -m pip install skills-ref
echo "$HOME/.local/bin" >> $GITHUB_PATH
- name: 'Validate skills'
run: |
shopt -s nullglob
for skill_dir in skills/*/; do
echo "Validating skill: $skill_dir"
agentskills validate "$skill_dir"
done
文档和 API 会不断演进,LLM 模型与 Agent Harness 同样如此。如果底层 API、模型或 Agent Harness 发生变化,今天能够正常工作的 Skill,明天可能就会失效。
为了设定初始质量门槛并防止质量退化,我们会持续运行评估:
提交时评估: 作者必须提供明确的评估 prompt 套件和评分标准。我们发布的每个新 Skill,都会先在内部接受评估,以确保其准确性和效率。
每周质量检查: 我们会针对完整的 Skill 库持续运行定期评估任务,以便尽早发现回归问题。
Skill 作者必须提供多个评估测试用例,每个用例都要包含一个 prompt 和一组预期结果。对于每套评估,我们都会比较 Agent 在使用和不使用该 Skill 时的表现。
我们主要关注两个维度:
准确性——回答质量和任务完成率
效率——消耗的 token 数量和完成任务所需的时间
此外,我们还会使用不同的 Agent Framework,多次运行评估,以获得具有统计显著性的结果。
最终,这个 2×2 矩阵可以证明某个 Skill 是否带来了可衡量的准确性和效率提升。

我们从实践中得到的一个重要经验是:Skill 是持续演进的产品,而不是一次性交付的文档。
为了确保长期可靠性,我们制定了严格的所有权规则:
仓库维护者负责维护仓库健康状况、CI Pipeline 和架构标准。
Skill Owner负责长期维护自己的 Skill。例如,如果产品 API 发生变化,Skill Owner 就需要更新相应的 Skill。在评估运行中发现质量下降时,同样由 Skill Owner 负责处理。
编写有效的指令和评估套件需要经验,我们并不期望 Skill 作者从零开始完成所有工作。
为了支持贡献者,我们构建了多种工具和 Agentic 工作流:
专门用于协助作者构建新 Skill、编写健壮评估的内部 Skill。
使用 ADK 构建的 Agentic 工具,可以运行用于创作和自我审查的 Multi-Agent 循环,并提供一条便捷的导出路径,将成果导入主仓库。
我会在后续文章中进一步介绍这些创作工具和 Agentic 工作流。
Google Agent Skills 承载的是面向外部开发者的公开 Skill,与此同时,我们还启动了一项名为 DevRel Skills 的内部并行计划。
DevRel Skills 专注于为内部团队工作流构建 Agent Skill。通过将内容转换、SEO 优化、内部报告等内部流程编码为专用 Skill,我们可以帮助团队每天都更加高效、一致地完成工作。
要规模化构建高质量的 Agent Skill,需要将明确的标准、严格的评估、自动化 CI/CD 和长期所有权结合起来。
随着 Agentic 开发不断发展,我们很想听听你的实践:
你如何在自己的工作流中构建和测试 Agent Skill?
你使用哪些检查或 eval 来验证 Agent 的回答?
欢迎在评论区告诉我们,或通过社交平台与我们联系!
要开始使用 Google Agent Skills,可以查看:
Google Agent Skills 仓库:github.com/google/skills
第 1 部分:简介:什么是 Google Cloud Agent Skills?
第 2 部分:实用指南:中级 Agent Skills 实战
如果你觉得这篇文章对你有帮助:
点击心形 ❤️ 按钮,为这篇文章添加 reaction。
在社交平台上把这篇文章分享给朋友。
通过 LinkedIn、X 或 Bluesky 与我联系。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。