前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8614
  • 开源本地化求职管理平台 FitPilot
  • 在一次性沙箱中测试编程 Agent 越界
  • 别把系统提示词写成规则仓库
  • Agent 审批卡的盲签名陷阱
  • 为真实项目编写AGENTS.md的经验
  • 用固定语料阻止AI审查能力回退
  • 为AI代码变更建立分阶段权限门禁
  • 别让LLM评测工具测到自身拥塞
  • AI自动扫描将放大密钥泄露风险
  • GPT-5.6 Sol能力升级并扩大免费开放
  • 人脸识别的94%匹配为何不可信
  • 如何测试具备工具权限的完整Agent链路
  • 多Agent共享状态为何会静默丢失
  • 一次失控编程Agent如何烧掉138美元
  • 一条命令统一九类触觉传感器数据
  • VS Code 1.132强化智能体开发体验
  • 用对话式设计Agent生成流水线契约
  • 精简智能体规则文件的实用原则
  • LLM 评审为何不能替代确定性校验
  • 用定时 Codex 任务生成可靠日报
  • 六智能体协作生成并部署游戏
  • GitHub 原生堆叠式 PR 改善评审瓶颈
  • Ollama 加速苹果芯片上的 Qwen3.5
  • Rovo 提示注入可窃取企业敏感数据
  • Prime Agent 开源递归式多智能体框架
  • 构建能识别调用异常的 API 监控 Agent
  • 工程团队的软件选型评估框架
  • 生产级 LLM 字幕翻译的完整工作流
  • 昇腾开源强化学习训推一致方案
  • 批量检测 AI 内容模板残留
  • 用Postgres为Claude Code构建长期记忆
  • 自主 Agent 的三层安全威胁模型
  • 多模型降级不能只替换模型名
  • 本地小模型如何应对MCP工具膨胀
  • GPT-Live全双工语音架构解析
  • Qwen3.8登顶Agentic能力榜单
  • AI智能体协作发动全自动攻击
  • 用Next.js构建实时AI代码审计器
  • 用活动图逐节点排查Copilot代理故障
  • AI安全测试因隔离失误波及外部系统
  • 用CLAUDE.md统一团队编码输出
  • Kimi K3开放权重,但个人设备难以运行
  • 用延迟与Token识别Agent空转
  • Maple端侧模型实现每秒127词元
  • 让 AI 生成的界面严守设计令牌
  • 把 AI 界面转成可维护的 Figma 组件库
  • 生产级 LLM 推理的 KV 缓存优化
  • 用 DSPy 把提示词变成稳定接口
  • 别让聊天记录充当 Agent 状态机
  • 用 Git 为编码 Agent 构建有效记忆
  • 生产级 LLM 可观测性不能只看 APM
  • 已加载 51 / 8614
8.0
热点
AI SCORE
技术实践2026-08-06 17:09

六智能体协作生成并部署游戏

dev.to · AI#多智能体#自动化测试#流水线
Editor brief · 编辑速览

作者将规格决策、图像生成、代码修改、浏览器测试和部署拆给六个智能体,并在关键节点保留人工审批。相比单一智能体,该流水线更容易定位故障并控制各阶段风险。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

这是「游戏工厂」系列 8 篇文章中的第 2 篇。

输入一句话,输出一个游戏

游戏工厂是一条由多个 Agent 组成的流水线,可以把一句话描述的主题,变成一个已经部署、可以直接玩的老虎机游戏。我输入「古埃及宝藏老虎机」,在过程中批准几个决策,几分钟后,一个主题游戏就出现在某个 URL 上:转轴上是金色圣甲虫,背景是莎草纸,中奖提示与法老有关,还有一个正常工作的排行榜。我不需要绘制任何图标,不需要写一行 React,也不需要打开控制台。

第 1 篇讲的是我为了学习 iGaming 领域,亲手构建的那一台老虎机。这篇文章讲的是,那一个游戏如何演变成一条能按需生产不同变体的流水线——六个 Agent 分别是什么,它们如何交接,以及人类仍然站在流水线的哪些位置。

为什么是一条 Agent 流水线,而不是一个 Agent

最显而易见的方案,是使用一个足够聪明的 Agent:「这是主题,这是代码库,帮我做一个游戏。」但我没有这么做,而背后的原因很重要。

制作一个老虎机变体并不是一项任务。首先要确定规格,然后生成图片、修改代码、进行浏览器测试,最后部署——每一步需要的工具不同,失败模式不同,而且在继续之前,人类想要检查的位置也不同。让单个 Agent 完成所有事情,意味着它必须在上下文中同时掌握太多信息;它的失败很难定位;而且在各个步骤之间,你也没有任何可供检查的中间产物。因此,我把整个过程拆成了一条流水线:每个阶段都是一个小型 Agent,只负责一项工作,并输出一个结构清晰、可供下一阶段使用的结果。

这里的 Agent 并不是什么复杂的东西:它只是一个运行在循环中的模型,配有一组工具,以及一个结束循环的条件。调用模型,让它调用工具,把工具结果反馈给它,如此重复,直到它发出完成信号。我刻意没有使用任何框架,只用了 Bedrock API 和 Python,这样我就能理解其中的每一个部分。真正有意思的工程问题不在循环本身,而在于如何限定每个 Agent 的职责范围,让这个循环能够顺利终止。

这条流水线按顺序运行。每个阶段读取之前生成的内容,并写出下一阶段需要的东西。

                one sentence in
                │
                ▼
        ┌────────────────┐
        │ Designer       │ ──▶ the spec (a JSON contract)
        └────────────────┘
                │
                ▼
        ┌────────────────┐
        │ Image-Gen      │ ──▶ symbol icons
        └────────────────┘
                │
                ▼
        ┌────────────────┐
        │ Background-Gen │ ──▶ the page background
        └────────────────┘
                │
                ▼
        ┌────────────────┐
        │ Builder        │ ──▶ the themed React code
        └────────────────┘
                │
                ▼
        ┌────────────────┐
        │ Tester         │ ──▶ a pass / fail QA report
        └────────────────┘
                │
                ▼
        ┌────────────────┐
        │ Deployer       │ ──▶ a live URL
        └────────────────┘
                │
                ▼
        a deployed, playable game
  1. Designer。你描述一个主题,Designer 会提出问题并生成一份规格说明——一个供后续所有阶段读取的 JSON 文件。它包含符号及其权重、配色方案、中奖模式、UI 文案和字体。这份文件是整个构建过程的契约:
{
  "theme_id": "ancient-egypt-slots",
  "symbols": [{ "name": "Scarab", "value": "scarab", "weight": 3 }],
  "color_palette": { "primary": "#C8A24B", "background": "#1A0F0A" },
  "win_names": { "three_of_a_kind": "PHARAOH'S FORTUNE" }
}
  1. Image-Gen。它会根据 prompt,为规格中的每一个符号生成图标,然后把图标缩放到转轴所需的尺寸。于是,转轴上的图案不再是云服务 Logo,而变成了圣甲虫和安卡十字。

  2. Background-Gen。思路相同,只不过它只生成一次,用作页面背景。

  3. Builder。这个 Agent 会把赌场的 React 代码转换成当前主题对应的代码。它是负责修改代码的 Agent,也是最让我头疼的一个——以至于它值得单独写一篇文章,讲述它如何经历了一次重新设计。

  4. Tester。它使用 Playwright,在真实浏览器中运行构建完成的游戏,并在每一步截取屏幕截图。随后由视觉模型判断游戏是否真的可以正常游玩——转轴会不会旋转、中奖结果能否正确显示、UI 看起来是否正常。这是一种依靠「看」来作出判断的自动化 QA,而不是对 DOM 编写断言。

  5. Deployer。它负责构建应用并将其部署到 AWS——前端部署到 CloudFront,并连接到 serverless 后端。如果 Tester 的报告没有表明游戏已经通过测试,它就会拒绝运行。

人类站在哪里

这条流水线并不是完全自主运行的,这是刻意设计的结果。各个阶段之间设有审批关卡:Designer 提出规格方案并等待确认;Builder 在修改代码之前先提交计划;Deployer 在正式发布之前再次确认。它遵循的模式是:Agent 提议,人类批准。这样,人类只需要在错误决策会带来高昂撤销成本的关键节点参与其中,而不必亲自完成具体工作。

各阶段之间的交接被刻意设计得十分朴素。规格说明是磁盘上的一个文件;图标和背景是磁盘上的文件;测试结果也是磁盘上的文件。每个 Agent 都会读取前序 Agent 生成的产物。朴素的交接方式意味着交接过程可以被检查——当构建结果看起来不对时,我可以打开规格文件和图片,准确查看下一阶段收到的内容。

如果你正在构建一个能把 prompt 转换成真实产物的系统,真正值得借鉴的形态并不是「一个包办所有工作的 Agent」,而是一条由多个职责明确的 Agent 组成的流水线:每个 Agent 只负责一项工作,输出一个供下一阶段读取的普通文件,并在错误代价高昂的位置设置人工审批关卡。

这种设计能够把故障限制在局部——当生成的游戏有问题时,我知道应该追究哪个阶段,因为我能看到它具体生成了什么。它也允许你单独替换或强化某个阶段,而不必改动其他阶段。正因如此,后来我才能拆掉并重建 Builder,同时不影响环绕在它前后的另外五个 Agent。

接下来,每个阶段都会按照顺序拥有一篇单独的文章,而且每篇都会回答同样三个问题:它是什么、它做了什么,以及哪里出了问题。

上一篇:那个后来变成工厂的老虎机。下一篇:Designer Agent。

如需采取进一步行动,你可以考虑屏蔽此人和/或举报其滥用行为。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
用定时 Codex 任务生成可靠日报
下一篇
GitHub 原生堆叠式 PR 改善评审瓶颈