文章探讨Kubernetes早年的单体设计教训如何应用于AI Agent框架的构建与管控。
以下是文章全文翻译:
很高兴你在这里。每周一至周五,你将收到 The New Stack 的最新内容,保持你对资讯的敏锐和领先。
查收收件箱中的确认邮件,你可以调整偏好设置,甚至加入更多群组。
在你等待第一封 TNS Newsletter 时,可以在各大社交媒体平台关注 TNS。
在 LinkedIn 上成为 TNS 粉丝。
在等待第一封 TNS Newsletter 时,浏览精选和热门文章。
欢迎来到《Road to KubeCon》新一期节目,这里是 KubeCon + CloudNativeCon NA(将于 11 月 9 日至 12 日在犹他州盐湖城举行)倒计时期间 Kubernetes 与云原生资讯的聚集地。
本周,我们来看看 agent harness 的现状及其需要演进的方向。同时还有 HPE 对 Kubernetes 可观测性的思考、更多科幻风格的 agentic DevOps,以及一个令人印象深刻的调度器——它向 Kubernetes 默认调度器展示了谁才是 GPU 利用率的主人。
此外还有 CNCF 的资讯:今年 ArgoCon 有哪些值得期待、用好机会提升开源项目安全卫生状况、Atlassian 如何将事件到指标的延迟削减至 10 秒以内,以及 TNS 读者的专属好礼。
让 Kubernetes 跑起来是一个里程碑。知道谁负责下一次升级、访问请求或故障恢复,则是一场持续的旅程。
本周,我们发布了《一个活跃的 Kubernetes 集群仍然可能存在所有权缺口》,这是 Chris J. Preimesberger 四篇系列文章的第二篇,由 HPE 赞助。该系列探讨了发布后平台团队和应用团队如何划分职责——从配置漂移、安全策略到升级验证和恢复演练。一个健康的集群不必然等同于一个健康的应用程序——而总得有人来承担这个缺口。
Hewlett Packard Enterprise(HPE)是 Road to KubeCon 的联合赞助商。HPE Software 帮助 IT 组织实现基础设施现代化、简化运营,并在混合多供应商环境中加速 AI 计划。
错过了开篇?第一部分探讨了 Kubernetes 自助服务:开发者如何在不经历工单排队的情况下获得审批通过的环境,同时平台团队保留对访问、成本和生命周期控制的职责。这一系列文章共同探讨了一个实际问题:如何在让开发者获得更多自主权的同时,使运营责任更加清晰?
接下来,该系列将转向诊断 Kubernetes 看起来健康但应用响应慢的情况,然后是衡量 AI 推理性能。这两篇都将探讨随着工作负载需求日益严苛,团队在迈向 KubeCon 的道路上需要什么样的可观测性。
本周,Cloud Native Computing Foundation(CNCF)为 The New Stack 的读者带来了特别福利。如果你计划参加在盐湖城举行的 KubeCon + CloudNativeCon NA,在此链接注册时使用折扣码 KCNA26MED10,可享受 10% 的入场优惠。
距离 KubeCon 只有 38 天了(如果你按专栏计算,是四期 Road to KubeCon),所以赶紧注册并规划你的行程吧。
Agent "harness" 很快成了一个包罗万象的概念——涵盖了围绕 AI agent 的方方面面:上下文、文件系统、子 agent、权限,等等。然而,Stacklok 创始人兼 CEO Craig McLuckie 认为,这还远远不够。
在他看来,大多数 harness 过于本地化,是为单个开发者在笔记本上工作而构建的。典型的 harness 无法良好地扩展以服务数百个会话。会话会中断,而且你无法轻松地在不同客户端或设备之间迁移体验。
本周,他在 CNCF 博客上发文,倡导云原生的 agent harness。在他看来,这是一个分布式应用程序,将 agent 循环与其周围的基础设施和服务分离。
"Kubernetes 教会了这个行业:容器里的单体应用仍然是单体应用,"他写道。"这个教训同样适用于 agent。"
周二发布的一份案例研究详细介绍了中国自动驾驶科技公司卓驭科技(Zhuoyu Technology)如何借助 Koordinator 显著提升 Kubernetes 利用率。Koordinator 是一个 CNCF 沙箱项目,用于高效调度微服务、AI 和大数据工作负载。
卓驭科技在基于 Kubernetes 的环境中运行自动驾驶工作负载,但在使用默认 Kubernetes 调度器时遇到了性能效率问题——GPU 分配率和利用率都被限制了。通过使用 Koordinator,团队将 GPU 分配率提升至 95% 以上,GPU 整体利用率超过 55%。
该案例研究展示了默认 Kubernetes 调度器中的某些差距如何导致发布失败、GPU 利用率低、GPU 资源闲置以及分布式作业调度问题。同时也展示了 Koordinator 在生产环境中的表现。
Open Source Security Foundation(OpenSSF)与 CNCF 合作组织 Security Slam,这是一项为期 30 天的挑战,带领参与者使用 OpenSSF 项目来提升其项目安全状况。
所有开源项目均可参与。Eddie Knight 和 OpenSSF 的 Stacey Potter 表示,这个活动"现在正利用新工具大幅拓宽参与资格"。
挑战时间为 10 月 5 日至 11 月 6 日。在此处注册参与并关注目标公告。完成挑战后,你可能会在 KubeCon 的 OpenSSF 展位(#313)收到一份精美的奖品。
在事件检测和响应中,每一秒都至关重要。周三,Atlassian 高级工程经理 Deepak Biswas 在 CNCF 博客上分享了一个深度案例研究,讲述了 Atlassian 如何将延迟压到极致。
AutoHOT(其自动化事件创建系统)背后的检测平台结合了 OpenTelemetry、Apache Kafka 和 Apache Flink on Kubernetes。运维遥测追踪着横跨 10 多个云产品、数百万租户的用户行为,每天生成数十亿个事件。
标题已经说明了一切:他们将事件到指标指标(说起来有点自指)从 40 多秒降低到了 10 秒以内。
然而,Biswas 很坦诚:"这不是一个绑着蝴蝶结的成功故事。"他们仍在持续调优。例如,Recall 在 8 月份下降到了 64%。尽管如此,对于其他正在构建自动化事件检测和响应工作流的人来说,这是一个有用的蓝本。
随着 Kubernetes 的演进,运行它对团队的要求也在提高。联合赞助商 HPE 帮助团队用跨越虚拟化、云管理、可观测性和自动化的软件来应对这种复杂性。
KubeCon NA 将于 11 月 9 日(周一)举办 ArgoCon North America 2026 暨同期活动。这是一场全天双轨活动,提供关于改进软件交付、管理数据和机器学习管道、以及实现渐进式交付的实用思路。
周三,CNCF 博客上发布了 ArgoCon 联合主席 Dan Garfield、Christian Hernandez 和 Katie Lamkin 的文章,他们强调此次活动正值社区开始 Argo CD 4.0 愿景规划进程之际。
他们在文章中将 ArgoCon(日程已上线)描述为"一个连接当下用户构建成果与项目未来走向的机会"。
"如果几年前你告诉我这个存在,我会觉得'这是科幻,不应该成真,'"工程负责人 Alexander Mattoni 在本周的功能发布视频中展示 Cycle 的新型远程 MCP 服务器时如此说道。
这一发布意味着 Cycle 用户可以通过自然语言,使用兼容 MCP 的 AI 助手和编码工具,在多云和混合环境中配置、编排和管理工作负载。
此前云原生行业陆续发布了一系列 agentic 功能,持续将 DevOps 抽象化,并将强大能力融入 prompt。昨天还是科幻的东西,如今正日益成为常态。
Road to KubeCon 是由 HPE 在盐湖城 KubeCon + CloudNativeCon North America 期间呈现的八篇系列报道。在你离开之前,可以了解一下 HPE Software 如何帮助 IT 团队以更低的复杂性完成更多工作。
228 个 CNCF 项目。1,754 位最新 Kubernetes 版本的独立贡献者。预计 230 多家赞助商和参展商将亮相 KubeCon NA 2026……
云原生生态系统正在蓬勃发展。因此,这里总有新鲜事发生。
在 KubeCon NA 之前,我们将每周五在 The New Stack 上持续跟踪这些动态。
这意味着,在我们展会相见之前,还有几期内容和简讯等着撰写。
如果你在云原生领域工作并有有趣的分享,系列作者 Bill Doerrfeld 欢迎投稿。你可以通过他的个人联系方式页面分享新闻、选题或引用。
如果你错过了上周关于 OpenTelemetry 和 Prometheus 互操作性的那期,可以点击此处回顾。
你也可以关注 Road to KubeCon 系列存档。