前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8836
  • Jev 决策模型真实成本拆解:何时省钱何时烧钱
  • 开源CLM-8B:Agent动作评分比Jev快9倍
  • JEV:打破布尔二值困境的类型安全验证方案
  • Claude Opus 5.5降价40%逼近前沿性能
  • VS Code 1.139:Agent 会话首次加载提速约 12 倍
  • 定时 Agent 总重复干活?用完成分类账让它知道什么是「做完」
  • TypeSafe AI Jev 编码指南:类型化决策、置信度校准与推测式广播
  • Vercel Connect 新增 TanStack AI 集成
  • Anthropic与OpenAI 90分钟内相继降价
  • 选LLM API的六个价格陷阱
  • Agent记忆正常仍出错:问题在状态不在记忆
  • Mercury 2.5 推理速度达 770 tokens/秒
  • GitHub Copilot 代码审查新增个人配置选项
  • MCP单人上手容易,团队规模落地是另一回事
  • 影子测试100%一致率背后:模型实际正确率仅75%
  • 两个都通过的测试,代价却不同:重试的隐性成本
  • 定时运行AI Agent输出飘移的根因与修复
  • Anthropic如何两周将Claude.ai速度提升3倍
  • claude-code-templates:一键装配 Claude Code 开发套件,含 100+ Agent/MCP
  • Agent 删改测试必须拦截:CI 合并门禁实操方案
  • Google Antigravity SDK 支持本地 AI 模型:Gemma 4 26B 可离线跑
  • NVIDIA Warp 与 MjWarp 加速机器人仿真工作流
  • HEMA 用 MCP 和 Amazon Bedrock 实现内部 AI 助手转型
  • 五大LLM网关工具生产环境横评
  • GitHub Copilot应用如何渲染百万行PR
  • 基于 AWS 构建 Agent 式视频智能对话系统架构解析
  • Bedrock 上用开源权重模型做 AI 编程助手
  • Anthropic 实验室:Claude 自主发现类 CRISPR 新型酶系统
  • ChatGPT Voice 集成邮件、日历和 Slack:Altman 心中的"Her"更近一步
  • OpenAI GPT-6 Sol/Luna 和 Claude Opus 5.5 同步降价 50%
  • AI 工具循环必须显式传递 Retry-After 头否则必死循环
  • AI 代码补丁静默引入新工具调用:merge 前必须强制契约检查
  • AI 写 API 文档无法区分 null/0/缺省三态:OpenAPI 契约必须显式约束
  • AI 编程 Agent 工具输出遭截断:应记录 stdout_bytes 和截断标志
  • Anthropic工程师揭秘:Claude为何越进化写作越差
  • Gemini 3.8 Flash / Flash-Lite TTS 发布:千款语音、30秒克隆、逐行台词控制
  • 工程师详解:新版Claude为何写作风格变得怪异
  • 小米MiMo-V3将搭载HySparse 2:100万Token下KV缓存缩小4.5倍
  • GitHub Copilot 应用新增本地沙箱隔离功能
  • AI Agent 调试指南:重启不是调试,七层架构定位根因
  • AI 加剧软件供应链攻击威胁,行业如何应对
  • 阿里 Qwen Audio 3.1 发布:语音识别/TTS 多模型,API 价格最高降 95%
  • Claude Code部署到Lizard平台实战指南
  • Claude Opus 5.5降价却破坏四个Agent依赖项
  • OpenAI GPT-6 Sol/Luna 半价发布,缓存机制或为更大降本杠杆
  • treg:聚合 3000+ Agent 工具的统一网关
  • 向量检索权限校验应内嵌到 pgvector 查询中
  • Univer:面向 AI Agent 的开源办公套件 SDK
  • DeepSeek公开Agent训练新论文,梁文锋署名
  • 为 AI 编程 Agent 构建可复用技能系统的实践
  • DeepMind研究:百个AI智能体协作求解时出现作弊与告密现象
  • 已加载 51 / 8836
8.0
热点
AI SCORE
工具产品2026-09-24 02:44

Google Antigravity SDK 支持本地 AI 模型:Gemma 4 26B 可离线跑

Google Developers Blog#Google#本地部署#Gemma
Editor brief · 编辑速览

Antigravity SDK 新增本地模型支持,Gemma 4 26B 等模型可通过 LiteRT 本地执行,支持 Ollama/vLLM 兼容推理服务器。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

今天,我们正式宣布 Antigravity SDK 支持在多种本地模型和执行选项上运行本地工作流,并首发支持 Google AI Edge 的 LiteRT 驱动的 Gemma 4 26B A4B。

Antigravity SDK 让开发者能够基于驱动 Google Antigravity 的同款 Agent 能力进行开发。借助这一新支持,你可以通过本地模型完全离线地启用 Agent 辅助功能。我们针对 LiteRT 和 Gemma 4 26B 优化了这一工作流,高效利用本地 GPU 和 RAM,进一步释放本地机器的能力上限。

为什么要在本地运行 Agent?

本地模型执行为 Agent 体验带来多项优势:

成本效率:无需 API 费用或速率限制,即可执行本地 Agent 工作流。

隐私保护:代码和请求完全保留在本地机器上,非常适合有严格数据隐私要求或受合规限制的企业环境。

离线容错:即使在无法保证稳定网络连接的环境下,也能无缝执行 Agent 工作流。

混合工作流:将节省 Token 的本地处理与云端处理相结合,在需要时仍能访问更大、更强大的模型,同时最大化效率。

入门指南

(推荐使用 >24GB VRAM 或统一内存的机器)

创建一个虚拟环境:

python3 -m venv .venv
source .venv/bin/activate

安装 Antigravity SDK 和 LiteRT-LM,并下载 Gemma 4 26B A4B:

pip install google-antigravity litert-lm

litert-lm import \
  --from-huggingface-repo=litert-community/gemma-4-26B-A4B-it-litert-lm \
  gemma-4-26B-A4B-it-gpu.litertlm \
  gemma4-26b

在目录下创建一个名为 agy_sample.py 的文件,将以下内容粘贴进去:

import asyncio
import os
from google.antigravity import Agent, LiteRTAgentConfig
from google.antigravity.hooks import policy

# UPDATE: Point to the locally downloaded model from the previous step (litert-lm import ...)
MODEL_PATH = os.path.expanduser("~/.litert-lm/models/gemma4-26b/model.litertlm")

async def main():
   print(f"Using local LiteRT model: {MODEL_PATH}. Please wait for local inference to complete. This could take several minutes.")

   config = LiteRTAgentConfig(model_path=MODEL_PATH).lightweight()
   async with Agent(config) as agent:
      response = await agent.chat("What files are in the current directory?")
      async for token in response:
         print(token, end="", flush=True)

if __name__ == "__main__":
   asyncio.run(main())

混合编排:云端架构师 + 本地执行者

在许多场景中,我们发现"架构师-构建者"模式是结合云端模型规模与本地模型优势的绝佳方式。在下方这段由更新版 Antigravity SDK 构建的混合演示视频中,云端架构师(Gemini 3.8 Flash)担任规划者和指挥者,而本地部署的 Gemma 4 26B 实例集群则在设备端完成所有重活。

当被要求对三个有漏洞的模块(auth.py、billing.py 和 database.py)进行审计和修复时,整个工作流严格保证了数据隐私,同时最大化 Token 利用率:

无需上传代码:Gemini 3.8 Flash 仅根据文件名和任务描述制定策略并分解工作——仅消耗 95 个云端 Token,全程没有任何源代码离开本机。

本地自主接力:本地 Gemma 4 26B 模型接管本地 GPU,执行对抗性审计循环:复现安全漏洞、编写候选修复方案、对补丁进行评审,并根据回归测试套件进行验证。

巨大的成本和隐私收益:在这段录制运行中,97.2% 的 Token(3322 个)完全在本地离线运行,未调用任何云端 API,在将专有代码完全安全地保留在设备端的同时,交付了完全验证通过的绿色补丁。

点击这里查看示例项目,可以运行内置的 3 文件审计流程,也可以将其指向你自己的 Python 模块和测试套件。

Sorry, your browser doesn't support playback for this video

Token 免费本地工具:CLI 资源监控器

Antigravity SDK 配合 Gemma 4 26B A4B 在构建实用系统工具方面表现出色。在这个例子中,Agent 构建了一个在终端中实时更新的资源监控工具。仅需一条提示词,Agent 就能自主编写一个使用 psutil 和 rich 库的 Python 脚本,用于追踪 CPU 和内存使用情况,生成所需的 requirements.txt 文件,甚至测试生成的代码是否正常工作——全程完全在本地机器上运行,使用 Gemma 4 26B。

Sorry, your browser doesn't support playback for this video

cli_resource_monitor.py

import asyncio
import os
from google.antigravity import Agent, LiteRTAgentConfig
from google.antigravity.hooks import policy

# UPDATE: Your prompt
PROMPT = "Build a command-line interface tool using the psutil and rich libraries that displays a live-updating terminal dashboard. It should show CPU usage, memory consumption, and a sorted table of the top 5 most memory-intensive processes. Save the script as 'monitor.py' and create a 'requirements.txt' file. Test that it works."

# UPDATE: Point to the locally imported LiteRT-LM model path
MODEL_PATH = os.path.expanduser("~/.litert-lm/models/gemma4-26b/model.litertlm")

# UPDATE: Give AGY-SDK a workspace to write files
WORKING_DIR = os.path.expanduser("~/agy-test")

os.makedirs(WORKING_DIR, exist_ok=True)
os.chdir(WORKING_DIR)

async def main():
  print(f"Using local LiteRT model: {MODEL_PATH}. Please wait for local inference to complete. This could take several minutes.")

  config = LiteRTAgentConfig(
     model_path=MODEL_PATH,
     workspaces=[WORKING_DIR],
     policies=[policy.allow_all()],
  ).lightweight()

  async with Agent(config) as agent:
     response = await agent.chat(PROMPT)
     async for token in response:
        print(token, end="", flush=True)

if __name__ == "__main__":
  asyncio.run(main())

Antigravity SDK 还通过 LocalOpenAIAgentConfig 提供了无缝、即插即用的支持,可连接任何 OpenAI 兼容的服务器,如 Ollama、LM Studio 或 vLLM。这让你能够灵活尝试不同的本地推理后端,同时保持 Agent 编排、工具和工作流完全不变。

通过查看 Antigravity Python SDK README 中的说明,开始你的本地 AI 之旅,并进一步了解如何使用 LiteRT 在边缘高效运行模型。欢迎在 Antigravity Python SDK GitHub Issue Tracker 上分享你的反馈和功能请求。期待看到你们的作品!

致谢:Abhi Patel、Ander Dobo、Ben Miles、Cormac Brick、Ian Ballantyne、Jingxiao Zheng、Jonathan Reay、Kimish Patel、Lu Wang、Marissa Ikonomidis、Matthias Grundmann、Olivier Lacombe、Omar Sanseviero、Rishika Sinha、Rody Davis、Taylor Mullen、Tyler Mullen、Wai Hon Law、Xiaoming Hu、Xu Chen、Yu-hui Chen

Original source

本文由 AI 翻译整理自 Google Developers Blog,原文版权归原作者所有。

阅读英文原文
上一篇
Agent 删改测试必须拦截:CI 合并门禁实操方案
下一篇
NVIDIA Warp 与 MjWarp 加速机器人仿真工作流