跳到正文
Google Developers Blog·· 2 小时前精选AI 评分69

Antigravity SDK 新增本地 AI 模型支持,首发适配 Gemma 4 26B A4B

Introducing Support for Local AI Models in the Antigravity SDK

AI 导读

Google 宣布 Antigravity SDK 支持本地模型工作流,首发通过 Google AI Edge 的 LiteRT 支持 Gemma 4 26B A4B,可完全离线运行智能体。

推荐理由

官方给出本地模型接入 Antigravity SDK 的完整配置与混合编排示例,可据此评估离线智能体工作流的落地方式。

正文 · AI 翻译

2026年9月23日

今天,我们宣布 Antigravity SDK 支持跨多种本地模型和执行选项的本地工作流,并初步支持使用 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B。

Antigravity SDK 让开发者能够使用驱动 Google Antigravity 的相同智能体能力进行构建。借助这一新支持,你可以完全离线地通过本地模型启用智能体辅助。我们针对 LiteRT 和 Gemma 4 26B 优化了这一工作流,高效利用本地 GPU 和 RAM,进一步放大你本地机器的能力!

为什么要在本地运行智能体?

本地模型执行可为智能体体验带来多项优势:

  • 成本效益:执行本地智能体工作流,无需 API 费用或速率限制。
  • 隐私:将你的代码和请求完全保留在本地机器上,非常适合面临严格数据隐私要求或合规受限企业环境的开发者。
  • 离线韧性:即使在无法获得持续或稳定互联网连接的环境中,也能无缝执行你的智能体工作流。
  • 混合工作流:将节省 token 的本地流程与基于云的流程相结合,以最大化效率,同时在需要时仍可使用更大、更强大的模型。

以下是如何开始:(我们推荐使用显存或统一内存 >24GB 的机器)。

创建虚拟环境:

python3 -m venv .venv
source .venv/bin/activate

Python

已复制

安装 Antigravity SDK 和 LiteRT-LM,并下载 Gemma 4 26B A4B:

pip install google-antigravity litert-lm

litert-lm import \
  --from-huggingface-repo=litert-community/gemma-4-26B-A4B-it-litert-lm \
  gemma-4-26B-A4B-it-gpu.litertlm \
  gemma4-26b

Python

已复制

在你的目录中创建一个名为 agy_sample.py 的文件。将以下内容粘贴到其中。

import asyncio
import os
from google.antigravity import Agent, LiteRTAgentConfig
from google.antigravity.hooks import policy

# UPDATE: Point to the locally downloaded model from the previous step (litert-lm import ...)
MODEL_PATH = os.path.expanduser("~/.litert-lm/models/gemma4-26b/model.litertlm")

async def main():
   print(f"Using local LiteRT model: {MODEL_PATH}. Please wait for local inference to complete. This could take several minutes.")

   config = LiteRTAgentConfig(model_path=MODEL_PATH).lightweight()
   async with Agent(config) as agent:
      response = await agent.chat("What files are in the current directory?")
      async for token in response:
         print(token, end="", flush=True)

if __name__ == "__main__":
   asyncio.run(main())

Python

已复制

混合编排:云端架构师遇上设备端工作团队

在许多情况下,我们发现架构师-构建者模式是结合云模型规模与本地模型优势的绝佳方式。在下方使用更新后的 Antigravity SDK 构建的混合演示视频中,云端架构师(Gemini 3.8 Flash)充当规划者和指挥者,而由 Gemma 4 26B 实例组成的本地集群则完全在设备端承担繁重工作。

当任务是对三个存在漏洞的模块(auth.py、billing.py 和 database.py)进行审计和修补时,该工作流保持了严格的数据隐私,并让我们能够最大限度地利用 token:

  • 不上传代码:Gemini 3.8 Flash 仅根据文件名和任务描述来规划策略并分解工作——仅消耗 95 个云端 token,且源代码从未离开本机。
  • 自主本地挑战:本地 Gemma 4 26B 模型接管本地 GPU,执行对抗性审计循环:复现安全漏洞、编写候选修复、评审补丁,并针对回归测试套件进行验证。
  • 巨大的成本和隐私收益:在本次记录的运行中,97.2% 的 token(3,322 个 token)在本地离线运行,未调用云端 API,在将专有代码完全安全地保留在设备端的同时,交付了经过全面验证的绿色补丁。

查看示例项目此处,运行内置的三文件挑战,或将其指向你自己的 Python 模块和测试套件。

抱歉,你的浏览器不支持此视频播放

免 token 本地实用工具:CLI 资源监视器

搭载 Gemma 4 26B A4B 的 Antigravity SDK 擅长构建实用的系统工具。在本示例中,智能体构建了一个在终端中运行的实时更新的资源监视器。只需一条提示,智能体就会自主编写一个使用 psutil 和 rich 库来跟踪 CPU 和内存使用情况的 Python 脚本,生成必要的 requirements.txt 文件,甚至测试生成的代码以确保其正常工作——所有这些都完全在你的本地机器上运行,并使用 Gemma 4 26B。

抱歉,你的浏览器不支持此视频的播放

一个基于 Python 的 CLI 资源监视工具,使用 Gemma 4 26B 在设备上生成

## cli_resource_monitor.py

import asyncio
import os
from google.antigravity import Agent, LiteRTAgentConfig
from google.antigravity.hooks import policy

# UPDATE: Your prompt
PROMPT = "Build a command-line interface tool using the psutil and rich libraries that displays a live-updating terminal dashboard. It should show CPU usage, memory consumption, and a sorted table of the top 5 most memory-intensive processes. Save the script as 'monitor.py' and create a 'requirements.txt' file. Test that it works."

# UPDATE: Point to the locally imported LiteRT-LM model path
MODEL_PATH = os.path.expanduser("~/.litert-lm/models/gemma4-26b/model.litertlm")

# UPDATE: Give AGY-SDK a workspace to write files
WORKING_DIR = os.path.expanduser("~/agy-test")

os.makedirs(WORKING_DIR, exist_ok=True)
os.chdir(WORKING_DIR)

async def main():
  print(f"Using local LiteRT model: {MODEL_PATH}. Please wait for local inference to complete. This could take several minutes.")

  config = LiteRTAgentConfig(
     model_path=MODEL_PATH,
     workspaces=[WORKING_DIR],
     policies=[policy.allow_all()],
  ).lightweight()

  async with Agent(config) as agent:
     response = await agent.chat(PROMPT)
     async for token in response:
        print(token, end="", flush=True)

if __name__ == "__main__":
  asyncio.run(main())

Python

已复制

Antigravity SDK 还通过 LocalOpenAIAgentConfig 为任何兼容 OpenAI 的服务器(如 Ollama、LM Studio 或 vLLM)提供无缝的即插即用支持。这让你能够灵活地尝试不同的本地推理后端,同时保持你的智能体编排、工具和工作流完全不变。

通过查看 Antigravity Python SDK README 中的说明来开始使用本地 AI,并了解如何使用 LiteRT 在边缘高效运行模型。请在 Antigravity Python SDK GitHub Issue Tracker 上分享你的反馈和功能请求。我们期待看到你构建的作品!

致谢:Abhi Patel、Ander Dobo、Ben Miles、Cormac Brick、Ian Ballantyne、Jingxiao Zheng、Jonathan Reay、Kimish Patel、Lu Wang、Marissa Ikonomidis、Matthias Grundmann、Olivier Lacombe、Omar Sanseviero、Rishika Sinha、Rody Davis、Taylor Mullen、Tyler Mullen、Wai Hon Law、Xiaoming Hu、Xu Chen、Yu-hui Chen

上一篇

下一篇

来源:Google Developers Blog · developers.googleblog.com