Antigravity SDK 新增本地 AI 模型支持,首发适配 Gemma 4 26B A4B
Introducing Support for Local AI Models in the Antigravity SDK
Google 宣布 Antigravity SDK 支持本地模型工作流,首发通过 Google AI Edge 的 LiteRT 支持 Gemma 4 26B A4B,可完全离线运行智能体。
官方给出本地模型接入 Antigravity SDK 的完整配置与混合编排示例,可据此评估离线智能体工作流的落地方式。
2026年9月23日
今天,我们宣布 Antigravity SDK 支持跨多种本地模型和执行选项的本地工作流,并初步支持使用 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B。
Antigravity SDK 让开发者能够使用驱动 Google Antigravity 的相同智能体能力进行构建。借助这一新支持,你可以完全离线地通过本地模型启用智能体辅助。我们针对 LiteRT 和 Gemma 4 26B 优化了这一工作流,高效利用本地 GPU 和 RAM,进一步放大你本地机器的能力!
为什么要在本地运行智能体?
本地模型执行可为智能体体验带来多项优势:
- 成本效益:执行本地智能体工作流,无需 API 费用或速率限制。
- 隐私:将你的代码和请求完全保留在本地机器上,非常适合面临严格数据隐私要求或合规受限企业环境的开发者。
- 离线韧性:即使在无法获得持续或稳定互联网连接的环境中,也能无缝执行你的智能体工作流。
- 混合工作流:将节省 token 的本地流程与基于云的流程相结合,以最大化效率,同时在需要时仍可使用更大、更强大的模型。
以下是如何开始:(我们推荐使用显存或统一内存 >24GB 的机器)。
创建虚拟环境:
python3 -m venv .venv
source .venv/bin/activatePython
已复制
安装 Antigravity SDK 和 LiteRT-LM,并下载 Gemma 4 26B A4B:
pip install google-antigravity litert-lm
litert-lm import \
--from-huggingface-repo=litert-community/gemma-4-26B-A4B-it-litert-lm \
gemma-4-26B-A4B-it-gpu.litertlm \
gemma4-26bPython
已复制
在你的目录中创建一个名为 agy_sample.py 的文件。将以下内容粘贴到其中。
import asyncio
import os
from google.antigravity import Agent, LiteRTAgentConfig
from google.antigravity.hooks import policy
# UPDATE: Point to the locally downloaded model from the previous step (litert-lm import ...)
MODEL_PATH = os.path.expanduser("~/.litert-lm/models/gemma4-26b/model.litertlm")
async def main():
print(f"Using local LiteRT model: {MODEL_PATH}. Please wait for local inference to complete. This could take several minutes.")
config = LiteRTAgentConfig(model_path=MODEL_PATH).lightweight()
async with Agent(config) as agent:
response = await agent.chat("What files are in the current directory?")
async for token in response:
print(token, end="", flush=True)
if __name__ == "__main__":
asyncio.run(main())Python
已复制
混合编排:云端架构师遇上设备端工作团队
在许多情况下,我们发现架构师-构建者模式是结合云模型规模与本地模型优势的绝佳方式。在下方使用更新后的 Antigravity SDK 构建的混合演示视频中,云端架构师(Gemini 3.8 Flash)充当规划者和指挥者,而由 Gemma 4 26B 实例组成的本地集群则完全在设备端承担繁重工作。
当任务是对三个存在漏洞的模块(auth.py、billing.py 和 database.py)进行审计和修补时,该工作流保持了严格的数据隐私,并让我们能够最大限度地利用 token:
- 不上传代码:Gemini 3.8 Flash 仅根据文件名和任务描述来规划策略并分解工作——仅消耗 95 个云端 token,且源代码从未离开本机。
- 自主本地挑战:本地 Gemma 4 26B 模型接管本地 GPU,执行对抗性审计循环:复现安全漏洞、编写候选修复、评审补丁,并针对回归测试套件进行验证。
- 巨大的成本和隐私收益:在本次记录的运行中,97.2% 的 token(3,322 个 token)在本地离线运行,未调用云端 API,在将专有代码完全安全地保留在设备端的同时,交付了经过全面验证的绿色补丁。
查看示例项目此处,运行内置的三文件挑战,或将其指向你自己的 Python 模块和测试套件。
抱歉,你的浏览器不支持此视频播放
免 token 本地实用工具:CLI 资源监视器
搭载 Gemma 4 26B A4B 的 Antigravity SDK 擅长构建实用的系统工具。在本示例中,智能体构建了一个在终端中运行的实时更新的资源监视器。只需一条提示,智能体就会自主编写一个使用 psutil 和 rich 库来跟踪 CPU 和内存使用情况的 Python 脚本,生成必要的 requirements.txt 文件,甚至测试生成的代码以确保其正常工作——所有这些都完全在你的本地机器上运行,并使用 Gemma 4 26B。
抱歉,你的浏览器不支持此视频的播放
一个基于 Python 的 CLI 资源监视工具,使用 Gemma 4 26B 在设备上生成
## cli_resource_monitor.py
import asyncio
import os
from google.antigravity import Agent, LiteRTAgentConfig
from google.antigravity.hooks import policy
# UPDATE: Your prompt
PROMPT = "Build a command-line interface tool using the psutil and rich libraries that displays a live-updating terminal dashboard. It should show CPU usage, memory consumption, and a sorted table of the top 5 most memory-intensive processes. Save the script as 'monitor.py' and create a 'requirements.txt' file. Test that it works."
# UPDATE: Point to the locally imported LiteRT-LM model path
MODEL_PATH = os.path.expanduser("~/.litert-lm/models/gemma4-26b/model.litertlm")
# UPDATE: Give AGY-SDK a workspace to write files
WORKING_DIR = os.path.expanduser("~/agy-test")
os.makedirs(WORKING_DIR, exist_ok=True)
os.chdir(WORKING_DIR)
async def main():
print(f"Using local LiteRT model: {MODEL_PATH}. Please wait for local inference to complete. This could take several minutes.")
config = LiteRTAgentConfig(
model_path=MODEL_PATH,
workspaces=[WORKING_DIR],
policies=[policy.allow_all()],
).lightweight()
async with Agent(config) as agent:
response = await agent.chat(PROMPT)
async for token in response:
print(token, end="", flush=True)
if __name__ == "__main__":
asyncio.run(main())Python
已复制
Antigravity SDK 还通过 LocalOpenAIAgentConfig 为任何兼容 OpenAI 的服务器(如 Ollama、LM Studio 或 vLLM)提供无缝的即插即用支持。这让你能够灵活地尝试不同的本地推理后端,同时保持你的智能体编排、工具和工作流完全不变。
通过查看 Antigravity Python SDK README 中的说明来开始使用本地 AI,并了解如何使用 LiteRT 在边缘高效运行模型。请在 Antigravity Python SDK GitHub Issue Tracker 上分享你的反馈和功能请求。我们期待看到你构建的作品!
致谢:Abhi Patel、Ander Dobo、Ben Miles、Cormac Brick、Ian Ballantyne、Jingxiao Zheng、Jonathan Reay、Kimish Patel、Lu Wang、Marissa Ikonomidis、Matthias Grundmann、Olivier Lacombe、Omar Sanseviero、Rishika Sinha、Rody Davis、Taylor Mullen、Tyler Mullen、Wai Hon Law、Xiaoming Hu、Xu Chen、Yu-hui Chen
上一篇
下一篇
来源:Google Developers Blog · developers.googleblog.com