Google 提出可证明隐私洞察 PPI,用 LLM 与差分隐私分析 GenAI 使用数据
Google Research 提出可证明隐私洞察(PPI),结合 LLM、差分隐私(DP)和可信执行环境(TEE),在保证个体数据不可被查看、聚合结果匿名的前提下分析 GenAI 使用数据。
Google Research 提出可证明隐私洞察(PPI),结合 LLM、差分隐私(DP)和可信执行环境(TEE),在保证个体数据不可被查看、聚合结果匿名的前提下分析 GenAI 使用数据。
Google Research 发布 StreetReaderAI,一个基于 Gemini 的街景无障碍原型,通过 AI Describer 和 AI Chat 为盲人及低视力用户实时生成道路、路口和地点的语音描述,并支持语音或键盘漫游全景图像。
Google 公布基于 Gemini 模型的个人健康教练构建方式,采用多智能体框架协调对话、数据科学与领域专家子智能体,对睡眠和活动等生理时间序列数据做数值推理。
推荐理由:Google 公开了健康教练的技术路径,包括多智能体分工与 SHARP 评估框架,可了解 Gemini 在健康场景的落地方式。
Google 发布 EmbeddingGemma,一款面向端侧场景的多语言嵌入模型,308M 参数、2K 上下文窗口,支持 100 多种语言,量化后内存占用低于 200MB。
推荐理由:原文给出 308M 参数、2K 上下文与量化后 200MB 内存等指标,可据此判断端侧多语言检索的可用边界。
Gemma 3n 从 Google I/O 的预览版转为正式发布,已在 transformers、timm、MLX、llama.cpp、transformers.js、ollama 等主流开源库上线。
推荐理由:Gemma 3n 正式开源并接入主流推理库,读者可据此了解端侧多模态模型的硬件门槛与部署路径。
Google 发布 Gemma 3 系列开放权重模型,包含 1B、4B、12B、27B 四种尺寸,均有预训练和指令微调版本。4B、12B、27B 支持图像与文本输入及 140 多种语言,上下文窗口从 Gemma 2 的 8k 提升至 128k(1B 为 32k)。
推荐理由:梳理 Gemma 3 的四种尺寸、多模态与 128k 上下文等规格,并给出 transformers 与端侧推理的可用路径。
Google 发布 SigLIP 2 多语言视觉语言编码器系列,在 SigLIP 的 sigmoid loss 基础上加入解码器、自蒸馏 Global-Local Loss 与 Masked Prediction Loss 等训练目标,在零样本分类、图文检索和视觉表征迁移上均优于前代。
Google 发布 PaliGemma 2 Mix,这是基于 SigLIP 和 Gemma 2 的微调视觉语言模型,覆盖 OCR、长短描述、视觉问答、目标检测与图像分割等任务。模型提供 3B、10B、28B 三种参数规模和 224、448、896 三种分辨率,支持 HF Transformers 与 JAX 框架,并已上线 demo。
Artificial Analysis 发布 Big Bench Audio,一个从 Big Bench Hard 改编的音频推理评测数据集,含 1000 道音频题,覆盖 Formal Fallacies、Navigate、Object Counting、Web of Lies 四类各 250 题。
Hugging Face 在 Google Cloud 的 N2 与 C4 实例上基准测试了文本嵌入和文本生成两类智能体 AI 负载,C4 的文本嵌入吞吐量是 N2 的 10x 至 24x,文本生成吞吐量是 N2 的 2.3x 至 3.6x。
Google 发布新一代视觉语言模型 PaliGemma 2,用 Gemma 2 替换前代的文本解码器,保留 SigLIP 图像编码器,提供 3B、10B、28B 三种参数规模,均支持 224x224、448x448、896x896 三种输入分辨率,而前代 PaliGemma 仅有 3B 版本。
推荐理由:Google 开源视觉语言模型 PaliGemma 2 提供 3B 到 28B 多规格与三种分辨率,读者可据此判断微调选型空间。
Hugging Face 博客发布 Judge Arena,一个让用户对两个 LLM 裁判的评分和理由进行投票对比的平台,投票结果汇总为 Elo 排行榜并每小时更新。
CGIAR 与 Digital Green 在 Hugging Face 专家支持下为农业问答机器人 Farmer.chat 搭建了 LLM-as-a-Judge 评估体系,用于衡量 RAG 回答的质量、简洁度与准确性。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 logits processor 为 AI 生成文本加水印,并用分类器检测。
推荐理由:原文给出了水印的配置参数、检测器训练流程与已知局限,读者可据此判断该方案在自家生成链路中的落地条件。
Hugging Face 发布教程,介绍如何在 Google Cloud Vertex AI 上以 FP8 量化版本部署 Meta Llama 3.1 405B Instruct,运行于配备 8 块 H100 GPU 的 A3 节点,并使用 Text Generation Inference(TGI)与 Hugging Face 深度学习容器(DLC)。
Google 在 Gemma 2 发布一个月后扩充模型阵容,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版),适合端侧使用,并可与 Gemma 2 27B 搭配做辅助生成,官方称可获得最高 3 倍加速且不损失质量。
推荐理由:Gemma 2 新增 2B 小模型与安全分类器、可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。
Mistral AI 发布 Mistral Large 2,参数规模 123B,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上达到 84.0% 准确率,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并针对减少幻觉和指令遵循做了优化。
推荐理由:Mistral Large 2 以 123B 参数实现单节点高吞吐,并给出与 GPT-4o、Claude 3 Opus 的对比数据,便于判断开源模型的性能成本位置。
Hugging Face 与 KerasHub 实现共享模型保存格式,Hub 上 300K+ 个 Transformers 模型现可直接加载进 KerasHub,首批支持 Gemma 1/2、Llama 3 和 PaliGemma。KerasHub 模型可在 TensorFlow、JAX、PyTorch 后端间无缝切换,需将 keras 升级至 3.3.3 以上。
Hugging Face 宣布其 Inference Endpoints 和 Spaces 现已支持 Google Cloud TPU v5e,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Google 发布开源大模型 Gemma 2,提供 9B 和 27B 两个参数规模,各有预训练基础版与指令微调版,上下文长度 8K tokens,采用与初代相同的宽松许可,允许再分发、微调和商用。
推荐理由:原文给出 Gemma 2 的两种参数规模、训练数据量与评测对比,可据此判断开源小模型的能力位置。
Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。
推荐理由:Google 开源视觉语言模型 PaliGemma 的完整发布说明,含架构、三种 checkpoint 与微调路径,便于判断适用场景。
Hugging Face 推出 Deploy on Google Cloud 集成,可将数千个开源模型一键部署到 Google Cloud 的 Vertex AI 或 GKE,作为自有账号内的 API Endpoint。
Google 发布 CodeGemma 代码专用模型系列,基于预训练的 2B 和 7B Gemma checkpoint 继续训练 5000 亿 token,包含 2B 基座、7B 基座和 7B instruct 三个开源版本,上下文均为 8K token。
推荐理由:CodeGemma 三个规格的定位、基准对比和 FIM 提示格式都写清了,可据此判断它适合哪类代码补全场景。
Hugging Face 发布教程,介绍如何用 Transformers 和 PEFT 库对 Google DeepMind 的开源模型 Gemma(2B 和 7B 参数)进行参数高效微调(PEFT)。
Google 发布开源大模型系列 Gemma,包含 2B 和 7B 两个尺寸,各有基础版和指令微调版,上下文长度 8K tokens,可运行在消费级硬件上。Hugging Face 宣布全面支持,提供 Transformers 集成、Google Cloud 与 Inference Endpoints 部署,以及用 TRL 在单卡上微调的示例。
推荐理由:Google 开源 Gemma 系列并同步接入 Hugging Face 生态,读者可了解其规格、许可与部署路径。
Hugging Face 宣布与 Google Cloud 建立战略合作,围绕开放科学、开源、云和硬件展开协作,帮助企业在 Hugging Face 开放模型与 Google Cloud 的 Vertex AI、TPU 等基础设施上构建自己的 AI。
Hugging Face 发布 aMUSEd,一个基于掩码图像建模(MIM)的非扩散文生图模型,是对 Google MUSE 的开源复现,采用宽松许可证并以研究预览形式发布。
OpenAI 联合 Anthropic、Google 和 Microsoft 宣布 Frontier Model Forum 新任执行董事,并设立 1000 万美元 AI 安全基金。该论坛由上述四家公司共同推进,此次更新聚焦于治理层人事与安全资金投入。
Hugging Face Diffusers 现已支持使用 JAX 在 Cloud TPU 上部署 SDXL,实现高性能、低成本的推理。演示运行在多个 TPU v5e-4 实例上,约 4 秒生成四张 1024×1024 图像,其中实际生成时间约 2.3 秒。
OpenAI 联合组建新的行业机构 Frontier Model Forum,旨在推动前沿 AI 系统的安全与负责任开发。该论坛将推进 AI 安全研究、制定最佳实践与标准,并促进政策制定者与行业间的信息共享。
Hugging Face 展示了如何将 🤗 Transformers 中的 ViT B/16 模型部署到 Google Cloud 的 Vertex AI 平台,用比 Kubernetes 方案更少的代码实现同等扩展能力。
Hugging Face 发布教程,讲解如何用 Docker 和 Kubernetes 将本地部署的 Vision Transformer(ViT)模型扩展为可服务多用户的线上服务。流程包括用 TensorFlow Serving 基础镜像容器化 SavedModel,再部署到 Google Kubernetes Engine(GKE)集群,代码已开源。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 曾任 Google 伦理 AI 团队创始人兼联合负责人,现于 Hugging Face 负责伦理 AI 研究协议与包容性招聘。她因在微软 Seeing AI 项目中目睹模型将爆炸场景描述为"美丽景色"而转向伦理 AI,并指出 ML 团队普遍缺乏对偏见概念的认知与沟通词汇。
Google AI Language 于 2018 年推出 BERT,这一基于 Transformer 的双向编码器模型可同时处理 11+ 种常见 NLP 任务,并在多项任务上超越此前模型。
Hugging Face 发布教程,演示如何用 🤗 datasets 加载 beans 图像分类数据集,并借助 🤗 transformers 微调预训练的 google/vit-base-patch16-224-in21k 模型。ViT 由 Google Brain 团队于 2021 年 6 月提出,将图像切分为子图块并嵌入为 token 序列后送入 Transformer 训练。
Hugging Face 在 Transformers 库中加入 Perceiver IO,这是首个可处理文本、图像、音频、视频、点云及其组合的 Transformer 类模型,并随附示例 Space 与 notebook。
推荐理由:Hugging Face 把 Perceiver IO 接入 Transformers,读者可了解这套架构如何用 latent 空间统一处理文本、图像、音频与光流。
Hugging Face 在社区周期间用 10 亿句对训练出 SOTA 句嵌入模型,硬件为 7 块 TPU v3-8,并获 Google Flax、JAX 与 Cloud 团队指导。训练采用对比学习与 in-batch negatives(InfoNCE/NTXentLoss),通过增大 batch、引入 hard negatives 和跨数据集批次提升质量。所有模型与数据集已在模型卡中公开。
Hugging Face 发文详解 BigBird 的块稀疏注意力机制,该模型通过滑动注意力、全局 token 和随机 token 三种方式近似 BERT 的完整注意力,可处理长达 4096 的序列,计算成本远低于 BERT,并已在长文档摘要、长上下文问答等任务上取得 SOTA。BigBird 的 RoBERTa 类模型现已集成到 Transformers 中。
社区成员 Maxence Dominici 在 Google Cloud 上部署了基于 DistilBERT base uncased finetuned SST-2 的情感分析 pipeline,用于自动判断 Discord 中客户评论的正负向。
Hugging Face 与 PyTorch / XLA 团队合作,让用户通过相同的 Trainer 接口在 Cloud TPU 上训练和扩展 Transformer 模型。