Google 发布 Gemma 2 2B、ShieldGemma 与 Gemma Scope
Google 在 Gemma 2 发布一个月后扩充模型阵容,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版),适合端侧使用,并可与 Gemma 2 27B 搭配做辅助生成,官方称可获得最高 3 倍加速且不损失质量。
推荐理由:Gemma 2 新增 2B 小模型与安全分类器、可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。
公司与模型
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
192 条精选近 30 天 41 条共收录 602 条
Google 在 Gemma 2 发布一个月后扩充模型阵容,新增 2.6B 参数的 Gemma 2 2B(含 base 与指令微调版),适合端侧使用,并可与 Gemma 2 27B 搭配做辅助生成,官方称可获得最高 3 倍加速且不损失质量。
推荐理由:Gemma 2 新增 2B 小模型与安全分类器、可解释性工具,读者可据此判断端侧部署与内容审核的可用选项。
Mistral AI 发布 Mistral Large 2,参数规模 123B,支持 128k 上下文窗口和数十种语言,可在单节点上实现大吞吐推理。官方称其在 MMLU 上达到 84.0% 准确率,代码与推理表现与 GPT-4o、Claude 3 Opus、Llama 3 405B 相当,并针对减少幻觉和指令遵循做了优化。
推荐理由:Mistral Large 2 以 123B 参数实现单节点高吞吐,并给出与 GPT-4o、Claude 3 Opus 的对比数据,便于判断开源模型的性能成本位置。
Google 发布开源大模型 Gemma 2,提供 9B 和 27B 两个参数规模,各有预训练基础版与指令微调版,上下文长度 8K tokens,采用与初代相同的宽松许可,允许再分发、微调和商用。
推荐理由:原文给出 Gemma 2 的两种参数规模、训练数据量与评测对比,可据此判断开源小模型的能力位置。
Gemini API 更新中,Gemini 1.5 Pro 的 2M 上下文窗口从预览转为正式可用(GA)。同时 API 新增对代码执行的支持。
推荐理由:Gemini 1.5 Pro 的 2M 上下文窗口转为正式可用,并新增代码执行能力,读者可据此判断长上下文与代码任务的可用边界。
Gemini 1.5 Pro(gemini-1.5-pro-001)和 Gemini 1.5 Flash(gemini-1.5-flash-001)均已正式可用(GA)。
推荐理由:Gemini 1.5 Pro 与 1.5 Flash 从预览转为正式可用,读者可据此确认生产环境可用的模型版本。
Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像与文本并输出文本。
推荐理由:Google 开源视觉语言模型 PaliGemma 的完整发布说明,含架构、三种 checkpoint 与微调路径,便于判断适用场景。
Gemini API 更新为 Gemini 1.5 Pro 引入 2M 上下文窗口(候补名单),并为 Gemini 1.0 Pro 引入按量计费,Gemini 1.5 Pro 和 Gemini 1.5 Flash 的计费即将跟进。同时提高了即将推出的 Gemini 1.5 Pro 付费层级的速率限制,File API 新增内置视频支持和纯文本支持,并支持并行函数调用,可一次返回多个调用。
推荐理由:Gemini API 一次性给出 2M 上下文、按量计费和并行函数调用等变化,可据此判断开发者能做什么。
Google 发布 CodeGemma 代码专用模型系列,基于预训练的 2B 和 7B Gemma checkpoint 继续训练 5000 亿 token,包含 2B 基座、7B 基座和 7B instruct 三个开源版本,上下文均为 8K token。
推荐理由:CodeGemma 三个规格的定位、基准对比和 FIM 提示格式都写清了,可据此判断它适合哪类代码补全场景。
Google 在 Gemini API 中发布 Gemini 1.5 Pro(gemini-1.5-pro-latest)预览版,并推出新的文本嵌入模型 text-embeddings-004,支持 768 以下的弹性嵌入维度。
推荐理由:Gemini 1.5 Pro 预览版与新版嵌入模型同步上线,并补齐多模态提示、文件 API 等接口能力。
Google 发布开源大模型系列 Gemma,包含 2B 和 7B 两个尺寸,各有基础版和指令微调版,上下文长度 8K tokens,可运行在消费级硬件上。Hugging Face 宣布全面支持,提供 Transformers 集成、Google Cloud 与 Inference Endpoints 部署,以及用 TRL 在单卡上微调的示例。
推荐理由:Google 开源 Gemma 系列并同步接入 Hugging Face 生态,读者可了解其规格、许可与部署路径。
Google 在 Gemini API 中发布 gemini-pro 文本模型、gemini-pro-vision 多模态模型和 embedding-001 嵌入模型,另推出基于文本段落作答的 aqa 模型。
推荐理由:Gemini API 首批模型与接口同日开放,读者可据此了解 gemini-pro、多模态版本和嵌入模型的初始能力边界。
OpenAI 与 DeepMind 安全团队合作开发了一种算法,通过让人类指出两种候选行为中哪一个更好,来推断人类想要的目标。OpenAI 称,构建安全 AI 系统的一步是免去人类手写目标函数,因为用简单代理替代复杂目标或把复杂目标写偏一点,都可能导致不良甚至危险的行为。
推荐理由:OpenAI 与 DeepMind 安全团队提出用人类偏好比较替代手写目标函数,为对齐研究提供了一条早期思路。