跳到正文
Hugging Face Blog·· 2025-02-20精选AI 评分62

Hugging Face 发布 SmolVLM2 视频理解模型,含 2.2B、500M 和 256M 三个尺寸

SmolVLM2: Bringing Video Understanding to Every Device

AI 导读

Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 2.2B、500M 和 256M 三个参数规模,并称 500M 与 256M 是迄今最小的视频语言模型。

推荐理由

Hugging Face 发布三档小尺寸视频理解模型,并给出端侧与 MLX 的可用路径,可据此判断小模型做视频理解的实际边界。

来源:Hugging Face Blog · huggingface.co