Google 发布 PaliGemma 模型家族,整合 SigLIP 视觉编码器和 Gemma 语言解码器,明确定位为微调基础而非通用聊天机器人,提供多种规格(2B-27B)。
Google 发布 PaliGemma 模型家族,为视觉语言任务提供了一个强大的新组件。最关键的一点是:它们并非通用的多模态聊天机器人,而是专为 fine-tuning 设计、具备良好适应能力的开源基础模型。如果你正在针对某项特定的视觉任务构建系统,那么应该把 PaliGemma 当作起点,而不是可以直接使用的成品。
PaliGemma 是一个视觉语言模型(VLM)家族,结合了两个强大的开放组件:SigLIP 视觉编码器和 Gemma 语言解码器。它的架构很直观:SigLIP 模型先将图像处理成一系列 token,再把这些 token 放到文本 prompt 的 token 前面,一并输入 Gemma 模型,最终生成文本输出。
这些模型提供了多种规模和版本。最初的 PaliGemma 基于 Gemma 2B 模型,而较新的 PaliGemma 2 家族采用了更大的 Gemma 2 骨干模型,最大版本达到 270 亿参数。它们发布了几种不同类型的 checkpoint:
PT(Pretrained):基础模型,用作针对具体下游任务进一步 fine-tuning 的起点。不建议未经调优就直接使用。
Mix:这些 checkpoint 已经在多个学术数据集的混合数据上完成 fine-tuning。它们可以开箱即用地处理一些常见场景,例如基础 VQA 或目标检测,同时也能很好地展示 PT 模型的能力。
尤为重要的是,PaliGemma 模型还使用了多种图像分辨率进行训练,通常包括 224×224、448×448 和 896×896 像素。对于需要识别精细细节的任务,例如读取图像中的文字,更高的分辨率会带来更好的表现,但计算成本也会随之增加。
对于开发者来说,最需要理解的一点是:PaliGemma 并不是为对话场景设计的。它是一种单轮 VLM,针对这样的流程进行了优化:接收一张图像和一个文本 prompt,然后直接生成文本响应。当使用 "detect" 或 "segment" 这类特定任务前缀进行条件引导时,它尤其擅长完成对应任务。
它的主要用途,是作为一个紧凑、便于迁移的基础模型来进行 fine-tuning。这一点与面向通用任务、针对聊天优化的模型有着显著区别。你不必费力设计完美的 few-shot prompt,去说服一个庞大的通用模型完成特定视觉任务;PaliGemma 所倡导的工作流,是在为你的需求量身定制的数据集上对模型进行 fine-tuning。对于下面这些专业应用,这种方式通常更稳健、更高效,性能也更好:
视觉问答(VQA)
目标检测与分割
光学字符识别(OCR)
文档理解
你可以通过 Hugging Face 的 transformers 库直接使用 PaliGemma。配置过程需要使用 PaliGemmaProcessor,它对图像处理器和 tokenizer 进行了便捷封装。
准备 fine-tuning 数据时,可以将答案作为 suffix 传给 processor。这样一来,processor 会在训练过程中自动为模型生成符合要求的 labels。
下面是一段概念性代码,展示了如何准备单条训练样本:
from transformers import PaliGemmaProcessor
# Load the processor for your chosen model checkpoint
model_id = "google/paligemma-3b-pt-224"
processor = PaliGemmaProcessor.from_pretrained(model_id)
# Your training data
image = load_your_image("path/to/image.jpg")
prompt = "What is in this image?"
answer = "a pallas cat"
# The processor prepares image, text, and labels (from the suffix)
inputs = processor(
images=image,
text=prompt,
suffix=answer,
return_tensors="pt"
)
# These 'inputs' are now ready to be passed to the model during your fine-tuning loop
# inputs['pixel_values'], inputs['input_ids'], inputs['attention_mask'], inputs['labels']
这套工作流清楚地表明,该模型的设计目标是学习从一张图像和一个具体问题,到一种具体答案格式之间的映射——而这正是生产系统所需要的能力。
PaliGemma 这类开放、高质量基础模型的发布,改变了构建视觉功能时的成本与收益权衡。你不必再依赖一连串脆弱的 prompt 去驱动某个闭源通用模型,而是有了一条更直接的工程实现路径。
在你的下一个项目中,如果涉及某项具体的视觉语言任务——无论是文档分析、UI 组件检测,还是商品分类——都不要从聊天机器人开始,而应从 PaliGemma 的 pretrained checkpoint 开始。与其费力调整 prompt,让一个庞大的通用模型完成任务,对更小、更专业的模型进行 fine-tuning,几乎总能获得更加可靠且更具成本效益的结果。
Google AI 开发者资源:PaliGemma
Hugging Face 博客:PaliGemma
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。