Gemini API 文件搜索升级为多模态
Google Gemini 支持在搜索中处理图片、视频等多种格式。对构建 RAG 应用的开发者有直接帮助。
Google Gemini 支持在搜索中处理图片、视频等多种格式。对构建 RAG 应用的开发者有直接帮助。
我们将为 Gemini API File Search 工具推出三项重大更新:多模态支持、自定义元数据和页面级引用。这些功能可以帮助开发者为非结构化数据建立结构,从而实现高效、可验证的 RAG。
Google DeepMind 产品经理
你的浏览器不支持音频元素。
今天,我们扩展了 Gemini API 的 File Search 工具。现在,你可以使用多模态数据和自定义元数据构建检索增强生成(RAG)系统。我们还推出了页面引用功能,以提升生成内容的事实依据和透明度。
无论你是在为周末项目制作原型,还是在扩展一款服务数千名用户的生产应用,你的 RAG 系统现在都能原生处理文本和视觉数据,并以更好的方式组织这些数据。
File Search 现在可以同时处理图片和文本。借助 Gemini Embedding 2 模型,该工具能够理解原生图片数据,让你的 Agent 具备上下文感知能力。
设想一家创意机构需要找出某个特定的视觉素材。你的应用不再需要依赖关键词或文件名,而是可以根据自然语言需求简报中描述的特定情绪基调或视觉风格,在整个素材库中搜索匹配的图片。
来看看开发者已经如何使用这项功能:
把文件一股脑丢进数据库很容易。真正的挑战,是在数据规模扩大后找到正确的文件。自定义元数据允许你为非结构化数据添加键值标签,例如 department: Legal 或 status: Final。
通过在查询时应用元数据过滤器,你的应用可以将请求限定在所需的数据范围内。这能显著减少无关文档带来的噪声,同时提升 RAG 工作流的速度和准确性。
当你的应用从一份庞大的 PDF 中提取答案时,用户需要准确验证这个答案来自哪里。
File Search 现在可以将模型的响应直接关联到原始来源。它会记录每条索引信息所在的页码。如此细致的定位能力,可以让你将用户直接引导到正确的位置,不仅有助于建立信任,还能让你的工具立即适用于严谨的事实核查。
我们希望尽可能简化数据的存储和检索,让这些数据真正为你的创意服务。File Search 工具会处理繁重的基础设施工作,让你可以专注于构建产品。
上传文件并在其中进行搜索非常简单:
from google import genai
client = genai.Client()
# Initialize a multimodal file store
store = client.file_search_stores.create(
config={
"display_name": "my-knowledge-base",
"embedding_model": "models/gemini-embedding-2"
}
)
print(f"Created store: {store.name}")
# Upload documents and images
operation = client.file_search_stores.upload_to_file_search_store(
file="example.png",
file_search_store_name=store.name,
config={"display_name" : "my example image"}
)
# Now the system can search across your files
response = client.models.generate_content(
model="gemini-3-flash-preview",
contents="What files are in my knowledge base?",
config={
"tools": [{
"file_search": {
"file_search_store_names": [file_search_store.name]
}
}]
}
)
print(response.text)
你可以在开发者指南和 Gemini API 文档中查看更多代码片段,了解如何使用 File Search 构建应用。