展示如何用Llama 3.2-Vision进行高精度OCR识别,支持11B和90B模型本地部署。有具体可复现的应用场景。
Llama 3.2-Vision 是一款多模态大语言模型,提供 11B 和 90B 两种规模,能够同时处理文本和图像输入,并生成文本输出。该模型擅长视觉识别、图像推理、图像描述以及回答与图像相关的问题,在多项行业基准测试中超越了现有的开源和闭源多模态模型。
本文将介绍如何调用由 Ollama 运行的 Llama 3.2-Vision 11B 模型服务,并使用 Ollama-OCR 实现图像文字识别(OCR)功能。
🚀 使用 Llama 3.2-Vision 模型进行高精度文字识别
📝 保留原始文本的格式和结构
🖼️ 支持多种图像格式:JPG、JPEG、PNG
⚡️ 支持自定义识别 prompt 和模型
🔍 可选择 Markdown 输出格式
💪 完善的错误处理机制
在开始使用 Llama 3.2-Vision 之前,你需要先安装 Ollama。Ollama 是一个支持在本地运行多模态模型的平台。请按照以下步骤完成安装:
下载 Ollama:访问 Ollama 官方网站,下载与你的操作系统对应的安装包。
安装 Ollama:根据下载的安装包,按照提示完成安装。
安装 Ollama 后,可以使用以下命令安装 Llama 3.2-Vision 11B 模型:
ollama run llama3.2-vision
npm install ollama-ocr
# or using pnpm
pnpm add ollama-ocr
import { ollamaOCR, DEFAULT_OCR_SYSTEM_PROMPT } from "ollama-ocr";
async function runOCR() {
const text = await ollamaOCR({
filePath: "./handwriting.jpg",
systemPrompt: DEFAULT_OCR_SYSTEM_PROMPT,
});
console.log(text);
}
输出:Llama 3.2-Vision 多模态大语言模型(LLM)系列是一组经过指令微调的图像推理生成模型,提供 118 和 908 两种规模(输入文本和图像,输出文本)。经过指令微调的 Llama 3.2-Vision 模型针对视觉识别、图像推理、图像描述以及回答有关图像的一般性问题进行了优化。在常见的行业基准测试中,这些模型的表现优于许多现有的开源和闭源多模态模型。
import { ollamaOCR, DEFAULT_MARKDOWN_SYSTEM_PROMPT } from "ollama-ocr";
async function runOCR() {
const text = await ollamaOCR({
filePath: "./trader-joes-receipt.jpg",
systemPrompt: DEFAULT_MARKDOWN_SYSTEM_PROMPT,
});
console.log(text);
}
async function runOCR() {
const text = await ollamaOCR({
model: "minicpm-v",
filePath: "./handwriting.jpg.jpg",
systemPrompt: DEFAULT_OCR_SYSTEM_PROMPT,
});
console.log(text);
}
ollama-ocr 使用的是本地 Vision 模型。如果你想使用在线的 Llama 3.2-Vision 模型,可以尝试 llama-ocr 库。
部分评论可能只有登录后的访客才能看到。登录后即可查看全部评论。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。