前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9278
  • 微软MAI-Code-1.1-Flash:代码能力涨22%,价格降至1/4
  • AI Agent可观测性:推理链追踪、工具日志与结果归因
  • AI Agent 擅自改写正常代码?一条规则解决
  • AI Agent安全隔离实践指南
  • LLM输出验证层设计方法
  • O(k)响应式:变更复杂度与图大小解耦
  • 为 LLM 输出搭建快照回归测试:模型被偷偷换底也能发现
  • 30天用AI Agent建50个表单:46%需人工修复的教训
  • 白名单救了我的生产数据:AI安全边界设计实录
  • 优化 LLM 内存占用:KV 缓存、量化与 MoE 架构实战
  • Docker YOLO 模式:为 AI 编码 Agent 打造 microVM 沙箱
  • AI数据库助手实战:从自然语言到SQL查询
  • 多模型路由设计:一张 OpenAI 兼容端点搞定 ticket 分类与升级
  • LLM Guard 归档:主流 AI 安全护栏工具横评
  • AI安全审计工具BugZ:流式AST修复,三天151用户
  • 统一 API 密钥审核:跨 OpenAI/Claude/Gemini 结构化输出
  • Figma 将 Dev Mode 重构为 MCP 服务器,定价下调只是配套动作
  • Web 访问 API 可复现基准测试的五层设计方案
  • AI编程时代:代码审查取代代码编写成为瓶颈
  • AI Agent 运行机制深度解析:工具调用、记忆与循环
  • HuggingFace Transformers 5.0稳定支持多模态
  • 长音频转录后结构化提取的字段级精度优化
  • LoCoMo 99.95%背后:参数化记忆的架构意义
  • MCP服务器SSRF漏洞防护指南
  • Backboard CLI登顶Terminal-Bench测评
  • 小团队Terminal-Bench得分超越Claude Code和Codex
  • GPT-5.6三档深度解析:Sol/Terra/Luna如何选
  • LLM工具调用安全:给Agent赋权而不泄密
  • 英伟达开源Nemotron 3.5 Lightning:30B MoE模型,推理速度提升4倍
  • 最低价长上下文Chatbot API实测:以真实工单评估质量
  • PostgreSQL MCP 结果限制:无声截断如何让样本变成谎言
  • AI 数据库返回正确答案仍可能不完整:完整性契约设计
  • GitHub Copilot JetBrains 版:Ollama 本地推理与记忆的隐私边界
  • 微软8月补丁修复398个漏洞,含已遭利用的Win驱动零日
  • GitHub README中的提示注入攻击实测
  • BuildIt:强制要求解释AI代码后才能合并的编程学习平台
  • WebSocket重连去重:市场数据采集幂等设计
  • RTK:拦截AI编程Agent冗余输出的工具
  • Container Use vs Sculptor:并行AI编程环境隔离对比
  • Exa网页搜索在AI Gateway和eve中8月底前免费使用
  • Mistral Forge:企业级自有 AI 模型治理框架
  • 一条命令在 AI Gateway 中配置多个编程 Agent
  • Vercel用AI软件工厂维护AI SDK:4周覆盖30% PR
  • Grok 4.6登陆Vercel AI Gateway:50万token上下文
  • RingCentral如何用ChatGPT Work和Codex构建AI原生工作流
  • 自然语言处理不存在无损转换——AI 辅助写作的根本局限
  • OpenAI发布ChatGPT for Linux预览版,整合Codex编程
  • AI编程助手可能在git历史中遗留敏感信息
  • 抓取文档站无需浏览器:__NEXT_DATA__脚本提取法
  • 生产级 RAG 内容管道:五个决定成败的分叉口
  • Claude Code 自动模式 8 月 14 日起成为默认
  • 已加载 51 / 9278
10.0
重磅
AI SCORE
模型发布2026-08-12 10:22

HuggingFace Transformers 5.0稳定支持多模态

GitHub Trending#HuggingFace#机器学习#开源
Editor brief · 编辑速览

transformers作为模型定义框架,覆盖文本、视觉、音频、视频多模态,是训练和推理的枢纽。兼容axolotl、unsloth、vLLM、SGLang等主流框架。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Transformers 是面向自然语言处理、计算机视觉、音频、视频及多模态模型进行推理和训练的 SOTA 预训练模型框架。

它将模型定义集中化,使整个生态系统中对模型定义达成一致。transformers 是跨框架的枢纽:只要某种模型定义被支持,它就能兼容大多数训练框架(Axolotl、Unsloth、DeepSpeed、FSDP、PyTorch-Lightning 等)、推理引擎(vLLM、SGLang、TGI 等)以及相邻的建模库(llama.cpp、mlx 等)—— 这些库都从 transformers 获取模型定义。

我们承诺,通过让模型定义保持简洁、可定制且高效,来帮助支持新的 SOTA 模型并推动其使用民主化。

Hugging Face Hub 上有超过 100 万个 Transformers 模型检查点可供使用。

立即探索 Hub,找到合适的模型并用 Transformers 快速开始使用。

Transformers 支持 Python 3.10+ 和 PyTorch 2.5+。

使用 venv 或 uv(一个基于 Rust 的快速 Python 包和项目管理器)创建并激活虚拟环境。

# venv
python -m venv .my-env
source .my-env/bin/activate
# uv
uv venv .my-env
source .my-env/bin/activate

在虚拟环境中安装 Transformers。

# pip
pip install "transformers[torch]"

# uv
uv pip install "transformers[torch]"

如果你想使用库中最新的变动或者想参与贡献,可以从源码安装。不过最新版本可能不稳定,遇到错误请随时提交 issue。

git clone https://github.com/huggingface/transformers.git
cd transformers

# pip
pip install '.[torch]'

# uv
uv pip install '.[torch]'

通过 Pipeline API 立即开始使用 Transformers。Pipeline 是一个高级推理类,支持文本、音频、视觉和多模态任务。它处理输入的预处理并返回相应的输出。

实例化一个 pipeline 并指定用于文本生成的模型。模型会被下载并缓存,以便你可以轻松地重复使用它。最后,传入一些文本作为模型的提示。

from transformers import pipeline

pipeline = pipeline(task="text-generation", model="Qwen/Qwen2.5-1.5B")
pipeline("the secret to baking a really good cake is ")
[{'generated_text': 'the secret to baking a really good cake is 1) to use the right ingredients and 2) to follow the recipe exactly. the recipe for the cake is as follows: 1 cup of sugar, 1 cup of flour, 1 cup of milk, 1 cup of butter, 1 cup of eggs, 1 cup of chocolate chips. if you want to make 2 cakes, how much sugar do you need? To make 2 cakes, you will need 2 cups of sugar.'}]

与模型对话的用法完全相同。唯一的区别是你需要在你和系统之间构建一个聊天历史(作为 Pipeline 的输入)。

只要 transformers serve 在运行,你也可以直接从命令行与模型对话。

transformers chat Qwen/Qwen2.5-0.5B-Instruct
import torch
from transformers import pipeline

chat = [
    {"role": "system", "content": "You are a sassy, wise-cracking robot as imagined by Hollywood circa 1986."},
    {"role": "user", "content": "Hey, can you tell me any fun things to do in New York?"}
]

pipeline = pipeline(task="text-generation", model="meta-llama/Meta-Llama-3-8B-Instruct", dtype=torch.bfloat16, device_map="auto")
response = pipeline(chat, max_new_tokens=512)
print(response[0]["generated_text"][-1]["content"])

展开以下示例,查看 Pipeline 如何处理不同模态和任务。

from transformers import pipeline

pipeline = pipeline(task="automatic-speech-recognition", model="openai/whisper-large-v3")
pipeline("https://huggingface.co/datasets/Narsil/asr_dummy/resolve/main/mlk.flac")
{'text': ' I have a dream that one day this nation will rise up and live out the true meaning of its creed.'}

文章配图

from transformers import pipeline

pipeline = pipeline(task="image-classification", model="facebook/dinov2-small-imagenet1k-1-layer")
pipeline("https://huggingface.co/datasets/Narsil/image_dummy/raw/main/parrots.png")
[{'label': 'macaw', 'score': 0.997848391532898},
 {'label': 'sulphur-crested cockatoo, Kakatoe galerita, Cacatua galerita',
  'score': 0.0016551691805943847},
 {'label': 'lorikeet', 'score': 0.00018523589824326336},
 {'label': 'African grey, African gray, Psittacus erithacus',
  'score': 7.85409429227002e-05},
 {'label': 'quail', 'score': 5.502637941390276e-05}]

文章配图

from transformers import pipeline

pipeline = pipeline(task="visual-question-answering", model="Salesforce/blip-vqa-base")
pipeline(
    image="https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/transformers/tasks/idefics-few-shot.jpg",
    question="What is in the image?",
)
[{'answer': 'statue of liberty'}]

为什么应该使用 Transformers?

易于使用的 SOTA 模型:在自然语言理解与生成、计算机视觉、音频、视频和多模态任务上具有高性能。研究人员、工程师和开发者的入门门槛低。只需学习三个类即可掌握,接口简洁。使用统一 API 调用所有预训练模型。

易于使用的 SOTA 模型:

  • 在自然语言理解与生成、计算机视觉、音频、视频和多模态任务上具有高性能
  • 研究人员、工程师和开发者的入门门槛低
  • 只需学习三个类即可掌握,接口简洁
  • 使用统一 API 调用所有预训练模型

更低的计算成本,更小的碳足迹:共享训练好的模型,无需从头训练。减少计算时间和生产成本。数百种模型架构,覆盖所有模态的 100 万 + 预训练检查点。

更低的计算成本,更小的碳足迹:

  • 共享训练好的模型,无需从头训练
  • 减少计算时间和生产成本
  • 数百种模型架构,覆盖所有模态的 100 万 + 预训练检查点

为模型的整个生命周期选择合适的框架:用三行代码训练 SOTA 模型。可以随时在 PyTorch / JAX / TF2.0 框架之间迁移单个模型。为训练、评估和生产选择合适的框架。

为模型的整个生命周期选择合适的框架:

  • 用三行代码训练 SOTA 模型
  • 可以随时在 PyTorch / JAX / TF2.0 框架之间迁移单个模型
  • 为训练、评估和生产选择合适的框架

轻松根据需求自定义模型或示例:我们为每种架构提供示例,以复现原作者发布的结果。模型内部尽可能保持一致地暴露。模型文件可以独立于库使用,以便快速实验。

轻松根据需求自定义模型或示例:

  • 为每种架构提供示例,以复现原作者发布的结果
  • 模型内部尽可能保持一致地暴露
  • 模型文件可以独立于库使用,以便快速实验

什么时候不适合使用 Transformers?

这个库不是神经网络的模块化工具箱。模型文件中的代码故意没有通过额外抽象进行重构,以便研究人员能够快速迭代每个模型,而无需深入额外的抽象层或文件。

训练 API 针对与 Transformers 提供的 PyTorch 模型协同工作进行了优化。对于通用的机器学习循环,你应该使用其他库,如 Accelerate。

示例脚本仅作为示例。它们不一定开箱即用地适用于你的特定用例,你需要自行调整代码才能使其正常工作。

100 个使用 Transformers 的项目

Transformers 不仅仅是一个使用预训练模型的工具包,它是一个围绕它和 Hugging Face Hub 构建的项目社区。我们希望 Transformers 能够帮助开发者、研究人员、学生、教授、工程师以及任何想要构建自己梦想项目的人。

为了庆祝 Transformers 达到 10 万星,我们希望在 awesome-transformers 页面上展示社区的力量,列出了 100 个使用 Transformers 构建的令人惊叹的项目。

如果你拥有或使用一个你认为应该被列入名单的项目,请提交 PR 来添加它!

你可以在 Hub 的模型页面上直接测试我们的大多数模型。

展开以下每个模态,查看各种用例的一些示例模型。

  • 音频分类:CLAP
  • 自动语音识别:Parakeet、Whisper、GLM-ASR 和 Moonshine-Streaming
  • 关键词检测:Wav2Vec2
  • 语音转语音生成:Moshi
  • 文本转音频:MusicGen
  • 文本转语音:CSM
  • 自动掩码生成:SAM
  • 深度估计:DepthPro
  • 图像分类:DINO v2
  • 关键点检测:SuperPoint
  • 关键点匹配:SuperGlue
  • 目标检测:RT-DETRv2
  • 姿态估计:VitPose
  • 通用分割:OneFormer
  • 视频分类:VideoMAE
  • 音频或文本转文本:Voxtral、Audio Flamingo
  • 文档问答:LayoutLMv3
  • 图像或文本转文本:Qwen-VL
  • 图像描述:BLIP-2
  • 基于 OCR 的文档理解:GOT-OCR2
  • 表格问答:TAPAS
  • 统一多模态理解和生成:Emu3
  • 视觉转文本:Llava-OneVision
  • 视觉问答:Llava
  • 视觉指代表达分割:Kosmos-2
  • 掩码词补全:ModernBERT
  • 命名实体识别:Gemma
  • 问答:Mixtral
  • 摘要:BART
  • 文本生成:Llama
  • 文本分类:Qwen

现在有一篇可以引用的关于 🤗 Transformers 库的论文:

@inproceedings{wolf-etal-2020-transformers,
    title = "Transformers: State-of-the-Art Natural Language Processing",
    author = "Thomas Wolf and Lysandre Debut and Victor Sanh and Julien Chaumond and Clement Delangue and Anthony Moi and Pierric Cistac and Tim Rault and Rémi Louf and Morgan Funtowicz and Joe Davison and Sam Shleifer and Patrick von Platen and Clara Ma and Yacine Jernite and Julien Plu and Canwen Xu and Teven Le Scao and Sylvain Gugger and Mariama Drame and Quentin Lhoest and Alexander M. Rush",
    booktitle = "Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
    month = oct,
    year = "2020",
    address = "Online",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2020.emnlp-demos.6/",
    pages = "38--45"
}
Original source

本文由 AI 翻译整理自 GitHub Trending,原文版权归原作者所有。

阅读英文原文
上一篇
AI Agent 运行机制深度解析:工具调用、记忆与循环
下一篇
长音频转录后结构化提取的字段级精度优化