Llama-Factory:统一微调 100+ 开源模型的框架
开源工具提供统一接口和工作流支持大规模开源 LLM 微调,降低自定义模型训练的门槛。
开源工具提供统一接口和工作流支持大规模开源 LLM 微调,降低自定义模型训练的门槛。
已被 Amazon、NVIDIA、阿里云等公司采用。
查看我们的全新开源项目——🐧 PenguinHarness:仅需价值 0.02 美元的 token,即可让桌面智能体自动为你构建智能体!
关注我们的项目:https://github.com/Prism-Shadow/penguin-harness
通过零代码 CLI 和 Web UI,轻松微调 100 多种大语言模型
👋 欢迎加入我们的微信和 NPU 用户群。
微调大语言模型可以像这样简单……
开始本地训练:
请参阅使用说明
开始云端训练:
Colab(免费):https://colab.research.google.com/drive/1eRTPn37ltBbYsISy9Aw2NuI2Aq5CQrD9?usp=sharing
PAI-DSW(免费试用):https://gallery.pai-ml.com/#/preview/deepLearning/nlp/llama_factory
AMD GPU Cloud(免费额度):https://github.com/AMD-AIM/AMD_Developers_Notebooks/blob/main/en/AMD_developer_LLaMAFactory_note_en.md
阅读技术资料:
文档(持续完善中):https://llamafactory.readthedocs.io/en/latest/
文档(AMD GPU):https://rocm.docs.amd.com/projects/ai-developer-hub/en/latest/notebooks/fine_tune/llama_factory_llama3.html
文档(ASCEND NPU):https://llamafactory.readthedocs.io/en/latest/multibackend/npu/index.html
官方博客:https://blog.llamafactory.net/en/
除上述链接外,其他所有网站均为未经授权的第三方网站,请谨慎使用。
支持的训练方法
快速开始 安装 数据准备 快速入门 使用 LLaMA Board GUI 进行微调 构建 Docker 使用 OpenAI 风格 API 和 vLLM 部署 从 ModelScope Hub 下载 从 Modelers Hub 下载 使用 W&B Logger 使用 SwanLab Logger
使用 LLaMA Board GUI 进行微调
使用 OpenAI 风格 API 和 vLLM 部署
从 ModelScope Hub 下载
从 Modelers Hub 下载
使用 LLaMA Factory 的项目
多种模型:LLaMA、LLaVA、Mistral、Mixtral-MoE、Qwen3、Qwen3-VL、DeepSeek、Gemma、GLM、Phi 等。
集成方法:(持续)预训练、(多模态)监督微调、奖励建模、PPO、DPO、KTO、ORPO 等。
可扩展的资源方案:16 位全参数微调、冻结微调、LoRA,以及通过 AQLM/AWQ/GPTQ/LLM.int8/HQQ/EETQ 实现的 2/3/4/5/6/8 位 QLoRA。
高级算法:GaLore、BAdam、APOLLO、Adam-mini、Muon、OFT、DoRA、LongLoRA、LLaMA Pro、Mixture-of-Depths、LoRA+、LoftQ 和 PiSSA。
实用技巧:FlashAttention-2、Unsloth、Liger Kernel、KTransformers、RoPE 缩放、NEFTune 和 rsLoRA。
广泛的任务支持:多轮对话、工具使用、图像理解、视觉定位、视频识别、音频理解等。
实验监控:LlamaBoard、TensorBoard、Wandb、MLflow、SwanLab 等。
更快的推理:支持搭配 vLLM worker 或 SGLang worker 使用 OpenAI 风格 API、Gradio UI 和 CLI。
前沿模型微调的 Day-N 支持
现在,我们为 LLaMA Factory 推出了专属博客!
网站:https://blog.llamafactory.net/en/
💡 KTransformers 微调 × LLaMA Factory:使用 2 张 4090 GPU + CPU 微调 1000B 模型(英文)
💡 Easy Dataset × LLaMA Factory:让大语言模型高效学习领域知识(英文)
💡 DataFlow × LLaMA Factory:通过数据准备流水线生成用于大语言模型训练的高质量数据(英文)| 中文
💡 DataFlex × LLaMA Factory:基于 LLaMA-Factory 构建的以数据为中心的动态训练系统(英文)| 中文
基于 LLaMA-Factory 和 EasyR1 的一站式零代码模型强化学习与部署平台(中文)
Apoidea Group 如何在 Amazon SageMaker HyperPod 上使用 LLaMA-Factory,通过多模态模型增强银行文档的视觉信息提取能力(英文)
LLaMA Factory:为新闻分类器微调 DeepSeek-R1-Distill-Qwen-7B 模型(中文)
基于 SageMaker 和 LLaMA-Factory 的一站式零代码模型微调与部署平台(中文)
LLaMA Factory 多模态微调实践:为私人导游场景微调 Qwen2-VL(中文)
LLaMA Factory:为角色扮演微调 Llama3(中文)
[25/10/26] 我们通过 mcore_adapter 支持了 Megatron-core 训练后端。请参阅 PR #9237 开始使用。
[25/08/22] 我们支持了 OFT 和 OFTv2。请参阅示例了解用法。
[25/08/20] 我们支持了 Intern-S1-mini 模型的微调。请参阅 PR #8976 开始使用。
[25/08/06] 我们支持了 GPT-OSS 模型的微调。请参阅 PR #8826 开始使用。
[25/07/02] 我们支持了 GLM-4.1V-9B-Thinking 模型的微调。
[25/04/28] 我们支持了 Qwen3 模型家族的微调。
[25/04/21] 我们支持了 Muon 优化器。请参阅示例了解用法。感谢 @tianshijing 提交的 PR。
[25/04/16] 我们支持了 InternVL3 模型的微调。请参阅 PR #7258 开始使用。
[25/04/14] 我们支持了 GLM-Z1 和 Kimi-VL 模型的微调。
[25/04/06] 我们支持了 Llama 4 模型的微调。请参阅 PR #7611 开始使用。
[25/03/31] 我们支持了 Qwen2.5 Omni 模型的微调。请参阅 PR #7537 开始使用。
[25/03/15] 我们支持将 SGLang 用作推理后端。尝试使用 infer_backend: sglang 加速推理。
[25/03/12] 我们支持了 Gemma 3 模型的微调。
[25/02/24] 正式发布 EasyR1,这是一个高效、可扩展且支持多模态的强化学习训练框架,可用于高效的 GRPO 训练。
[25/02/11] 我们支持在导出模型检查点时保存 Ollama modelfile。请参阅示例了解用法。
[25/02/05] 我们支持在音频理解任务上微调 Qwen2-Audio 和 MiniCPM-o-2.6。
[25/01/31] 我们支持了 DeepSeek-R1 和 Qwen2.5-VL 模型的微调。
[25/01/15] 我们支持了 APOLLO 优化器。请参阅示例了解用法。
[25/01/14] 我们支持了 MiniCPM-o-2.6 和 MiniCPM-V-2.6 模型的微调。感谢 @BUAADreamer 提交的 PR。
[25/01/14] 我们支持了 InternLM 3 模型的微调。感谢 @hhaAndroid 提交的 PR。
[25/01/10] 我们支持了 Phi-4 模型的微调。
[24/12/21] 我们支持使用 SwanLab 进行实验跟踪和可视化。详情请参阅本节。
[24/11/27] 我们支持了 Skywork-o1 模型和 OpenO1 数据集的微调。
[24/10/09] 我们支持从 Modelers Hub 下载预训练模型和数据集。请参阅本教程了解用法。
[24/09/19] 我们支持了 Qwen2.5 模型的微调。
[24/08/30] 我们支持了 Qwen2-VL 模型的微调。感谢 @simonJJJ 提交的 PR。
[24/08/27] 我们支持了 Liger Kernel。尝试使用 enable_liger_kernel: true 实现高效训练。
[24/08/09] 我们支持了 Adam-mini 优化器。请参阅示例了解用法。感谢 @relic-yuexi 提交的 PR。
[24/07/04] 我们支持了无数据污染的打包训练。使用 neat_packing: true 即可启用。感谢 @chuan298 提交的 PR。
[24/06/16] 我们支持了 PiSSA 算法。请参阅示例了解用法。
[24/06/07] 我们支持了 Qwen2 和 GLM-4 模型的微调。
[24/05/26] 我们支持了用于偏好学习的 SimPO 算法。请参阅示例了解用法。
[24/05/20] 我们支持了 PaliGemma 系列模型的微调。请注意,PaliGemma 模型是预训练模型,你需要使用 paligemma 模板对其进行微调,才能用于对话补全。
[24/05/18] 我们支持了用于偏好学习的 KTO 算法。请参阅示例了解用法。
[24/05/14] 我们支持在 Ascend NPU 设备上进行训练和推理。详情请查看安装章节。
[24/04/26] 我们支持了 LLaVA-1.5 多模态大语言模型的微调。请参阅示例了解用法。
[24/04/22] 我们提供了一个 Colab 笔记本,可在免费的 T4 GPU 上微调 Llama-3 模型。Hugging Face 上现已提供两个使用 LLaMA Factory 微调的 Llama-3 衍生模型,详情请查看 Llama3-8B-Chinese-Chat 和 Llama3-Chinese。
[24/04/21] 我们根据 AstraMindAI 的实现支持了 Mixture-of-Depths。请参阅示例了解用法。
[24/04/16] 我们支持了 BAdam 优化器。请参阅示例了解用法。
[24/04/16] 我们支持了 unsloth 的长序列训练(在 24GB 显存内训练 Llama-2-7B-56k)。与 FlashAttention-2 相比,它的速度达到 117%,内存占用为 50%;更多基准测试结果请参阅此页面。
[24/03/31] 我们支持了 ORPO。请参阅示例了解用法。
[24/03/21] 我们的论文《LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models》已发布于 arXiv!
[24/03/20] 我们支持了 FSDP+QLoRA,可在 2×24GB GPU 上微调 70B 模型。请参阅示例了解用法。
[24/03/13] 我们支持了 LoRA+。请参阅示例了解用法。
[24/03/07] 我们支持了 GaLore 优化器。请参阅示例了解用法。
[24/03/07] 我们集成了 vLLM,以实现更快的并发推理。尝试使用 infer_backend: vllm,即可获得 270% 的推理速度。
[24/02/28] 我们支持了权重分解 LoRA(DoRA)。尝试使用 use_dora: true 启用 DoRA 训练。
[24/02/15] 我们支持了 LLaMA Pro 提出的块扩展方法。请参阅示例了解用法。
[24/02/05] LLaMA-Factory 已支持 Qwen1.5(Qwen2 测试版)系列模型。详情请查看这篇博客文章。
[24/01/18] 我们支持了大多数模型的智能体微调,通过使用 dataset: glaive_toolcall_en 进行微调,为模型赋予工具使用能力。
[23/12/23] 我们支持了 unsloth 的实现,以加速 LLaMA、Mistral 和 Yi 模型的 LoRA 微调。尝试使用 use_unsloth: true 参数启用 unsloth 补丁。在我们的基准测试中,它的速度达到 170%;详情请查看此页面。
[23/12/12] 我们的框架现已支持微调最新的 MoE 模型 Mixtral 8x7B。硬件要求请参见此处。
[23/12/01] 我们现已支持从 ModelScope Hub 下载预训练模型和数据集。用法请参见此教程。
[23/10/21] 我们现已支持用于微调的 NEFTune 技巧。可尝试使用 neftune_noise_alpha: 5 参数启用 NEFTune。
[23/09/27] 我们现已为 LLaMA 模型支持 LongLoRA 提出的 $S^2$-Attn。可尝试使用 shift_attn: true 参数启用移位短注意力。
[23/09/23] 我们已在此仓库中集成 MMLU、C-Eval 和 CMMLU 基准测试。用法请参见示例。
[23/09/10] 我们现已支持 FlashAttention-2。如果你使用的是 RTX4090、A100 或 H100 GPU,可尝试使用 flash_attn: fa2 参数启用 FlashAttention-2。
[23/08/12] 我们现已支持通过 RoPE 缩放扩展 LLaMA 模型的上下文长度。在训练时可尝试使用 rope_scaling: linear 参数,在推理时使用 rope_scaling: dynamic 参数,以外推位置嵌入。
[23/08/11] 我们现已支持对指令微调模型进行 DPO 训练。用法请参见示例。
[23/07/31] 我们现已支持数据集流式加载。可尝试使用 streaming: true 和 max_steps: 10000 参数,以流式模式加载数据集。
[23/07/29] 我们在 Hugging Face 上发布了两个经过指令微调的 13B 模型。详情请参见这些 Hugging Face 仓库(LLaMA-2 / Baichuan)。
[23/07/18] 我们开发了一套集训练、评估和推理于一体的 Web UI。可尝试使用 train_web.py 在 Web 浏览器中微调模型。感谢 @KanadeSiina 和 @codemayq 在开发过程中付出的努力。
[23/07/09] 我们发布了 FastEdit ⚡🩹,这是一个易于使用的软件包,可高效编辑大语言模型中的事实性知识。如果你对此感兴趣,请关注 FastEdit。
[23/06/29] 我们提供了一个使用指令遵循数据集训练聊天模型的可复现示例,详情请参见 Baichuan-7B-sft。
[23/06/22] 我们已将演示 API 与 OpenAI 的格式对齐,因此你可以将微调后的模型接入任意基于 ChatGPT 的应用程序。
[23/06/03] 我们现已支持量化训练和推理(即 QLoRA)。用法请参见示例。
如果你无法使用最新功能,请拉取最新代码并重新安装 LLaMA-Factory。
对于“base”模型,template 参数可以从 default、alpaca、vicuna 等选项中选择。但对于“instruct/chat”模型,请务必使用与之对应的模板。
如果模型同时具有推理版本和非推理版本,请使用 _nothink 后缀加以区分。例如,qwen3 和 qwen3_nothink。
请记住,在训练和推理时使用相同的模板。
*:你应当安装 main 分支的 transformers,并使用 DISABLE_VERSION_CHECK=1 跳过版本检查。
**:你需要安装特定版本的 transformers 才能使用对应的模型。
我们所支持模型的完整列表请参见 constants.py。
你也可以向 template.py 添加自定义聊天模板。
PPO 的实现细节可参见此博客。
CCI4.0-M2-Base-v1(英文和中文)
CCI4.0-M2-CoT-v1(英文和中文)
CCI4.0-M2-Extra-v1(英文和中文)
Glaive Function Calling V2(英文和中文)
Guanaco Dataset(多语言)
BELLE Dialogue 0.4M(中文)
BELLE School Math 0.25M(中文)
BELLE Multiturn Chat 0.8M(中文)
Alpaca CoT(多语言)
Advertise Generating(中文)
ShareGPT Hyperfiltered(英文)
Infinity Instruct(中文)
Evol Instruct V2(英文)
Magpie-Pro-300K-Filtered(英文)
Magpie-ultra-v0.1(英文)
Chinese-DeepSeek-R1-Distill(中文)
Pokemon-gpt4o-captions(英文和中文)
OpenSchnabeltier(德文)
某些数据集需要在使用前进行确认,因此我们建议使用以下命令登录你的 Hugging Face 账号。
pip install "huggingface_hub<1.0.0"
huggingface-cli login
安装是必需的。
git clone --depth 1 https://github.com/hiyouga/LlamaFactory.git
cd LlamaFactory
pip install -e .
pip install -r requirements/metrics.txt
可选依赖包括:metrics、deepspeed。使用以下命令安装:pip install -e . && pip install -r requirements/metrics.txt -r requirements/deepspeed.txt
特定功能所需的额外依赖位于 examples/requirements/ 中。
docker run -it --rm --gpus=all --ipc=host hiyouga/llamafactory:latest
此镜像基于 Ubuntu 22.04(x86_64)、CUDA 12.4、Python 3.11、PyTorch 2.6.0 和 Flash-attn 2.7.4 构建。
可在此处查找预构建镜像:https://hub.docker.com/r/hiyouga/llamafactory/tags
如需自行构建镜像,请参见 Docker 构建说明。
使用 uv 创建隔离的 Python 环境:
uv run llamafactory-cli webui
在 Windows 平台上,你需要手动安装 GPU 版本的 PyTorch。请参阅官方网站,并使用以下命令安装支持 CUDA 的 PyTorch:
pip uninstall torch torchvision torchaudio
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu126
python -c "import torch; print(torch.cuda.is_available())"
如果看到 True,则表示你已成功安装支持 CUDA 的 PyTorch。
如果遇到 Can't pickle local object 错误,请尝试设置 dataloader_num_workers: 0。
要在 Windows 上启用量化 LoRA(QLoRA),你需要安装 bitsandbytes。
对于大多数用户,建议安装最新的官方版本:
pip install bitsandbytes
如果使用 uv 管理虚拟环境,建议在安装支持 GPU 的 PyTorch 版本后再安装 bitsandbytes:
uv pip install bitsandbytes --no-deps
[!IMPORTANT] 安装 bitsandbytes 时,请注意 CUDA Toolkit 的版本。官方发布的 bitsandbytes 是针对特定 CUDA Toolkit 版本构建的。目前在 Windows x86-64 平台上,分别提供适用于 CUDA 11.8–12.6 和 CUDA 12.8–12.9 的构建版本。要支持 NVIDIA RTX 50 系列 GPU(例如 RTX 5060 Ti、sm_120),需要使用 CUDA 12.8–12.9 构建版本。
如果你的环境使用较旧的 CUDA 版本,或者需要兼容较旧的 Windows / PyTorch 组合,可以安装第三方预编译的 Windows wheel:
pip install https://github.com/jllllll/bitsandbytes-windows-webui/releases/download/wheels/bitsandbytes-0.41.2.post2-py3-none-win_amd64.whl
要在 Windows 平台上启用 FlashAttention-2,请使用 flash-attention-windows-wheel 提供的脚本自行编译并安装。
要在 Ascend NPU 设备上安装 LLaMA Factory,请将 Python 升级至 3.10 或更高版本:pip install -r requirements/npu.txt。此外,你还需要安装 Ascend CANN Toolkit 和 Kernels。请按照安装教程操作。
你也可以下载预构建的 Docker 镜像:
# Docker Hub
docker pull hiyouga/llamafactory:latest-cann9.0.0-torch_npu2.7.1-A2-ubuntu-py3.11
docker pull hiyouga/llamafactory:latest-cann9.0.0-torch_npu2.7.1-A3-ubuntu-py3.11
docker pull hiyouga/llamafactory:latest-cann9.0.0-torch_npu2.7.1-A2-openeuler-py3.11
docker pull hiyouga/llamafactory:latest-cann9.0.0-torch_npu2.7.1-A3-openeuler-py3.11
# quay.io
docker pull quay.io/ascend/llamafactory:latest-cann9.0.0-torch_npu2.7.1-A2-ubuntu-py3.11
docker pull quay.io/ascend/llamafactory:latest-cann9.0.0-torch_npu2.7.1-A3-ubuntu-py3.11
docker pull quay.io/ascend/llamafactory:latest-cann9.0.0-torch_npu2.7.1-A2-openeuler-py3.11
docker pull quay.io/ascend/llamafactory:latest-cann9.0.0-torch_npu2.7.1-A3-openeuler-py3.11
要在 Ascend NPU 上使用基于 bitsandbytes 的 QLoRA,请按照以下 3 个步骤操作:
手动编译 bitsandbytes:请参照 NPU 版本 bitsandbytes 的安装文档完成编译和安装。编译要求 cmake 版本至少为 3.22.1,g++ 版本至少为 12.x。
# Install bitsandbytes from source
# Clone bitsandbytes repo, Ascend NPU backend is currently enabled on multi-backend-refactor branch
git clone -b multi-backend-refactor https://github.com/bitsandbytes-foundation/bitsandbytes.git
cd bitsandbytes/
# Install dependencies
pip install -r requirements-dev.txt
# Install the dependencies for the compilation tools. Note that the commands for this step may vary depending on the operating system. The following are provided for reference
apt-get install -y build-essential cmake
# Compile & install
cmake -DCOMPUTE_BACKEND=npu -S .
make
pip install .
安装 main 分支的 transformers。
git clone -b main https://github.com/huggingface/transformers.git
cd transformers
pip install .
在配置中设置 double_quantization: false。你可以参考相关示例。
有关数据集文件格式的详细信息,请参阅 data/README.md。你可以使用 HuggingFace / ModelScope / Modelers Hub 上的数据集、加载本地磁盘中的数据集,或者指定 s3/gcs 云存储路径。
请更新 data/dataset_info.json 以使用你的自定义数据集。
你还可以使用 Easy Dataset、DataFlow 和 GraphGen 创建用于微调的合成数据。
使用以下 3 个命令分别运行 Qwen3-4B-Instruct 模型的 LoRA 微调、推理和合并。
llamafactory-cli train examples/train_lora/qwen3_lora_sft.yaml
llamafactory-cli chat examples/inference/qwen3_lora_sft.yaml
llamafactory-cli export examples/merge_lora/qwen3_lora_sft.yaml
查看 examples/README.md 了解高级用法(包括分布式训练)。
使用 llamafactory-cli help 显示帮助信息。
遇到问题请先阅读常见问题解答。
llamafactory-cli webui
cd docker/docker-cuda/
docker compose up -d
docker compose exec llamafactory bash
对于昇腾 NPU 用户(A2 默认使用 Ubuntu):
cd docker/docker-npu/
docker compose up -d llamafactory-a2-ubuntu
docker compose exec llamafactory-a2-ubuntu bash
其他 NPU 变体可以用对应的 profile 和 service 启动:
# A3 with Ubuntu
docker compose --profile a3 up -d llamafactory-a3-ubuntu
docker compose exec llamafactory-a3-ubuntu bash
# A2 with openEuler
docker compose --profile openeuler up -d llamafactory-a2-openeuler
docker compose exec llamafactory-a2-openeuler bash
# A3 with openEuler
docker compose --profile a3-openeuler up -d llamafactory-a3-openeuler
docker compose exec llamafactory-a3-openeuler bash
cd docker/docker-rocm/
docker compose up -d
docker compose exec llamafactory bash
docker build -f ./docker/docker-cuda/Dockerfile \
--build-arg PIP_INDEX=https://pypi.org/simple \
-t llamafactory:latest .
docker run -dit --ipc=host --gpus=all \
-p 7860:7860 \
-p 8000:8000 \
--name llamafactory \
llamafactory:latest
docker exec -it llamafactory bash
对于昇腾 NPU 用户:
docker build -f ./docker/docker-npu/Dockerfile \
--build-arg PIP_INDEX=https://pypi.org/simple \
-t llamafactory:latest .
docker run -dit --ipc=host \
-v /usr/local/dcmi:/usr/local/dcmi \
-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \
-v /usr/local/Ascend/driver:/usr/local/Ascend/driver \
-v /etc/ascend_install.info:/etc/ascend_install.info \
-p 7860:7860 \
-p 8000:8000 \
--device /dev/davinci0 \
--device /dev/davinci_manager \
--device /dev/devmm_svm \
--device /dev/hisi_hdc \
--name llamafactory \
llamafactory:latest
docker exec -it llamafactory bash
docker build -f ./docker/docker-rocm/Dockerfile \
--build-arg PIP_INDEX=https://pypi.org/simple \
-t llamafactory:latest .
docker run -dit --ipc=host \
-p 7860:7860 \
-p 8000:8000 \
--device /dev/kfd \
--device /dev/dri \
--name llamafactory \
llamafactory:latest
docker exec -it llamafactory bash
可以取消注释 Dockerfile 中的 VOLUME [ "/root/.cache/huggingface", "/app/shared_data", "/app/output" ] 来使用数据卷。
构建 Docker 镜像时,使用 -v ./hf_cache:/root/.cache/huggingface 参数将本地目录挂载到容器。以下数据卷可用。
hf_cache:利用主机上的 Hugging Face 缓存。
shared_data:存储数据集的主机上的目录。
output:将导出目录设置到此位置,以便可以直接在主机上访问合并结果。
API_PORT=8000 llamafactory-cli api examples/inference/qwen3.yaml infer_backend=vllm vllm_enforce_eager=true
访问此页面了解 API 文档。
示例:图像理解 | 函数调用
如果你在从 Hugging Face 下载模型和数据集时遇到困难,可以使用 ModelScope。
export USE_MODELSCOPE_HUB=1 # Windows 使用 `set USE_MODELSCOPE_HUB=1`
通过指定 ModelScope Hub 的模型 ID 作为 model_name_or_path 来训练模型。你可以在 ModelScope Hub 找到完整的模型 ID 列表,例如 LLM-Research/Meta-Llama-3-8B-Instruct。
你也可以使用 Modelers Hub 下载模型和数据集。
export USE_OPENMIND_HUB=1 # Windows 使用 `set USE_OPENMIND_HUB=1`
通过指定 Modelers Hub 的模型 ID 作为 model_name_or_path 来训练模型。你可以在 Modelers Hub 找到完整的模型 ID 列表,例如 TeleAI/TeleChat-7B-pt。
要使用 Weights & Biases 记录实验结果,需要向 yaml 文件添加以下参数。
report_to: wandb
run_name: test_run # optional
启动训练任务时设置 WANDB_API_KEY 为你的密钥,以用你的 W&B 账户登录。
要使用 SwanLab 记录实验结果,需要向 yaml 文件添加以下参数。
use_swanlab: true
swanlab_run_name: test_run # optional
启动训练任务时,可以通过以下三种方式登录 SwanLab:
在 yaml 文件中添加 swanlab_api_key=<your_api_key>,并将其设置为你的 API 密钥。
将环境变量 SWANLAB_API_KEY 设置为你的 API 密钥。
使用 swanlab login 命令完成登录。
如果你有应该被列入的项目,请通过电子邮件联系或创建拉取请求。
Wang et al. ESRL: Efficient Sampling-based Reinforcement Learning for Sequence Generation. 2023. [arxiv]
Yu et al. Open, Closed, or Small Language Models for Text Classification? 2023. [arxiv]
Wang et al. UbiPhysio: Support Daily Functioning, Fitness, and Rehabilitation with Action Understanding and Feedback in Natural Language. 2023. [arxiv]
Luceri et al. Leveraging Large Language Models to Detect Influence Campaigns in Social Media. 2023. [arxiv]
Zhang et al. Alleviating Hallucinations of Large Language Models through Induced Hallucinations. 2023. [arxiv]
Wang et al. Know Your Needs Better: Towards Structured Understanding of Marketer Demands with Analogical Reasoning Augmented LLMs. KDD 2024. [arxiv]
Wang et al. CANDLE: Iterative Conceptualization and Instantiation Distillation from Large Language Models for Commonsense Reasoning. ACL 2024. [arxiv]
Choi et al. FACT-GPT: Fact-Checking Augmentation via Claim Matching with LLMs. 2024. [arxiv]
Zhang et al. AutoMathText: Autonomous Data Selection