Soup CLI

Soup CLI

Soup CLI:在4GB显存笔记本上微调Llama-3.1-8B,支持DPO、ORPO等对齐方法,流式推理省显存,多后端兼容,轻量搞定大模型训练。

Soup CLI 是什么?

Soup CLI 是一款免费开源的命令行工具,覆盖 AI 模型后训练(post-training)全流程——从数据准备到微调再到评估。它通过规则自动生成训练配置,无需手动摸索任务类型、量化方式、学习率和训练轮数。工具支持 23 种训练方法、142 个配方和 17 种量化格式,并原生适配 MLX 和 Apple 硬件。用户只需通过 pip 安装、初始化配置文件,然后运行一条 soup train 命令即可开始训练。它专为低配硬件设计,能在 4GB 显存的笔记本电脑 GPU 上微调 Llama-3.1-8B。

Application scenarios

  • 笔记本 GPU 微调

    在 4GB 显存 GPU 上训练和对齐 Llama-3.1-8B,无需将完整冻结基座模型加载进内存。

  • 对齐训练

    支持 DPO、ORPO、SimPO、KTO 等对齐方法,并支持流式处理。

  • 配置迁移

    通过 `soup migrate` 命令,约 30 秒即可从 LLaMA-Factory、Axolotl 或 Unsloth 迁移过来。

  • 数据预检

    在正式训练前对训练数据进行校验和"修复"。

  • 评估驱动训练

    基于自有数据集生成评估指标,每次保存模型都附带 SHIP(可发布)或 DON'T-SHIP(不可发布)判定。

  • 语音与文本训练

    支持文本或语音训练,且不会覆盖已学任务。

核心特性

  • 自动生成配置:Soup 根据规则自动写出完整训练配置(任务、量化、学习率、轮数),无需手动调参。
  • 层流式加载:将冻结基座模型从内存或 NVMe 逐层流式加载,并量化为 4-bit,让大模型适配小显存 GPU。
  • 奖励黑客纠正:训练中途自动纠正奖励黑客(reward hacking)问题,而非简单中止训练。
  • 保存门控:每次保存模型都附带 SHIP 或 DON'T-SHIP 判定,可随权重一起提交。
  • 迁移工具:一条命令即可转换 LLaMA-Factory、Axolotl 或 Unsloth 的现有配置。
  • 多后端兼容:集成 HuggingFace、Ollama、vLLM、DeepSpeed、Unsloth、ONNX、NVIDIA TensorRT、W&B、SGLang 和 FlashAttention。
  • 广泛方法支持:23 种训练方法、142 个配方、17 种量化格式。
  • Apple 硬件支持:内置适配 Apple 芯片的 MLX 适配器。
  • 开源:Apache-2.0 许可证,支持 Python 3.10 至 3.12,无厂商锁定。

目标用户

Soup CLI 面向机器学习工程师和 AI 研究员,尤其是那些需要在没有昂贵 GPU 集群的情况下微调或对齐开源模型的开发者。它适合已经在使用 LLaMA-Factory、Axolotl 或 Unsloth 的团队,希望进一步自动化训练流程。对于在笔记本或单 GPU 工作站上工作的开发者,其显存效率和层流式加载尤为实用。此外,它也适合希望在训练流程中内置明确"可发布/不可发布"判定的评估驱动训练实践者。

如何使用 Soup CLI?

  1. 安装:pip install "soup-cli[train]"
  2. 初始化:运行 soup init 生成 soup.yaml 配置文件。
  3. 开始训练:运行 soup train
  4. 如果从其他工具迁移,使用 soup migrate --from llamafactory config.yaml(或 axolotl/unsloth 对应命令)。
  5. 完整文档请访问官网:https://trysoup.dev/。

效果评价

Soup CLI 的核心卖点——在 4GB 显存笔记本 GPU 上微调 Llama-3.1-8B——对没有高端硬件的开发者来说是一个实实在在的优势。自动生成配置和迁移工具大幅减少了训练环境搭建的繁琐步骤,确实能节省大量时间。SHIP/DON'T-SHIP 保存门控和奖励黑客纠正功能,为训练流程增加了大多数工具不具备的质量控制层。虽然官网没有展示用户评价或基准测试结果,但功能体系完整且直击后训练流程中的常见痛点。Apache-2.0 许可证和零厂商锁定,让它成为生产环境的安全选择。

Frequently Asked Questions

Soup CLI 是什么?
Soup CLI 是一个微调工具,能在 4GB 显存的笔记本 GPU 上训练和对齐 Llama-3.1-8B 模型,支持 DPO 和 ORPO 等方法。
Soup CLI 能在低配硬件上跑吗?
能,Soup CLI 针对显存效率做了优化,4GB 显存的笔记本 GPU 就能微调,不需要高端硬件。
Soup CLI 支持哪些微调方法?
它支持 DPO(直接偏好优化)、ORPO(比值偏好优化)以及其他对齐技术。
Soup CLI 支持流式推理吗?
支持,它内置流式推理功能,训练中或训练后都能实时生成 token。
Soup CLI 兼容哪些后端?
它支持多后端,能适配多种硬件和软件环境,集成起来比较灵活。
Soup CLI 免费吗?
官方描述里没提价格,具体授权和费用得看 Soup CLI 的官方文档。

Soup CLI - AI Tool Detail

Soup CLI:在4GB显存笔记本上微调Llama-3.1-8B,支持DPO、ORPO等对齐方法,流式推理省显存,多后端兼容,轻量搞定大模型训练。

Category:模型微调

Visit Link:https://trysoup.dev/

Tags:模型微调、LLaMA 3.1、DPO训练、ORPO对齐、显存优化