Soup CLI

Soup CLI

Soup CLI 是 Soup 推出的微調工具,可在 4 GB 筆電 GPU 上訓練與對齊 Llama-3.1-8B,支援 DPO、ORPO 等多種方法,具備串流推論、節省 VRAM,並相容多種後端。

Soup CLI 是什麼?

Soup CLI 是一款免費、開源的命令列工具,涵蓋 AI 模型後訓練(post-training)的完整流程——從資料準備、微調到評估。它會根據規則自動幫你寫好訓練設定,不需要手動摸索任務類型、量化方式、學習率和訓練輪數(epochs)。這套工具支援 23 種訓練方法、142 種配方(recipes)和 17 種量化格式,並整合 MLX 與 Apple 硬體。使用者透過 pip 安裝、初始化設定檔,再執行單一指令 soup train 即可開始訓練。它設計上可在一般規格硬體運行,例如在 4 GB 顯卡的筆電 GPU 上微調 Llama-3.1-8B。

Application scenarios

  • 筆電 GPU 微調

    在 4 GB 顯卡上訓練與對齊 Llama-3.1-8B,無需將完整凍結的基礎模型載入記憶體。

  • 對齊訓練

    支援 DPO、ORPO、SimPO 和 KTO 對齊方法,並具備串流(streaming)處理能力。

  • 設定遷移

    使用 `soup migrate` 指令,約 30 秒即可從 LLaMA-Factory、Axolotl 或 Unsloth 轉換設定。

  • 資料前檢核

    在開始訓練前,驗證並「修復」(doctor)你的訓練資料。

  • 評估驅動訓練

    從自己的資料集產生評估指標,並以 SHIP 或 DON'T-SHIP 的判定來把關每一次模型儲存。

  • 語音與文字訓練

    可訓練文字或語音模型,不會覆蓋先前已學習的任務。

Core Features

  • 自動產生設定

    Soup 會根據規則自動寫出完整的訓練設定(任務、量化、學習率、訓練輪數),不需手動調整。

  • 層級串流(Layer streaming)

    將凍結的基礎模型從 RAM 或 NVMe 逐層串流載入,並量化至 4-bit,讓大型模型也能在小型 GPU 上運行。

  • 獎勵駭取(Reward hacking)修正

    訓練中途會自動修正獎勵駭取問題,而非單純中止訓練。

  • 儲存把關(Save gating)

    每次模型儲存都會以 SHIP 或 DON'T-SHIP 判定為門檻,你可將此判定與權重一起提交。

  • 遷移工具

    單一指令即可轉換 LLaMA-Factory、Axolotl 或 Unsloth notebook 的既有設定。

  • 多後端相容性

    整合 HuggingFace、Ollama、vLLM、DeepSpeed、Unsloth、ONNX、NVIDIA TensorRT、W&B、SGLang 與 FlashAttention。

  • 廣泛方法支援

    23 種訓練方法、142 種配方、17 種量化格式。

  • Apple 硬體支援

    內建適用於 Apple Silicon 的 MLX 轉接器。

  • 開放原始碼

    採用 Apache-2.0 授權,支援 Python 3.10 至 3.12,無廠商綁定。

目標使用者

Soup CLI 是為機器學習工程師和 AI 研究人員打造的,讓你在沒有昂貴 GPU 叢集的情況下,也能微調或對齊開源模型。它適合已在使用 LLaMA-Factory、Axolotl 或 Unsloth 等工具的團隊,想進一步自動化訓練流程。在筆電或單 GPU 工作站上開發的人,會特別受惠於其 VRAM 效率與層級串流技術。此外,它也吸引那些希望在訓練流程中內建明確 ship / don't-ship 決策機制的實務工作者。

如何使用 Soup CLI?

  1. 安裝:pip install "soup-cli[train]"
  2. 執行 soup init 建立 soup.yaml 設定檔。
  3. 執行 soup train 開始訓練。
  4. 若要從其他工具遷移,使用 soup migrate --from llamafactory config.yaml(或對應的 axolotl / unsloth 參數)。
  5. 完整細節請見官方網站:https://trysoup.dev/。

效果評價

Soup CLI 的核心承諾——在 4 GB 筆電 GPU 上微調 Llama-3.1-8B——對沒有高階硬體的開發者來說,是相當實用的優勢。自動產生的設定與遷移工具大幅減少了訓練前置作業的繁瑣流程,確實能節省時間。SHIP / DON'T-SHIP 儲存把關與獎勵駭取修正,則提供了多數訓練工具缺乏的品質控管層級。雖然官方網站沒有提供使用者見證或基準測試數據,但功能架構完整且直接對應後訓練流程中的常見痛點。Apache-2.0 授權加上無廠商綁定,讓它成為生產環境中安全的選擇。

Frequently Asked Questions

Soup CLI 是什麼?
Soup CLI 是一款微調工具,可在 4 GB 筆電 GPU 上訓練並對齊 Llama-3.1-8B 模型,支援 DPO 與 ORPO 等方法。
Soup CLI 能在低階硬體上運作嗎?
可以。Soup CLI 針對 VRAM 使用效率做了最佳化,即使只有 4 GB 筆電 GPU 也能進行微調,不需要高階硬體。
Soup CLI 支援哪些微調方法?
它支援 DPO(直接偏好最佳化)、ORPO(勝率比偏好最佳化)以及其他對齊技術。
Soup CLI 是否支援串流推論?
是的,它具備串流推論功能,可在訓練期間或訓練後即時產生 token。
Soup CLI 相容哪些後端?
它提供多後端相容性,可整合各種硬體與軟體環境。
Soup CLI 可以免費使用嗎?
官方說明中並未明確標示價格;授權與費用細節請參閱 Soup CLI 的官方文件。

Soup CLI - AI Tool Detail

Soup CLI 是 Soup 推出的微調工具,可在 4 GB 筆電 GPU 上訓練與對齊 Llama-3.1-8B,支援 DPO、ORPO 等多種方法,具備串流推論、節省 VRAM,並相容多種後端。

Category:模型微調

Visit Link:https://trysoup.dev/

Tags:微調、Llama 3.1、DPO 訓練、ORPO 訓練、省顯存