Soup CLI 是一款免費、開源的命令列工具,涵蓋 AI 模型後訓練(post-training)的完整流程——從資料準備、微調到評估。它會根據規則自動幫你寫好訓練設定,不需要手動摸索任務類型、量化方式、學習率和訓練輪數(epochs)。這套工具支援 23 種訓練方法、142 種配方(recipes)和 17 種量化格式,並整合 MLX 與 Apple 硬體。使用者透過 pip 安裝、初始化設定檔,再執行單一指令 soup train 即可開始訓練。它設計上可在一般規格硬體運行,例如在 4 GB 顯卡的筆電 GPU 上微調 Llama-3.1-8B。
筆電 GPU 微調
在 4 GB 顯卡上訓練與對齊 Llama-3.1-8B,無需將完整凍結的基礎模型載入記憶體。
對齊訓練
支援 DPO、ORPO、SimPO 和 KTO 對齊方法,並具備串流(streaming)處理能力。
設定遷移
使用 `soup migrate` 指令,約 30 秒即可從 LLaMA-Factory、Axolotl 或 Unsloth 轉換設定。
資料前檢核
在開始訓練前,驗證並「修復」(doctor)你的訓練資料。
評估驅動訓練
從自己的資料集產生評估指標,並以 SHIP 或 DON'T-SHIP 的判定來把關每一次模型儲存。
語音與文字訓練
可訓練文字或語音模型,不會覆蓋先前已學習的任務。
自動產生設定
Soup 會根據規則自動寫出完整的訓練設定(任務、量化、學習率、訓練輪數),不需手動調整。
層級串流(Layer streaming)
將凍結的基礎模型從 RAM 或 NVMe 逐層串流載入,並量化至 4-bit,讓大型模型也能在小型 GPU 上運行。
獎勵駭取(Reward hacking)修正
訓練中途會自動修正獎勵駭取問題,而非單純中止訓練。
儲存把關(Save gating)
每次模型儲存都會以 SHIP 或 DON'T-SHIP 判定為門檻,你可將此判定與權重一起提交。
遷移工具
單一指令即可轉換 LLaMA-Factory、Axolotl 或 Unsloth notebook 的既有設定。
多後端相容性
整合 HuggingFace、Ollama、vLLM、DeepSpeed、Unsloth、ONNX、NVIDIA TensorRT、W&B、SGLang 與 FlashAttention。
廣泛方法支援
23 種訓練方法、142 種配方、17 種量化格式。
Apple 硬體支援
內建適用於 Apple Silicon 的 MLX 轉接器。
開放原始碼
採用 Apache-2.0 授權,支援 Python 3.10 至 3.12,無廠商綁定。
Soup CLI 是為機器學習工程師和 AI 研究人員打造的,讓你在沒有昂貴 GPU 叢集的情況下,也能微調或對齊開源模型。它適合已在使用 LLaMA-Factory、Axolotl 或 Unsloth 等工具的團隊,想進一步自動化訓練流程。在筆電或單 GPU 工作站上開發的人,會特別受惠於其 VRAM 效率與層級串流技術。此外,它也吸引那些希望在訓練流程中內建明確 ship / don't-ship 決策機制的實務工作者。
pip install "soup-cli[train]"soup init 建立 soup.yaml 設定檔。soup train 開始訓練。soup migrate --from llamafactory config.yaml(或對應的 axolotl / unsloth 參數)。Soup CLI 的核心承諾——在 4 GB 筆電 GPU 上微調 Llama-3.1-8B——對沒有高階硬體的開發者來說,是相當實用的優勢。自動產生的設定與遷移工具大幅減少了訓練前置作業的繁瑣流程,確實能節省時間。SHIP / DON'T-SHIP 儲存把關與獎勵駭取修正,則提供了多數訓練工具缺乏的品質控管層級。雖然官方網站沒有提供使用者見證或基準測試數據,但功能架構完整且直接對應後訓練流程中的常見痛點。Apache-2.0 授權加上無廠商綁定,讓它成為生產環境中安全的選擇。
Soup CLI 是 Soup 推出的微調工具,可在 4 GB 筆電 GPU 上訓練與對齊 Llama-3.1-8B,支援 DPO、ORPO 等多種方法,具備串流推論、節省 VRAM,並相容多種後端。
Category:模型微調
Visit Link:https://trysoup.dev/
Tags:微調、Llama 3.1、DPO 訓練、ORPO 訓練、省顯存