
Soup CLI é a ferramenta da Soup para fine-tuning e alinhamento do Llama-3.1-8B direto em GPUs de notebook com apenas 4 GB de VRAM. Suporta DPO, ORPO e mais, com inferência em streaming e compatibilidade multi-backend, otimizando memória para máxima eficiência.
O Soup CLI é uma ferramenta de linha de comando gratuita e de código aberto que gerencia todo o pipeline de pós-treinamento para modelos de IA — da preparação de dados ao fine-tuning e avaliação. Ele escreve a configuração de treinamento para você, usando regras em vez de busca manual para determinar o tipo de tarefa, quantização, taxa de aprendizado e épocas. A ferramenta suporta 23 métodos de treinamento, 142 receitas e 17 formatos de quantização, com integrações para MLX e hardware Apple. Os usuários instalam via pip, inicializam um arquivo de configuração e executam um único comando soup train para iniciar o treinamento. Foi projetado para rodar em hardware modesto, fazendo fine-tuning do Llama-3.1-8B em uma GPU de laptop com 4 GB.
Fine-tuning em GPU de laptop
Treinar e alinhar o Llama-3.1-8B em uma GPU de 4 GB sem carregar o modelo base congelado inteiro na memória.
Treinamento de alinhamento
Executar métodos de alinhamento DPO, ORPO, SimPO e KTO com suporte a streaming.
Migração de configuração
Trocar do LLaMA-Factory, Axolotl ou Unsloth em cerca de 30 segundos usando o comando `soup migrate`.
Verificações pré-treino de dados
Validar e "corrigir" seus dados de treinamento antes de iniciar uma execução.
Treinamento orientado por avaliação
Derivar métricas de avaliação do seu próprio conjunto de dados e condicionar cada salvamento do modelo a um veredito SHIP ou DON'T-SHIP.
Treinamento de fala e texto
Treinar em texto ou fala sem apagar tarefas aprendidas anteriormente.
Configurações geradas automaticamente
O Soup escreve toda a configuração de treinamento (tarefa, quantização, LR, épocas) com base em regras, não em ajuste manual.
Streaming por camadas
Transmite o modelo base congelado da RAM ou NVMe uma camada por vez, quantizando para 4 bits, para que modelos grandes caibam em GPUs pequenas.
Correção de reward hacking
Corrige automaticamente o reward hacking durante a execução, em vez de simplesmente interromper o treinamento.
Gating de salvamento
Cada salvamento do modelo é condicionado a um veredito SHIP ou DON'T-SHIP que você pode commitar junto com os pesos.
Ferramenta de migração
Um comando converte configurações existentes de notebooks LLaMA-Factory, Axolotl ou Unsloth.
Compatibilidade multi-backend
Integra-se com HuggingFace, Ollama, vLLM, DeepSpeed, Unsloth, ONNX, NVIDIA TensorRT, W&B, SGLang e FlashAttention.
Ampla variedade de métodos
23 métodos de treinamento, 142 receitas e 17 formatos de quantização.
Suporte a hardware Apple
Inclui um adaptador MLX para Apple silicon.
Código aberto
Licença Apache-2.0, suporta Python 3.10 a 3.12, sem vendor lock-in.
O Soup CLI foi criado para engenheiros de machine learning e pesquisadores de IA que precisam fazer fine-tuning ou alinhamento de modelos de código aberto sem depender de clusters caros de GPU. É adequado para equipes que já usam ferramentas como LLaMA-Factory, Axolotl ou Unsloth e desejam um pipeline mais automatizado. Desenvolvedores que trabalham em laptops ou workstations com uma única GPU encontrarão a eficiência de VRAM e o streaming por camadas particularmente úteis. Também atrai profissionais que buscam treinamento orientado por avaliação, com decisões claras de ship/don't-ship incorporadas ao fluxo de trabalho.
pip install "soup-cli[train]".soup init para criar um arquivo de configuração soup.yaml.soup train para iniciar o treinamento.soup migrate --from llamafactory config.yaml (ou os equivalentes para axolotl/unsloth).A promessa central do Soup CLI — fazer fine-tuning do Llama-3.1-8B em uma GPU de laptop com 4 GB — é uma vantagem prática significativa para desenvolvedores sem acesso a hardware de ponta. As configurações geradas automaticamente e as ferramentas de migração eliminam grande parte do atrito associado à configuração de execuções de treinamento, o que representa uma economia real de tempo. O gating de salvamento SHIP/DON'T-SHIP e a correção de reward hacking adicionam uma camada de controle de qualidade que a maioria das ferramentas de treinamento não oferece. Embora o site não inclua depoimentos de usuários ou resultados de benchmarks, o conjunto de recursos é coerente e aborda diretamente os pontos problemáticos comuns em fluxos de pós-treinamento. A licença Apache-2.0 e a ausência de vendor lock-in tornam a ferramenta uma escolha segura para uso em produção.
Soup CLI é a ferramenta da Soup para fine-tuning e alinhamento do Llama-3.1-8B direto em GPUs de notebook com apenas 4 GB de VRAM. Suporta DPO, ORPO e mais, com inferência em streaming e compatibilidade multi-backend, otimizando memória para máxima eficiência.
Category:Ajuste fino de modelo
Visit Link:https://trysoup.dev/
Tags:ajuste-fino、llama-3.1、dpo、orpo、eficiência-de-vram