
Soup CLI es la herramienta de ajuste fino de Soup para entrenar y alinear Llama-3.1-8B en una GPU de portátil con solo 4 GB. Compatible con DPO, ORPO y más, ofrece inferencia en streaming, eficiencia de VRAM y soporte multi-backend.
Soup CLI es una herramienta de línea de comandos gratuita y de código abierto que gestiona todo el stack de post-entrenamiento para modelos de IA, desde la preparación de datos hasta el ajuste fino y la evaluación. Escribe automáticamente la configuración de entrenamiento por ti, utilizando reglas en lugar de búsqueda manual para determinar el tipo de tarea, la cuantización, la tasa de aprendizaje y las épocas. La herramienta admite 23 métodos de entrenamiento, 142 recetas y 17 formatos de cuantización, con integraciones para MLX y hardware de Apple. Los usuarios la instalan vía pip, inicializan un archivo de configuración y ejecutan un único comando soup train para comenzar el entrenamiento. Está diseñada para funcionar en hardware modesto, ajustando Llama-3.1-8B en una GPU de portátil con 4 GB de VRAM.
Ajuste fino en GPU de portátil
Entrena y alinea Llama-3.1-8B en una GPU de 4 GB sin cargar el modelo base congelado completo en memoria.
Entrenamiento de alineación
Ejecuta métodos de alineación DPO, ORPO, SimPO y KTO con soporte de streaming.
Migración de configuraciones
Cambia desde LLaMA-Factory, Axolotl o Unsloth en unos 30 segundos usando el comando `soup migrate`.
Verificaciones previas de datos
Valida y "sanea" tus datos de entrenamiento antes de iniciar una ejecución.
Entrenamiento basado en evaluación
Deriva métricas de evaluación desde tu propio conjunto de datos y condiciona cada guardado del modelo a un veredicto de APROBADO o NO APROBADO.
Entrenamiento de voz y texto
Entrena con texto o voz sin borrar tareas previamente aprendidas.
Configuraciones autogeneradas
Soup escribe toda la configuración de entrenamiento (tarea, cuantización, LR, épocas) basándose en reglas, no en ajuste manual.
Streaming por capas
Transmite el modelo base congelado desde RAM o NVMe capa por capa, cuantizando a 4 bits, para que modelos grandes quepan en GPUs pequeñas.
Corrección de reward hacking
Se autocorrige ante el reward hacking a mitad de ejecución, en lugar de simplemente detener el entrenamiento.
Control de guardado
Cada guardado del modelo está condicionado a un veredicto de APROBADO o NO APROBADO que puedes confirmar junto con los pesos.
Herramienta de migración
Un solo comando convierte configuraciones existentes desde notebooks de LLaMA-Factory, Axolotl o Unsloth.
Compatibilidad multi-backend
Se integra con HuggingFace, Ollama, vLLM, DeepSpeed, Unsloth, ONNX, NVIDIA TensorRT, W&B, SGLang y FlashAttention.
Amplio soporte de métodos
23 métodos de entrenamiento, 142 recetas y 17 formatos de cuantización.
Soporte para hardware Apple
Incluye un adaptador MLX para Apple Silicon.
Código abierto
Licencia Apache-2.0, compatible con Python 3.10 a 3.12, sin dependencia de proveedor.
Soup CLI está diseñada para ingenieros de machine learning e investigadores de IA que necesitan ajustar o alinear modelos de código abierto sin necesidad de costosos clústeres de GPU. Es adecuada para equipos que ya usan herramientas como LLaMA-Factory, Axolotl o Unsloth y buscan un pipeline más automatizado. Los desarrolladores que trabajan en portátiles o estaciones de trabajo con una sola GPU encontrarán especialmente útiles la eficiencia de VRAM y el streaming por capas. También resulta atractiva para profesionales que quieren entrenamiento basado en evaluación con decisiones claras de aprobación/no aprobación integradas en el flujo de trabajo.
pip install "soup-cli[train]".soup init para crear un archivo de configuración soup.yaml.soup train para comenzar el entrenamiento.soup migrate --from llamafactory config.yaml (o los equivalentes para axolotl/unsloth).La promesa principal de Soup CLI—ajustar Llama-3.1-8B en una GPU de portátil con 4 GB—es una ventaja práctica significativa para desarrolladores sin acceso a hardware de gama alta. Las configuraciones autogeneradas y las herramientas de migración eliminan gran parte de la fricción asociada con la configuración de ejecuciones de entrenamiento, lo que supone un auténtico ahorro de tiempo. El control de guardado APROBADO/NO APROBADO y la corrección del reward hacking añaden una capa de control de calidad de la que carecen la mayoría de las herramientas de entrenamiento. Aunque el sitio web no incluye testimonios de usuarios ni resultados de benchmarks, el conjunto de funciones es coherente y aborda directamente los problemas comunes en los flujos de trabajo de post-entrenamiento. La licencia Apache-2.0 y la ausencia de dependencia de proveedor la convierten en una opción segura para uso en producción.
Soup CLI es la herramienta de ajuste fino de Soup para entrenar y alinear Llama-3.1-8B en una GPU de portátil con solo 4 GB. Compatible con DPO, ORPO y más, ofrece inferencia en streaming, eficiencia de VRAM y soporte multi-backend.
Category:Ajuste del modelo
Visit Link:https://trysoup.dev/
Tags:ajuste-fino、llama-3.1、dpo、orpo、eficiente-en-vram