Configuration Parsing Warning:In adapter_config.json: "peft.base_model_name_or_path" must be a string

Configuration Parsing Warning:In adapter_config.json: "peft.task_type" must be a string

tfg-diffusion-dpo-sdxl-r8

Adaptador LoRA r=8 sobre el UNet de Stable Diffusion XL base 1.0, entrenado con Diffusion-DPO siguiendo la receta de Wallace et al. (2024) adaptada al pipeline diffusers.

Configuración

  • Base: stabilityai/stable-diffusion-xl-base-1.0 (UNet)
  • LoRA: r=8, alpha=8, target_modules=[to_q, to_k, to_v, to_out.0]
  • Dataset: kashif/pickascore (500 pares filtrados)
  • Loss: log-sigmoide de Wallace 2024 con beta=2000
  • Pasos: 210 sobre A100 80 GB (~33 min)

Resultado

Resultado nulo a esta escala (deltas MSE 10⁻⁵-10⁻⁴, CLIPSIM idéntico al base sobre los 20 prompts evaluados). El factor limitante es el tamaño del dataset, no la duración del entrenamiento: Wallace et al. emplean del orden de 800.000 pares y 24 días-GPU.

El experimento sirve como verificación de pipeline end-to-end del Diffusion-DPO sobre SDXL. Las consideraciones de escalado quedan en las líneas futuras.

Downloads last month
5
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for airdude/tfg-diffusion-dpo-sdxl-r8

Adapter
(9725)
this model