Workflow1111: cómo reconstruir AUTOMATIC1111 con Gradio Workflow

Workflow1111 reensambla la mayoría de funciones de AUTOMATIC1111 sobre un único lienzo de Gradio Workflow, integrando modelos SOTA para text-to-image, hi-res fix, interrogación visual, máscaras de inpaint y más. Este enfoque modular facilita pruebas locales y adaptación para contextos con restricciones de red.

Por Redaccion TD
Workflow1111: cómo reconstruir AUTOMATIC1111 con Gradio Workflow

Introducción

Workflow1111 es una reconstrucción ambiciosa del famoso frontend AUTOMATIC1111 (stable-diffusion-webui) dentro del ecosistema de Gradio Workflow. En lugar de ventanas y pestañas tradicionales, el proyecto organiza once pipelines de medios en un solo lienzo gráfico compuesto por setenta y tres nodos. El resultado es una plataforma modular que combina modelos de última generación para generación, edición y análisis de imágenes.

Para quienes trabajan en equipos creativos, agencias o iniciativas de IA en América Latina, Workflow1111 ejemplifica cómo migrar flujos de trabajo complejos a una arquitectura basada en nodos, que facilita la reutilización, la auditoría y la adaptación a restricciones locales de conectividad o presupuesto.

Cómo se ejecuta y control de cuota

Pueden ejecutar cualquiera de los pipelines iniciando sesión con una cuenta de Hugging Face o proporcionando un token de acceso. Cuando inician sesión, las llamadas a los modelos consumen la cuota asociada a su cuenta, lo que permite control y trazabilidad del consumo —un aspecto relevante para proyectos con presupuesto o límites de uso definidos.

Los cuatro tipos de operadores en el lienzo

Todas las piezas del lienzo se construyen a partir de cuatro tipos de operadores:

  • fn: funciones Python que pueden ejecutar procesamiento local (por ejemplo, con Pillow o NumPy).
  • model: llamadas a modelos mediante InferenceClient.
  • space: invocaciones a otra Gradio Space alojada en el Hub.
  • dataset: filas de un dataset del Hub.

Cada nodo encapsula un operador; los puertos de entrada y salida del operador se conectan con aristas que determinan el flujo de datos.

Pipeline central: Text-to-image

El pipeline principal replica las opciones clásicas de la pestaña txt2img de A1111: prompt y negative prompt, pasos, CFG, seed, tamaño y un campo model_id para elegir checkpoint. El prompt primero pasa por un nodo fn de construcción que aplica presets de estilo y limpia el texto, luego se envía a un nodo model que llama al checkpoint a través de los proveedores de inferencia. Un post-process fn escribe los parámetros de generación en los metadatos PNG; esos metadatos son leídos más tarde por la pipeline PNG Info.

Hi-resolution fix

En AUTOMATIC1111, el hi-res fix suele escalar la imagen y aplicar un segundo paso de denoising. En Workflow1111 esto se resuelve con un desvío de dos nodos: la salida de text-to-image entra a un modelo FLUX.1-Kontext con una instrucción de refinamiento —“enhance fine detail and micro-texture, keep the composition identical”— y vuelve con más nitidez y resolución.

Image-to-image

El mismo modelo Kontext funciona también como la pestaña image-to-image: suban una imagen, describan el cambio deseado y obtendrán la variante editada por el modelo.

Generar prompts con un LLM

Si parte de su proceso creativo incluye delegar la redacción del prompt a un modelo, hay un pipeline que toma un prompt bruto (por ejemplo, “A lighthouse in a storm”) y lo envía a Qwen3-4B. Una pequeña función transforma la respuesta en una lista depurada de etiquetas, limitada a cuarenta. Cualquier nodo de difusión puede conectarse a esa salida para renderizar la imagen. En este lienzo, tanto el LLM como los modelos de difusión son operadores regulares, sin necesidad de nodos especializados.

Interrogación visual (VLM) y clasificación

La función Interrogate se implementa con un VLM: Qwen2.5-VL analiza una foto (por ejemplo, un mercado nocturno) y genera un prompt que podría haberla producido. En paralelo, un clasificador ViT lee la misma imagen y devuelve etiquetas con probabilidades (por ejemplo: restaurant 51.9%, tobacco shop 15.6%, toyshop 9.1%). Gradio Workflow ejecuta ambos nodos en paralelo cuando comparten la misma entrada, reduciendo latencias.

De detección a máscara de inpaint

En lugar de pedirle al usuario que pinte una máscara manualmente, Workflow1111 incorpora un detector (DETR) que localiza objetos en la foto. En el ejemplo, DETR encuentra seis objetos: tres personas, un perro, una bicicleta y un auto. A partir de la detección, el flujo se bifurca: una rama dibuja las cajas detectadas sobre la imagen original y la otra genera la máscara de inpaint. El dibujo y la creación de máscara se realizan localmente con Pillow y NumPy; únicamente la llamada de detección sale a la red.

Prompt matrix y ejecución paralela

La matriz de prompts funciona como en AUTOMATIC1111: un prompt base (“a lone oak tree”) se combina con cuatro sufijos (por ejemplo, “at sunrise”, “in a thunderstorm”, etc.) mediante una función que genera las variantes. Dado que Gradio Workflow no tiene un operador de bucle, las cuatro variantes se asignan a cuatro nodos text-to-image alineados en el mismo nivel de dependencia, lo que permite que se ejecuten en paralelo y generen las cuatro imágenes simultáneamente. Una etapa final compone un contact sheet con los resultados.

Upscale y remoción de fondo

La pestaña Extras se reproduce con dos enfoques de upscale: uno local y otro remoto. El primero usa un remuestreo Lanczos implementado en una función Python (Pillow), lo que evita llamadas de red y ejecuta tan rápido como la CPU lo permita. El segundo usa AuraSR ×4 y se implementa como un nodo space que invoca otra Space en el Hub. La remoción de fondo sigue el mismo patrón; BRIA RMBG-2.0 es llamado como espacio remoto.

Annotators tipo ControlNet

Los preprocesos tipo ControlNet —Canny, line art, sketch, luma-depth, posterize— se implementan como nodos fn escritos en NumPy. En un ejemplo precargado (la fachada de un edificio), cada anotador tarda alrededor de medio segundo en CPU. En total la app contiene 36 operadores, de los cuales 32 son fn nodes y 22 de esos funcionan completamente en proceso sin llamadas de red. Eso significa que aproximadamente dos tercios del lienzo continúa operando si se pierde la conexión.

PNG Info y trazabilidad

Como en AUTOMATIC1111, Workflow1111 escribe los parámetros de generación en el chunk de texto de los PNG. La pipeline PNG Info lee esos metadatos para mostrar configuraciones y facilitar reproducibilidad y auditoría.

Relevancia para América Latina y consideraciones prácticas

Para equipos en América Latina, el enfoque de Workflow1111 ofrece ventajas concretas: la posibilidad de ejecutar muchas transformaciones localmente reduce la dependencia de ancho de banda; el uso de nodos fn para tareas determinísticas facilita pruebas sin GPU; y la integración con Hugging Face permite gestionar cuotas y modelos desde una cuenta central. Al mismo tiempo, al apoyarse en Spaces remotos se mantienen disponibles modelos especializados sin necesidad de desplegarlos localmente.

Conclusión

Workflow1111 muestra cómo reconstruir un frontend complejo como AUTOMATIC1111 sobre Gradio Workflow, manteniendo la mayoría de funcionalidades y aportando modularidad, paralelismo y mayor control sobre dónde se ejecuta cada paso. Para organizaciones y creativos que buscan adaptar pipelines de generación y edición de imágenes a entornos con limitaciones operativas, este enfoque es un ejemplo práctico y replicable.

Si quieren probarlo, pueden ejecutar Workflow1111 desde el Hub de Hugging Face o duplicar el Space para empezar a reconfigurarlo según sus necesidades.

Fuente original: Hugging Face Blog