Orquestación en directo se mueve solo cuando hay actividad real
Línea de tiempo de decisiones hora de Madrid
Cómo decide el arbiter
- Mira la GPU cada segundo: cuánta memoria hay libre, qué trabajo corre en ComfyUI y qué modelos hay cargados en Ollama y llama-swap.
- El chat va primero. Cuando core-ai pide un turno, el arbiter comprueba si el modelo cabe. Si cabe, pasa al instante.
- Si no cabe, primero suelta lo que está parado (modelos sin uso, memoria de ComfyUI sin trabajo) y el turno espera (pulso ámbar).
- Si sigue sin caber por culpa de un trabajo de ComfyUI, pasado el plazo del plan B lo interrumpe y lo guarda («retenido») para repetirlo después. Un cliente sin plan B recibe «ocupado» al momento y core-ai usa Bedrock.
- ComfyUI y el chat conviven si caben los dos. Si ComfyUI lleva un rato sin trabajar y sigue reteniendo memoria, se le pide que la suelte (
free). - Los retenidos vuelven cuando hay hueco: de noche y en fin de semana (ventana de drenado), o antes si los retiró un turno y ya hay sitio.
- DRY-RUN solo apunta lo que haría; LIVE lo ejecuta de verdad.
Próxima acción
Cuentas atrás se actualizan cada segundo
Leyenda
Líneas
- Peticiones: alguien pide trabajo. Los puntos viajan solo mientras hay peticiones en curso.
- Control del arbiter: se enciende y muestra la acción (
free,steal,inject,unload,interrumpir) cuando actúa. - Uso de la GPU: color del servicio; cuanto más gruesa, más memoria ocupa.
- Pulso ámbar: hay un turno de chat esperando sitio.
Memoria de la GPU
- Ollama
- llama-swap (chat)
- ComfyUI
- Whisper (Speaches)
- Otros
- Reservada para un turno que aún no ha cargado
- Libre
Eventos de la línea de tiempo
- Acción del arbiter (o propuesta en dry-run)
- Turno de chat: pasa, espera o se rechaza
- Un modelo se carga o se descarga
- Cambio de ventana horaria