>_ DevTrendses

Idioma

Inicio

Lenguajes

Secciones

Frontend Backend Móvil DevOps AI / ML GameDev Blockchain Embebidos Seguridad
Unknown

Cómo crear cine de IA multimodal en un único lienzo infinito

Si alguna vez has intentado crear algo más complejo que una simple generación de imágenes—como un clip animado corto o un storyboard para un video musical—conoces este infierno. La primera pestaña del navegador tiene ChatGPT abierto para el guión. La segunda ejecuta Midjourney o Stable Diffusion. La tercera tiene ElevenLabs para la voz en off. La cuarta tiene Runway o Luma abierto para animación de fotogramas. Y en algún lugar del fondo, un ComfyUI local con un grafo de trescientos nodos está zumbando.

Como resultado, tu escritorio se convierte en un vertedero de archivos PNG con nombres extraños como final_v2_really_final.png, y transferir contexto entre redes neuronales lleva más tiempo que el trabajo creativo real.

Un desarrollador chino con el apodo ashuoAI intentó resolver este problema con el proyecto SHUO Canvas (anteriormente conocido como AI-CanvasPro). Es una aplicación de escritorio que combina generación de texto, gráficos, audio y video en una única pizarra interactiva.

Guión y storyboard en el entorno de trabajo

Cómo funciona el Lienzo

En el núcleo de SHUO Canvas está la idea de un espacio de trabajo infinito, similar a Figma, Miro o ComfyUI, pero adaptado para la producción integral de contenido multimedia. En lugar de cambiar entre servicios, colocas los elementos directamente en la pizarra y los conectas con líneas lógicas.

Cada elemento en la pizarra es un nodo. Un nodo puede ser un prompt de texto, una imagen subida, un clip de video generado, una pista de audio o un bloque de control completo. Conectas las salidas de algunos nodos a las entradas de otros, construyendo una cadena: guión -> generación de fotogramas -> animación -> voz en off y edición.

La aplicación puede guardar automáticamente el estado del lienzo al reiniciar, y para transferir un proyecto a otra PC, genera un único archivo .aicpkg con todos los recursos utilizados.

Reemplazando personajes en fotogramas

Qué hay de interesante en su interior

Los desarrolladores no se limitaron a una cuadrícula básica de generadores de imágenes. Dentro de la aplicación, hay varios nodos especializados que rara vez se encuentran en herramientas tan todo-en-uno.

Storyboarding y Dirección 3D

Para quienes construyen historias en video, se ha añadido un nodo de guión de director. Ayuda a descomponer el texto en escenas individuales, describir movimientos de cámara, diálogos y efectos de sonido.

Trabajando junto a él hay un nodo de dirección 3D. Aquí puedes colocar esquemáticamente personajes en el espacio, establecer el ángulo de la cámara virtual y posicionar objetos. El esquema 3D resultante se pasa más abajo en la cadena como imagen de referencia (ControlNet/IP-Adapter) para generar el fotograma final. Esto ayuda a mantener la perspectiva y composición de fotograma a fotograma.

Dirección 3D

Herramientas de procesamiento en el lienzo

Directamente en el lienzo, puedes recortar video, cortar pistas de audio, eliminar fondos, eliminar objetos no deseados de imágenes o ensamblar collages. Para trabajar con pipelines de generación de video, se han añadido nodos para dividir video en fotogramas individuales y sincronización labial precisa.

Si necesitas crear una cuadrícula de variantes o un panorama, se utilizan nodos separados:

  • Grid divide el storyboard en bloques para generación por lotes.
  • 360 Panorama transforma una imagen plana en un entorno esférico interactivo.

Nodo de edición en el lienzo

Asistente de IA integrado

Para evitar perder tiempo creando manualmente docenas de nodos, un agente está integrado en el sistema. A través del símbolo @ en el campo de texto, haces referencia a cualquier objeto en el lienzo (imagen, texto o video). El símbolo / invoca plantillas de prompts rápidos.

Además, el asistente de diálogo en la esquina de la pantalla puede ejecutar comandos en la pizarra misma: crear nodos, conectarlos y lanzar generación por lotes desde una consulta de texto.

Integraciones y conexión de redes neuronales

SHUO Canvas no incluye sus propios modelos generativos de fábrica. Es un cliente gráfico que envía solicitudes a proveedores externos o servidores locales.

Importando flujos de trabajo de ComfyUI y RunningHub

Las siguientes opciones de conexión son compatibles:

  • ComfyUI local o en la nube. Puedes importar flujos de trabajo JSON de ComfyUI directamente en la pizarra de SHUO Canvas.
  • La plataforma RunningHub para ejecutar pipelines de ComfyUI en la nube.
  • APIs directas de servicios en la nube chinos (Jimeng, Volcengine, APImart, GRSAI).
  • Cualquier proveedor con API compatible con OpenAI para modelos de texto.

Este esquema proporciona libertad: si quieres, puedes ejecutar todo localmente con tu propia potencia GPU a través de ComfyUI, o conectar APIs de terceros y no forzar tu hardware.

Varios matices importantes

Antes de descargar la distribución, debes considerar algunas características del proyecto.

Primero, el proyecto no es de código abierto en el sentido tradicional (Non-Open-Source / NC). El repositorio de GitHub sirve como plataforma para publicaciones de lanzamientos, documentación y un rastreador de tareas. La aplicación en sí se distribuye como compilaciones listas para usar para Windows y macOS (se admiten chips Apple Silicon).

Segundo, la monetización se basa en la activación del software. El desarrollador cobra una tarifa por la licencia del programa, y tú pagas por las generaciones directamente a los servicios cuyas claves API ingresas en la configuración.

Tercero, la interfaz y los videos tutoriales están principalmente dirigidos a audiencias de habla china e inglesa, aunque el control básico a través de atajos de teclado no presenta dificultades. Se utilizan atajos familiares para la navegación del lienzo: Space + ЛКМ para mover, Alt + перетаскивание para duplicar un nodo con conexiones, Ctrl+Z para deshacer acciones.

Quién debería probarlo

SHUO Canvas será interesante para quienes están hartos del caos al crear contenido generativo complejo. Si tu flujo de trabajo implica una combinación de ComfyUI, editores de video y generadores de voz, el concepto de lienzo único ahorrará mucho tiempo.

El proyecto se desarrolla rápidamente: la versión 0.7.1 trajo algoritmos de control de personajes actualizados y personalización flexible de atajos de teclado. Puedes descargar compilaciones para Windows y macOS en la sección de lanzamientos en GitHub.

Proyectos relacionados