Como Criar Cinema de IA Multimodal em uma Única Tela Infinita
Se você já tentou criar algo mais complexo do que uma simples geração de imagem—como um clipe animado curto ou um storyboard para um videoclipe—você conhece esse inferno. A primeira aba do navegador tem o ChatGPT aberto para o roteiro. A segunda executa o Midjourney ou o Stable Diffusion. A terceira tem o ElevenLabs para narração. A quarta tem o Runway ou o Luma aberto para animação de quadros. E em algum lugar em segundo plano, um ComfyUI local com um grafo de trezentos nós está funcionando silenciosamente.
Como resultado, sua área de trabalho se transforma em um despejo de arquivos PNG com nomes estranhos como final_v2_really_final.png, e transferir contexto entre redes neurais leva mais tempo do que o próprio trabalho criativo.
Um desenvolvedor chinês sob o pseudônimo ashuoAI tentou resolver esse problema com o projeto SHUO Canvas (anteriormente conhecido como AI-CanvasPro). É um aplicativo desktop que combina geração de texto, gráficos, áudio e vídeo em uma única tela interativa.

Como a Tela Funciona
No centro do SHUO Canvas está a ideia de um espaço de trabalho infinito, similar ao Figma, Miro ou ComfyUI, mas adaptado para produção abrangente de conteúdo de mídia. Em vez de alternar entre serviços, você organiza os elementos diretamente na tela e os conecta com linhas lógicas.
Cada elemento na tela é um nó. Um nó pode ser um prompt de texto, uma imagem carregada, um clipe de vídeo gerado, uma faixa de áudio ou um bloco de controle completo. Você conecta as saídas de alguns nós às entradas de outros, construindo uma cadeia: roteiro -> geração de quadros -> animação -> narração e edição.
O aplicativo pode salvar automaticamente o estado da tela ao reiniciar, e para transferir um projeto para outro PC, ele gera um único arquivo compactado .aicpkg com todos os recursos utilizados.

O Que Há de Interessante Por Dentro
Os desenvolvedores não se limitaram a uma grade básica de geradores de imagem. Dentro do aplicativo, existem vários nós especializados que raramente se encontram em ferramentas tão completas.
Storyboarding e Direção 3D
Para quem constrói histórias em vídeo, foi adicionado um nó de roteiro de direção. Ele ajuda a dividir o texto em cenas individuais, descrever movimentos de câmera, diálogos e efeitos sonoros.
Trabalhando junto com ele está um nó de direção 3D. Aqui você pode posicionar schematicamente personagens no espaço, definir o ângulo da câmera virtual e posicionar objetos. O esquema 3D resultante é passado adiante na cadeia como uma imagem de referência (ControlNet/IP-Adapter) para gerar o quadro final. Isso ajuda a manter a perspectiva e a composição de quadro a quadro.

Ferramentas de Processamento na Própria Tela
Diretamente na tela, você pode cortar vídeos, editar trilhas sonoras, remover fundos, eliminar elementos indesejados de imagens ou montar colagens. Para trabalhar com pipelines de geração de vídeo, foram adicionados nós para dividir vídeos em quadros individuais e sincronização labial precisa.
Se você precisa criar uma grade de variantes ou uma panorâmica, são usados nós separados:
- Grid divide o storyboard em blocos para geração em lote.
- 360 Panorama transforma uma imagem plana em um ambiente esférico interativo.

Assistente de IA Integrado
Para evitar perder tempo criando manualmente dezenas de nós, um agente é construído no sistema. Através do símbolo @ no campo de texto, você referencia qualquer objeto na tela (imagem, texto ou vídeo). O símbolo / chama modelos de prompt rápido.
Além disso, o assistente de diálogo no canto da tela pode executar comandos na própria tela: criar nós, conectá-los e iniciar geração em lote a partir de uma consulta de texto.
Integrações e Conexão de Redes Neurais
O SHUO Canvas não inclui seus próprios modelos generativos por padrão. É um cliente gráfico que envia solicitações para provedores externos ou servidores locais.

As seguintes opções de conexão são suportadas:
- ComfyUI local ou em nuvem. Você pode importar fluxos de trabalho JSON do ComfyUI diretamente para a tela do SHUO Canvas.
- A plataforma RunningHub para executar pipelines do ComfyUI em nuvem.
- APIs diretas de serviços em nuvem chineses (Jimeng, Volcengine, APImart, GRSAI).
- Quaisquer provedores com API compatível com OpenAI para modelos de texto.
Este esquema fornece liberdade: se você quiser, pode executar tudo localmente em seu próprio poder de GPU através do ComfyUI, ou conectar APIs de terceiros e não sobrecarregar seu hardware.
Vários Nuances Importantes
Antes de baixar a distribuição, você deve considerar algumas características do projeto.
Primeiro, o projeto não é código aberto no sentido tradicional (Non-Open-Source / NC). O repositório GitHub serve como plataforma para publicações de releases, documentação e um rastreador de tarefas. O aplicativo em si é distribuído como builds prontos para Windows e macOS (chips Apple Silicon são suportados).
Segundo, a monetização é baseada em ativação de software. O desenvolvedor cobra uma taxa pela licença do programa em si, e você paga pelas gerações diretamente aos serviços cujas chaves de API você insere nas configurações.
Terceiro, a interface e os vídeos tutoriais são principalmente voltados para públicos de língua chinesa e inglesa, embora o controle básico através de atalhos de teclado não cause dificuldades. Atalhos familiares são usados para navegação na tela: Space + ЛКМ para mover, Alt + перетаскивание para duplicar um nó com conexões, Ctrl+Z para desfazer ações.
Quem Deve Experimentar
O SHUO Canvas será interessante para quem está cansado do caos ao criar conteúdo generativo complexo. Se seu fluxo de trabalho envolve uma combinação de ComfyUI, editores de vídeo e geradores de fala, o conceito de tela única economizará muito tempo.
O projeto está se desenvolvendo rapidamente: a versão 0.7.1 trouxe algoritmos de controle de personagens atualizados e personalização flexível de atalhos. Você pode baixar builds para Windows e macOS na seção de releases no GitHub.
Projetos relacionados