>_ DevTrendspl

Język

Strona główna

Języki

Sekcje

Frontend Backend Mobilne DevOps AI / ML GameDev Blockchain Systemy wbudowane Bezpieczeństwo
Unknown

Jak zbudować multimodalne kino AI na jednym nieskończonym płótnie

Jeśli kiedykolwiek próbowałeś stworzyć coś bardziej złożonego niż generowanie pojedynczego obrazu — na przykład krótki animowany klip lub storyboard do teledysku — wiesz, że to piekło. Pierwsza karta przeglądarki ma otwarty ChatGPT do scenariusza. Druga uruchamia Midjourney lub Stable Diffusion. Trzecia ma ElevenLabs do lektora. Czwarta ma otwarty Runway lub Lumę do animacji klatek. A gdzieś w tle huczy lokalny ComfyUI z grafem trzystu węzłów.

W rezultacie Twoje biurko zamienia się w wysypisko plików PNG z dziwnymi nazwami jak final_v2_really_final.png, a przenoszenie kontekstu między sieciami neuronowymi zajmuje więcej czasu niż sama twórcza praca.

Chiński deweloper o nicku ashuoAI próbował rozwiązać ten problem projektem SHUO Canvas (dawniej znanym jako AI-CanvasPro). To aplikacja desktopowa łącząca generowanie tekstu, grafik, audio i wideo na jednej interaktywnej tablicy.

Scenariusz i storyboard w środowisku pracy

Jak działa płótno

U podstaw SHUO Canvas leży idea nieskończonego obszaru roboczego, podobnego do Figmy, Miro czy ComfyUI, ale dostosowanego do kompleksowej produkcji treści multimedialnych. Zamiast przełączać się między serwisami, układasz elementy bezpośrednio na tablicy i łączysz je liniami logicznymi.

Każdy element na tablicy to węzeł. Węzeł może być promptem tekstowym, przesłanym obrazem, wygenerowanym klipem wideo, ścieżką dźwiękową lub pełnym blokiem sterującym. Łączysz wyjścia niektórych węzłów z wejściami innych, budując łańcuch: scenariusz -> generowanie klatek -> animacja -> lektor i edycja.

Aplikacja może automatycznie zapisywać stan płótna po restarcie, a aby przenieść projekt na inny komputer, generuje pojedyncze archiwum .aicpkg ze wszystkimi wykorzystanymi zasobami.

Zastępowanie postaci w klatkach

Co ciekawego w środku

Deweloperzy nie ograniczyli się do podstawowej siatki generatorów obrazów. Wewnątrz aplikacji znajduje się kilka wyspecjalizowanych węzłów, które rzadko spotyka się w takich narzędziach all-in-one.

Storyboarding i reżyseria 3D

Dla tych, którzy tworzą historie wideo, dodano węzeł scenariusza reżyserskiego. Pomaga podzielić tekst na poszczególne sceny, opisać ruchy kamery, dialogi i efekty dźwiękowe.

Obok niego działa węzeł reżyserii 3D. Tutaj możesz schematycznie rozmieścić postacie w przestrzeni, ustawić kąt wirtualnej kamery i pozycję obiektów. Powstały schemat 3D jest przekazywany dalej w łańcuchu jako obraz referencyjny (ControlNet/IP-Adapter) do generowania ostatecznej klatki. Pomaga to zachować perspektywę i kompozycję z klatki na klatkę.

Reżyseria 3D

Narzędzia do obróbki na płótnie

Wprost na płótnie możesz przycinać wideo, wycinać ścieżki dźwiękowe, usuwać tła, usuwać niepożądane obiekty z obrazów lub składać kolaże. Do pracy z potokami generowania wideo dodano węzły do rozbijania wideo na pojedyncze klatki i precyzyjnej synchronizacji ust.

Jeśli potrzebujesz stworzyć siatkę wariantów lub panoramę, używane są oddzielne węzły:

  • Grid dzieli storyboard na bloki do wsadowego generowania.
  • 360 Panorama przekształca płaski obraz w interaktywne środowisko sferyczne.

Węzeł edycji na płótnie

Wbudowany asystent AI

Aby nie tracić czasu na ręczne tworzenie dziesiątek węzłów, w system wbudowano agenta. Poprzez symbol @ w polu tekstowym odwołujesz się do dowolnego obiektu na płótnie (obraz, tekst lub wideo). Symbol / wywołuje szybkie szablony promptów.

Dodatkowo asystent dialogowy w rogu ekranu może wykonywać polecenia bezpośrednio na tablicy: tworzyć węzły, łączyć je i uruchamiać wsadowe generowanie z zapytania tekstowego.

Integracje i podłączanie sieci neuronowych

SHUO Canvas nie zawiera własnych modeli generatywnych out of the box. To graficzny klient, który wysyła żądania do zewnętrznych dostawców lub lokalnych serwerów.

Importowanie workflow ComfyUI i RunningHub

Obsługiwane są następujące opcje połączenia:

  • Lokalny lub chmurowy ComfyUI. Możesz importować gotowe workflow ComfyUI JSON bezpośrednio na tablicę SHUO Canvas.
  • Platforma RunningHub do uruchamiania potoków ComfyUI w chmurze.
  • Bezpośrednie API chińskich usług chmurowych (Jimeng, Volcengine, APImart, GRSAI).
  • Dowolni dostawcy z API kompatybilnym z OpenAI dla modeli tekstowych.

Ten schemat zapewnia swobodę: jeśli chcesz, możesz uruchomić wszystko lokalnie na własnej mocy GPU przez ComfyUI, lub podłączyć zewnętrzne API i nie obciążać swojego sprzętu.

Kilka ważnych niuansów

Przed pobraniem dystrybucji powinieneś wziąć pod uwagę kilka charakterystyk projektu.

Po pierwsze, projekt nie jest open source w tradycyjnym sensie (Non-Open-Source / NC). Repozytorium GitHub służy jako platforma do publikacji wydań, dokumentacji i trackera zadań. Sama aplikacja jest dystrybuowana jako gotowe buildy dla Windows i macOS (układy Apple Silicon są obsługiwane).

Po drugie, monetyzacja opiera się na aktywacji oprogramowania. Deweloper pobiera opłatę za licencję programu, a płacisz za generowanie bezpośrednio usługom, których klucze API wprowadzasz w ustawieniach.

Po trzecie, interfejs i filmy instruktażowe są przede wszystkim skierowane do odbiorców chińsko- i angielskojęzycznych, choć podstawowa kontrola przez skróty klawiszowe nie sprawia trudności. Do nawigacji po płótnie używane są znajome skróty: Space + ЛКМ do przesuwania, Alt + перетаскивание do duplikowania węzła z połączeniami, Ctrl+Z do cofania działań.

Kto powinien spróbować

SHUO Canvas będzie interesujący dla tych, którzy mają dość chaosu podczas tworzenia złożonych treści generatywnych. Jeśli Twój workflow obejmuje kombinację ComfyUI, edytorów wideo i generatorów mowy, koncepcja jednego płótna zaoszczędzi mnóstwo czasu.

Projekt rozwija się szybko: wersja 0.7.1 przyniosła zaktualizowane algorytmy kontroli postaci i elastyczną personalizację skrótów klawiszowych. Buildy dla Windows i macOS można pobrać w sekcji releases na GitHubie.

Powiązane projekty