Jak nauczyć agentów AI samodzielnie testować aplikacje mobilne
Znana historia: prosisz asystenta AI, takiego jak Cursor czy Claude, żeby napisał funkcję do aplikacji mobilnej, on wyrzuca masę kodu, kopiujesz to, a potem... otwierasz symulator i ręcznie klikasz przez każdy ekran, żeby sprawdzić, czy układ się nie popsuł. W tym momencie wygląda to tak, jakby automatyzacja gdzieś zboczyła z właściwej drogi. AI potrafi pisać kod, ale jest „ślepy" na prawdziwy interfejs poza edytorem tekstu.
Ludzie z Callstack rozwiązali ten problem, wydając agent-device. To narzędzie CLI, które zamienia agenta AI z teoretyka w praktyka. Teraz agent może otworzyć aplikację na symulatorze iOS lub emulatorze Android, zobaczyć elementy ekranu i kliknąć odpowiednie przyciski.
Po co zawracać sobie głowę, skoro są Appium czy Maestro
Może się wydawać, że narzędzi do automatyzacji mobilnej jest już wiele. Ale jest jeden haczyk: Appium i Maestro zostały zaprojektowane dla ludzi. Agent AI nie potrzebuje pisać skomplikowanych scenariuszy YAML ani grzebać w selektorach drzewa XML. Potrzebuje szybkiego, taniego i prostego sposobu na interakcję ze sprzętem.
agent-device działa inaczej. Przechwytuje zrzuty ekranu nie tylko jako obrazy, ale jako strukturalne drzewa dostępności. Zamiast przesyłać ciężkie screenshoty do multimodalnego modelu i palić tokeny, agent otrzymuje tekstowy opis elementów z krótkimi referencjami jak @e1, @e2. To obniża koszty i przyspiesza działanie.

Co to narzędzie potrafi
Narzędzie pozycjonuje się jako „ręce i oczy" agenta. Oto główne funkcje, które przykuły moją uwagę:
- Inteligentne zrzuty ekranu. Polecenie
snapshot -izwraca tylko interaktywne elementy. Agent widzi listę:@e1 [button] "Sign In",@e2 [text-field] "Email". Bez zgadywania, gdzie kliknąć. - Wieloplatformowość out of the box. Ten sam workflow działa dla iOS, Android, TV (tvOS i Android TV), a nawet aplikacji desktopowych na macOS i Linux.
- Zbieranie dowodów. Jeśli coś pójdzie nie tak, agent może samodzielnie rozpocząć nagrywanie wideo, przechwycić logi lub wyodrębnić ruch sieciowy. To bezcenne przy debugowaniu błędów, które reprodukują się tylko w runtime.
- Integracja z React Native. Ponieważ Callstack stoi za tym projektem, istnieje głęboka obsługa RN: możesz sprawdzać drzewo komponentów i profilować renderowania.

Jak to wygląda w praktyce
Wyobraź sobie, że konfigurujesz serwer MCP (Model Context Protocol) dla swojego agenta AI. Teraz może on wykonywać polecenia bezpośrednio w terminalu.
Najpierw sprawdzamy środowisko:
agent-device doctor
Jeśli wszystko się zgadza, agent może uruchomić aplikację:
agent-device open "MyApp" --platform ios
Następnie rozgląda się wokół:
agent-device snapshot -i
Gdy już ma listę elementów, po prostu symuluje działania użytkownika:
agent-device fill @e3 "hello@world.com"
agent-device tap @e2
I to wszystko. Bez czekania na kompilację czy ręcznego przełączania okien.
Pod maską
Narzędzie nie próbuje wymyślać koła tam, gdzie standardy już dobrze działają. Dla iOS używa XCTest, dla Androida to ADB w połączeniu z własnym helperem do screenshotów. Dla weba pod spodem pracuje Playwright (konkretnie logika z vercel/agent-browser).
Ciekawe jest to, że agent-device potrafi konwertować swoje sesje do formatu Maestro. Oznacza to, że agent może tworzyć test podczas „eksploracji" aplikacji, a następnie możesz zapisać go jako pełny test E2E do CI.
Kto powinien tego spróbować
Widzę kilka scenariuszy, gdzie to naprawdę zaoszczędzi czas:
- Deweloperzy React Native i Expo. Jeśli używasz Cursor lub Windsurf, dodaj dokumentację agent-device do kontekstu. Agent może samodzielnie weryfikować swoje zmiany bez przerywania ci pracy.
- Testerzy QA. Możesz zlecić AI pisanie podstawowych testów smoke. Sam znajdzie przyciski i zweryfikuje, że przejścia działają.
- Zespoły pracujące z platformami TV. Automatyzacja TV to zawsze ból, a tutaj masz to w pakiecie.
Projekt aktywnie się rozwija i choć dokumentacja w niektórych miejscach jest jeszcze uzupełniana, główne CLI działa stabilnie. Jeśli wierzysz w koncepcję Agentic Workflows, to narzędzie zdecydowanie warte jest poświęcenia jednego wieczoru.
Możesz zacząć od ich oficjalnej dokumentacji, która szczegółowo opisuje, jak zintegrować CLI z popularnymi agentami AI.
Powiązane projekty