Dlaczego agenci potrzebują specjalnej inferencji i jak TokenSpeed przyspiesza LLM-y
Przy uruchamianiu standardowej sieci neuronowej do generowania tekstu lub kodu, silniki takie jak vLLM zazwyczaj mają wystarczające możliwości. Ale gdy tylko mowa o autonomicznych agentach AI, obraz się zmienia. Ciągłe wywołania narzędzi, rozgałęzienia dialogu, powtarzające się przekazywanie kontekstu i rosnący KV-cache szybko doprowadzają standardową inferencję do kolan.
W maju tego roku zespół LightSeek udostępnił TokenSpeed na GitHubie. Deweloperzy postawili sobie za cel stworzenie wyspecjalizowanego silnika dla obciążeń agentowych, który łączy szybkość TensorRT-LLM z przejrzystym i prostym interfejsem Python.

Co pęka w standardowych silnikach podczas pracy z agentami
Scenariusze agentowe różnią się znacząco od dialogów czatbotów. Bot otrzymuje żądanie, generuje pojedynczą odpowiedź i zwalnia zasoby. Agent natomiast działa w cyklach:
- Formuje myśli i wybiera narzędzie
- Czeka na odpowiedź z zewnętrznego API lub bazy danych
- Analizuje otrzymany wynik i podejmuje kolejny krok
To powoduje ciągły wzrost kontekstu, zmuszając serwer do przeliczania długich łańcuchów tokenów lub utrzymywania ogromnych wolumenów pamięci dla KV-cache. Jeśli uruchomisz dziesiątki takich agentów jednocześnie, nawet potężne akceleratory zaczynają bezczynnie czekać na transfer danych.
Architektura TokenSpeed i rozwiązanie problemu
Autorzy TokenSpeed nie stworzyli kolejnej cienkiej nakładki na PyTorch. Przepisali krytyczne komponenty systemowe, aby wycisnąć maksymalną wydajność ze sprzętu.
Po pierwsze, oddzielili pętlę sterowania od wykonania. Scheduler żądań jest napisany w C++, podczas gdy wyższy poziom wykonania pozostaje w Pythonie. Stan każdego żądania, transfer własności KV-cache i timing są powiązane z rygorystyczną maszyną stanów skończonych. System typów C++ sprawdza bezpieczeństwo ponownego użycia zasobów cache w czasie kompilacji, całkowicie eliminując wycieki pamięci.
Po drugie, silnik zawiera statyczny kompilator do obliczeń rozproszonych. Deweloperzy nie muszą ręcznie pisać logiki równoległości przez torch.distributed. Wystarczy umieszczenie adnotacji na granicach modułów — kompilator automatycznie generuje polecenia komunikacji międzyprocesorowej.
Po trzecie, przepisali niskopoziomowe kernele. Autorzy zaimplementowali własną wersję algorytmu Multi-head Latent Attention (MLA), zoptymalizowaną dla architektur NVIDIA Hopper i Blackwell. Minimalizuje opóźnienia podczas aktywnej pracy z długimi kontekstami.
Liczby i testy w rzeczywistych warunkach
Deweloperzy podają konkretne benchmarki na aktualnych modelach. W maju projekt wykazał szybkość 580 tokenów na sekundę na modelu Qwen3.5-397B-A17B w zadaniach agentowych.
Patrząc na wykresy porównawcze z TensorRT-LLM na chipach NVIDIA B200 przy uruchamianiu modelu Kimi K2.5, TokenSpeed wygrywa pod względem przepływności przy tym samym poziomie opóźnień.

Interesujące jest to, jak szybko projekt adaptuje się do nowych wydań. Na przykład wsparcie dla modeli Kimi K3 i inferencji FP4 dla GPU NVIDIA i AMD zostało dodane dosłownie w dniu ich oficjalnego wydania.
Integracja z istniejącym kodem
Z perspektywy punktu wejścia TokenSpeed używa AsyncLLM. Architektura minimalizuje obciążenie CPU przy przetwarzaniu przychodzących żądań HTTP, więc serwer nie jest przeciążany przy wysokim RPS.
Przykład uruchomienia serwera wygląda znajomo dla każdego, kto pracował z vLLM:
python3 -m tokenspeed.entrypoints.openai.api_server \
--model Qwen/Qwen2.5-7B-Instruct \
--port 8000
Po tym możesz połączyć się z serwerem używając standardowego klienta OpenAI, co upraszcza integrację z istniejącymi frameworkami agentowymi jak AutoGen, CrewAI czy LangChain.
Czy warto wdrożyć do produkcji
Obecnie repozytorium ma około 17 000 gwiazdek i prawie 50 otwartych zgłoszeń. To młody, dynamiczny projekt, o którym jeszcze za wcześnie, żeby nazwać go konserwatywnym standardem branżowym.
Zdecydowanie warto wypróbować TokenSpeed, jeśli masz już wdrożoną infrastrukturę agentów AI i natknąłeś się na sufit wydajności vLLM na długich kontekstach. Jeśli potrzebujesz prostego serwera do obsługi podstawowego czatbota, standardowe narzędzia na razie wystarczą.
Powiązane projekty