>_ DevTrendspl

Język

Strona główna

Języki

Sekcje

Frontend Backend Mobilne DevOps AI / ML GameDev Blockchain Systemy wbudowane Bezpieczeństwo
C-plus-plus

Jak uruchomić rozpoznawanie mowy na dowolnym sprzęcie bez bólu i zależności Pythona

Wyobraź sobie, że musisz dodać funkcję zamiany mowy na tekst do swojej aplikacji. Otwierasz dokumentację popularnych bibliotek i widzisz nieskończoną listę zależności: PyTorch ważący kilka gigabajtów, konkretne wersje CUDA, mnóstwo skryptów w Pythonie i kapryśne środowiska. A co jeśli musisz to uruchomić na zwykłym laptopie bez mocnego GPU lub na Apple Silicon?

Ostatnio natknąłem się na projekt transcribe. cpp, który rozwiązuje ten problem radykalnie. To lekka biblioteka C/C++ zbudowana na silniku ggml. Robi dla rozpoznawania mowy to, co llama. cpp zrobiło dla modeli językowych: zamienia ciężkie sieci neuronowe w kompaktowe pliki wykonywalne, które „po prostu działają”.

Pod maską

Projekt nie ogranicza się do jednej architektury. Deweloperzy z handy-computer wykonali ogromną pracę, portując 16 rodzin modeli. Lista obejmuje zarówno sprawdzony w czasie Whisper od OpenAI, jak i nowsze opcje: Parakeet, Canary od NVIDII, GigaAM, a nawet multimodalny Voxtral, który potrafi nie tylko transkrybować, ale także bezpośrednio tłumaczyć audio.

Głównym wyróżnikiem jest tutaj wykorzystanie formatu GGUF. Oznacza to, że modele mogą być kwantyzowane (kompresowane), co zmniejsza ich rozmiar kilkukrotnie przy niemal zerowej utracie dokładności. Jeśli masz ograniczony RAM, możesz wybrać wersję Q4_K_M i uruchomić całkiem poważny model nawet na biurowym PC.

Dlaczego to jest wygodne dla deweloperów

Przeglądając repozytorium, zwróciłem uwagę na kilka rzeczy, których rzadko się spotyka w podobnych projektach open source.

Po pierwsze, wsparcie dla backendów. Biblioteka automatycznie wybiera Metal na Mac, działa przez Vulkan na Linuksie i Windowsie, a dla posiadaczy NVIDII jest CUDA. Jeśli nie masz GPU w ogóle, używany jest tinyBLAS — zoptymalizowane instrukcje CPU, które przyspieszają obliczenia 10-15 razy w porównaniu ze standardowym kodem.

Po drugie, autorzy zadbali o weryfikację dokładności. Każdy model, który publikują na Hugging Face, przechodzi test numeryczny i sprawdzenie WER (Word Error Rate). To nie jest „skopiowałem wagi i mam nadzieję, że zadziała

Powiązane projekty