>_ DevTrendsnl

Taal

Home

Talen

Secties

Frontend Backend Mobiel DevOps AI / ML GameDev Blockchain Embedded Beveiliging
JavaScript

Spraak omzetten naar code en notities zonder clouds en nieuwsgierige ogen

Stel je voor: je bent aan het bellen, ideeën vliegen je om de oren, en ze handmatig opschrijven betekent de flow verliezen. Of een andere situatie: je moet snel wat documentatie opstellen, maar je vingers zijn al moe van het typen. Herkenbaar? Meestal grijpen we in zulke momenten naar betaalde diensten die je audiogegevens naar hun servers sturen, analyseren, en mogelijk hun modellen ermee trainen.

Onlangs stuitte ik op OpenWhispr. Het is een open-source project dat het dicteer- en transcriptieprobleem probeert op te lossen voor gewone gebruikers. Het belangrijkste hier is privacy: alles kan lokaal draaien op je hardware, of het nu een MacBook met een M-chip is of een Linux-machine met een NVIDIA GPU.

OpenWhispr

Wat dit tooltje kan

OpenWhispr is niet zomaar een wrapper rond een spraakherkenningsmodel. Het is een volwaardige desktop-applicatie op Electron die integreert in je workflow.

Dicteren direct bij de cursor

Het simpelste scenario: je drukt op een hotkey, dicteert tekst, en het verschijnt meteen in het actieve venster. Of het nu VS Code, Slack of een browser is. Er is zelfs een aparte functie voor on-the-fly vertaling — spreek in de ene taal, en tekst in een andere wordt ingevoegd.

Slimme vergaderingen en sprekerherkenning

Het project kan automatisch gesprekken detecteren in Zoom, Teams of FaceTime. Maar het coolste hier is lokale diarization. Het programma onthoudt stem-"vingerafdrukken" en labelt wie wat zei, zonder de opname naar de cloud te sturen. Als je vaak vergaderopnames terugluistert om te onthouden wie beloofde die bug voor woensdag te fixen, scheelt dit enorm veel tijd.

AI-agents binnen handbereik

Er zitten agents in die je met spraakopdrachten kunt aansturen. Je kunt zware jongens zoals GPT-4 of Claude via API aansluiten, of lokale modellen gebruiken via llama.cpp. Druk op een knop, vraag "schrijf een korte samenvatting van deze tekst", en de agent levert het resultaat.

Technische binnenkant

De ontwikkelaars hebben een vrij solide stack samengesteld. De basis is React 19 en Tailwind CSS v4 voor de interface, met Electron 41 eronder.

Voor de spraakmagie gebruiken ze:

  • whisper.cpp voor snelle C++-herkenning.
  • NVIDIA Parakeet en sherpa-onnx voor wie liever GPU-snelheid heeft.
  • better-sqlite3 voor het opslaan van notities en transcripties.

Interessant is dat het project Metal-acceleratie ondersteunt op macOS, CUDA op NVIDIA, en zelfs Vulkan voor AMD en Intel GPU's. Dit betekent dat lokale transcriptie niet eindeloos hoeft te duren.

Hoe het te draaien

Als je geen zin hebt om vanaf de bron te bouwen, hebben ze kant-en-klare builds voor alle platforms. Maar we zijn hier ontwikkelaars, we willen onze handen aan de code hebben. Om vanaf de bron te draaien heb je Node.js 24+ nodig.

git clone https://github.com/OpenWhispr/openwhispr.git
cd openwhispr
npm install
npm run dev

Trouwens, het project heeft zijn eigen MCP-server (Model Context Protocol). Hiermee kun je je notities en transcripties direct aan je favoriete AI-assistent koppelen als externe context.

Wie heeft hier wat aan

Ik zie verschillende categorieën mensen die OpenWhispr zullen waarderen:

  1. Ontwikkelaars die veel logs of notities bijhouden en dit sneller willen doen.
  2. Team leads die vergaderuitkomsten moeten vastleggen zonder derden in te schakelen.
  3. Paranoiden (in de goede zin) die self-hosted oplossingen en dataprivacy waarderen.

Het project ziet er levendig uit: bijna 5.000 sterren op GitHub en actieve commits. Natuurlijk vreet Electron behoorlijk wat RAM, en lokale modellen belasten de CPU, maar dat is een eerlijke prijs voor het houden van je gesprekken alleen op je eigen schijf.

Als je op zoek bent naar een gratis en open alternatief voor proprietaire dicteerdiensten, is OpenWhispr zeker de moeite waard om een avondje te testen onder realistische omstandigheden.

Gerelateerde projecten