Naslag

Spraakherkenning begrippenlijst

Elke productpagina in dit vak gebruikt dezelfde twaalf woorden en geen enkele legt er een uit. De meeste betekenen minder dan ze klinken.

Gidsen

De vier woorden die door elkaar gebruikt worden

Spraakherkenning, of ASR. Software die opgenomen geluid omzet in geschreven woorden. ASR staat voor automatic speech recognition en betekent hetzelfde. Het begrijpt niet wat je zei; het zoekt uit welke woorden er uitgesproken zijn.

Inspreken. Spraakherkenning bewust gebruiken om tekst te maken die je van plan was te schrijven. Onderscheidt zich van transcriptie doordat jij de spreker bent en het met opzet doet.

Transcriptie. Een bestaande opname omzetten in tekst. Meestal iemand anders zijn spraak, meestal achteraf, meestal met een document als uitkomst.

Meeschrijven of ondertitelen. Spraak in tekst omzetten terwijl het gebeurt, zodat het meegelezen kan worden, doorgaans voor toegankelijkheid.

In reclame staan die vier door elkaar, en een zoekresultatenpagina voor de ene staat daarom vol met producten voor de andere drie.

Waar het werk gebeurt

Op het toestel, ook wel lokaal. Het model draait op je telefoon of computer. Er wordt niets verstuurd, en het werkt zonder verbinding.

Cloud, ook wel serverzijde. Audio gaat naar een server op afstand, wordt daar verwerkt, en er komt tekst terug. Maakt veel grotere modellen mogelijk en vraagt een verbinding.

Gemengd. Allebei, met iets dat per moment beslist welke geldt. Die beslissing kan bij jou liggen of bij de software, en kan afhangen van je telefoon, je taal of je instellingen.

Offline stand. De lokale optie van een gemengd product. Het bestaan van een stand betekent dat er ook een andere stand is, en dat die verkeerd kan staan.

Het model zelf

Model. Het bestand dat het herkennen doet. Ontstaat door oefenen en is in wezen een heel grote verzameling getallen.

Gewichten. Die getallen. Zeggen mensen dat een model open gewichten heeft, dan bedoelen ze dat het bestand door iedereen binnengehaald en gedraaid kan worden, en dat is wat producten op je telefoon mogelijk maakt.

Oefenmateriaal. De opgenomen spraak met de bijbehorende tekst waarvan een model geleerd heeft. Hoeveel daarvan er voor jouw taal bestond, bepaalt in hoge mate hoe goed het bij jou werkt.

Modelgrootte. Meestal in megabytes genoemd. Grotere modellen gaan beter om met accenten, rumoer en ongewone woorden, en hebben meer geheugen en meer tijd nodig.

Quantisatie. De getallen van een model met minder precisie opslaan zodat het bestand kleiner is en sneller draait, tegen een bescheiden verlies aan nauwkeurigheid. Het is voor een groot deel de reden dat modellen op telefoonformaat bruikbaar werden.

Whisper. Een model voor spraakherkenning dat door OpenAI is uitgebracht met beschikbare gewichten, en dat is waarom heel veel producten die op je telefoon draaien erop gebouwd zijn of op herbouwde versies ervan.

whisper.cpp. Een versie van Whisper die geschreven is om efficiënt op gewone processors te draaien, veel gebruikt in mobiele apps omdat de meeste telefoons geen videokaart hebben die het gebruiken waard is.

Hoe het zich gedraagt, en de getallen erbij

Wachttijd. De vertraging tussen jij die stopt en de tekst die verschijnt. Op het toestel hangt die af van je hardware en de modelmaat; in de cloud van je verbinding.

Nauwkeurigheid, of woordfoutpercentage. Hoe vaak het woorden fout heeft. De cijfers die rondgaan beschrijven vrijwel altijd schone opnames in talen met veel materiaal, dus behandel ze als een plafond en niet als een verwachting.

Veraf en dichtbij. Of de microfoon aan de andere kant van een kamer zit of vlak bij je mond. Producten voor inspreken gaan van het tweede uit.

Spraakdetectie. Uitzoeken wanneer spraak begint en stopt, zodat het systeem weet wat het moet verwerken en wanneer je klaar bent.

Taalherkenning. Uit de opname afleiden welke taal er gesproken wordt, zonder dat je het vooraf opgeeft. Betrouwbaar op hele zinnen, onbetrouwbaar op losse woorden.

Afgeleide leestekens. Komma’s en punten die het systeem uit je ritme en je grammatica bepaalt, zonder dat je ze hardop als opdracht uitspreekt. Standaard in moderne producten.

Megabytes voor een model. De opslag die het op je telefoon inneemt. Let op dat het geheugen dat het tijdens het draaien gebruikt een apart getal is en meestal groter, en dat is waarom een model op een telefoon kan passen en er toch ongemakkelijk op kan zijn.

Verhouding tot realtime. Hoe lang het verwerken duurt tegenover hoe lang je praatte. Onder de één betekent sneller dan spraak; boven de één betekent wachten. Een getal als “6,9 seconden spraak in 4,1 seconden” is precies dit, gewoon opgeschreven.

Ondersteunde talen. Een telling van de talen die het product zal proberen, en dat is niet hetzelfde als de talen die het goed doet. Honderd tegen achttien afzetten zegt vrijwel niets over jouw taal.

Op de telefoon zelf

Invoermethode, of IME. De technische naam voor een toetsenbord op Android. Een invoermethode krijgt je aanslagen binnen en kan de tekst rond de cursor lezen, en zo werkt de autocorrectie en daarom waarschuwt Android je als je er een aanzet.

Aanzetten tegenover kiezen. Twee losse stappen. Aanzetten geeft een toetsenbord toestemming om als mogelijkheid te bestaan; kiezen maakt er het toetsenbord van dat in gebruik is. De tweede missen is de meest voorkomende reden dat een net geïnstalleerd toetsenbord niets lijkt te doen.

Eigen woordenlijst. Woorden die je zelf toevoegt zodat ze niet meer verbeterd worden en, in producten die dat ondersteunen, zodat de herkenner weet dat ze mogelijk zijn.

Activeerwoord, of wake word. Een korte zin waar een toestel onafgebroken naar luistert om een assistent te starten. Inspreken gebruikt er geen, en daarom luistert een toetsenbord niet tussen twee keer gebruiken door.

Wachtwoordveld. Android laat het toetsenbord weten dat een veld een wachtwoord bevat. Wat een toetsenbord daar vervolgens mee doet verschilt per product: suggesties uitzetten, niets leren van wat je tikt, of de microfoontoets weglaten.

Back-up in de cloud. Het routinematig kopiëren door Android van gegevens van apps naar je account. Een app kan zich daarvoor afmelden, wat de gegevens beschermt en betekent dat ze op een nieuwe telefoon niet terugkomen.

Woorden die als garantie klinken en dat niet zijn

“Privé.” Ongedefinieerd. Vraag waar de audio heen gaat en of er een account in het spel is.

“Veilig.” Beschrijft meestal het versturen en niet de vraag of er überhaupt verstuurd wordt.

“Werkt offline.” Betekent soms dat je tekst lokaal bewaard wordt, en dat zegt niets over waar je stem verwerkt is. Twee volstrekt verschillende beweringen.

“Werkt op Whisper.” Zegt welk model, niet waar het draait. Een open model op andermans server staat nog steeds op andermans server.

“Wij verzamelen geen gegevens.” Smaller dan het klinkt. Vraag wat er als gegevens telt, en of de audio zelf daarbij hoort.

De betrouwbare test achter al die termen is gedrag: zet mobiele data en wifi uit en probeer de functie te gebruiken.

LocalType, in deze woordenschat

LocalType is een invoermethode met ASR op je telefoon, zonder gemengde stand, zonder activeerwoord en zonder account. Het model heeft open gewichten, is gequantiseerd om op een telefoon te draaien, en wordt in drie maten aangeboden van 60, 190 en 539 MB, zodat je zelf je punt op de lijn tussen wachttijd en nauwkeurigheid kiest. Op het testtoestel met 4 GB zette de middelste stand 6,9 seconden spraak om in 4,1 seconden, wat in de termen hierboven een verhouding tot realtime van ongeveer 0,6 is.

Het doet taalherkenning over achttien talen uit de opname en niet uit een instelling, en het leidt de leestekens af zonder dat je ze uitspreekt. Het ondersteunt een eigen woordenlijst, die op je telefoon blijft en als context aan het model wordt gegeven.

Om internettoegang wordt gevraagd voor precies één doel, het ophalen van het model. Reclame ontbreekt, er draait geen tracking binnen het product, er wordt geen archief van je opnames bewaard, het model staat in de eigen opslag van de app waar alleen die app bij kan, en de back-up van Android krijgt die gegevens met opzet niet. Tik je in een wachtwoordveld, dan wordt daar geen microfoontoets aangeboden.

LocalType voor Android

Spraak naar tekst, privé op je eigen telefoon. De spraakherkenning draait op de telefoon zelf.

Ontdek op Google Play