Expliqué

Qu’est-ce que Whisper

Whisper est un modèle de reconnaissance vocale publié par OpenAI. Ce qui compte n’est pas sa précision. C’est que tu peux en avoir une copie.

Guides

Un modèle, pas un service

Whisper est un modèle, autrement dit un gros fichier, entraîné sur une très grande quantité de parole enregistrée, qui change de l’audio en texte. Il traite beaucoup de langues, et il a été publié avec ses poids disponibles plutôt que gardé derrière un service.

Ce dernier détail est la raison pour laquelle il compte. Avant des modèles de ce genre, une reconnaissance vocale correcte était quelque chose qu’on louait. Tu envoyais de l’audio à une entreprise, elle faisait tourner son modèle sur son matériel, et tu récupérais du texte. Le modèle lui-même ne t’appartenait jamais.

Whisper a rendu possible de télécharger la chose qui fait le travail et de la faire tourner sur ta propre machine.

Pourquoi « tu peux le faire tourner toi-même » était le vrai changement

Deux conséquences en découlent, et toutes deux ont fini dans le clavier de ton téléphone.

Ton audio n’a plus besoin de voyager. Si le modèle est sur ton appareil, il n’y a aucun envoi, aucun serveur qui reçoit ta voix, et aucune copie ailleurs. Ce n’est ni une politique ni une promesse. C’est la description de ce que fait le logiciel.

Ça continue de marcher sans connexion. Rien n’est demandé nulle part, donc un avion, un tunnel ou une carte SIM étrangère cessent d’être un problème.

Ni l’un ni l’autre ne parle de précision. Les deux parlent de l’endroit où le calcul se produit, et il s’est avéré que c’était la propriété à laquelle les gens tenaient une fois qu’ils ont eu le choix.

Il existe en plusieurs tailles, et c’est tout le compromis

Whisper n’est pas un fichier unique. Il existe en plusieurs tailles, des petites qui tournent à peu près partout aux grandes qui attendent du matériel sérieux.

Les gros modèles se débrouillent généralement mieux avec les accents, le bruit de fond, la parole rapide et les noms inhabituels. Ils réclament aussi plus de mémoire, mettent plus longtemps à rendre un résultat, et occupent plus de place.

Ce seul arbitrage explique presque toutes les différences entre les apps bâties dessus. Un outil de bureau avec une carte graphique sous la main peut faire tourner quelque chose de gros. Une app de téléphone ne le peut pas, donc elle prend plus petit et en accepte les conséquences. Qui cite des chiffres de précision de bureau pour un téléphone compare deux modèles différents.

Whisper sur un téléphone

Le faire tourner sur un appareil de poche n’est pas une simple affaire de copie de fichier.

Un téléphone a quelques gigaoctets de mémoire partagés avec toutes les apps que tu as ouvertes, aucun refroidissement actif, et une batterie qu’il essaie de protéger. Un travail qu’un portable termine sans s’en apercevoir va faire chauffer et ralentir un téléphone.

La plupart des réalisations mobiles s’appuient donc sur des réimplémentations optimisées plutôt que sur le code de recherche d’origine. La plus connue est whisper.cpp, une version écrite pour tourner efficacement sur des processeurs ordinaires, et c’est elle qui rend la transcription locale praticable sur du matériel sans carte graphique digne de ce nom.

Le résultat concret sur un téléphone, c’est un modèle plus petit que celui qu’on encense en ligne, une courte attente après que tu as cessé de parler, quelques centaines de mégaoctets d’espace tout au plus, et moins de langues bien couvertes qu’un service côté serveur n’en proposerait.

Ce que veut dire « poids ouverts »

L’expression circule à la légère, alors qu’elle est toute la raison pour laquelle ceci est possible.

Un modèle entraîné est, au bout du compte, une très grande collection de nombres. Ces nombres sont le produit de l’entraînement et ce sont eux qui reconnaissent. Les publier veut dire que n’importe qui peut télécharger cette collection et la faire tourner lui-même.

Ce n’est pas la même chose que le logiciel libre au sens strict. Le libre veut d’ordinaire dire que tu peux lire le code qui fabrique la chose. Les poids ouverts veulent dire que tu reçois l’objet fini. Tu peux l’exécuter, le mesurer, bâtir des produits dessus et le poser sur un téléphone, mais tu ne peux pas facilement voir comment il en est venu aux opinions qu’il a, puisqu’elles ont émergé d’un entraînement et non de lignes que quelqu’un a écrites.

En pratique, la conséquence est simple pour toi. Un modèle aux poids disponibles peut être embarqué dans une app qui ne contacte jamais de serveur, et c’est ce qui rend la dictée hors ligne possible sur un appareil de poche. Sans cela, toute app de dictée serait forcément le client du service de quelqu’un.

Pourquoi il ne règle pas la ponctuation comme tu l’attends

Qui vient d’anciens logiciels de dictée est surpris par ceci.

Les systèmes classiques attendaient que tu dises la ponctuation à voix haute. « Virgule ». « Nouveau paragraphe ». Les modèles modernes la déduisent plutôt du rythme de ta parole et de la forme de la phrase, ce qui paraît bien plus naturel et se trompe parfois d’une manière dont la version parlée n’était pas capable.

Aucune des deux approches n’est meilleure dans toutes les situations. La ponctuation déduite convient aux messages et aux réponses rapides, où dire « point » à voix haute demande plus d’effort que la ponctuation n’en vaut. Les commandes parlées conviennent aux longs documents structurés, où tu veux du contrôle et où tu dictes déjà volontairement.

Sache laquelle des deux une app pratique avant de la juger sur une virgule mal placée.

Ce qu’il ne fait pas

Le nom se retrouve accroché à des choses qu’il n’est pas.

Ce n’est pas un assistant. Il ne répond pas aux questions, ne résume pas et n’écrit pas de texte à ta place. Il transcrit : du son entre, des mots sortent.

Ce n’est pas un enregistreur ni un service de transcription. Ceux-là sont des produits bâtis autour d’un modèle, et ils ajoutent par-dessus du stockage, des comptes, de la recherche et du partage.

Et il n’est pas automatiquement discret. Un modèle aux poids téléchargeables peut tourner sur un serveur aussi facilement que sur ton appareil. Quantité de services en ligne emploient des modèles ouverts. La propriété de confidentialité vient de l’endroit où il tourne, pas du modèle employé, et c’est pourquoi la mention « propulsé par Whisper » sur une fiche produit ne t’apprend rien en soi.

Comment ça se traduit dans les apps que tu peux installer

Parce que les poids sont disponibles, beaucoup de petits projets ont bâti dessus, et plusieurs apps Android locales sincèrement bonnes existent en conséquence. Certaines sont libres et gratuites, plusieurs ne traitent que l’anglais, et chacune choisit son propre point sur la ligne entre taille et vitesse.

LocalType repose sur le même principe : le modèle est un fichier sur ton téléphone et la reconnaissance s’y déroule, sans chemin cloud dans l’app. Il livre trois tailles pour que tu choisisses toi-même le compromis, à 60, 190 et 539 Mo, couvre dix-huit langues à partir d’un seul modèle multilingue, et devine laquelle tu parles depuis l’enregistrement plutôt que depuis un menu. Pour donner un chiffre à ce compromis, sur un appareil de test avec 4 Go de mémoire, la taille du milieu a transformé 6,9 secondes de parole en texte en 4,1 secondes.

Les limites du début s’appliquent à lui entièrement. Ses modèles sont plus petits que tout ce qu’un serveur ferait tourner, la précision est inégale sur ces dix-huit langues parce que la matière d’entraînement l’est, et une pièce bruyante reste une pièce bruyante.

Si tu ne retiens qu’une chose

La question intéressante, à propos de n’importe quelle app de dictée, n’est pas quel modèle elle emploie. C’est où ce modèle tourne.

Le même modèle sur un serveur : ton audio est transmis, il faut une connexion, et la capacité est bornée par leur matériel plutôt que par le tien. Le même modèle sur ton téléphone : rien n’est transmis, ça marche en mode avion, et la capacité est bornée par ce que ton appareil peut contenir.

Tout le reste est du détail.

LocalType pour Android

Ta parole transformée en texte, en privé, sur ton propre téléphone. La reconnaissance vocale tourne sur le téléphone lui-même.

Disponible sur Google Play