Mode d’emploi

Améliorer la précision de la dictée vocale

La plupart des problèmes de précision ne viennent pas de l’app. Ils viennent de la distance, du bruit, de la diction et du vocabulaire, à peu près dans cet ordre, et tu peux agir sur les quatre dès aujourd’hui.

Guides

Commence par la distance, ça ne coûte rien

Le micro capte ce qui lui parvient, et la part de toi là-dedans relève de la physique plutôt que du logiciel.

Tenu à bout de bras dans une pièce où il y a le moindre bruit, ta voix arrive comme un signal parmi plusieurs. Tenu près du bas du téléphone, à distance de conversation, elle domine tout le reste. Cet écart à lui seul règle une part étonnante des plaintes.

Ne couvre pas le micro avec un doigt, puisque sur la plupart des téléphones il se trouve sur la tranche du bas, exactement là où l’on tient l’appareil. Et si tu es dehors, tourne-toi dos au vent, parce que le bruit du vent est fort, large en fréquences et à peu près impossible à séparer de la parole pour n’importe quel modèle.

Ensuite la diction, qui est un savoir-faire

La dictée récompense une certaine façon de parler, et ce n’est pas celle dont la plupart des gens parlent.

Des phrases complètes. Un système de reconnaissance se sert des mots voisins pour choisir entre des options qui sonnent pareil. Un mot dit tout seul ne lui donne rien, et c’est pourquoi un prénom ressort faux alors que le même prénom dans une phrase ressort juste.

Décide avant de parler. Laisser une phrase en suspens, repartir à mi-chemin et penser à voix haute suppriment tous le rythme sur lequel le système s’appuie, et c’est la ponctuation qui se dégrade en premier.

Débit et volume normaux. Ralentir énormément ou surarticuler empire les choses au lieu de les améliorer. Les modèles sont entraînés sur de la parole ordinaire, donc une parole exagérément soignée est une entrée inhabituelle.

Une pause entre les phrases. C’est le signal qui sert à poser un point.

Rien de tout ça ne réclame une autre app, et ça fait d’ordinaire plus de différence qu’un changement d’app.

Apprends-lui ton vocabulaire

Les mots les plus susceptibles d’être mal entendus sont ceux dont tu te sers le plus : noms de famille des collègues, noms de clients, produits, sigles, les termes techniques de ton activité.

Un modèle entraîné sur de la parole générale n’a rencontré aucun d’eux, donc il substitue quelque chose d’ordinaire qui sonne pareil. Aucune articulation, si soignée soit-elle, ne corrige ça, parce que le bon mot n’est pas dans la course.

Si ton clavier permet d’ajouter des mots, c’est la chose la plus rentable de toutes. LocalType garde les ajouts sur l’appareil et les transmet au modèle vocal comme contexte, si bien qu’ils commencent à arriver bien orthographiés, et ils améliorent les suggestions de frappe au passage.

Ajoute-les en une fois plutôt qu’un par un à mesure qu’ils se trompent.

Vérifie le réglage de langue

Toute une catégorie de « ça produit n’importe quoi » vient d’un décalage entre la langue que tu parles et celle que l’app attend.

La panne déroute parce qu’il n’y a aucun message d’erreur. Le système fait de son mieux pour entendre la langue qu’on lui a annoncée, et produit un charabia plein d’assurance.

Si tu écris dans plus d’une langue, soit tu la règles explicitement avant une longue séance, soit tu prends une app qui identifie la langue depuis l’enregistrement. LocalType fait la seconde chose sur dix-huit langues et décide à chaque enregistrement, donc passer de l’une à l’autre entre deux messages ne te demande rien. Régler une langue précise déplace en revanche la disposition du clavier et le dictionnaire avec elle, ce qui vaut mieux si tu restes dans une seule langue toute la journée.

À savoir : la précision n’est pas identique sur ces dix-huit. La matière d’entraînement est répartie inégalement, et les langues très parlées s’en sortent mieux.

À propos des accents

Les accents sont l’endroit où la dictée est la moins régulière, et la raison en est mécanique.

Un modèle se comporte le mieux sur une parole qui ressemble à celle sur laquelle il a été entraîné. Si ton accent était peu représenté dans cette matière, les résultats seront moins bons, et c’est une propriété de l’entraînement plutôt que de ta façon de parler.

Deux choses aident vraiment. Un modèle plus gros a plus de capacité pour les cas inhabituels, donc essaie de monter d’une taille avant de conclure que la technologie n’est pas pour toi. Et l’astuce du vocabulaire ci-dessus compte davantage, pas moins, parce qu’un nom propre que le modèle prononce mal est ton erreur la plus fréquente.

Ce qui n’aide pas, c’est d’exagérer ta prononciation vers un accent neutre imaginaire. Ça produit une parole dont le modèle a entendu encore moins d’exemples.

Acheter de la justesse avec de la patience

Là où une app propose un choix de modèle, ce choix est une commande de précision, et presque personne n’y touche.

La capacité coûte du temps. Un modèle qui a plus de place pour représenter des prononciations inhabituelles, des noms inconnus et une parole en concurrence avec du bruit en attrapera davantage, et il mettra plus longtemps à le faire. LocalType propose 60, 190 et 539 Mo exactement pour cette raison, avec 4,1 secondes nécessaires pour 6,9 secondes de parole au réglage intermédiaire sur l’appareil de test à 4 Go.

Accorde-le à ce que tu dictes plutôt que de choisir une fois et d’oublier. Quand tu enchaînes des réponses, l’attente est ce que tu remarques. Quand tu déroules un long message, tu regardes la pièce plutôt que l’écran, et les erreurs évitées sont des corrections que tu n’auras jamais à faire.

L’exception est un téléphone vraiment à court de mémoire, où le plus gros modèle peut finir plus lent et pas plus juste que le plus petit, parce qu’il n’arrive jamais à tourner confortablement.

Prends de l’élan

Une petite astuce qui ne coûte rien et aide plus qu’elle ne le devrait.

Les systèmes de reconnaissance sont les plus faibles au tout début d’un enregistrement, avant d’avoir le moindre contexte sur lequel s’appuyer. Si la première chose que tu dis est le mot difficile, un nom de famille inconnu, un terme technique, un nom de lieu, il a le moins d’aide disponible précisément au moment où il lui en faut le plus.

Commencer par deux ou trois mots ordinaires lui donne de quoi se caler avant que la partie difficile arrive. « Alors l’adresse, c’est » avant le nom de rue. « Envoie ça à » avant le nom de famille. Ça paraît artificiel pendant une journée, puis ça devient automatique.

La même logique explique pourquoi redire un mot raté tout seul marche rarement. Isolé, il a encore moins de contexte que la première fois. Redis la phrase entière à la place.

Ce qu’aucun réglage ne réparera

Il y a un plafond, et aucun réglage ne le relève.

Plusieurs personnes qui parlent en même temps. Un téléphone posé sur une table à l’autre bout de la pièce. Un café à plein volume. De la musique forte derrière toi. Dans tous ces cas, la parole et le bruit arrivent mélangés dans les mêmes mesures et ne s’en séparent plus ensuite, sur aucun appareil, avec aucune app.

Les homophones sont l’autre limite définitive. Quand deux formulations se prononcent à l’identique et ont toutes les deux du sens, le système devine, et il devinera parfois mal.

Et aucun système ne sait ce que tu voulais dire. Il sait ce qui est parvenu au micro, et c’est pourquoi la diction pèse plus lourd que tout ce qui est technique.

Cinq étapes, dans l’ordre

Rapproche-toi du micro. Parle en phrases complètes et fais une pause entre elles. Ajoute tes propres noms et ton jargon. Vérifie la langue. Puis, si ce n’est toujours pas assez bon, monte d’une taille de modèle.

La plupart des gens cessent d’être agacés vers la troisième étape.

Une dictée qui tourne hors ligne sur l’appareil a un comportement stable : elle ne devient pas moins juste parce que le réseau faiblit, et deux essais dans les mêmes conditions donnent le même résultat. Ça paraît un détail jusqu’au jour où tu passes vingt minutes à chercher ce que tu as mal fait, alors que la seule chose qui avait changé était la couverture.

LocalType pour Android

Ta parole transformée en texte, en privé, sur ton propre téléphone. La reconnaissance vocale tourne sur le téléphone lui-même.

Disponible sur Google Play