Nous avons mesuré le nombre d'erreurs de notre transcription sur des jeux de données publics. Voici les résultats, y compris ceux qui ne sont pas flatteurs, la méthode et les limites de la mesure.
Modèle utilisé aujourd'hui pour tous les clients : Large v3 Turbo
Les modèles plus grands font nettement moins d'erreurs mais demandent plus de calcul. Nous publions ces chiffres pour que vous sachiez à quoi vous attendre.
Mesure réalisée le
Qu'est-ce que le taux d'erreur sur les mots (WER) ?
On compare la transcription à un texte de référence écrit par un humain, et on compte les mots remplacés, oubliés ou ajoutés. Ce total, divisé par le nombre de mots de la référence, donne le taux d'erreur sur les mots, appelé WER. Plus il est bas, mieux c'est.
Exemple
Phrase prononcée
nous validons le budget lundi prochain matin
Transcription obtenue
nous validons un budget lundi prochain
Erreurs : « le » remplacé par « un », « matin » oublié.
2 erreurs sur 7 mots : taux d'erreur de 29 %.
Comment lire ces chiffres
Taux d'erreur
Niveau
En pratique
Moins de 5 %
Excellent
Presque rien à corriger.
5 à 10 %
Très bon
Quelques corrections par paragraphe.
10 à 20 %
Correct
Le sens passe ; noms propres et chiffres à relire.
20 à 30 %
Moyen
Utile comme brouillon, relecture nécessaire.
Plus de 30 %
Difficile
Beaucoup de corrections ; utile surtout pour repérer un passage.
Résultats sur FLEURS : parole lue, sept langues
20 phrases lues distinctes par langue (arabe : sous-ensemble « ar_eg », arabe standard lu)
Faites défiler le tableau horizontalement pour voir toutes les colonnes.
Taux d'erreur sur les mots (WER) par modèle et par langue, phrases lues. Plus c'est bas, mieux c'est.
Modèle
Français
Anglais
Arabe standard
Espagnol
Allemand
Italien
Néerlandais
Vitesse
Tiny
35,6 %
12,7 %
55,0 %
15,2 %
26,0 %
24,8 %
56,0 %
0,07
Base
28,5 %
9,8 %
42,8 %
9,2 %
16,2 %
18,5 %
36,8 %
0,12
Small
14,6 %
6,8 %
22,9 %
5,8 %
8,9 %
6,9 %
18,5 %
0,31
Medium
8,5 %
4,3 %
10,5 %
2,7 %
10,2 %
1,8 %
10,0 %
0,90
Large v3 TurboEn production
6,7 %
5,0 %
8,3 % (meilleur résultat)
2,3 %
3,8 % (meilleur résultat)
1,4 % (meilleur résultat)
5,1 % (meilleur résultat)
1,19
Large v3
6,4 % (meilleur résultat)
4,1 % (meilleur résultat)
8,3 % (meilleur résultat)
1,9 % (meilleur résultat)
3,8 % (meilleur résultat)
2,2 %
5,8 %
1,72
En gras : meilleur résultat de la colonne. Ligne soulignée en doré : modèle utilisé en production.
Vitesse : temps de calcul divisé par la durée de l'audio, sur 4 cœurs de processeur. En dessous de 1, le modèle va plus vite que le temps réel : à 0,31, une minute d'audio est traitée en environ 19 secondes.
Résultats en darija marocaine : parole spontanée
50 extraits spontanés de type radio ou télévision, environ 30 s chacun (23,8 min au total)
La mesure en darija est en cours. Les résultats seront publiés ici dès qu'ils seront disponibles, y compris s'ils sont moins bons que sur FLEURS.
Taux d'erreur sur les mots (WER) et sur les caractères (CER) en darija. Plus c'est bas, mieux c'est.
Modèle
WER (mots)
CER (caractères)
Vitesse
Small
mesure en cours
mesure en cours
mesure en cours
Medium
mesure en cours
mesure en cours
mesure en cours
Large v3 TurboEn production
mesure en cours
mesure en cours
mesure en cours
Large v3
mesure en cours
mesure en cours
mesure en cours
Le taux d'erreur sur les caractères (CER) est utile en darija, où l'orthographe n'est pas fixée : un mot écrit un peu différemment compte comme une erreur entière en WER, mais seulement pour quelques lettres en CER.
Méthode de mesure
Moteur : whisper.cpp, le même programme que celui qui transcrit vos fichiers en production.
Langue imposée : le modèle ne devine pas la langue, on lui indique celle de l'extrait.
Normalisation avant comparaison : Unicode NFKC, minuscules, ponctuation supprimée et diacritiques arabes (voyelles courtes) supprimés, pour ne pas compter comme erreur une simple différence d'écriture.
Taux d'erreur sur les mots = (mots remplacés + mots oubliés + mots ajoutés) ÷ nombre de mots de la référence.
Vitesse : temps de calcul divisé par la durée de l'audio, sur 4 cœurs de processeur.
Limites
Petits échantillons : 20 phrases par langue sur FLEURS et 50 extraits en darija. Les chiffres donnent un ordre de grandeur, pas une mesure au dixième près.
FLEURS contient de la parole lue, claire et bien articulée. Les extraits en darija sont de la parole spontanée, nettement plus difficile.
Une vraie réunion est plus bruyante : micros d'ordinateur portable, voix qui se chevauchent, vocabulaire métier. Attendez-vous à plus d'erreurs que dans ces tableaux.
Le score arabe de FLEURS porte sur l'arabe standard lu. Les dialectes autres que la darija ne sont pas mesurés : golfe, égyptien, tunisien, levantin.