Reconnaissance vocale pour les langues que les benchmarks ignorent
Le taux d'erreur sur ce corridor n'est pas un problème de modélisation. C'est un problème de données, et ces données n'ont jamais été collectées.

Le problème
Un modèle de parole entraîné sur les corpus ouverts disponibles pour l'Afrique de l'Ouest et centrale apprend un registre qui n'existe pas hors d'une consigne d'enregistrement. La matière publiée est très majoritairement de la parole lue : un locuteur, un microphone, une phrase à la fois, sollicitée par un script. C'est propre, c'est monocanal, et cela ne ressemble en rien à une négociation de marché, à une émission d'antenne ouverte ou à deux mécaniciens qui se parlent par-dessus un moteur.
Les modèles sortent donc avec des chiffres honorables en benchmark et échouent en production sur les trois traits qui caractérisent réellement la parole ici — le chevauchement, l'interruption, et l'alternance codique en milieu de phrase entre pidgin, anglais et langue locale. Le benchmark ne les contenait pas parce que la méthode de collecte ne pouvait pas les produire.
Ce que nous y opposons
Deux sources, et un acheteur peut prendre l'une, l'autre ou les deux. L'archive libérée issue des émissions de parole et d'antenne ouverte, matière existante qui avance au rythme d'un audit de droits. Et la captation sur commande au micro-cravate, qui avance au rythme d'un cahier des charges.
Les deux arrivent à canaux séparés lorsque la source le permet, horodatées, attribuées par locuteur, avec diarisation et taux de chevauchement dans les métadonnées et les alternances codiques signalées plutôt que normalisées. La transcription conserve l'alternance parce que l'alternance est précisément la difficulté.





Ce à quoi cela doit répondre
| Exigence | Comment elle est satisfaite |
|---|---|
| Audio multi-locuteurs chevauché, avec interruptions réelles | Antenne ouverte et captation de marché, canaux séparés, taux de chevauchement indiqué par actif |
| Alternance codique conservée plutôt qu'effacée | Alternances signalées dans la transcription, avec la langue de part et d'autre |
| Conditions acoustiques conformes au déploiement | Captation en plein air, en bord de route et en atelier, bruit de fond documenté et non supprimé |
| Des droits qui résistent à une revue juridique | Consentement du locuteur nommant l'entraînement commercial et les modèles génératifs, sous-licenciable |
Ce que vous pouvez vérifier d'abord
- Échantillon avant contrat
- Extraits publiés avec transcription et annotation, téléchargeables sans accord de confidentialité
- Manifeste
- CSV de 38 colonnes par collection, exportable avant tout engagement
- Chaîne de consentement
- Chaque actif remonte à un consentement enregistré et à un contributeur payé
- Langues
- Pidgin nigérian, anglais nigérian, yorouba, haoussa, igbo, lingala, français, wolof, twi
Lignes d'approvisionnement mobilisées


Une solution n'est marquée « en service » que si une ligne qui la porte détient de la matière libérée. Rien de sourcé sur mandat n'est présenté comme un stock.
Cinquante heures livrées au standard de production, deux semaines après validation du cahier des charges.
Autres solutions

Post-entraînement et évaluation hors du corpus web
Le web n'est pas un échantillon du monde. Pour ce corridor, c'est un échantillon de ce qui a été écrit en anglais par des gens connectés — et un modèle entraîné dessus hérite de ce manque sous forme d'assurance.

Le travail à la première personne, y compris quand il rate
Une politique de manipulation généralise à partir de la variété de mains, d'outils et d'échecs qu'elle a vus. Les corpus égocentriques ouverts montrent un procédé fixe dans un intérieur industriel, filmé jusqu'à ce qu'il réussisse.

Les documents tels qu'ils sont réellement classés
Un modèle d'extraction qui n'a vu que des gabarits propres n'a pas vu la paperasse de ce corridor — le tampon en travers du champ, la photocopie de troisième génération, le formulaire rempli à deux mains.