TexaData
Solutions
Équipes parole et voix

Reconnaissance vocale pour les langues que les benchmarks ignorent

Le taux d'erreur sur ce corridor n'est pas un problème de modélisation. C'est un problème de données, et ces données n'ont jamais été collectées.

A barber cutting hair at a stand on the roadside

Le problème

Un modèle de parole entraîné sur les corpus ouverts disponibles pour l'Afrique de l'Ouest et centrale apprend un registre qui n'existe pas hors d'une consigne d'enregistrement. La matière publiée est très majoritairement de la parole lue : un locuteur, un microphone, une phrase à la fois, sollicitée par un script. C'est propre, c'est monocanal, et cela ne ressemble en rien à une négociation de marché, à une émission d'antenne ouverte ou à deux mécaniciens qui se parlent par-dessus un moteur.

Les modèles sortent donc avec des chiffres honorables en benchmark et échouent en production sur les trois traits qui caractérisent réellement la parole ici — le chevauchement, l'interruption, et l'alternance codique en milieu de phrase entre pidgin, anglais et langue locale. Le benchmark ne les contenait pas parce que la méthode de collecte ne pouvait pas les produire.

Ce que nous y opposons

Deux sources, et un acheteur peut prendre l'une, l'autre ou les deux. L'archive libérée issue des émissions de parole et d'antenne ouverte, matière existante qui avance au rythme d'un audit de droits. Et la captation sur commande au micro-cravate, qui avance au rythme d'un cahier des charges.

Les deux arrivent à canaux séparés lorsque la source le permet, horodatées, attribuées par locuteur, avec diarisation et taux de chevauchement dans les métadonnées et les alternances codiques signalées plutôt que normalisées. La transcription conserve l'alternance parce que l'alternance est précisément la difficulté.

A barber cutting hair at a stand on the roadside
Trading in the open beside a road
A customer in the chair reflected in a barbershop mirror
A market seen from above, dense with trading umbrellas
A barber at work in the open air, customer under a cape

Ce à quoi cela doit répondre

ExigenceComment elle est satisfaite
Audio multi-locuteurs chevauché, avec interruptions réellesAntenne ouverte et captation de marché, canaux séparés, taux de chevauchement indiqué par actif
Alternance codique conservée plutôt qu'effacéeAlternances signalées dans la transcription, avec la langue de part et d'autre
Conditions acoustiques conformes au déploiementCaptation en plein air, en bord de route et en atelier, bruit de fond documenté et non supprimé
Des droits qui résistent à une revue juridiqueConsentement du locuteur nommant l'entraînement commercial et les modèles génératifs, sous-licenciable

Ce que vous pouvez vérifier d'abord

Échantillon avant contrat
Extraits publiés avec transcription et annotation, téléchargeables sans accord de confidentialité
Manifeste
CSV de 38 colonnes par collection, exportable avant tout engagement
Chaîne de consentement
Chaque actif remonte à un consentement enregistré et à un contributeur payé
Langues
Pidgin nigérian, anglais nigérian, yorouba, haoussa, igbo, lingala, français, wolof, twi

Lignes d'approvisionnement mobilisées

Une solution n'est marquée « en service » que si une ligne qui la porte détient de la matière libérée. Rien de sourcé sur mandat n'est présenté comme un stock.

Lancer un pilote

Cinquante heures livrées au standard de production, deux semaines après validation du cahier des charges.