Post-entraînement et évaluation hors du corpus web
Le web n'est pas un échantillon du monde. Pour ce corridor, c'est un échantillon de ce qui a été écrit en anglais par des gens connectés — et un modèle entraîné dessus hérite de ce manque sous forme d'assurance.

Le problème
La couverture du pidgin nigérian, du lingala ou du twi par un grand modèle dépend de ce qui a été collecté du web, donc de qui était en ligne et écrivait. Il en résulte un modèle qui produit un texte d'apparence fluide dans une langue qu'il a surtout vue traduite, et qui obtient de bons résultats sur des benchmarks traduits de l'anglais vers cette langue — ce qui mesure la traduction, non la compétence.
Les données de post-entraînement qui corrigeraient cela n'existent quasiment pas sous licence. Ce qui existe est soit aspiré, donc inutilisable par un laboratoire tenu de garantir la provenance, soit de la matière sollicitée à tour unique, qui ne porte ni le raisonnement, ni le désaccord, ni la connaissance métier dont un jeu de post-entraînement a besoin.
Ce que nous y opposons
De la matière spontanée, à plusieurs voix, en langue, l'argumentation intacte : une antenne ouverte où un auditeur et un animateur s'opposent, une négociation où un prix est contesté puis conclu, un atelier où un savoir-faire se transmet étape par étape. Ce sont des traces de raisonnement naturelles, dans des langues qui n'en ont presque aucune de consignée.
Livrée avec attribution des locuteurs, horodatage et couche de contexte rédigée, et — parce que le conseil juridique d'un laboratoire le demandera — avec la chaîne des droits reconstituée actif par actif et l'entraînement de modèles nommé dans la cession plutôt que déduit d'une licence générale.





Ce à quoi cela doit répondre
| Exigence | Comment elle est satisfaite |
|---|---|
| De la matière en langue, non traduite de l'anglais | Audio d'origine et d'archive dans la langue d'usage, transcrit dans cette langue |
| Des jeux d'évaluation qui mesurent la compétence, non la traduction | Matière de registre natif, dont un benchmark peut être tiré, registre documenté |
| Une provenance qu'un conseil juridique acceptera | Chaîne des droits par actif, garantie ; entraînement de modèles nommé explicitement dans la cession |
| La sous-licence sur plusieurs niveaux | Cessions rédigées pour la sous-licence, à l'usage des agrégateurs revendant aux laboratoires |
Ce que vous pouvez vérifier d'abord
- Nommé dans la cession
- « Entraînement de modèles » figure dans l'instrument, et n'est pas déduit d'une licence générale
- Par tranches
- Rien n'entre dans une tranche tant que le titre n'est pas reconstituable et garantissable
- Comparaison aux corpus ouverts
- Les corpus déjà existants sont nommés sur la page données ouvertes, l'écart énoncé
- Exclusions
- Musique de tiers, plans d'insert sous licence, interprètes non libérés
Lignes d'approvisionnement mobilisées



Une solution n'est marquée « en service » que si une ligne qui la porte détient de la matière libérée. Rien de sourcé sur mandat n'est présenté comme un stock.
Cinquante heures livrées au standard de production, deux semaines après validation du cahier des charges.
Autres solutions

Reconnaissance vocale pour les langues que les benchmarks ignorent
Le taux d'erreur sur ce corridor n'est pas un problème de modélisation. C'est un problème de données, et ces données n'ont jamais été collectées.

Le travail à la première personne, y compris quand il rate
Une politique de manipulation généralise à partir de la variété de mains, d'outils et d'échecs qu'elle a vus. Les corpus égocentriques ouverts montrent un procédé fixe dans un intérieur industriel, filmé jusqu'à ce qu'il réussisse.

Les documents tels qu'ils sont réellement classés
Un modèle d'extraction qui n'a vu que des gabarits propres n'a pas vu la paperasse de ce corridor — le tampon en travers du champ, la photocopie de troisième génération, le formulaire rempli à deux mains.