Aller au contenu
Corpshore Colombia

Livraison d'IA

Données d'entraînement en espagnol d'Amérique latine pour un groupe mondial de commerce en ligne

Livraison d'IASPANISHMEDELLÍN

En un coup d'œil

Secteur
Commerce en ligne et technologie du commerce de détail
Géographie du client
Groupe mondial de commerce en ligne en expansion à travers l'Amérique latine
Taille du client
Grand compte, opérateur de place de marché internationale
Ligne de service
Prestation IA, données d'entraînement multilingues, annotation, RLHF
Langue principale
Espagnol à travers les variantes régionales, avec le portugais et l'anglais
Site de livraison
Medellín
Durée de l'engagement
11 mois, en cours
Taille de l'équipe
56 annotateurs, 6 responsables linguistiques, 4 spécialistes QA, 2 ingénieurs de liaison ML

Profil du client

Le client est un groupe mondial de commerce en ligne en pleine expansion à travers la Colombie, le Mexique, l'Argentine, le Pérou et le Chili. Son automatisation en contact client, la classification d'intention, le support conversationnel, la compréhension de recherche et la catégorisation de contenu, est bâtie sur des modèles entraînés majoritairement sur des données en espagnol castillan et européen.

Le défi

Les modèles du client performaient bien en Espagne et mal à travers l'Amérique latine, de façon assez constante pour être structurelle. Le F1 de classification d'intention s'établissait à 91,0 % sur l'espagnol castillan et tombait à 71,1 % sur l'espagnol caraïbe, 78,2 % sur le colombien, 79,6 % sur le rioplatense. Le chiffre caraïbe était commercialement inutilisable, et plusieurs de ces marchés se situaient tôt dans la séquence d'expansion du client. Les modes d'échec étaient précis : divergence de vocabulaire sur des concepts ordinaires du commerce, conventions différentes de politesse et de franchise, usage du diminutif régionalement distinct, et alternance codique. Un modèle qui interprète à tort une plainte comme une demande produit des échecs d'automatisation qui atteignent directement les clients.

La remédiation initiale du client, traduire automatiquement les données castillanes vers les variantes régionales, a rendu le problème plus difficile à voir. Elle a produit des données grammaticalement régionales et pragmatiquement castillanes, ce qui a amélioré les scores de référence tout en laissant la performance réelle largement inchangée. S'approvisionner en véritable annotation espagnole multivariante à grande échelle s'était avéré difficile, car aucun fournisseur unique ne pouvait fournir plusieurs variantes avec un discernement pragmatique natif dans chacune.

Pourquoi Corpshore Colombia

Corpshore Colombia a proposé Medellín, dont la réputation de plaque tournante technologique a attiré une main-d'œuvre mobile et multinationale, donnant accès à des locuteurs natifs de plusieurs variantes de l'espagnol d'Amérique latine aux côtés de l'espagnol colombien sur un seul site. Corpshore a pu démontrer une capacité multivariante que les fournisseurs concurrents mono-marché ne pouvaient pas offrir.

Le client a mené un essai à l'aveugle sur trois fournisseurs. L'accord inter-annotateurs de Corpshore sur l'espagnol caraïbe et colombien était sensiblement plus élevé, et ses responsables linguistiques ont produit une taxonomie écrite des divergences pragmatiques à l'origine des erreurs de classification, que l'équipe ML du client n'avait pas eue documentée auparavant. Corpshore a également proposé d'intégrer des ingénieurs de liaison ML dans le pipeline d'entraînement du client plutôt que de livrer les données par lots.

L'engagement

Cinquante-six annotateurs à Medellín organisés en équipes par variante, colombienne, caraïbe, mexicaine, rioplatense et castillane, avec six responsables linguistiques, quatre spécialistes QA et deux ingénieurs de liaison ML travaillant à l'intérieur du pipeline du client. Les annotateurs sont des locuteurs natifs de la variante qu'ils annotent. Tous suivent une intégration de quatre semaines couvrant le schéma d'étiquetage, le vocabulaire du commerce en ligne, les principes d'annotation pragmatique et la taxonomie des divergences.

Approche et méthodologie

Annotation native par variante, jamais de traduction. Chaque enregistrement est annoté par un locuteur natif de sa variante, à partir de données produites à l'origine dans cette variante. C'est la décision qui distingue le projet de la tentative interne ratée du client et la raison pour laquelle les gains se sont maintenus en production.

Annotation pragmatique, pas seulement sémantique. Le schéma d'étiquetage saisit la franchise, le registre de politesse, la signalisation de l'urgence et l'intensité du sentiment, les traits qui varient réellement et provoquent les erreurs de classification.

Apprentissage actif face à l'incertitude du modèle. La priorité d'annotation est fixée chaque semaine par l'incertitude du modèle, réduisant le volume total d'annotation requis d'environ un quart par rapport à un échantillonnage uniforme.

Calibrage inter-variantes. Toutes les équipes examinent un échantillon hebdomadaire partagé pour établir où un concept est réellement le même d'une variante à l'autre et où il diffère, ce qui exige que les équipes soient co-localisées, la raison pour laquelle le modèle à site unique importe.

F1 de classification d'intention par variante d'espagnol

Résultats

Le F1 de classification d'intention est passé au-dessus de 91 % sur toutes les variantes, l'espagnol caraïbe s'améliorant de 71,1 % à 91,5 % et le colombien de 78,2 % à 92,4 %. L'écart entre la meilleure et la pire variante s'est resserré de 19,9 points à 2,1.

Le client a lancé l'automatisation du support conversationnel en Colombie, au Mexique et dans les Caraïbes dans les délais, après avoir précédemment reporté ces lancements pour des raisons de performance du modèle.

Le débit d'annotation a atteint 61 600 enregistrements par semaine au mois six. Le coût par enregistrement annoté était inférieur de 60 % à la référence du précédent fournisseur européen du client.

Valeur durable

La taxonomie des divergences pragmatiques et le schéma d'étiquetage étendu appartiennent au client et régissent désormais tout son travail de modèles hispanophones. Le modèle d'annotation multivariante à site unique est devenu une capacité définie de Corpshore Colombia. Le projet s'est étendu au RLHF pour l'assistant de support génératif du client.

Indicateurs clés

IndicateurPoint de départMois 11Évolution
F1 d'intention, espagnol caraïbe71.1%91.5%+20.4 pts
F1 d'intention, espagnol colombien78.2%92.4%+14.2 pts
F1 d'intention, espagnol rioplatense79.6%92.0%+12.4 pts
F1 d'intention, espagnol mexicain84.4%92.8%+8.4 pts
Écart entre variantes19.9 pts2.1 pts-89%
Débit d'annotation hebdomadairen/a61,600 recordsNouvelle capacité
Coût par enregistrement annotéRéférence fournisseur européen-60%-60%

Quand un indicateur n'a révélé qu'une évolution, les chiffres absolus sont affichés avec un tiret. Les chiffres sont rapportés par le client ou mesurés conjointement.

Nous avions traité l'espagnol d'Amérique latine comme une seule chose avec des accents. La taxonomie des divergences que leurs responsables linguistiques ont produite lors de l'essai a changé la façon dont toute notre équipe ML pense le problème.
Directeur de l'apprentissage automatique, groupe mondial de commerce en ligne

Sujets connexes

données d'entraînement IA espagnol Colombieannotation de données Amérique latineannotation de données multilingueTAL variantes espagnoles