KI-Delivery
Spanischsprachige Content-Moderation und Klassifikatoren-Training für eine lateinamerikanische Plattform
Auf einen Blick
- Sektor
- Medien und digitale Plattformen
- Geografie des Kunden
- Lateinamerika, regionale Social- und Content-Plattform
- Größe des Kunden
- Enterprise, Nutzerbasis in mehreren Ländern
- Servicelinie
- AI-Delivery, Content-Moderation, Klassifikatoren-Training, KI-gestützte Triage
- Hauptsprache
- Spanisch über lateinamerikanische Varianten hinweg, mit Portugiesisch
- Delivery-Standort
- Cali
- Dauer des Engagements
- 13 Monate, fortlaufend
- Teamgröße
- 66 Moderatoren, 8 KI-Trainingsspezialisten, 5 Trust-and-Safety-Leads, 2 Wellbeing-Berater
Kundenprofil
Der Kunde betreibt eine Social- und User-Generated-Content-Plattform mit einer erheblichen Nutzerbasis in Kolumbien, Mexiko, Argentinien, Chile, Peru und Zentralamerika, neben einem brasilianisch-portugiesischen Segment. Das Content-Volumen ist hoch und überwiegend spanisch, mit starken regionalen Unterschieden in Slang, Humor und kulturellen Bezügen.
Die Herausforderung
Die automatisierte Moderation der Plattform schnitt bei lateinamerikanischem Spanisch schlecht ab. Der Toxizitätsklassifikator, der weitgehend auf englischen und kastilischen Daten trainiert war, erreichte bei lateinamerikanischen Inhalten eine Präzision von 72,0 Prozent und einen Recall von 61,4 Prozent. Niedriger Recall bedeutete, dass schädliche Inhalte bestehen blieben; niedrige Präzision bedeutete, dass harmlose Inhalte entfernt wurden, was Beschwerden und Vorwürfe willkürlicher Zensur erzeugte. Das Versagen konzentrierte sich genau auf die Inhalte, die am wichtigsten sind. Regionaler Slang, verschlüsselte Sprache und kontextabhängige Beleidigungen wurden systematisch übersehen, während in einem Land harmloses und in einem anderen anstößiges Vokabular uneinheitlich behandelt wurde. Die Reaktionszeit verschärfte den Schaden, mit einer mittleren Zeit von der Meldung bis zur Maßnahme von 45 Minuten, die während Spitzen vier Stunden überschritt. Das Wohlergehen der Moderatoren war zu einer Bindungskrise geworden, mit einer annualisierten Fluktuation von über 70 Prozent unter der vorherigen Regelung, was eine dauerhaft unerfahrene Belegschaft und eine verschlechterte Entscheidungsqualität hervorbrachte.
Warum Corpshore Colombia
Corpshore Colombia schlug Cali wegen seiner lateinamerikanischen demografischen Mischung und seines wachsenden Dienstleistungsarbeitsmarkts vor und schlug ein Moderationsmodell vor, das um regionales Entscheidungs-Routing statt um einheitliche Besetzung herum aufgebaut ist.
Das Wellbeing-Rahmenwerk war ausschlaggebend. Der dokumentierte Ansatz von Corpshore, verpflichtende Rotation aus hochintensiven Warteschlangen, geplante Dekompression, Beratung vor Ort und Peer-Support, wurde als deutlich weiterentwickelt gegenüber konkurrierenden Angeboten bewertet, und der Kunde hatte geschlossen, dass sein Fluktuationsproblem die eigentliche Ursache seines Qualitätsproblems war. Corpshore schlug außerdem vor, menschliche Moderation und Klassifikatoren-Training in einem einzigen Engagement zu verbinden.
Das Engagement
Sechsundsechzig Moderatoren in Cali aus verschiedenen lateinamerikanischen Nationalitäten, acht KI-Trainingsspezialisten für die Klassifikatorverbesserung, fünf Trust-and-Safety-Leads und zwei Wellbeing-Berater vor Ort. Die Abdeckung beträgt 24 Stunden in rotierenden Schichten. Alle Moderatoren absolvieren ein sechswöchiges Onboarding, das Richtlinien, regionalen Kontext, Entscheidungsrahmen, Eskalation und Wellbeing-Praxis abdeckt, bevor sie mit Live-Inhalten umgehen, mit separaten Trainings- und Rotationsgrenzen für die schwierigsten Kategorien.
Ansatz und Methodik
Regionales Entscheidungs-Routing. Inhalte werden an einen Moderator geleitet, der mit der Sprache und dem kulturellen Kontext der Herkunftsregion vertraut ist, statt an eine generische spanische Warteschlange, was die Uneinheitlichkeit adressiert, die eine einheitliche Besetzung nicht lösen kann.
Moderatorenentscheidungen als Trainingsdaten. Jede Entscheidung, mit ihrem regionalen Kontext und ihrem Begründungscode, fließt in den Trainingsdatensatz des Klassifikators ein. Sechs Retraining-Zyklen wurden abgeschlossen, wobei jeder die menschlichen Entscheidungen des vorherigen Zyklus einbezog.
KI-gestützte Triage, kein Ersatz. Der Klassifikator bewertet vorab und priorisiert, statt oberhalb eines schmalen Bandes hoher Konfidenz autonom zu handeln, und behält so das menschliche Urteil bei mehrdeutigen Inhalten bei, während er das Routinevolumen entfernt, was die Verbesserung der Reaktionszeit ohne Präzisionskosten hervorbrachte.
Wellbeing als betriebliche Anforderung. Rotationsgrenzen, Dekompression, Beratung vor Ort und Peer-Support sind geplant und werden durchgesetzt. Die Fluktuation auf diesem Account beträgt annualisiert 21 Prozent gegenüber den vorherigen 70 Prozent des Kunden, und der Kunde führt die Verbesserung der Entscheidungsqualität in erster Linie auf die Betriebszugehörigkeit zurück.
Präzision und Recall des spanischsprachigen Klassifikators
Ergebnisse
Die Präzision des Klassifikators stieg über sechs Retraining-Zyklen von 72,0 Prozent auf 94,0 Prozent und der Recall von 61,4 Prozent auf 93,1 Prozent. Die Verbesserung der Präzision reduzierte fälschliche Entfernungen, die Quelle der öffentlichen Kritik an der Plattform. Die mittlere Zeit von der Meldung bis zur Maßnahme fiel von 45 Minuten auf 4 Minuten, auch während Spitzen aufrechterhalten, weil die KI-Triage das Routinevolumen aufnimmt, das zuvor hinter mehrdeutigen Fällen in der Warteschlange stand. Die Fluktuation der Moderatoren fiel von über 70 Prozent auf 21 Prozent, und die Entscheidungsgenauigkeit gegenüber der Prüfung durch die Trust-and-Safety-Leads stieg von 79 Prozent auf 96 Prozent.
Dauerhafter Wert
Der regional annotierte Trainingskorpus und die Taxonomie der Begründungscodes gehören dem Kunden und werden die Klassifikatorentwicklung unabhängig von jedem Anbieter unterstützen. Das Wellbeing-Rahmenwerk wurde als Standard von Corpshore Colombia für Accounts übernommen, die mit belastenden Inhalten umgehen. Das Engagement wurde auf die Moderation von brasilianischem Portugiesisch und auf das Red-Teaming der generativen Content-Funktionen des Kunden ausgeweitet.
Kernkennzahlen
| Kennzahl | Ausgangspunkt | Monat 12 | Veränderung |
|---|---|---|---|
| Präzision des Klassifikators | 72.0% | 94.0% | +22.0 pts |
| Recall des Klassifikators | 61.4% | 93.1% | +31.7 pts |
| Mittlere Zeit bis zur Moderationsmaßnahme | 45 min | 4 min | -91% |
| Entscheidungsgenauigkeit der Moderatoren | 79% | 96% | +17 pts |
| Moderatorenfluktuation, annualisiert | > 70% | 21% | -70% |
| Stattgegebene Einsprüche gegen fälschliche Entfernungen | 18% | 3% | -83% |
| Geprüfte Inhalte pro Tag | n/a | n/a | +235% |
Wenn eine Kennzahl nur eine Veränderung offenbarte, werden die absoluten Zahlen mit einem Bindestrich dargestellt. Die Zahlen sind vom Kunden berichtet oder gemeinsam gemessen.
Wir hatten die Fluktuation als HR-Problem und die Qualität als Trainingsproblem behandelt. Es war dasselbe Problem. Sobald Moderatoren länger als ein Jahr blieben, löste sich die Entscheidungsqualität von selbst.
Verwandte Themen