El problema
El grupo había tratado el español latinoamericano como una sola cosa con acentos, entrenando con datos traducidos a variantes regionales que eran gramaticalmente regionales pero pragmáticamente castellanos, lo que mejoraba los puntajes de referencia mientras el desempeño real quedaba plano. Sus modelos de intención, búsqueda y moderación clasificaban mal entre variantes.
Qué hicimos
- Organizó 58 anotadores en cinco mesas de variante: caribeña, mexicana, andina, rioplatense y castellana
- Extendió el esquema de etiquetado para capturar rasgos pragmáticos además de los semánticos
- Se apoyó en la reserva laboral genuinamente multivariante y panlatinoamericana de Punta Cana
- Construyó una taxonomía de divergencia entre las variantes del español
Resultados
El desempeño real del modelo mejoró donde el trabajo guiado por referencias no lo había hecho, porque la anotación capturó la divergencia pragmática, la franqueza, el registro de cortesía y la señalización de urgencia, que era la verdadera fuente de la mala clasificación. Las métricas completas están en el portafolio descargable.
Las cifras corresponden al periodo indicado y las facilitó el cliente. Dependen de su punto de partida, así que no son una previsión para otra operación.
Habíamos tratado el español latinoamericano como una sola cosa con acentos. La taxonomía de divergencia que construyeron sus líderes lingüísticos cambió cómo pensamos todo el mercado latinoamericano, no solo los datos.
Qué quedó funcionando
La taxonomía de divergencia de variantes es un activo del cliente que hoy moldea su estrategia de producto en América Latina, y el modelo de anotación de cinco variantes es un estándar de Corpshore Dominicana.
