Ir al contenido principal
Corpshore España

Borrador pendiente de validación

Este caso está redactado sobre un escenario representativo y todavía no ha sido validado contra un proyecto real. Las cifras y la cita son ilustrativas, no corresponden a un cliente concreto y no deben citarse como resultados obtenidos. Se publicará como caso real cuando el proyecto, las métricas y la cita estén confirmados.

Detalle de azulejos colocados a mano en un panel geométrico
Inteligencia artificialHíbrido

Datos de entrenamiento y evaluación en español de España para una plataforma de contenidos

Una plataforma española de contenidos digitales con audiencia en España y Latinoamérica

En resumen: equipos en España y en el corredor con Latinoamérica anotan y evalúan datos en español de España y en las lenguas cooficiales para afinar los sistemas de moderación y recomendación de la plataforma.

El problema

Los modelos que la plataforma usaba para moderar y recomendar funcionaban razonablemente en inglés y bastante peor en español de España. Los errores se concentraban en el matiz: ironía, coloquialismos regionales y expresiones que un hablante de español latinoamericano interpreta de otra manera.

En catalán, gallego y euskera la cobertura era directamente insuficiente, y la plataforma no tenía forma de medir cuán insuficiente era, porque no disponía de conjuntos de evaluación en esas lenguas.

Qué hicimos

Corpshore AI construyó primero los conjuntos de evaluación, no los de entrenamiento: sin una forma de medir, cualquier mejora posterior habría sido una impresión. Los conjuntos se elaboraron con hablantes nativos de cada lengua, con guías escritas y revisión cruzada entre anotadores.

A partir de ahí, el equipo anotó datos de entrenamiento centrados en los casos donde el sistema fallaba, que es donde el dato nuevo aporta y no en el volumen general.

La evaluación es continua: cada versión del sistema se mide contra los mismos conjuntos, de modo que la plataforma puede afirmar si ha mejorado en lugar de suponerlo.

Forma del equipo

Un equipo de doce anotadores y tres evaluadores sénior, con hablantes nativos de castellano, catalán, gallego y euskera, repartidos entre España y el corredor.

Calendario

Seis semanas para los conjuntos de evaluación iniciales, piloto de 30 días de anotación sobre casos de fallo y operación continua a partir del tercer mes.

Tratamiento de datos y cumplimiento

El contenido tratado es contenido publicado en la plataforma. Los datos que salen del Espacio Económico Europeo se amparan en cláusulas contractuales tipo, y el contenido con datos personales identificables se seudonimiza antes de llegar al equipo de anotación.

Resultados

+17 pts
Precisión de moderación en español de España

Medida sobre el conjunto de evaluación construido al inicio.

0 a 4 lenguas
Cobertura de evaluación en lenguas cooficiales

Antes no existía conjunto de evaluación en catalán, gallego ni euskera.

-31 %
Falsos positivos en moderación

Contenido legítimo que el sistema retiraba por error.

-24 %
Casos escalados a revisión humana

Tras afinar el sistema sobre los casos de fallo reales.

Las cifras corresponden al periodo indicado en cada caso y dependen del punto de partida de cada cliente.

Lo que nos cambió el proyecto fue empezar por medir. Llevábamos dos años mejorando el modelo sin poder decir si estaba mejorando en español.
Responsable de producto de datos, plataforma de contenidos digitales