El problema
Los modelos que la plataforma usaba para moderar y recomendar funcionaban razonablemente en inglés y bastante peor en español de España. Los errores se concentraban en el matiz: ironía, coloquialismos regionales y expresiones que un hablante de español latinoamericano interpreta de otra manera.
En catalán, gallego y euskera la cobertura era directamente insuficiente, y la plataforma no tenía forma de medir cuán insuficiente era, porque no disponía de conjuntos de evaluación en esas lenguas.
Qué hicimos
Corpshore AI construyó primero los conjuntos de evaluación, no los de entrenamiento: sin una forma de medir, cualquier mejora posterior habría sido una impresión. Los conjuntos se elaboraron con hablantes nativos de cada lengua, con guías escritas y revisión cruzada entre anotadores.
A partir de ahí, el equipo anotó datos de entrenamiento centrados en los casos donde el sistema fallaba, que es donde el dato nuevo aporta y no en el volumen general.
La evaluación es continua: cada versión del sistema se mide contra los mismos conjuntos, de modo que la plataforma puede afirmar si ha mejorado en lugar de suponerlo.
Forma del equipo
Un equipo de doce anotadores y tres evaluadores sénior, con hablantes nativos de castellano, catalán, gallego y euskera, repartidos entre España y el corredor.
Calendario
Seis semanas para los conjuntos de evaluación iniciales, piloto de 30 días de anotación sobre casos de fallo y operación continua a partir del tercer mes.
Tratamiento de datos y cumplimiento
El contenido tratado es contenido publicado en la plataforma. Los datos que salen del Espacio Económico Europeo se amparan en cláusulas contractuales tipo, y el contenido con datos personales identificables se seudonimiza antes de llegar al equipo de anotación.
Resultados
- +17 pts
- Precisión de moderación en español de España
- 0 a 4 lenguas
- Cobertura de evaluación en lenguas cooficiales
- -31 %
- Falsos positivos en moderación
- -24 %
- Casos escalados a revisión humana
Medida sobre el conjunto de evaluación construido al inicio.
Antes no existía conjunto de evaluación en catalán, gallego ni euskera.
Contenido legítimo que el sistema retiraba por error.
Tras afinar el sistema sobre los casos de fallo reales.
Las cifras corresponden al periodo indicado en cada caso y dependen del punto de partida de cada cliente.
Lo que nos cambió el proyecto fue empezar por medir. Llevábamos dos años mejorando el modelo sin poder decir si estaba mejorando en español.
