
Datos de entrenamiento en español de España: por qué el rendimiento cae y cómo se mide
Equipo editorial de Corpshore España · · 6 min de lectura
En resumen: los sistemas de IA suelen rendir peor en español de España que en inglés, y bastante peor en catalán, euskera y gallego. El primer paso no es anotar más datos de entrenamiento, es construir un conjunto de evaluación que permita saber si una versión mejora o empeora.
Una empresa española que despliega un sistema de inteligencia artificial sobre texto o voz descubre pronto un patrón: funciona razonablemente en inglés, algo peor en español y bastante peor si el usuario escribe en catalán, en euskera o en gallego.
Ese patrón tiene una causa conocida y una solución que casi siempre se aborda en el orden equivocado.
¿Por qué rinde peor en español de España?
Por volumen y por variedad. La mayor parte del texto disponible para entrenar está en inglés, y dentro del español la proporción latinoamericana es mucho mayor que la peninsular por número de hablantes.
El resultado no es que el sistema no entienda español, es que falla en el matiz: expresiones coloquiales peninsulares, ironía, usos que un hablante latinoamericano interpreta de otro modo, y el registro de cortesía que espera un cliente español, que no coincide exactamente con el de otros mercados hispanohablantes.
En catalán, euskera y gallego el problema es distinto y más severo: el volumen disponible es sustancialmente menor, y en el caso del euskera la distancia estructural con las lenguas romances añade una dificultad propia.
¿Por qué hay que empezar por la evaluación y no por el entrenamiento?
Porque sin una forma de medir, cualquier mejora posterior es una impresión. Es el error más común y el más caro: se anotan miles de ejemplos de entrenamiento, se afina el sistema y después nadie puede decir con datos si ha mejorado en español peninsular o si simplemente ha cambiado.
Un conjunto de evaluación es un grupo de casos con la respuesta correcta acordada, construido por hablantes nativos, con guías escritas y revisión cruzada entre anotadores. Sirve para medir cada versión contra la misma vara.
Construirlo primero tiene una segunda ventaja: señala dónde falla el sistema, y eso permite anotar datos de entrenamiento dirigidos a los casos de fallo en lugar de volumen general, que es bastante más eficiente.
¿Qué hace falta para anotar bien?
Hablantes nativos de la variedad concreta, no hablantes de español genérico. Para español de España, hablantes de España; para catalán, gallego o euskera, hablantes nativos de esas lenguas.
Guías de anotación escritas y vivas. La mayor parte del valor de un proyecto de anotación se decide en cómo se resuelven los casos límite, y esos casos hay que incorporarlos a la guía en lugar de resolverlos de forma distinta cada vez.
Y revisión cruzada, porque la consistencia entre anotadores es lo que convierte un conjunto de datos en algo utilizable. Dos anotadores que etiquetan el mismo caso de forma distinta producen ruido, y el ruido se entrena igual que la señal.
¿Qué obligaciones de protección de datos aparecen?
Depende del origen del dato. Si se anota contenido publicado por usuarios, hay que valorar si contiene datos personales identificables y, en caso afirmativo, seudonimizarlo antes de que llegue al equipo de anotación.
Si el equipo trabaja fuera del Espacio Económico Europeo, se aplican las cláusulas contractuales tipo y, según la sensibilidad, una evaluación de impacto de la transferencia. La minimización vuelve a ser aquí la medida más eficaz: buena parte de los proyectos de anotación no necesitan los campos identificativos para hacer el trabajo.
¿Cuánto dato hace falta?
Menos del que se suele suponer, si está bien dirigido. Un conjunto de evaluación sólido y unos miles de ejemplos de entrenamiento centrados en los casos de fallo suelen mover más el resultado que un volumen mucho mayor recogido sin criterio.
La pregunta útil no es cuántos ejemplos, sino qué casos concretos falla hoy el sistema y en qué lengua. Esa pregunta solo tiene respuesta si existe el conjunto de evaluación, que es por donde conviene empezar.
Este artículo es información general, no asesoramiento jurídico. Trabajamos junto a sus asesores legales, no en su lugar.