
Inteligencia artificial
Evaluación y seguridad de sistemas de IA
Medir cómo se comporta el sistema antes de que lo descubran sus clientes.
En resumen: evaluación sistemática de sistemas de IA, con conjuntos de prueba independientes, análisis de casos límite y de sesgo, y la documentación que el marco europeo requiere. La evaluación es independiente de quien construye el sistema, que es de donde viene su valor.
Un sistema de inteligencia artificial que funciona bien en la demostración y mal en producción no es un fallo técnico, es un fallo de evaluación. La demostración se hace sobre los casos que el sistema resuelve; la producción trae los que no.
Evaluar en serio significa construir el conjunto de prueba a partir de los casos reales que preocupan, incluidos los incómodos, y medir antes de que los encuentre un cliente.
Qué incluye
Según el sistema y el riesgo asociado.
- Construcción de conjuntos de evaluación independientes del entrenamiento
- Medición de calidad de salidas contra criterios acordados
- Pruebas sobre casos límite y entradas adversas
- Análisis de sesgo sobre las dimensiones relevantes para su caso
- Evaluación específica en español de España y lenguas cooficiales
- Documentación de resultados con metodología reproducible
- Reevaluación periódica para detectar degradación
Qué no incluye
Lo que una evaluación no puede ofrecer.
- Certificación de conformidad con el Reglamento de Inteligencia Artificial, que no emitimos
- Garantía de que el sistema no fallará en producción
- Corrección de los problemas encontrados, que corresponde a quien desarrolla el sistema
- Auditoría independiente cuando también prestamos el servicio gestionado sobre ese mismo sistema
- Dictamen jurídico sobre la clasificación de riesgo de su sistema
Desde dónde se presta
La evaluación en español de España y lenguas cooficiales se presta desde España, con hablantes nativos, por la misma razón que la anotación: el matiz es exactamente lo que se está midiendo.
La evaluación técnica y la construcción de la infraestructura de pruebas se prestan desde Polonia o Uzbekistán según el modelo de coordinación.
Marco europeo y calendario
Las obligaciones de transparencia del artículo 50 del Reglamento de Inteligencia Artificial están en vigor desde el 2 de agosto de 2026.
Las obligaciones para sistemas de alto riesgo se aplican más adelante: diciembre de 2027 para los supuestos del anexo III y agosto de 2028 para los del anexo I. Ese calendario es útil porque permite preparar la documentación de evaluación con tiempo en lugar de improvisarla.
Conviene decir con claridad qué no hacemos: no emitimos certificaciones de conformidad ni evaluamos la clasificación jurídica de riesgo de su sistema. Producimos evidencia técnica reproducible sobre cómo se comporta, que es una entrada para ese análisis, no el análisis.
Hay además una incompatibilidad que preferimos declarar: si operamos su sistema mediante un servicio gestionado, no somos la parte adecuada para auditarlo de forma independiente. Un evaluador que acepta evaluar su propio trabajo debería preocuparle.
Preguntas frecuentes
¿Emiten certificaciones de conformidad con el Reglamento de IA?
No. Producimos evidencia técnica reproducible sobre el comportamiento del sistema. La conformidad y su clasificación de riesgo corresponden a su organización y a sus asesores.
¿Pueden evaluar un sistema que ustedes operan?
No de forma independiente. Si prestamos el servicio gestionado sobre ese sistema, la evaluación independiente debería encargarse a un tercero. Lo decimos aunque suponga renunciar a un encargo.
¿Qué significa evaluar el sesgo?
Medir si el sistema se comporta de forma sistemáticamente distinta según dimensiones que no deberían influir en el resultado. Qué dimensiones son relevantes depende de su caso de uso y se acuerda antes de empezar.
¿Con qué frecuencia hay que reevaluar?
Con la frecuencia con la que cambie el sistema o su entrada. Un sistema estable con datos estables se degrada lentamente; uno que se actualiza con frecuencia necesita evaluación continua.
¿Sabe cómo se comporta su sistema en los casos difíciles?
Cuéntenos qué hace el sistema y qué fallos le preocuparían más.