Indicadores de éxito¶
Por qué la medición importa¶
Sin métricas predefinidas, la evaluación de los proyectos de IA es subjetiva y susceptible de sesgos de confirmación: los promotores tienden a ver éxito donde hay resultados parciales, y los escépticos tienden a ver fracaso donde hay aprendizaje válido. Las métricas establecidas antes del inicio del proyecto eliminan la ambigüedad y permiten tomar decisiones de continuación, ajuste o abandono con criterios objetivos.
El error más frecuente es confundir métricas técnicas con métricas de negocio. Que un modelo tenga un 95% de precisión no dice nada sobre si está generando valor para la organización. Las métricas que importan son las que miden el cambio en los resultados de negocio que el sistema de IA debería producir.
Tres categorías de métricas¶
Métricas de adopción¶
Miden si los usuarios están usando el sistema. Un sistema de IA con excelentes resultados técnicos que nadie usa es un fracaso operativo.
| Métrica | Descripción | Cómo medir |
|---|---|---|
| Tasa de activación | % de usuarios con acceso que han usado el sistema al menos una vez | Log de accesos / total de usuarios con acceso |
| Uso activo semanal | % de usuarios que usan el sistema al menos una vez a la semana | Log de uso semanal / total de usuarios con acceso |
| Retención a 30 días | % de usuarios que siguen usando el sistema 30 días después del primer uso | Análisis de cohortes de adopción |
| Procesos con IA integrada | Número de procesos de negocio con IA activa en producción | Inventario de sistemas de IA |
| Tasa de Shadow AI | % de usos de IA no inventariados detectados | Auditorías periódicas de herramientas usadas por los equipos |
Métricas de impacto¶
Miden si el sistema de IA está generando el valor de negocio esperado. Deben estar vinculadas directamente a las métricas de línea base definidas en el caso de negocio.
| Tipo de impacto | Ejemplos de métricas específicas |
|---|---|
| Eficiencia operativa | Horas/semana dedicadas a tarea antes vs. después; tiempo de ciclo del proceso antes vs. después |
| Calidad del output | Tasa de errores antes vs. después; satisfacción del cliente (NPS, CSAT); tasa de reproceso |
| Velocidad | Tiempo de respuesta al cliente; tiempo de procesamiento de documentos; tiempo de toma de decisión |
| Ingresos | Tasa de conversión; valor medio de pedido; número de oportunidades identificadas |
| Costes | Coste unitario del proceso; reducción de incidencias; ahorro en horas de trabajo |
Métricas de riesgo¶
Miden si el sistema de IA opera dentro de los límites de riesgo definidos por el Comité. Un sistema que genera valor pero introduce riesgos no gestionados no está operando de forma sostenible.
| Métrica | Descripción | Umbral de alerta |
|---|---|---|
| Incidentes registrados | Número de incidencias con el sistema de IA en el periodo | >0 incidentes críticos en un mes |
| Tiempo de resolución de incidentes | Tiempo medio entre detección y resolución de incidentes | >48 horas para incidentes mayores |
| Deriva del modelo | Variación en las métricas de rendimiento del modelo respecto a la línea base | >10% de degradación en métricas principales |
| Cobertura de supervisión humana | % de outputs del sistema revisados por un humano antes de su uso | Según política y nivel de riesgo del sistema |
| Cumplimiento de AUP | Casos de uso detectados fuera de la Política de Uso Aceptable | >0 en el periodo |
OKRs por fase del ciclo de adopción¶
Los Objetivos y Resultados Clave (OKR) permiten estructurar los indicadores de éxito por fase. A continuación se proponen OKRs orientativos que cada organización debe adaptar a su contexto.
Fase 0 — Fundamentos¶
Objetivo: Construir los cimientos de gobierno y alfabetización que permitan seleccionar y ejecutar un piloto con garantías.
| Resultado Clave | Medición |
|---|---|
| El Comité de IA está constituido con todos los roles mínimos cubiertos | Sí/No |
| La Política de Uso Aceptable está aprobada y comunicada a todos los empleados | % de empleados que han recibido la comunicación |
| Al menos el 80% de los empleados que usarán IA han completado la formación introductoria | % de completado |
| Se ha generado una lista de al menos 5 candidatos de piloto evaluados con el proceso formal | Número de candidatos en el scorecard |
Fase 1 — Pilares y Selección¶
Objetivo: Seleccionar el piloto con mayor probabilidad de éxito y preparar todo lo necesario para su ejecución.
| Resultado Clave | Medición |
|---|---|
| El diagnóstico de los 4 pilares de madurez está completo y documentado | Sí/No |
| El piloto seleccionado tiene un caso de negocio aprobado por el Comité | Sí/No |
| Los datos necesarios para el piloto están disponibles con calidad suficiente | Sí/No |
| El equipo que ejecutará el piloto ha sido formado en las herramientas que usará | % de completado |
Fase 2 — Ejecución¶
Objetivo: Desplegar el piloto, medir sus resultados y producir el dossier de cierre.
| Resultado Clave | Medición |
|---|---|
| El piloto ha alcanzado la tasa de adopción objetivo (uso activo semanal ≥70%) | % de adopción semanal |
| Al menos 2 de las 3 métricas de impacto principales han alcanzado el objetivo del caso de negocio | Número de métricas en objetivo |
| No se han registrado incidentes críticos sin resolución | Número de incidentes críticos abiertos |
| El dossier de cierre está completado y aprobado por el Comité | Sí/No |
Errores más frecuentes en la definición de KPIs¶
Medir lo que es fácil de medir, no lo que importa. El número de consultas al chatbot no es un indicador de valor. El tiempo ahorrado al equipo de atención al cliente o la satisfacción del cliente después de la implementación, sí.
No establecer la línea base antes del despliegue. Sin el dato de partida, no es posible calcular la mejora. La línea base debe medirse antes de implementar el sistema, no después.
Definir umbrales de éxito después de ver los resultados. El umbral que define si un piloto es éxito o fracaso debe estar definido en el caso de negocio, antes del inicio. Definirlo a posteriori invalida la evaluación.
Ignorar las métricas de adopción. Un sistema técnicamente exitoso que los usuarios no adoptan es un fracaso. La adopción es siempre una métrica de primer orden.
Usar solo métricas de eficiencia sin métricas de calidad. Un sistema que procesa documentos el doble de rápido pero con una tasa de error del 15% puede estar generando más problemas que los que resuelve.