En el campo del Machine Learning y en la Inteligencia Artificial en general, gran parte de nuestro esfuerzo se centra en construir modelos que posteriormente serán utilizados para tomar decisiones críticas en el mundo real, abarcando diversos campos de aplicación.
Por ejemplo, para un profesional médico puede resultar absolutamente esencial entender por qué un modelo de Inteligencia Artificial tomó una cierta decisión al momento de generar un diagnóstico. De igual forma, si utilizamos la Inteligencia Artificial para decidir si una entidad bancaria le otorga o no un préstamo a un cliente, dicha entidad seguramente estará interesada en comprender los motivos precisos por los cuales se le aprobó o negó el crédito a una persona determinada.
En consecuencia, en una multitud de aplicaciones del mundo real, resulta esencial no solo construir el modelo y generar predicciones precisas, sino que resulta fundamental entender cómo se generaron esas predicciones. Y aquí es donde entran en juego dos conceptos clave: la interpretabilidad y la explicabilidad de un modelo.
Así que en este artículo, exploraremos en detalle qué son la interpretabilidad y la explicabilidad en el Machine Learning y cuándo resulta indispensable tener en cuenta estos dos conceptos al momento de diseñar soluciones de IA para problemas reales.
El contexto de las decisiones en el mundo real
Para comprender la necesidad de estos conceptos, analicemos tres ejemplos detallados de aplicación del Machine Learning:
- Diagnóstico médico preventivo: supongamos que creamos un modelo de Machine Learning capaz de predecir si un paciente tiene un alto riesgo de desarrollar una cierta enfermedad. Como entradas, el modelo toma datos como la edad del paciente, su índice de masa corporal y la cantidad de ejercicio físico que realiza diariamente. Si para un paciente específico el modelo predice un alto riesgo y este modelo se usa en un entorno real, al médico le interesará muy seguramente entender por qué el modelo llegó a esta conclusión. El profesional necesita tener la certeza absoluta de que la predicción es correcta, puesto que el tratamiento a seguir dependerá directamente de dicha predicción.
- Aprobación de solicitudes de crédito: supongamos que trabajamos en una entidad bancaria y desarrollamos un modelo para indicar si se aprueba o rechaza una solicitud de crédito. Para simplificar, el modelo procesa como entradas la edad, el nivel de ingreso anual y el nivel de endeudamiento del aplicante. Lo que resulta clave aquí es garantizar que, si el modelo decide que la solicitud debe ser rechazada, la entidad bancaria debe estar en plena capacidad de explicarle al cliente los motivos exactos que originaron dicho rechazo.
- Vehículos autónomos: en este tercer ejemplo, supongamos que colaboramos en el desarrollo de vehículos autónomos, es decir, automóviles que no requieren intervención humana para desplazarse por la ciudad. Imaginemos la situación en la que uno de estos vehículos frena repentinamente en medio de una vía muy transitada y a alta velocidad. Esta situación es crítica y podría causar un grave accidente. Como creadores del modelo de Inteligencia Artificial, necesitamos imperativamente entender por qué el vehículo tomó la decisión de frenar. Solo comprendiendo este proceso podremos determinar qué elementos modificar en el modelo para evitar que este comportamiento se repita.
Con estos tres ejemplos, resulta evidente por qué entender los motivos detrás de las predicciones de un modelo es fundamental. Esto nos lleva directamente a definir los conceptos de interpretabilidad y explicabilidad.
¿Qué es la Interpretabilidad en el Machine Learning?
La interpretabilidad se refiere a la capacidad que tenemos los humanos de entender exactamente por qué y cómo un modelo logró generar una predicción en particular. En esencia, decimos que un modelo es interpretable cuando podemos trazar y comprender todo el proceso interno: desde la toma de las variables de entrada, su procesamiento matemático dentro del modelo, hasta la generación de la predicción final.
Para entender este concepto, retomemos algunos de nuestros ejemplos iniciales aplicando modelos interpretables:
Ejemplo de interpretabilidad 1: predicción pédica con Regresión lineal
Volvamos al caso del modelo que predice el riesgo de enfermedad. Supongamos que optamos por desarrollar un modelo de Regresión Lineal que toma la edad de la persona, su índice de masa corporal y su nivel de actividad física. Y supongamos que, tras entrenar el modelo, obtenemos esta ecuación:
Riesgo de enfermedad = 2.5 * (Edad) + 1.8 * (Índice de Masa Corporal) – 1.2 * (Nivel de Actividad Física)
Si le presentamos esta información a un médico, el profesional podrá ver fácilmente de qué manera la edad, el índice de masa corporal y el nivel de actividad física contribuyen (ya sea aumentando o disminuyendo) al riesgo de desarrollar la patología. Al comprender la dinámica de los pesos matemáticos asignados a cada variable, podemos afirmar que el modelo lineal es interpretable.
Ejemplo de interpretabilidad 2: aprobación de crédito con un árbol de decisión
Analicemos ahora el caso de la entidad bancaria. Supongamos que en esta ocasión utilizamos un modelo conocido como árbol de decisión. Este modelo toma secuencialmente las características del aplicante (edad, nivel de ingreso, nivel de endeudamiento) y evalúa sus valores a través de nodos condicionales para emitir un fallo a favor o en contra del crédito.
Por ejemplo, consideremos un cliente con las siguientes características:
- Edad: 38 años
- Nivel de ingreso anual: $20.000 USD
- Nivel de endeudamiento: $130.000 USD
El árbol de decisión analiza cada variable e indica que al cliente no se le debe aprobar el crédito:

Si presentamos esta predicción a un analista de la entidad bancaria, este podrá seguir el camino del árbol y observar fácilmente que el crédito fue rechazado principalmente porque el nivel de endeudamiento del cliente ($130.000) supera significativamente el nivel de ingreso anual ($20.000). Esta información detallada puede ser interpretada y comunicada fácilmente al cliente final. Por tanto, podemos concluir que el árbol de decisión es un modelo interpretable.
¿Qué es la explicabilidad en el Machine Learning?
El segundo elemento fundamental es la explicabilidad. Esta entra en juego cuando un modelo no es interpretable en su funcionamiento interno profundo, pero aún así podemos intentar explicar por qué llegó a un determinado resultado en un lenguaje comprensible para los humanos.
Existen arquitecturas sumamente complejas, como las Redes Neuronales gigantescas utilizadas en vehículos autónomos o en los Grandes Modelos de Lenguaje (LLMs). Como humanos, nos es imposible rastrear y comprender cada uno de los cálculos individuales que transforman las entradas en una predicción, dado que estos modelos operan con millones, o incluso miles de millones, de parámetros. Estos modelos complejos no son interpretables. Pero a pesar de esto, podrían ser explicables.
La explicabilidad significa que, tras el entrenamiento del modelo, aplicamos técnicas adicionales para intentar determinar su comportamiento general. Por ejemplo, podemos identificar cuáles variables o elementos de los datos de entrada tuvieron el mayor impacto en las predicciones, aun sin entender la relación matemática explícita de manera exacta.
Entendamos la explicabilidad a través de algunos ejemplos.
Ejemplo de explicabilidad 1: vehículos autónomos y Redes Neuronales
Retomemos el ejemplo del vehículo autónomo que se detiene de manera repentina en medio de la vía:

Al estar basado en una Red Neuronal Profunda que procesa los pixeles de una cámara, no sabremos la ruta matemática exacta que llevó a la predicción de frenado. Sin embargo, aplicando técnicas de explicabilidad (como mapas de calor o de saliencia, a la derecha en la figura de arriba), podríamos intentar determinar qué elementos visuales específicos de la imagen de entrada (por ejemplo, una sombra inusual, un destello un patrón en el asfalto) pudieron ser los «culpables» o detonantes de dicha decisión.
En este caso, la red neuronal usada es explicable, pero no interpretable.
Ejemplo de explicabilidad 2: Bosques Aleatorios (Random Forests) para riesgo crediticio
Supongamos que en el modelo de puntaje crediticio decidimos no usar un único árbol de decisión, sino un modelo de Bosques Aleatorios. Este algoritmo es un ensamble que combina simultáneamente varios cientos de árboles de decisión.
Debido a esta agregación, resultará humanamente inviable seguir la ruta exacta de la predicción y entender el «por qué» absoluto. Sin embargo, analizando el comportamiento general del bosque, podremos extraer métricas de «importancia de las características» para determinar qué variables (como el endeudamiento) tuvieron mayor peso global en el rechazo:

Así que un Bosque Aleatorio es, por lo general, un modelo explicable pero no interpretable.
Relación entre complejidad y transparencia
Habiendo aclarado los conceptos de interpretabilidad y explicabilidad en el Machine Learning, vale la pena hacernos la siguiente pregunta: ¿De qué depende que un modelo sea interpretable o explicable?
La respuesta radica en la complejidad. Como vimos, los modelos interpretables tienden a ser arquitecturas más simples (como la regresión lineal o un árbol de decisión individual). Esta simplicidad algorítmica suele estar asociada a datos que son, de igual manera, relativamente simples y estructurados.
Sin embargo, a medida que nuestros datos se vuelven más complejos (imágenes de alta resolución, lenguaje natural en formato de texto, series temporales multivariadas, etc.), el modelo que tendremos que usar para extraer patrones útiles será inevitablemente más complejo.
Así que, como ocurre muchas veces en la Ciencia de Datos y la IA, tendremos un compromiso: entre más complejos sean tanto los datos como los modelos que usemos, menos interpretable será el modelo resultante:

En tales casos de alta complejidad, la interpretabilidad se pierde y nos vemos forzados a recurrir a técnicas auxiliares que nos permitan únicamente explicar el comportamiento (aunque esto no siempre es posible).
¿En qué situaciones es imprescindible usar modelos interpretables?
Si bien los modelos complejos y de caja negra (como los diferentes tipos de Redes Neuronales) suelen tener un rendimiento predictivo superior, existen escenarios donde la interpretabilidad no es negociable. Considero que existen al menos tres ámbitos críticos donde es esencial contar con modelos interpretables:
- Entornos de salud y medicina: cuando creamos modelos que procesan señales biológicas o imágenes médicas para predecir el riesgo de una enfermedad, resulta esencial que cada paso de las predicciones pueda ser auditado, comprendido e interpretado por un médico especialista antes de intervenir a un paciente.
- Entornos legales y de justicia: en situaciones donde las decisiones de un juez, un abogado o un sistema penal puedan estar soportadas por Inteligencia Artificial (por ejemplo, evaluación de riesgo de reincidencia), la transparencia absoluta del modelo es un requisito para garantizar los derechos y la equidad.
- Sistemas críticos de seguridad: en aplicaciones como vehículos autónomos, control de tráfico aéreo o sistemas de transporte masivo donde la vida humana está en juego, comprender cómo la IA procesa la información es imperativo.
En contraste, en otras situaciones donde los efectos de no comprender la mecánica interna de la predicción no generan impactos adversos en la salud, la integridad humana, los animales o el medio ambiente (como predecir la demanda de un producto de retail o clasificar correos de spam), resultaría más que suficiente contar con un modelo complejo que sea simplemente explicable.
Conclusión
A lo largo de este artículo, hemos desglosado detalladamente la diferencia entre los conceptos de interpretabilidad y explicabilidad que resultan esenciales al desarrollar aplicaciones de Machine Learning e IA en la actualidad:
- Un modelo es interpretable cuando el flujo de procesamiento (de los datos de entrada a la predicción final) es transparente y entendible de extremo a extremo.
- Si el modelo es demasiado complejo y no podemos entender sus detalles internos, pero usamos técnicas para justificar o identificar qué influyó en su resultado, estamos ante un modelo explicable.
En última, ambos tipos de modelos pueden ser usados al resolver problemas de Ciencia de Datos, pero la elección final dependerá enteramente de las características particulares del problema que estemos resolviendo y del uso que se le dará al modelo que construyamos.
