Doxa 2648

Por qué los mejores empleados anulan sistemas de IA que funcionan: aversión algorítmica, calibración de la confianza y diseño de la colaboración humano-IA

Por qué los mejores empleados anulan los sistemas de IA que funcionan:
Aversión algorítmica, calibración de la confianza y diseño de la colaboración humano-IA

Por: Oscar Hernando Benavides Paz, MBA

Resumen

Las organizaciones que implementan sistemas de inteligencia artificial (IA) con desempeño demostrado observan con frecuencia un fenómeno paradójico: los profesionales más experimentados y mejor valorados son quienes con mayor frecuencia ignoran o modifican las recomendaciones del sistema. Esta revisión de literatura sintetiza la evidencia publicada hasta 2025 en revistas y bases indexadas sobre la aversión algorítmica, la apreciación algorítmica, la calibración de la confianza en la automatización y la eficacia de las combinaciones humano-IA. La evidencia indica que la anulación de la IA no es, en sí misma, un fallo de actitud: puede constituir un uso razonable del criterio experto cuando la IA falla, pero también una pérdida de valor cuando la IA supera al humano. Un metaanálisis de 106 estudios experimentales halló que, en promedio, las combinaciones humano-IA rindieron peor que el mejor de los dos agentes por separado, con pérdidas particulares en tareas de decisión. Otro estudio con 140 radiólogos mostró que la experiencia, la subespecialidad y la familiaridad con la IA no predicen de forma fiable quién se beneficia de la asistencia. Se discuten implicaciones de diseño (control modificable por el usuario, retroalimentación de desempeño, asignación de tareas según ventaja comparativa) y se señalan vacíos de evidencia, entre ellos la ausencia de estudios primarios que comparen directamente la tasa de anulación entre empleados de alto y bajo desempeño.

Palabras clave: aversión algorítmica; anulación de la IA; colaboración humano-IA; confianza en la automatización; sesgo de automatización; adopción de IA; gestión del cambio.

1. Introducción

La promesa de la IA aplicada a decisiones organizacionales descansa en un supuesto simple: si el sistema tiene un desempeño superior al promedio, su adopción debería mejorar los resultados. Sin embargo, la adopción efectiva depende de la decisión de cada persona de aceptar, modificar o rechazar la recomendación. Cuando quienes rechazan el sistema son precisamente los empleados de mayor reputación y experiencia, el problema deja de ser de capacitación básica y se convierte en un problema de diseño de la relación entre el experto y la máquina.

La literatura conductual aporta un punto de partida sólido. Dietvorst, Simmons y Massey (2015) demostraron en cinco estudios que las personas pierden la confianza en un algoritmo más rápidamente que en un humano tras observar el mismo error, y que, como consecuencia, eligen con frecuencia al pronosticador humano inferior. Este fenómeno se denominó aversión algorítmica. Simultáneamente, Logg et al. (2019) documentaron en seis experimentos el fenómeno contrario, la apreciación algorítmica, en el que personas legas ajustaron más sus juicios cuando el consejo provenía de un algoritmo que de una persona. Ambos hallazgos coexisten y sugieren que la respuesta a la IA depende del contexto, del tipo de tarea y del usuario.

Desde la ingeniería de factores humanos, Parasuraman y Riley (1997) describieron cuatro modos de relación con la automatización: uso, mal uso, desuso y abuso. La anulación sistemática de un sistema fiable corresponde al desuso; la aceptación acrítica de un sistema falible corresponde al mal uso. Lee y See (2004) formularon el marco de la confianza apropiada: el objetivo no es maximizar la confianza, sino calibrarla con la fiabilidad real del sistema.

Esta revisión aborda la pregunta de por qué los empleados más competentes anulan sistemas de IA que funcionan, distinguiendo los casos en que la anulación destruye valor de aquellos en que lo protege.

2. Objetivos

2.1 Objetivo general

Sintetizar la evidencia científica publicada antes de 2026 sobre los mecanismos por los cuales profesionales de alto desempeño anulan recomendaciones de sistemas de IA con desempeño demostrado, y sobre las condiciones en que dicha anulación mejora o deteriora los resultados.

2.2 Objetivos específicos

(a) Describir los mecanismos psicológicos y organizacionales asociados a la aversión algorítmica y a su contraparte, la apreciación algorítmica. (b) Examinar la evidencia empírica sobre el desempeño de combinaciones humano-IA frente a humanos e IA por separado. (c) Identificar intervenciones de diseño con soporte empírico para reducir la anulación perjudicial. (d) Delimitar los vacíos de evidencia existentes.

3. Metas

Las metas de esta revisión son: proveer a directivos, líderes de transformación digital y diseñadores de sistemas un marco conceptual basado en evidencia de nivel I y II; proponer criterios para distinguir la anulación productiva de la anulación costosa; y orientar decisiones de implementación que traten al experto como socio calibrado del sistema y no como obstáculo del cambio.

4. Método de la revisión

Se realizó una búsqueda dirigida y validación cruzada de cada fuente citada mediante registros bibliográficos (editoriales, PubMed, repositorios de preprints y bases de indexación), verificando autores, año, revista, volumen y páginas. Se aceptaron únicamente artículos revisados por pares y metaanálisis publicados en revistas indexadas. Los preprints, los documentos de trabajo y los informes sin revisión por pares se excluyeron como sustento de afirmaciones. Esta síntesis es narrativa y no constituye una revisión sistemática preregistrada. Cuando un dato no pudo verificarse en fuentes primarias publicadas antes de 2026, se declara como "evidencia no encontrada".

5. Desarrollo

5.1 La aversión algorítmica y su asimetría frente al error

El hallazgo central de Dietvorst et al. (2015) es una asimetría en la tolerancia al error: tras ver equivocarse a un algoritmo, los participantes redujeron su confianza más de lo que la redujeron ante un humano con el mismo error, incluso cuando habían visto al algoritmo superar al humano. Esta asimetría es especialmente relevante para expertos, que suelen detectar con rapidez los errores visibles del sistema, en particular los casos atípicos, y ponderarlos de forma desproporcionada frente a sus aciertos silenciosos. Dietvorst y Bharti (2020) añadieron que en dominios de alta incertidumbre las personas muestran una sensibilidad decreciente al error de pronóstico y prefieren la mayor varianza de los pronosticadores humanos, lo que las lleva a rechazar algoritmos de menor varianza aunque más precisos en promedio.

Burton et al. (2020) organizaron la literatura de aversión algorítmica en decisiones aumentadas y mostraron que el fenómeno depende de factores del decisor, del algoritmo y de la tarea, lo que desaconseja tratarlo como un rasgo fijo de las personas.

5.2 Apreciación algorítmica: la otra cara de la evidencia

Logg et al. (2019) hallaron que las personas legas ajustaron más su estimación cuando creían que el consejo procedía de un algoritmo. La coexistencia de aversión y apreciación implica que no existe una respuesta humana uniforme a la IA. Para el análisis organizacional, esto significa que la anulación por parte de empleados destacados no puede explicarse con una teoría general de rechazo, sino que debe examinarse en el contexto de la tarea, la responsabilidad asociada y el historial de errores visibles del sistema.

5.3 Control percibido y capacidad de modificar el sistema

Dietvorst et al. (2018) mostraron que las personas emplean algoritmos imperfectos con mayor disposición si pueden modificar, aunque sea de forma limitada, sus predicciones. Los autores interpretaron esta preferencia como un deseo de control sobre el resultado, más que como una confianza en su propia corrección. Para profesionales cuya identidad y responsabilidad profesional dependen del criterio propio, la ausencia de un espacio legítimo de intervención puede empujar hacia la anulación total.

5.4 Confianza, desuso y sesgo de automatización

Parasuraman y Riley (1997) sostienen que tanto el desuso como el mal uso de la automatización son fallos de calibración. Lee y See (2004) precisan que la confianza apropiada exige que el usuario disponga de información sobre el desempeño, el proceso y el propósito del sistema. Goddard et al. (2012), en una revisión sistemática en el ámbito de los sistemas de apoyo a la decisión clínica, describieron el sesgo de automatización, es decir, la tendencia a seguir la recomendación automática incluso cuando es incorrecta. Estas dos fuentes muestran que la anulación y la sobrerreliance son extremos de un mismo problema de calibración, y que una estrategia orientada solo a reducir la anulación puede aumentar los errores por aceptación acrítica.

5.5 El desempeño de las combinaciones humano-IA

Vaccaro et al. (2024) realizaron una revisión sistemática y metaanálisis preregistrado de 106 estudios experimentales con 370 tamaños de efecto. En promedio, las combinaciones humano-IA rindieron significativamente peor que el mejor de los dos agentes por separado. Se observaron pérdidas de desempeño en tareas de decisión y ganancias mayores en tareas de creación de contenido. Además, cuando el humano superaba a la IA por sí solo, la combinación producía ganancias, y cuando la IA superaba al humano, la combinación producía pérdidas. Este último resultado es clave para la pregunta de esta revisión: si el sistema es realmente superior en una tarea de decisión, la intervención humana tiende a restar valor, y la anulación por parte de expertos es un canal probable de esa pérdida. Los autores reportan un patrón agregado y no un mecanismo causal demostrado para cada contexto.

5.6 La experiencia no predice quién se beneficia de la IA

Yu et al. (2024) evaluaron a 140 radiólogos en 15 tareas diagnósticas de radiografía de tórax y encontraron una heterogeneidad sustancial en el efecto de la asistencia de IA. Los factores basados en experiencia (años de práctica, subespecialidad y familiaridad con herramientas de IA) no predijeron de manera fiable el efecto, y los radiólogos de menor desempeño sin asistencia no se beneficiaron consistentemente más. Este hallazgo cuestiona la suposición de que el experto veterano es quien mejor sabe cuándo confiar o no en la IA, y también la de que solo los menos hábiles necesitan la ayuda del sistema.

5.7 Dimensión organizacional: control, autonomía y resistencia

Kellogg et al. (2020) analizaron cómo los algoritmos se emplean en el lugar de trabajo como mecanismos de dirección, evaluación y disciplina, y cómo ello configura un terreno de control disputado entre organizaciones y trabajadores. Desde esta perspectiva, cierta anulación puede interpretarse como una defensa de la autonomía profesional frente a un sistema percibido como instrumento de vigilancia o de evaluación, más que como una evaluación técnica de su exactitud.

5.8 Evidencia no encontrada

Evidencia no encontrada en fuentes primarias indexadas y publicadas antes de 2026 que compare directamente, en entornos organizacionales reales, la tasa de anulación de IA entre empleados de alto y de bajo desempeño y su efecto sobre resultados. La hipótesis de que los mejores empleados anulan más que los demás es plausible, pero no está demostrada por los estudios verificados en esta revisión. Lo que sí está respaldado es que la experiencia no predice de manera fiable el beneficio de la asistencia (Yu et al., 2024) y que, en tareas donde la IA supera al humano, la combinación pierde valor en promedio (Vaccaro et al., 2024).

6. Discusión

La evidencia permite reformular la pregunta. Anular una recomendación no es intrínsecamente un error; lo es cuando el sistema tiene mayor exactitud que el criterio individual en esa tarea y el empleado carece de información para saberlo. Tres mecanismos convergen en los expertos: la asimetría en la tolerancia al error visible (Dietvorst et al., 2015), la preferencia por retener el control (Dietvorst et al., 2018) y la defensa de la autonomía profesional (Kellogg et al., 2020). A ellos se suma un problema de calibración: sin retroalimentación sobre resultados, el experto no puede aprender cuándo su criterio supera al sistema y cuándo no (Lee y See, 2004).

En términos de diseño, la literatura respalda las siguientes líneas, todas formuladas como implicaciones de la evidencia y no como resultados probados en todos los contextos: (i) permitir ajustes acotados y visibles a las salidas del sistema; (ii) proporcionar retroalimentación periódica y comparativa sobre el desempeño de las decisiones asistidas frente a las no asistidas; (iii) asignar la decisión final según la ventaja comparativa demostrada en cada subtarea, y no por jerarquía; (iv) registrar las anulaciones y su justificación para detectar tanto desuso como sesgo de automatización; y (v) distinguir explícitamente el uso del algoritmo como instrumento de apoyo del uso como instrumento de evaluación del trabajador.

7. Conclusiones

Primero, la anulación de sistemas de IA funcionales por parte de empleados destacados es un fenómeno coherente con la evidencia sobre aversión algorítmica, control percibido y calibración de la confianza, aunque su prevalencia diferencial entre empleados de alto y bajo desempeño carece de evidencia primaria directa. Segundo, en tareas de decisión donde la IA supera al humano, la intervención humana reduce en promedio el rendimiento del conjunto. Tercero, la experiencia profesional no predice de manera fiable quién se beneficia de la IA, por lo que las políticas basadas en la antigüedad o el prestigio son inadecuadas. Cuarto, la respuesta a la anulación no debe ser la obligación de aceptar, sino el diseño de interacciones que permitan control acotado, retroalimentación de resultados y asignación de roles según evidencia de desempeño.

8. Retos y agenda de investigación

Persisten retos sustantivos: (a) generar estudios de campo que midan la anulación por nivel de desempeño y sus consecuencias sobre resultados organizacionales; (b) separar la anulación correcta de la incorrecta en tiempo real, lo que exige verdad de referencia disponible; (c) evaluar si las intervenciones de control modificable mantienen su efecto con sistemas de IA generativa, cuya salida es abierta y no un pronóstico numérico; (d) estudiar las consecuencias a largo plazo sobre el aprendizaje y las competencias del experto cuando la IA asume parte de la decisión; y (e) abordar los aspectos éticos y de gobernanza cuando la anulación humana funciona como salvaguarda legítima frente a errores o sesgos del sistema. La transferencia de hallazgos experimentales y clínicos a otros sectores debe hacerse con cautela y sometida a validación local.

Referencias

  • Burton, J. W., Stein, M.-K., & Jensen, T. B. (2020). A systematic review of algorithm aversion in augmented decision making. Journal of Behavioral Decision Making, 33(2), 220–239. https://doi.org/10.1002/bdm.2155
  • Dietvorst, B. J., & Bharti, S. (2020). People reject algorithms in uncertain decision domains because they have diminishing sensitivity to forecasting error. Psychological Science, 31(10), 1302–1314.
  • Dietvorst, B. J., Simmons, J. P., & Massey, C. (2015). Algorithm aversion: People erroneously avoid algorithms after seeing them err. Journal of Experimental Psychology: General, 144(1), 114–126. https://doi.org/10.1037/xge0000033
  • Dietvorst, B. J., Simmons, J. P., & Massey, C. (2018). Overcoming algorithm aversion: People will use imperfect algorithms if they can (even slightly) modify them. Management Science, 64(3), 1155–1170. https://doi.org/10.1287/mnsc.2016.2643
  • Goddard, K., Roudsari, A., & Wyatt, J. C. (2012). Automation bias: A systematic review of frequency, effect mediators, and mitigators. Journal of the American Medical Informatics Association, 19(1), 121–127. https://doi.org/10.1136/amiajnl-2011-000089
  • Kellogg, K. C., Valentine, M. A., & Christin, A. (2020). Algorithms at work: The new contested terrain of control. Academy of Management Annals, 14(1), 366–410. https://doi.org/10.5465/annals.2018.0174
  • Lee, J. D., & See, K. A. (2004). Trust in automation: Designing for appropriate reliance. Human Factors, 46(1), 50–80. https://doi.org/10.1518/hfes.46.1.50_30392
  • Logg, J. M., Minson, J. A., & Moore, D. A. (2019). Algorithm appreciation: People prefer algorithmic to human judgment. Organizational Behavior and Human Decision Processes, 151, 90–103. https://doi.org/10.1016/j.obhdp.2018.12.005
  • Parasuraman, R., & Riley, V. (1997). Humans and automation: Use, misuse, disuse, abuse. Human Factors, 39(2), 230–253. https://doi.org/10.1518/001872097778543886
  • Vaccaro, M., Almaatouq, A., & Malone, T. (2024). When combinations of humans and AI are useful: A systematic review and meta-analysis. Nature Human Behaviour, 8(12), 2293–2303. https://doi.org/10.1038/s41562-024-02024-1
  • Yu, F., Moehring, A., Banerjee, O., Salz, T., Agarwal, N., & Rajpurkar, P. (2024). Heterogeneity and predictors of the effects of AI assistance on radiologists. Nature Medicine, 30(3), 837–849. https://doi.org/10.1038/s41591-024-02850-w

No hay comentarios:

Publicar un comentario