Vol. 13/ Núm. 3 2026 pág. 1431
https://doi.org/10.69639/arandu.v13i3.2481

Inteligencia artificial explicable en la contabilidad de gestión:
revisión sistemática sobre confianza, aceptación y calidad de
las decisiones

Explainable Artificial Intelligence in Management Accounting:
a Systematic Review of
Trust, Acceptance, and Decision Quality

Keny Arnold Mas Villanueva

vilmaskear@outlook.com

https://orcid.org/0000
-0001-9833-0048
Universidad Nacional de San Martín

Perú Rioja

Daniel Mijahuanga Chumbe

danielmchumbe@gmail.com

https://orcid.org/0009-0007-2211-7516

Universidad Católica Sede Sapientiae

Perú Rioja

Gianfranco Ramirez Torres

dangianke@gmail.com

https://orcid.org/0009-0003-3960-7539

Dirección Regional de Educación

Perú Moyobamba

Zarita Isabel Mijahuanga Chumbe

zimijahuanga@unsm.edu.pe

https://orcid.org/0009
-0000-8437-3098
UGEL Bellavista

Perú - Bellavista

Artículo recibido: 10 julio 2026- Aceptado para publicación:16 agosto 2026

Conflictos de intereses: Ninguno que declarar.

RESUMEN

El estudio tuvo como objetivo analizar críticamente y sintetizar la evidencia empírica publicada
entre enero de 2020 y mayo de 2026 sobre la relación entre las modalidades de explicabilidad de
la inteligencia artificial (IA), la confianza, la aceptación y la calidad de las decisiones en las
principales funciones de la contabilidad de gestión. Se aplicó una revisión sistemática con síntesis
crítica narrativa, de acuerdo con los preceptos de PRISMA 2020 y PRISMA-S. Se ejeuctaron
búsqueda de estudios en Scopus, SciELO y EBSCO, seleccionándose investigaciones arbitradas
y de carácter empírico sobre IA explicable o contextos gerenciales transferibles en materia de
resultados humanos y decisiones de contabilidad de gestión. Se recopilaron 98 estudios, después
de eliminar seis duplicados quedaron 92 registros, posteriormente se desestimaron 81, quedando
11 informes, cinco no eran de acceso y los seis restantes pasaron a una evaluación de texto
completo. Finalmente, tres de ellos se ajustaban a los criterios para la síntesis y los otros tres
Vol. 13/ Núm. 3 2026 pág. 1432
quedaron fuera. La evidencia directa no va más allá de la estimación de costos. Los trabajos
incorporados explican que la transparencia o la explicabilidad son propicias para depositar
confianza y hacer uso del consejo de un algoritmo. Conclusivamente, es poca cosa generalizar en
cuanto a la presupuestación, el pronóstico, la evaluación del desempeño o el análisis de
desviaciones. Hay necesidad de estudios de campo que vayan más allá y ofrezcan una medida
objetiva del desempeño, de la confianza calibrada y del uso efectivo, comparando a su vez las
modalidades explicativas.

Palabras clave: inteligencia artificial explicable, contabilidad de gestión, confianza,
aceptación tecnológica, calidad de las decisiones

ABSTRACT

The objective of this study was to critically analyze and synthesize the empirical evidence

published between January 2020 and May 2026 on the relationship between the modalities of

artificial intelligence (AI) explainability, trust, acceptance, and decisi
on quality in the main
functions of management accounting. A systematic review with a critical narrative synthesis was

conducted in accordance with the PRISMA 2020 and PRISMA
-S guidelines. Studies were
searched for in Scopus, SciELO, and EBSCO, and peer
-reviewed, empirical research on
explainable AI or transferable managerial contexts related to human outcomes and management

accounting decisions was selected. A total of 98 studies were identified; after removing six

duplicates, 92 records remained. Subseque
ntly, 81 were excluded, leaving 11 reports; five were
inaccessible, and the remaining six proceeded to a full
-text evaluation. Finally, three of these met
the criteria for the synthesis, while the other three were excluded. Direct evidence does not extend

beyond cost estimates. The included studies explain that transparency and explainability foster

trust and encourage the use of an algorithm’s recommendations. In conclusion, it is unwise to

generalize regarding budgeting, forecasting, performance evaluatio
n, or variance analysis. There
is a need for field studies that go further and provide an objective measure of performance,

calibrated trust, and effective use, while also comparing the various explanatory approaches.

Keywords
: explainable artificial intelligence, management accounting, trust, technology
acceptance, decision quality

Todo el contenido de la Revista Científica Internacional Arandu UTIC publicado en este sitio está disponible bajo
licencia Creative Commons Atribution 4.0 International.
Vol. 13/ Núm. 3 2026 pág. 1433
INTRODUCCIÓN

Con la ayuda de la inteligencia artificial y el aprendizaje automático, la contabilidad de
gestión ve reforzada su capacidad para estimar costos, hacer pronósticos o analizar desviaciones
con el fin de respaldar una mejor asignación de los recursos internos. No obstante, un exceso de
complejidad en los modelos puede poner en entredicho la comprensión del decisor sobre el origen
de una recomendación y si esta se ajusta al contexto. De hecho, las revisiones de campo dan fe de
un avance en el desarrollo de estas herramientas, aunque su uso en materia de control y decisión
interna sigue siendo algo fragmentado (Ranta et al., 2023; Abbas, 2026).

Con la digitalización se ve alterado no solo el caudal y la celeridad de los datos, sino la
propia arquitectura del juicio contable. De este modo, una porción del análisis se traslada a
sistemas de inteligencia de negocios o a modelos de analítica predictiva que redefinen cómo se
produce, circula y hace uso de la información interna (Appelbaum et al., 2017). Sin embargo, la
literatura de contabilidad de gestión pone de manifiesto que un progreso técnico de estas
proporciones no se traduce automáticamente en una mayor prudencia a la hora de decidir; más
bien hace necesario repensar el papel del contador y los procedimientos para abordar el fenómeno
(Bhimani, 2020; Quattrone, 2016; Rikhardsson & Yigitbasioglu, 2018).

Con la inteligencia artificial explicable (XAI) se ponen de manifiesto las propiedades y
los métodos que permiten dar sentido al comportamiento de un sistema de IA. En materia de
transparencia se trata de tener acceso a la información o a cómo funciona el sistema; la
interpretabilidad otorga la facultad de entender lo que hay detrás de su operación; y la
explicabilidad consiste en plantear al usuario razones de utilidad. Estas pueden adoptar diversas
formas, ya sean intrínsecas o post hoc, de carácter global o local, y expresarse con narrativas,
ejemplos, reglas, importancia de variables u otras vías como las explicaciones contrafactuales
(Barredo et al., 2020).

Para evaluar una explicación hay que hacer las debidas distinciones en tres órdenes: la
fidelidad técnica con el modelo, el grado de comprensión del usuario y cómo esta se traduce en
su comportamiento y capacidad de decisión. En ese sentido, los distintos marcos y taxonomías de
XAI están de acuerdo en que no existe una explicación válida a todas luces; su idoneidad depende
del contexto, de a quién va dirigida y del fin que se persigue (Miller, 2019; Mohseni et al., 2021;
Rai, 2020; Vilone & Longo, 2021). Un matiz de gran relevancia en la contabilidad de gestión, por
ejemplo, es que lo que a primera vista parece una explicación clara bien puede resultar irrelevante
para el control o mostrar poca fidelidad al modelo.

La explicación en materia de contabilidad de gestión ha de tener un propósito: poner a
prueba los supuestos, hallar posibles errores y asentar la responsabilidad profesional. No se trata
de una formalidad, pues una argumentación deficiente abre la puerta al rechazo por parte del
algoritmo, mientras que una de carácter persuasivo pero carente de rigor puede instilar una
Vol. 13/ Núm. 3 2026 pág. 1434
confianza desmedida. Lo que importa es contar con una confianza calibrada, es decir, una que se
mida a la competencia y a los límites efectivos del sistema.

Para los efectos de esta revisión, la confianza se define como la predisposición a poner
en manos del sistema lo que se necesita aun en situaciones de vulnerabilidad (Lee & See, 2004).
En lo que respecta a la aceptación, se equipara con la intención de seguir la recomendación o su
empleo de facto. La calidad de la decisión no se infiere de una mayor confianza, sino que se acota
a unos parámetros objetivos de resultado tales como el error, la exactitud, el desempeño o la
consistencia. Se obedece al precepto normativo de la confianza calibrada: poner fe en la IA en la
medida de su competencia y cuestionarla cuando el modelo da muestras de incertidumbre o tiene
limitaciones de otro tipo (Glikson & Woolley, 2020; Shin, 2021).

Lo que se desprende de la literatura de referencia es que no existe una relación lineal entre
la decisión y el hecho de explicar. El efecto viene matizado por un sinfín de factores: la
incertidumbre propia de la tarea, la exactitud del modelo o el formato en que se da la explicación,
pero también la responsabilidad de quien lo usa y su experiencia. Y es preciso hacer hincapié en
que cosas como la aceptación, la confianza o la calidad de la decisión son constructos a parte de
la simple utilización del consejo, de modo que cada uno exige ser medido por separado.

Con el marco analítico que se ha adoptado se plantea de este modo una cadena de
condicionantes: la calidad y modalidad con que se explica, la calibración de la confianza para
aceptar o hacer uso de ello, la comprensión y en última instancia la objetividad de la decisión.
Pese a esta secuencia, puede venirse abajo o volverse del revés por la aversión al algoritmo, una
sobreconfianza, los incentivos o la experiencia, así como por la índole de la tarea o el hecho de
poder incidir en la recomendación (Castelo et al., 2019; Dieta et al., 2018). No cabe considerar la
explicabilidad como un estímulo de carácter uniforme cuando la evidencia de la paradoja entre lo
humano y la automatización, el control que ejerce el usuario o su dependencia de la tarea se ponen
de manifiesto (Burton et al., 2020; Raisch & Krakowski, 2021).

El objetivo general fue analizar críticamente y sintetizar la evidencia empírica publicada
entre enero de 2020 y mayo de 2026 sobre la relación entre las modalidades de explicabilidad de
la inteligencia artificial, la confianza, la aceptación y la calidad de las decisiones en las principales
funciones de la contabilidad de gestión, con el propósito de establecer el estado del conocimiento,
identificar vacíos de aplicación y proponer líneas futuras de investigación.

Preguntas de revisión

1.
¿Qué modalidades de explicabilidad se han estudiado en contabilidad de gestión y en
contextos gerenciales transferibles?

2.
¿Qué relaciones se observan entre explicabilidad, confianza, aceptación o utilización
de la IA y calidad de las decisiones?

3.
¿Qué diseños, medidas y condiciones explican la heterogeneidad de los resultados?
Vol. 13/ Núm. 3 2026 pág. 1435
4.
¿Qué funciones de la contabilidad de gestión permanecen insuficientemente
investigadas?

MATERIALES Y MÉTODOS

Se realizó una revisión sistemática con síntesis crítica narrativa. Para la identificación,
selección y puesta en valor de los estudios se ha hecho acatamiento a PRISMA 2020 (Page et al.,
2021) y la documentación de las búsquedas tiene el respaldo de PRISMA-S (Rethlefsen et al.,
2021).

Con fecha de 21 de junio se ejecutaron las búsquedas en Scopus, SciELO y las
colecciones
Academic Search Ultimate, Applied Science & Technology Source Ultimate y Fuente
Académica
Plus de EBSCO. Por su parte, para localizar datos completos y no como fuente
independiente de identificación se empleó ScienceDirect. En cuanto al idioma, no existió
restricción; el periodo de elegibilidad comprendió desde el 1 de enero de 2020 hasta el 31 de
mayo de 2026.

Con las ecuaciones se han integrado tres bloques: el de XAI, es decir, la transparencia o
interpretabilidad del algoritmo (explicabilidad); el de contabilidad de gestión y sus decisiones o
control gerencial; y por último, los relativos a la calidad decisional, la adopción o aceptación, la
confianza y el uso que se hace del consejo. La búsqueda en Scopus abarcó título, resumen y
palabras clave con una proximidad W/6, mientras que para EBSCO se recurrió al campo resumen
y N6. En el caso de SciELO los términos se ajustaron al español, inglés o portugués. Todo ello,
junto con los conteos y filtros de las ecuaciones, queda de manifiesto en la matriz maestra.

Tabla 1

Criterios de inclusión y exclusión

Dimensión
Inclusión Exclusión
Periodo
01/01/202031/05/2026 Fuera de rango
Fenómeno
XAI, explicabilidad, interpretabilidad o
transparencia de IA/ML
IA sin componente explicativo
Resultados
Confianza, aceptación, uso del consejo o
calidad/desempeño decisional
Solo rendimiento técnico
Contexto
Contabilidad de gestión/control o
decisión gerencial transferible

Aplicación técnica sin decisión
humana

Diseño
Estudio empírico primario cuantitativo,
cualitativo o mixto
Revisión o propuesta sin datos
Documento
Artículo o trabajo completo arbitrado Resumen, póster o documento
no arbitrado

Habiendo consolidado los CSV, RIS y BibTeX por DOI y título normalizado, se realizó
el cribado de títulos y resúmenes y la valoración del texto completo con una matriz estructurada,
Vol. 13/ Núm. 3 2026 pág. 1436
para lo cual se consignaba una única razón de exclusión. Con los accesos institucionales y a partir
de archivos de acceso legítimo se hizo lo posible por obtener cada uno de los informes. A aquellos
que no daban abasto se les anotó como “no recuperados” en el flujo PRISMA, sin que por ello se
consideraran exclusiones temáticas o se procediera a extraer datos de sus resúmenes.

A los estudios que se han incluido se les ha tomado el contexto, el tipo de diseño y la
muestra, así como la modalidad de explicabilidad, las estimaciones primordiales, los desenlaces
a nivel humano, las limitaciones de cada uno y su pertinencia para la contabilidad de gestión. En
cuanto a la evidencia, se ha hecho una separación entre lo que emana de contextos gerenciales de
carácter general, considerada transferible, y aquella que está en función de lo estrictamente
contable.

Para la evaluación de los estudios que figuran en el análisis se ha recurrido Mixed
Methods Appraisal Tool (MMAT) versión 2018, tal como prescribe Hong et al. (2018). No se ha
procedido a elaborar un puntaje global, sino que se ha dado cuenta de la valoración en términos
de si es o no adecuada, o con las reservas del caso, y se ha hecho constar la limitación que la
justifique. La integración de los resultados se ha llevado a cabo por una síntesis temática crítica a
fin de distinguir entre la modalidad XAI, la confianza, la aceptación o uso, la calidad de la decisión
y las condiciones moderadoras.

Asimismo se han recurrido a estudios y revisiones de revistas con arbitraje para dar base
a los conceptos y una interpretación de lo hallado. Dado que no se daban a la vez los criterios
operativos en materia de diseño, desenlace, el contexto gerencial-contable o el fenómeno XAI,
estas fuentes de carácter contextual no figuran entre los estudios incluidos ni han aportado nada
a la síntesis de datos. Con ello se ha mantenido la coherencia de las conclusiones empíricas con
el corpus y el diagrama PRISMA.

RESULTADOS Y DISCUSIÓN

De las 98 coincidencias que arrojaron las búsquedas, se procedió a exportar 97 registros
en tanto la plataforma EBSCO daba cuenta de una repetida sin que se creara un registro de más.
Una vez desechados los seis duplicados de por medio, quedaron 92 referencias únicas para su
cribado. Del total, 81 fueron descartadas tras el examen del título y el resumen y se solicitó 11
informes. De estos, cinco resultaron imposibles de obtener y se hizo una valoración a texto
completo de los seis restantes. De estos seis, tres incumplieron los criterios de elegibilidad y
fueron excluidos; los otros tres cumplieron los criterios e integraron la síntesis final. El proceso
completo se presenta en la Figura 1.
Vol. 13/ Núm. 3 2026 pág. 1437
Figura 1

Diagrama de flujo PRISMA 2020 para la selección de estudios

Tabla 2

Razón principal de exclusión en título y resumen

Razón principal
n
Fuera de tema
25
No evalúa resultados humanos
24
No es estudio empírico
19
No aborda XAI/explicabilidad
5
Tipo documental no elegible
4
Fuera del periodo
4
Total
81
Identificación de estudios a través de base de datos y registros

Identificación
CribadoInclusión
Registros identificados

Base de datos (n = 98)

Registros cribados

Título y resumen (n = 92)

Informes buscados

Para recuperación (n = 11)

Informes evaluados

Texto completo
(n = 6)
Estudios incluidos

Síntesis cualitativa (n = 3)

Antes del cribado
Duplicados (n = 6)

Registros excluidos

Título y resumen (n = 81)

No recuperados

Informes (n = 5)

Informes
excluidos
Total
(n = 3)
Desenlaces: n = 1
Sin XAI: n = 1
Sin relación: n = 1
Vol. 13/ Núm. 3 2026 pág. 1438
Tabla 3

Decisiones sobre los seis textos completos evaluados

Estudio
Decisión Fundamento
Hammann y Wouters
(2026)
Incluir Evidencia directa; cumple fenómeno, desenlaces y
contexto

Shulner-Tal et al. (2025)
Excluir Desenlaces no elegibles: justicia y comprensión
Tuncer y Ramirez
(2022)
Incluir Cumple; evidencia gerencial transferible
Avramović et al. (2026)
Excluir No contrasta la relación objetivo
Volkmar (2022)
Excluir No proporciona ni manipula una modalidad XAI
Sturm et al. (2023)
Incluir Cumple; evidencia gerencial transferible
Cinco informes adicionales no se recuperaron mediante los accesos disponibles. Se
registraron en PRISMA como informes no recuperados y no se utilizaron para extraer resultados
ni evaluar calidad.

Tabla 4

Características de los estudios incluidos

Estudio
Contexto Diseño/muestra Modalidad Desenlaces MMAT
Hammann y
Wouters
(2026)

Costos de
productos

Métodos mixtos;
40 expertos, 640
observaciones

Explicabilidad
frente a
exactitud

Elección del
modelo e
interacción

Adecua
do

Tuncer y
Ramirez
(2022)

Decisiones
gerenciales

Encuesta n=134;
cualitativo n=14

Interpretabilida
d y confianza
informada

Confiabilidad
percibida

Con
reservas

Sturm et al.
(2023)

Decisiones
reales

Encuesta
retrospectiva;
n=239

Transparencia
de análisis ML

Uso, calidad
y eficiencia

Adecua
do

La Tabla 2 resume las exclusiones realizadas durante el cribado, la Tabla 3 documenta
las decisiones adoptadas después de evaluar los seis textos completos y la Tabla 4 presenta las
características de los tres estudios incluidos.

La única evidencia directamente situada en una función de contabilidad de gestión fue la
de Hammann y Wouters (2026). Cuarenta expertos en costos de una empresa automotriz
resolvieron 16 viñetas cada uno, para un total de 640 observaciones, y eligieron entre modelos
con diferentes niveles de explicabilidad y exactitud. Los participantes tendieron a preferir
modelos más explicables aun cuando eran menos exactos. La incertidumbre de la tarea y la
necesidad de interacción con el modelo ayudaron a explicar esa preferencia. El estudio ofrece alta
pertinencia para estimación de costos, aunque la procedencia de una sola organización limita la
generalización.
Vol. 13/ Núm. 3 2026 pág. 1439
En un trabajo de Tuncer y Ramirez (2022) se han ocupado de las respuestas de 134
gerentes y ejecutivos, a lo que han añadido para su estudio las notas cualitativas de 14 de los
participantes. De sus análisis se desprende que la interpretabilidad va de la mano con una mayor
percepción de fiabilidad y confiabilidad en términos de puntuación; asimismo, el hecho de
mostrar una medida de confianza del modelo ha sido propicio para distintas aristas de la misma.
No obstante, se hallan incongruencias, ya sea en la interpretación de la primera hipótesis como en
las pruebas expuestas o en los tamaños de grupo. En vista de ello, se toman los resultados de
manera indicativa y se anota la evaluación metodológica con ciertas reservas.

En un trabajo de Sturm et al. (2023) se han planteado el análisis de 239 decisiones
organizacionales reales que cuentan con el respaldo del aprendizaje automático, un 13,4 % de
ellas en materia de finanzas y controlling. Los resultados de su PLS-SEM ponen de manifiesto
una asociación entre la transparencia del análisis y un mayor uso del consejo (β = .14; p = .037).
Dicho uso va de la mano con la calidad (β = .61; p < .001) y la eficiencia a la hora de decidir (β
= .58; p < .001). Si bien el nivel gerencial modera la relación con la calidad (β = −.14; p = .007),
no es así con la eficiencia. Con todo, y para ofrecer el vínculo empírico más exhaustivo entre
transparencia, desempeño y la conducta de uso, el estudio tiene sus limitaciones: el hecho de ser
de diseño retrospectivo y basarse en medidas autoinformadas no permite establecer causalidad.

De modo que, al tomar los tres estudios en su conjunto, no se puede hacer una estimación
del efecto promedio. Hay disparidad en las unidades de análisis, en los desenlaces y en las propias
modalidades, sea en la selección de un modelo, en el grado de confianza percibido o en lo que
atañe a seguir recomendaciones para decisiones de verdad. Si bien la tendencia de fondo se aviene
con que la explicabilidad reporta algún provecho, lo que hay de evidencia no da cuenta de que
más explicación vaya a traducirse invariablemente en una mejor decisión, ni de que la confianza
que se obtenga tenga la calibración debida.

De lo que se desprende de la revisión, la evidencia empírica de calado en XAI y su vínculo
con los resultados de interés para un contable de gestión es aún incipiente. De los estudios que
figuran, uno tan solo se ha ocupado de una tarea contable en sentido estricto, a saber, la estimación
de los costos de un producto. Los dos restantes ofrecen mecanismos transferibles en materia de
uso del consejo o confianza, sin embargo no hay evaluación alguna de la presupuestación, el
pronóstico, el análisis de desviaciones o del desempeño.

Se echa de menos esta escasez en la extensa literatura de índole contable y gerencial que
versa sobre el consejo algorítmico y la analítica. De hecho, la literatura se presta a matices: Jung
y Seiter (2021) han puesto de manifiesto que al hacer un pronóstico la aversión al algoritmo cede
ante la presión del tiempo. Cuando se trata de tomar decisiones con el respaldo de la analítica, lo
que da credibilidad y se pone en práctica es la congruencia de valencia y tendencia del consejo
(Chen et al., 2022; Fehrenbacher et al., 2023). En materia de auditoría, según Commerford et al.
(2022), la dependencia de una evidencia en desacuerdo varía en función de si el origen del consejo
Vol. 13/ Núm. 3 2026 pág. 1440
es humano o de un algoritmo. Si bien no hay aquí evidencia XAI propiamente dicha, los resultados
dejan ver que cualquier explicación que se ofrezca estará sujeta a las señales de la tarea y a de
dónde se perciba que viene el consejo.

Los resultados dejan constancia de un orden conceptual que se ajusta a la lógica: con una
explicación de la calidad y las características oportunas se predispone a la confianza o a la
comprensión, y ello sienta las bases para que haya aceptación o se proceda al uso. En
consecuencia, de un buen empleo se deriva una mayor eficiencia y una calidad de la decisión.
Pero no hay que tomar por buenas estas relaciones sin más, pues la evidencia no lo ampara; son
muchos los elementos que pueden alterar cualquiera de sus eslabones, ya sea la responsabilidad,
la exactitud en sí, la incertidumbre, el nivel gerencial o la experiencia de quien lo usa.

No conviene ver la aceptación como una ventaja de por sí. La analítica predictiva tiene el
poder de reconfigurar las relaciones de autoridad en la organización (Labro et al., 2023), y hasta
los sistemas de apoyo, que se venden como un plus para el factor humano, pueden acabar
fomentando una sobrereliancia por parte de la gerencia (Keding & Meissner, 2021). De igual
modo, el tipo de incentivos y cómo se plantea la participación de los expertos influyen en la
consideración que se da al desempeño y a lo que dicta el algoritmo (Greiner et al., 2026). En
definitiva, una XAI de verdad no se mide por su capacidad de generar confianza o adhesión, sino
por propiciar una dependencia medida y dar pie a determinar en cada caso si hay que aceptar,
poner en duda o desechar lo que se recomienda.

Tabla 5

Vacíos de investigación y líneas prioritarias

Vacío
Evidencia en el corpus Línea prioritaria
1. Aplicación en
funciones
contables

Solo la estimación de costos
cuenta con evidencia directa en el
corpus final.

Experimentos y estudios de campo
en presupuestación, pronóstico,
desviaciones y desempeño.

2. Confianza
calibrada y calidad
objetiva

Predominan preferencia y
autoinforme; falta contrastar
confianza con competencia real
del sistema.

Medir uso, detección de errores,
precisión, tiempo, sesgo de
automatización y calibración.

3. Ajuste
explicacióntarea
usuario

No existen comparaciones
suficientes entre modalidades y
perfiles de decisor.

Comparar explicaciones
locales/globales,
técnicas/narrativas y niveles de
detalle según experiencia e
incertidumbre.

De lo que se desprende de la Tabla 5, las prioridades radican en extender el alcance de
las funciones contables analizadas, cuantificar un desempeño objetivo y la confianza calibrada de
un lado, y por otro, ver de qué manera se ajusta la modalidad explicativa a la tarea y al perfil de
quien decide.
Vol. 13/ Núm. 3 2026 pág. 1441
Los estudios futuros deberían preregistrar hipótesis y separar, como mínimo, cuatro
familias de medidas: calidad de la explicación, comprensión comprobada, confianza calibrada y
desempeño decisional objetivo. Los diseños factoriales permiten someter a prueba modelos de
interpretación intrínseca y todo tipo de explicaciones, sean de índole local o global, con reglas,
contrafactuales o ejemplos incluidos; y hacerlo en función de factores como la experiencia, la
responsabilidad o la incertidumbre. Por otra parte, hace falta el empleo de muestras de contadores
de gestión y tareas contables que se ajusten a la realidad, y un análisis de mediación o moderación
para someter a verificación la cadena conceptual, sin conformarse con las meras correlaciones de
percepciones (Mohseni et al., 2021; Vilone & Longo, 2021).

No convendría que las organizaciones se limiten a juzgar una herramienta XAI en base a
lo clara que parezca su explicación. A la hora de hacer una elección, hay que tener en cuenta otros
factores como la fidelidad o la exactitud, la utilidad para el trabajo de campo y si el usuario puede
poner en duda la recomendación o bien las repercusiones de un fallo. En el caso de decisiones
con un alto grado de responsabilidad, lo que se busca es que la explicación permita la supervisión
y la rendición de cuentas, no que sirva de coartada para dar por buena la acción del sistema.

Una gobernanza de múltiples capas es lo que se requiere para una implantación de
responsabilidad. De ahí la necesidad de poner a prueba la incertidumbre del modelo y el grado de
veracidad en su explicación, o bien de adecuar la interfaz a la tarea y al tipo de usuario. También
cabe registrar las recomendaciones, intervenciones o anulaciones que se produzcan, establecer
unos parámetros para la revisión por parte de un humano y, a continuación, auditar los patrones
de uso y cualquier sesgo o error de que haya constancia. La supervisión ha de contar con una
capacidad real de impugnar y corregir en este proceso, no puede quedarse en un formalismo (Lee
& See, 2004; Raisch & Krakowski, 2021).

Se advierten cuatro limitaciones primordiales en la revisión. En primer lugar, no ha sido
posible dar con cinco de los 11 informes (un 45,5 %) y sus resúmenes no han hecho las veces de
texto completo; de ahí un sesgo de disponibilidad que se hace evidente. Por otra parte, el corpus
final es de apenas tres estudios, de los cuales uno solo ofrece evidencia contable directa. Tampoco
hubo verificación independiente en la labor de evaluación y selección, que corrió a cargo de un
único revisor. Por último, Web of Science no figura entre las fuentes de identificación. Con tales
restricciones la certeza se ve mermada y hay que tomar los resultados como un mapa crítico de lo
que se ha podido recuperar más que una estimación de efectividad de carácter definitivo.

Aun cuando se amplíe el marco conceptual con la literatura de su entorno, las
restricciones de rigor y los recuentos PRISMA no se ven alterados. Lo que hace esta ampliación
es dar un contexto a los tres estudios que se han incorporado y permitir su interpretación; en
consecuencia, lo que se infiere de XAI en materia de contabilidad de gestión se circunscribe al
corpus apto para ello y no cabe considerarlo una extrapolación de efectos causales de carácter
general.
Vol. 13/ Núm. 3 2026 pág. 1442
CONCLUSIONES

De lo que se ha podido recabar en forma de evidencia a mayo de 2026 se desprende que,
al pretender una transparencia y explicabilidad de mayor calibre, se tiende a elegir modelos de
sencilla interpretación; ello no solo predispone a hacer caso a las recomendaciones de los
algoritmos sino que instaura la confianza. La conexión más cabal es la existente entre la
transparencia y el hecho de seguir el consejo, un proceder que conlleva por añadidura una mejor
calidad y eficiencia a la hora de decidir. Pero hay que tener en cuenta que el corpus de datos no
deja de ser de reducidas dimensiones y heterogéneo, y en su mayor parte procedente de
transferencias de ámbitos gerenciales de carácter general.

Lo que se detecta como un vacío de aplicación es la escasez de estudios en lo relativo a
la presupuestación, el pronóstico, el análisis de desviaciones o la evaluación del desempeño.
Tampoco se ha visto una asunción de medidas con la objetividad y confianza debidas, ni las
comparaciones explícitas que caben entre los perfiles de usuario, las tareas y las diferentes formas
de explicación. Esta revisión viene a subsanar tal deficiencia; en su aportación consiste en dejar
constancia de lo que hay de evidencia y a la vez establecer una agenda empírica bien definida
para la contabilidad de gestión.
Vol. 13/ Núm. 3 2026 pág. 1443
REFERENCIAS

Abbas, K. (2026). Management accounting and artificial intelligence: A comprehensive literature

review and recommendations for future research.
The British Accounting Review, 58(2),
101551.
https://doi.org/10.1016/j.bar.2025.101551
Appelbaum, D., Kogan, A., Vasarhelyi, M. A., & Yan, Z. (2017). Impact of business analytics

and enterprise systems on managerial accounting.
International Journal of Accounting
Information Systems, 25
, 2944. https://doi.org/10.1016/j.accinf.2017.03.003
Avramović, N., Marković, A., Čomić, T., Čavoški, S., Zornić, N., & Vujović, V. (2026). PRIME

INSPECT: A socio
-technical framework for trustworthy intelligent automation and real-
time decision
-making in Industry 4.0. Applied Sciences, 16(10), 4825.
https://doi.org/10.3390/app16104825

Barredo Arrieta, A., Díaz-Rodríguez, N., Del Ser, J., Bennetot, A., Tabik, S., Barbado, A., García,
S., Gil-López, S., Molina, D., Benjamins, R., Chatila, R., & Herrera, F. (2020).

Explainable artificial intelligence (XAI): Concepts, taxonomies, opportunities and

challenges toward responsible AI.
Information Fusion, 58, 82115.
https://doi.org/10.1016/j.inffus.2019.12.012

Bhimani, A. (2020). Digital data and management accounting: Why we need to rethink research

methods.
Journal of Management Control, 31, 923. https://doi.org/10.1007/s00187-
020
-00295-z
Burton, J. W., Stein, M.
-K., & Jensen, T. B. (2020). A systematic review of algorithm aversion
in augmented decision making.
Journal of Behavioral Decision Making, 33(2), 220239.
https://doi.org/10.1002/bdm.2155

Castelo, N., Bos, M. W., & Lehmann, D. R. (2019). Task
-dependent algorithm aversion. Journal
of Marketing Research, 56
(5), 809825. https://doi.org/10.1177/0022243719851788
Chen, C. X., Hudgins, R., & Wright, W. F. (2022). The effect of advice valence on the perceived

credibility of data analytics.
Journal of Management Accounting Research, 34(2), 97
116.
https://doi.org/10.2308/JMAR-2020-015
Commerford, B. P., Dennis, S. A., Joe, J. R., & Ulla, J. W. (2022). Man versus machine: Complex

estimates and auditor reliance on artificial intelligence.
Journal of Accounting Research,
60
(1), 171201. https://doi.org/10.1111/1475-679X.12407
Diet
a vorst, B. J., Simmons, J. P., & Massey, C. (2018). Overcoming algorithm aversion: People
will use imperfect algorithms if they can (even slightly) modify them.
Management
Science, 64
(3), 11551170. https://doi.org/10.1287/mnsc.2016.2643
Fehrenbacher, D. D., Ghio, A., & Weisner, M. M. (2023). Advice utilization from predictive

analytics tools: The trend is your friend.
European Accounting Review, 32(3), 637662.
https://doi.org/10.1080/09638180.2022.2138934
Vol. 13/ Núm. 3 2026 pág. 1444
Glikson, E., & Woolley, A. W. (2020). Human trust in artificial intelligence: Review of empirical

research.
Academy of Management Annals, 14(2), 627660.
https://doi.org/10.5465/annals.2018.0057

Greiner, B., Grünwald, P., Lindner, T., Lintner, G., & Wiernsperger, M. (2026). Incentives,

framing, and reliance on algorithmic advice: An experimental study.
Management
Science, 72
(1), 302322. https://doi.org/10.1287/mnsc.2022.02777
Hammann, D., & Wouters, M. (2026). Explainability versus accuracy of machine learning

models: The role of task uncertainty and need for interaction with the machine learning

model.
European Accounting Review, 35(2), 343375.
https://doi.org/10.1080/09638180.2025.2463961

Hong, Q. N., Fàbregues, S., Bartlett, G., Boardman, F., Cargo, M., Dagenais, P., Gagnon, M.
-P.,
Griffiths, F., Nicolau, B., O’Cathain, A., Rousseau, M.
-C., Vedel, I., & Pluye, P. (2018).
The Mixed Methods Appraisal Tool (MMAT) version 2018 for information
professionals
and researchers.
Education for Information, 34(4), 285291. https://doi.org/10.3233/EFI-
180221

Jung, M., & Seiter, M. (2021). Towards a better understanding on mitigating algorithm aversion

in forecasting: An experimental study.
Journal of Management Control, 32, 495516.
https://doi.org/10.1007/s00187
-021-00326-3
Keding, C., & Meissner, P. (2021). Managerial overreliance on AI
-augmented decision-making
processes: How the use of AI
-based advisory systems shapes choice behavior in R&D
investment decisions.
Technological Forecasting and Social Change, 171, 120970.
https://doi.org/10.1016/j.techfore.2021.120970

Labro, E., Lang, M. H., & Omartian, J. D. (2023).
Predictive analytics and centralization of
authority.
Journal of Accounting and Economics, 75(1), 101526.
https://doi.org/10.1016/j.jacceco.2022.101526

Lee, J. D., & See, K. A. (2004). Trust in automation: Designing for appropriate reliance.
Human
Factors, 46
(1), 5080. https://doi.org/10.1518/hfes.46.1.50_30392
Miller, T. (2019). Explanation in artificial intelligence: Insights from the social sciences.
Artificial
Intelligence, 267
, 138. https://doi.org/10.1016/j.artint.2018.07.007
Mohseni, S., Zarei, N., & Ragan, E. D. (2021).
A multidisciplinary survey and framework for
design and evaluation of explainable AI systems.
ACM Transactions on Interactive
Intelligent Systems, 11
(34), 1-45. https://doi.org/10.1145/3387166
Page, M. J., McKenzie, J. E., Bossuyt, P. M., Boutron, I., Hoffmann, T. C., Mulrow, C. D.,

Shamseer, L., Tetzlaff, J. M., Akl, E. A., Brennan, S. E., Chou, R., Glanville, J.,

Grimshaw, J. M., Hróbjartsson, A., Lalu, M. M., Li, T., Loder, E. W., Mayo
-Wilson, E.,
McDonald, S., … Moher, D. (2021). The PRISMA 2020 statement: An updated guideline

for reporting systematic reviews.
BMJ, 372(71), 19. https://doi.org/10.1136/bmj.n71
Vol. 13/ Núm. 3 2026 pág. 1445
Quattrone, P. (2016). Management accounting goes digital: Will the move make it wiser?

Management Accounting Research, 31
, 118122.
https://doi.org/10.1016/j.mar.2016.01.003

Rai, A. (2020). Explainable AI: From black box to glass box.
Journal of the Academy of
Marketing Science, 48
, 137141. https://doi.org/10.1007/s11747-019-00710-5
Raisch, S., & Krakowski, S. (2021). Artificial intelligence and management: The automation

augmentation paradox.
Academy of Management Review, 46(1), 192210.
https://doi.org/10.5465/amr.2018.0072

Ranta, M., Ylinen, M., & Järvenpää, M. (2023). Machine learning in management accounting

research: Literature review and pathways for the future.
European Accounting Review,
32
(3), 607636. https://doi.org/10.1080/09638180.2022.2137221
Rethlefsen
, M. L., Kirtley, S., Waffenschmidt, S., Ayala, A. P., Moher, D., Page, M. J., Koffel, J.
B., & PRISMA
-S Group. (2021). PRISMA-S: An extension to the PRISMA statement
for reporting literature searches in systematic reviews.
Systematic Reviews, 10, 39.
https://doi.org/10.1186/s13643
-020-01542-z
Rikhardsson, P., & Yigitbasioglu, O. (2018). Business intelligence & analytics in management

accounting research: Status and future focus.
International Journal of Accounting
Information Systems, 29
, 3758. https://doi.org/10.1016/j.accinf.2018.03.001
Shin, D. (2021). The effects of explainability and causability on perception, trust, and acceptance:

Implications for explainable AI.
International Journal of Human-Computer Studies, 146,
102551.
https://doi.org/10.1016/j.ijhcs.2020.102551
Shulner
-Tal, A., Kuflik, T., Kliger, D., & Mancini, A. (2025). Who made that decision and why?
Users’ perceptions of human versus AI decision
-making and the power of explainable-
AI.
International Journal of HumanComputer Interaction, 41(7), 42304247.
https://doi.org/10.1080/10447318.2024.2348843

Sturm, T., Pumplun, L., Gerlach, J. P., Kowalczyk, M., & Buxmann, P. (2023). Machine learning

advice in managerial decision
-making: The overlooked role of decision makers’ advice
utilization.
The Journal of Strategic Information Systems, 32(4), 101790.
https://doi.org/10.1016/j.jsis.2023.101790

Tuncer, S., & Ramirez, A. (2022). Exploring the role of trust during human
AI collaboration in
managerial decision
-making processes. In J. Y. C. Chen, G. Fragomeni, H. Degen, & S.
Ntoa (Eds.),
HCI International 2022Late Breaking Papers: HCI for Today’s
Community and Economy
(Lecture Notes in Computer Science, Vol. 13518, pp. 541
557). Springer.
https://doi.org/10.1007/978-3-031-21707-4_39
Vilone, G., & Longo, L. (2021). Notions of explainability and evaluation approaches for

explainable artificial intelligence.
Information Fusion, 76, 89106.
https://doi.org/10.1016/j.inffus.2021.05.009
Vol. 13/ Núm. 3 2026 pág. 1446
Volkmar, G. V. (2022). Managerial decisions in marketing: The individual perception of

explainable artificial intelligence. In J. L. Reis, E. P. López, L. Moutinho, & J. P. M. dos

Santos (Eds.),
Marketing and Smart Technologies (Smart Innovation, Systems and
Technologies, Vol. 279, pp. 15
21). Springer. https://doi.org/10.1007/978-981-16-9268-
0_2