Transformación de las auditorías de rendimiento: la Oficina del Contralor y Auditor General de la India y la innovación impulsada por las nuevas tecnologías

Source: Adobe Stock Images, ZETHA_WORK

Autor: Oficina del Contralor y Auditor General de la India

Introducción

La cada vez mayor complejidad de la gobernanza digital ha transformado radicalmente el panorama de la auditoría. Hoy día, las Entidades Fiscalizadoras Superiores (EFS) tienen que lidiar con enormes volúmenes de registros financieros y con arquitecturas de programas en rápida evolución, que tensionan los métodos de auditoría convencionales. El examen basado en muestras y las metodologías convencionales de análisis de datos resultan cada vez menos adecuados para detectar los riesgos sistémicos, las interrelaciones opacas y los fallos de gobernanza inherentes a los sistemas digitales interconectados.

La Oficina del Contralor y Auditor General de la India está respondiendo a este desafío mediante una innovación estructurada de las auditorías impulsada por las nuevas tecnologías. Así, en los últimos años nuestra entidad ha estado integrando capacidades de análisis avanzadas a sus procesos de auditoría de rendimiento, que abarcan desde el análisis de redes y el aprendizaje automático hasta el reconocimiento óptico de caracteres (OCR) y el análisis de imágenes con IA.

Estudio de caso 1: auditoría de rendimiento de programas de bienestar social

La arquitectura de protección social de la India comprende docenas de programas de bienestar social que se solapan, desde la seguridad alimentaria y la vivienda hasta el seguro médico y el empleo rural, y cada uno de ellos mantiene sus propias bases de datos de beneficiarios. Si bien la modalidad de pago digital a través de transferencias directas de prestaciones (Direct Benefit Transfers; DBT) ha mejorado sustancialmente la transparencia, también ha generado nuevos retos, como la exclusión de hogares con derecho a percibirlas, la duplicación encubierta de prestaciones y la fragmentación de la cobertura entre los distintos programas. Las auditorías convencionales examinaban los programas de forma aislada, lo que hacía casi imposible realizar un análisis sistémico cruzado de todos ellos.

La EFS de la India está llevando a cabo una auditoría de los beneficiarios de programas, basada en los datos de siete importantes programas de bienestar social en siete estados de la India. El gasto público total en estos siete programas durante el ejercicio 2023-24 ascendió a 4.140 millones de rupias. Para la auditoría, se adoptó un marco de análisis integrado y centrado en los hogares, en el que los registros de los beneficiarios de los siete programas se tratan como nodos interconectados dentro de un modelo de grafos unificado. El tamaño total de las bases de datos de los siete programas es de unos 800 TB, de los que alrededor de 140 TB han sido identificados como pertinentes y necesarios para la auditoría. Los valores de ‘hash’ del número Aadhaar1 nos sirvieron como identificadores de vinculación anonimizados, lo que permitió mapear los patrones de convergencia y de exclusión en el acceso a las prestaciones a nivel de hogar sin comprometer la privacidad. 

El flujo de trabajo de los análisis incluía la extracción y estandarización de conjuntos de datos, el mapeo de la coincidencia de hogares entre distintos programas, la modelización de grafos y el análisis de entidades vinculadas, la detección de anomalías y la priorización basada en riesgos para la verificación sobre el terreno. De hecho, la validación realizada mediante drones a efectos de verificar los registros del programa de vivienda Pradhan Mantri Awas Yojana (PMAY, o misión de vivienda asequible del Gobierno de la India) en determinadas ubicaciones reveló una discrepancia entre la fase de construcción de las viviendas y la liberación de fondos.

Mediante el análisis del big data de la población total, también observamos que aproximadamente 3,6 millones de familias permanecían excluidas de las prestaciones de los principales programas de bienestar social, a pesar de cumplir los requisitos para acogerse a ellos como hogares destinatarios, un hallazgo impensable con los métodos convencionales de muestreo y análisis de datos. Todo ello dejó patente, asimismo, la necesidad de una reforma sistémica de los mecanismos de identificación de beneficiarios y de la coordinación entre programas, quedando de manifiesto cómo el análisis integrado puede proporcionar información basada en evidencia que permita valorar la efectividad tanto de las prestaciones de bienestar social como de la equidad en el acceso a las mismos.

Estudio de caso 2: «Artifacial Intelligence» — herramienta de análisis de imágenes basada en IA

Tradicionalmente, la verificación de beneficiarios en las auditorías de prestaciones sociales se ha basado en campos de datos estructurados para detectar anomalías. No obstante, había un aspecto significativo de la identidad de los beneficiarios que jamás fue auditado, a saber, las fotografías almacenadas junto con los registros de la base de datos en prácticamente todos los grandes programas de bienestar social. El fraude ‘visual’, como la reutilización de fotografías para realizar múltiples inscripciones, las imágenes en blanco o no humanas, o las fotografías de grupo que encubren la identidad individual, representa una vulnerabilidad sistemática que el análisis de datos estructurados no puede detectar.

El Centro de Gestión y Análisis de Datos (Centre for Data Management and Analytics; CDMA) de la EFS de la India ha desarrollado una caja de herramientas de análisis de imágenes basada en IA, denominada «Artifacial Intelligence», que se apoya en bibliotecas Python de código abierto para la verificación de beneficiarios a partir de imágenes. Este kit permite detectar imágenes duplicadas mediante el algoritmo de hash perceptual, que señala fotografías idénticas utilizadas para múltiples registros con un umbral de coincidencia del 100 % para minimizar los falsos positivos, así como descubrir imágenes falsas, identificar archivos con extensiones de imagen válidas que no contienen datos de imagen reales, y realizar análisis faciales y de recuento.

Creado sobre las bibliotecas OpenCV, dlib y face_recognition, con una interfaz gráfica basada en PyQt6, el programa no requiere conocimientos de codificación, funciona en ordenadores de sobremesa estándar y genera resultados en forma de archivos CSV estructurados o directorios de imágenes organizados. Un diagrama de Sankey2 resume visualmente los resultados de los análisis para la elaboración de informes de auditoría.

Durante el transcurso de una sola auditoría de rendimiento, estas herramientas procesaron 238.000 fotografías vinculadas a 119.000 beneficiarios, quedando al descubierto fallos sistémicos en la infraestructura de TI a nivel de programas, como la duplicación de imágenes o entradas no válidas, susceptibles de facilitar el uso indebido de los fondos de bienestar social. Los hallazgos fueron reflejados directamente en las observaciones de la auditoría y en las recomendaciones políticas para reforzar los controles de validación de fotografías en los sistemas de TI del régimen de bienestar social.

Estudio de caso 3: auditorías de contratación pública electrónica mediante un algoritmo de aprendizaje automático

La contratación pública sigue siendo uno de los ámbitos de mayor riesgo de fallos de gobernanza. La colusión en las licitaciones, la formación de cárteles, la rotación de ganadores, las ofertas de cobertura y el uso de proveedores intermediarios son riesgos persistentes que las auditorías de contratación convencionales suelen tener dificultades para detectar. Un examen caso por caso de las licitaciones, por muy exhaustivo que sea, no es capaz de revelar los patrones a nivel de red que caracterizan a la colusión sistémica.

En este contexto, la EFS de la India ha desarrollado un marco de análisis de redes con enfoque relacional para las auditorías de la contratación pública electrónica, que integra tres técnicas de análisis complementarias. El análisis de redes basado en grafos, modelados como nodos y aristas interconectados, permite visualizar a gran escala clústeres densos de licitadores, redes de proveedores dominantes y relaciones de contratación anómalas; la detección de patrones mediante el algoritmo Apriori3, que permite identificar combinaciones recurrentes de licitadores en múltiples procesos de contratación; y la resolución de entidades mediante coincidencia difusa (una técnica para localizar y vincular conjuntos de datos que, aunque no coincidan exactamente, es probable que representen la misma entidad), que permite comparar los nombres, las direcciones y los datos de registro de los proveedores para detectar identidades duplicadas y relaciones ocultas entre licitadores aparentemente independientes.

Este marco fue diseñado íntegramente con tecnologías de código abierto, como la programación en R y las bibliotecas en Python4, lo que garantiza tanto la escalabilidad como una buena relación coste-eficacia. La metodología nos permitió realizar un análisis de la población total de conductas en materia de contratación pública, que ayudó a encontrar y señalar conexiones ocultas entre proveedores, patrones de licitaciones colusorias y riesgos sistémicos invisibles para una revisión convencional. Asimismo, reforzamos las capacidades de análisis a nivel institucional mediante plantillas de flujo de trabajo estandarizadas, lo que redujo las barreras técnicas para los posteriores equipos de auditoría.

Estudio de caso 4: OCR y análisis de documentos asistido por IA

Una característica definitoria de la auditoría pública en los grandes sistemas de gobernanza es el enorme volumen de evidencia documental no estructurada, tales como certificados escaneados, libretas de ahorro manuscritas, facturas, resoluciones de liquidación, etc. El examen manual de esta evidencia consume muchísimo tiempo, es propenso a errores y tiene un alcance intrínsecamente limitado.

Por ello, la EFS de la India implantó la tecnología de reconocimiento óptico de caracteres (OCR) en dos líneas de auditoría distintas. Por un lado, la utilizó en las auditorías de bienestar social e integridad de los documentos, combinando el OCR bilingüe (hindi e inglés) con el procesamiento de lenguaje natural (PLN) y la visión artificial (computer vision) para extraer y analizar el texto de los certificados de los beneficiarios, las libretas de ahorro y otros documentos relacionados. Una capa forense detecta indicadores de manipulación, como marcas de corrector, registros alterados o fotografías duplicadas, y una capa de fusión de auditoría sintetiza la evidencia en formato texto y la evidencia en formato visual en conclusiones de auditoría fundamentadas y asistidas por IA. Por otro lado, la aplicó en la auditoría de declaraciones de impuestos directos y de estados financieros, donde el OCR extrae datos estructurados de informes de auditoría fiscal, facturas, hojas de cálculo y estados financieros en formato PDF o escaneados. Los datos extraídos se estandarizan, se cotejan con los documentos originales y se analizan en busca de anomalías e inconsistencias. Además, esta tecnología permite realizar controles específicos, como pruebas de corte de facturas y cotejos entre las declaraciones del impuesto sobre la renta y los informes de auditoría fiscal, entre otras.

Pautas prácticas para las EFS: primeros pasos en la innovación de la auditoría

La experiencia de la EFS de la India con estas cuatro iniciativas arroja una serie de enseñanzas prácticas. En una primera etapa, de diagnóstico y establecimiento de las bases, las EFS pueden comenzar su proceso evaluando la disponibilidad, la calidad y la accesibilidad de los datos digitales en poder de las entidades auditadas. Además, las EFS deberían hacer una valoración muy honesta de sus capacidades de análisis a nivel interno y ver de qué habilidades disponen, qué herramientas ya utilizan y qué carencias quedan por resolver.

La segunda etapa consiste en la experimentación focalizada. Más que intentar llevar a cabo una transformación de golpe y en toda la organización, las EFS harán mejor en identificar un ámbito de auditoría concreto en el que ya se cuenta con datos digitales y en el que la pregunta de auditoría esté bien definida.

La tercera etapa es la de la consolidación metodológica. Los proyectos piloto que hayan tenido éxito deben codificarse en marcos reutilizables: flujos de trabajo documentados, guiones estandarizados, plantillas de auditoría y protocolos de aseguramiento de la calidad que permitan a los equipos posteriores replicar y adaptar la metodología sin tener que volver a crearla desde cero. Esta también es la etapa en la que la innovación transita de la pericia individual a la capacidad institucional.

Y la cuarta etapa, la más crucial, es la de la creación de capacidades y de ‘cultura’. Aquí, las EFS tienen que invertir en programas de capacitación estructurados, que ayuden a desarrollar la alfabetización analítica de todo el personal de auditoría. Esto no significa convertir a cada uno de los auditores en un científico de datos, pero sí garantizar que las herramientas de análisis se comprendan, se consideren fiables y se empleen con criterio profesional.

Conclusión

La transformación digital de los sistemas de gobernanza exige una transformación equivalente en la auditoría del sector público. La experiencia de la EFS de la India demuestra que las tecnologías emergentes, tales como los drones, el análisis de imágenes y las técnicas de IA/aprendizaje automático (ML) pueden lograr, entre todas, impulsar la capacidad auditora, llevándola de una verificación reactiva de transacciones a una supervisión proactiva e ‘inteligente’.

A medida que los sistemas de gobernanza se vuelven más complejos y digitalmente interconectados, las EFS de mayor valor público serán aquellas que inviertan hoy en las herramientas, las tecnologías y la cultura institucional requeridas para afrontar los retos de auditoría del día de mañana. La transformación ha comenzado ya; ahora, lo que toca es acelerarla y compartirla.


Notas al pie

  1.  El número Aadhaar es el número de identificación único de 12 dígitos que se asigna a los residentes de la India. ↩︎
  2.  Un diagrama de Sankey es un diagrama de flujo en el que la anchura de las flechas es directamente proporcional al caudal o volumen de datos. ↩︎
  3.  Algoritmo de aprendizaje automático no supervisado. ↩︎
  4.  Bibliotecas en Python que incluyen NetworkX, igraph y tidygraph. ↩︎
Back To Top