La transformation des audits de performance : l’innovation en matière d’audit axée sur la technologie du Contrôleur et Auditeur général de l’Inde

Source: Adobe Stock Images, ZETHA_WORK

Auteur : Contrôleur et Auditeur général de l’Inde

Introduction

La complexité croissante de la gouvernance numérique a profondément bouleversé le paysage de l’audit. Les Institutions supérieures de contrôle des finances publiques (ISC) sont aujourd’hui confrontées à des volumes considérables de documents financiers et à des architectures de programmes en constante évolution, qui mettent à rude épreuve les méthodes d’audit traditionnelles. Les contrôles par échantillonnage et les méthodologies classiques d’analyse des données s’avèrent de plus en plus insuffisants pour détecter les risques systémiques, les relations cachées et les défaillances de gouvernance inhérentes aux systèmes numériques interconnectés.

Le Contrôleur et Auditeur général de l’Inde relève ce défi grâce à une innovation structurée en matière d’audit, fondée sur la technologie. Au cours des dernières années, notre institution a intégré à ses processus d’audit de performance des capacités analytiques avancées couvrant l’analyse de réseaux, l’apprentissage automatique, la reconnaissance optique de caractères (OCR) et l’analyse d’images alimentée par l’IA.

Étude de cas n° 1 : Audit de performance des programmes de protection sociale 

L’architecture de protection sociale de l’Inde englobe des dizaines de programmes sociaux qui se chevauchent, allant de la sécurité alimentaire et du logement à l’assurance maladie et à l’emploi rural, chacun disposant de bases de données indépendantes sur ses bénéficiaires. Si la mise en œuvre numérique par le biais des transferts directs de prestations (DBT) a considérablement amélioré la transparence, elle a également engendré de nouveaux défis, tels que l’exclusion de ménages éligibles, la duplication silencieuse des prestations et une couverture fragmentée entre les différents programmes. Les audits conventionnels examinaient les programmes de manière isolée, rendant pratiquement impossible toute analyse systémique inter-programmes.

L’ISC de l’Inde mène actuellement un audit des programmes d’aide sociale fondé sur les données, portant sur sept grands programmes d’aide sociale dans sept États indiens. Le montant total des dépenses publiques consacrées à ces sept programmes au cours de l’exercice 2023 à 2024 s’élevait à 4,14 milliards de roupies. L’audit a adopté un cadre analytique intégré centré sur les ménages, traitant les dossiers des bénéficiaires des sept programmes comme des nœuds interconnectés au sein d’un modèle graphique unifié. La taille combinée des bases de données des sept programmes s’élève à environ 800 To, dont environ 140 To de données ont été identifiées comme pertinentes et nécessaires à l’audit. Les valeurs de hachage de l’Aadhaar1 ont servi d’identifiants de liaison anonymisés, permettant de cartographier les schémas de convergence et d’exclusion des prestations au niveau des ménages sans compromettre la vie privée. 

Le processus analytique comprenait l’extraction et la normalisation des ensembles de données, la cartographie des ménages entre les différents programmes, la modélisation de graphes et l’analyse des entités liées, la détection des anomalies, ainsi que la hiérarchisation des priorités en fonction des risques pour la vérification sur le terrain. La validation par drone visant à vérifier les dossiers du programme de logement Pradhan Mantri Awas Yojana (PMAY, ou mission pour le logement abordable menée par le gouvernement indien) dans des sites sélectionnés a révélé un décalage entre l’état d’avancement de la construction des logements et le déblocage des fonds. 

Grâce à l’analyse de mégadonnées portant sur l’ensemble de la population, nous avons observé qu’environ 3,6 millions de familles restaient exclues des prestations prévues par les principaux programmes sociaux, bien qu’elles répondent aux critères d’éligibilité en tant que ménages cibles. Ce constat aurait été impossible à mettre en évidence à l’aide des méthodes conventionnelles d’échantillonnage et d’analyse des données. Cela a également mis en évidence la nécessité de réformes systémiques des mécanismes de ciblage et de la coordination entre les programmes, démontrant ainsi comment l’analyse intégrée peut fournir des informations fondées sur des données probantes concernant l’efficacité de la mise en œuvre des programmes sociaux et la répartition équitable des prestations.

Étude de cas n° 2 : « Artifacial Intelligence » — Outil d’analyse d’images basé sur l’IA

La vérification des bénéficiaires dans le cadre des audits des programmes sociaux s’est traditionnellement appuyée sur des champs de données structurés pour détecter les anomalies. Pourtant, une dimension importante de l’identité des bénéficiaires est restée totalement non vérifiée, à savoir les photographies stockées aux côtés des enregistrements de la base de données dans pratiquement tous les grands programmes sociaux. Les fraudes visuelles, telles que la réutilisation de photographies permettant des inscriptions multiples, les images vides ou non humaines, ou encore les photographies de groupe masquant l’identité individuelle, constituent une vulnérabilité systématique que l’analyse des données structurées ne peut détecter. 

Le Centre de gestion et d’analyse des données (CDMA) de la Cour des comptes indienne (SAI India) a développé une boîte à outils d’analyse d’images basée sur l’IA, baptisée « Artifacial Intelligence », qui utilise des bibliothèques Python open source pour la vérification des bénéficiaires à partir d’images. Cet outil permet de détecter les images en double à l’aide du hachage perceptuel, de signaler les photographies identiques utilisées dans plusieurs inscriptions avec un seuil de correspondance de 100 % afin de minimiser les faux positifs, de détecter les images erronées, d’identifier les fichiers dotés d’extensions d’image valides mais ne contenant aucune donnée d’image réelle, ainsi que de procéder à la détection des visages et à l’analyse de leur nombre.

Conçue à partir des bibliothèques OpenCV, dlib et face_recognition, avec une interface graphique PyQt6, l’application ne nécessite aucune connaissance en programmation, fonctionne sur des ordinateurs de bureau standard et génère des résultats sous forme de fichiers CSV structurés ou de répertoires d’images organisés. Un diagramme de Sankey2 résume visuellement les résultats de l’analyse à des fins de rapports d’audit. 

L’outil a traité 238 000 photographies associées à 119 000 bénéficiaires lors d’un audit de performance. Des failles systémiques dans l’infrastructure informatique du dispositif, telles que la duplication d’images et des entrées non valides, auraient pu permettre un détournement des fonds sociaux. Ces conclusions ont directement alimenté les observations d’audit et les recommandations stratégiques visant à renforcer les contrôles de validation des photos dans les systèmes informatiques des dispositifs d’aide sociale.

Étude de cas n° 3 : Audits des marchés publics électroniques à l’aide d’un algorithme d’apprentissage automatique

Les marchés publics restent l’un des domaines présentant le plus de risques de défaillances en matière de gouvernance. Les ententes entre soumissionnaires, la formation de cartels, la rotation des offres, les offres de couverture et le recours à des fournisseurs intermédiaires constituent des risques persistants que les audits classiques des marchés publics peinent à identifier. L’examen minutieux de chaque appel d’offres, aussi approfondi soit-il, ne permet pas de mettre en évidence les schémas à l’échelle du réseau qui caractérisent la collusion systémique.

L’ISC de l’Inde a développé un cadre d’analyse de réseaux centré sur les relations pour les audits des marchés publics électroniques, intégrant trois techniques analytiques complémentaires. L’analyse de réseaux basée sur des graphes, modélisée sous forme de nœuds et d’arêtes interconnectés, permet de visualiser à grande échelle les grappes denses de soumissionnaires, les réseaux de fournisseurs dominants et les relations d’approvisionnement anormales. La détection de schémas à l’aide de l’algorithme Apriori3 permet d’identifier les combinaisons récurrentes de soumissionnaires sur plusieurs marchés publics. La résolution d’entités par correspondance floue (technique utilisée pour identifier et relier des chaînes de données qui ne correspondent pas exactement, mais qui sont susceptibles de représenter la même entité) a permis de recouper les noms, adresses et informations d’enregistrement des fournisseurs afin de détecter les identités de fournisseurs en double et les relations dissimulées entre des soumissionnaires apparemment indépendants.

Le cadre a été entièrement développé à partir de technologies open source telles que le langage de programmation R et les bibliothèques Python4, garantissant à la fois évolutivité et rentabilité. La méthodologie a permis une analyse exhaustive des comportements en matière de passation de marchés, en détectant les liens cachés entre fournisseurs, les schémas d’appels d’offres collusoires et en signalant les risques systémiques invisibles lors d’un examen conventionnel. Nous avons également renforcé les capacités analytiques institutionnelles grâce à des modèles de flux de travail standardisés, réduisant ainsi les obstacles techniques pour les équipes d’audit ultérieures.

Étude de cas n° 4 : OCR et analyse documentaire assistée par l’IA

Une caractéristique déterminante de l’audit public dans les grands systèmes de gouvernance est le volume considérable de pièces justificatives non structurées, telles que des certificats numérisés, des livrets bancaires manuscrits, des factures, des avis d’imposition, etc. L’examen manuel de ces pièces est chronophage, source d’erreurs et intrinsèquement limité en termes de couverture. 

L’ISC de l’Inde a déployé la technique de reconnaissance optique de caractères (OCR) dans deux volets d’audit distincts. Elle a été mise en œuvre pour les audits des prestations sociales et de l’intégrité des documents, en intégrant l’OCR bilingue (hindi et anglais) au traitement du langage naturel (NLP) et à la vision par ordinateur afin d’extraire et d’analyser le texte des certificats des bénéficiaires, des livrets bancaires et des documents connexes. Une couche d’analyse judiciaire détecte les indices de falsification tels que les traces de correcteur blanc, les enregistrements modifiés ou les photographies en double, tandis qu’une couche de fusion des résultats d’audit synthétise les preuves textuelles et visuelles pour aboutir à des conclusions d’audit explicables et assistées par l’IA. De même, dans le cadre des audits relatifs à la fiscalité directe et aux états financiers, l’OCR extrait des données structurées à partir de rapports d’audit fiscal, de factures, de feuilles de calcul et d’états financiers au format PDF ou numérisés. Les données extraites sont normalisées, recoupées avec les documents sources et analysées à la recherche d’anomalies et d’incohérences. Des contrôles spécifiques, notamment des tests de date limite des factures, des recoupements entre les déclarations d’impôt sur le revenu et les rapports d’audit fiscal, etc., sont effectués.

Cela a permis de réduire considérablement la charge de travail liée à l’examen manuel, d’accélérer le traitement des éléments probants, d’améliorer la détection des indicateurs de fraude et d’élargir la portée de l’audit.

Pistes pratiques pour les ISC : Se lancer dans l’innovation en matière d’audit

L’expérience de l’ISC d’inde dans le cadre de ces quatre initiatives offre des enseignements concrets. La première étape est diagnostique et fondamentale : les ISC peuvent commencer par évaluer la disponibilité, la qualité et l’accessibilité des données numériques détenues par les entités auditées. Les ISC doivent procéder à une évaluation honnête de leurs capacités analytiques internes : les compétences disponibles, les outils déjà utilisés et les lacunes à combler.

La deuxième étape consiste en une expérimentation ciblée. Plutôt que de tenter une transformation à l’échelle de l’institution d’un seul coup, les ISC ont tout intérêt à identifier un domaine d’audit spécifique où des données numériques sont disponibles et où la question d’audit est bien définie. 

La troisième étape est celle de la consolidation méthodologique. Les projets pilotes couronnés de succès doivent être codifiés en cadres réutilisables : des flux de travail documentés, des scripts standardisés, des modèles d’audit et des protocoles d’assurance qualité qui permettent aux équipes suivantes de reproduire et d’adapter la méthodologie sans avoir à la reconstruire à partir de zéro. C’est à ce stade que l’innovation passe de l’expertise individuelle à la capacité institutionnelle.

La quatrième étape, la plus cruciale, concerne les capacités et la culture. Les ISC doivent investir dans des programmes de formation structurés qui développent les compétences analytiques de l’ensemble des cadres d’audit. Il ne s’agit pas de transformer chaque auditeur en « data scientist », mais de veiller à ce que les outils analytiques soient compris, considérés comme fiables et utilisés avec discernement professionnel. 

Conclusion

La transformation numérique des systèmes de gouvernance exige une transformation correspondante de l’audit du secteur public. L’expérience de l’ISC de l’Inde démontre que les technologies émergentes telles que les drones, l’analyse d’images et les techniques d’IA/d’apprentissage automatique (ML) peuvent, collectivement, faire évoluer les capacités d’audit d’un contrôle réactif des transactions vers une surveillance proactive, fondée sur le renseignement.

À mesure que les systèmes de gouvernance gagnent en complexité et en interconnexion numérique, les ISC qui apporteront la plus grande valeur publique sont celles qui investissent dès aujourd’hui dans les outils, les techniques et la culture institutionnelle nécessaires pour relever les défis d’audit de demain. La transformation a commencé ; il est désormais impératif de l’accélérer et de la diffuser.


Notes de bas de page

  1.  Le numéro Aadhar est un numéro d’identification unique à 12 chiffres attribué aux résidents de l’Inde. ↩︎
  2.  Un diagramme de Sankey est un organigramme visuel dans lequel la largeur des flèches est directement proportionnelle au débit ou à la quantité de données. ↩︎
  3.  Algorithme d’apprentissage automatique non supervisé ↩︎
  4.  Bibliothèques Python, notamment NetworkX, igraph et tidygraph ↩︎
Back To Top