Les banques françaises multiplient les recalages lors des audits d'explicabilité de leurs modèles de scoring crédit. La documentation SHAP et LIME, censée démontrer la conformité, révèle au contraire des lacunes méthodologiques que les auditeurs identifient systématiquement.
L'ACPR travaille sur la question de l'explicabilité algorithmique depuis plusieurs années. En mars 2019, après un premier rapport et une première consultation publique, l'ACPR a lancé des travaux exploratoires avec quelques acteurs du secteur financier afin d'éclairer les enjeux d'explicabilité et de gouvernance de l'IA, couvrant notamment la lutte contre le blanchiment, les modèles internes et en particulier le scoring de crédit, ainsi que la protection de la clientèle. Ces travaux ont débouché en juin 2020 sur un document de référence désormais bien connu des équipes risques.
Ce document énonce quatre critères d'évaluation interdépendants pour tout algorithme d'IA utilisé dans la finance : une gestion des données appropriée, la performance, la stabilité dans le temps et l'explicabilité, c'est-à-dire la disponibilité d'explications valides. Il associe ces critères à des attentes de gouvernance portant sur l'interaction humain/algorithme, la validation initiale et continue, et un audit mené sur des bases à la fois analytiques et empiriques. C'est précisément ce dernier point, l'audit, qui pose problème en pratique : les banques ont intégré l'obligation de produire des explications SHAP ou LIME, mais peinent à documenter leur robustesse méthodologique.
En 2021, l'ACPR est allée plus loin en organisant un exercice grandeur nature. Le premier Tech Sprint, ou hackathon réglementaire, organisé par l'ACPR s'est déroulé en juin et juillet 2021 et portait sur l'explicabilité de l'intelligence artificielle, le défi consistant à expliquer le comportement de modèles prédictifs de risque de crédit basés sur de l'IA et uniquement accessibles en boîte noire. L'objectif affiché était de communiquer, à partir d'un cas d'usage, sur les méthodes et niveaux d'explicabilité qu'il est possible de fournir tant pour un public d'auditeurs que pour des experts métiers ou la clientèle. Cette distinction entre trois publics — auditeurs, experts métiers, clientèle — est précisément ce que la majorité des dossiers d'audit ne parviennent pas à structurer aujourd'hui.
La première erreur, la plus fréquente, consiste à livrer aux auditeurs un rapport SHAP brut — des graphiques en cascade (waterfall plots) ou des summary plots — sans traduction en langage métier. Un auditeur ACPR ne cherche pas une liste de coefficients : il cherche à comprendre pourquoi un client s'est vu refuser un crédit, en des termes compréhensibles par un chargé de clientèle. Or SHAP présente une limite structurelle sur ce point. SHAP explique la différence entre une prédiction et la prédiction moyenne globale, tandis que LIME explique la différence entre une prédiction et une prédiction moyenne locale. Ces deux logiques ne racontent pas la même histoire, et les équipes qui les mélangent sans le signaler produisent des explications contradictoires d'un dossier à l'autre.
De nombreuses équipes présentent SHAP et LIME comme deux méthodes interchangeables, alors que leur robustesse diffère fortement. SHAP est la seule méthode d'interprétabilité, à ce jour, avec un fondement mathématique : la différence entre la prédiction et la prédiction moyenne est distribuée de manière juste entre les différentes variables utilisées par le modèle, grâce à la propriété d'efficacité de la valeur de Shapley, ce qui n'est pas le cas de LIME, qui repose sur un principe qui semble cohérent mais n'a pas de justification mathématique. Un dossier d'audit qui s'appuie principalement sur LIME sans en mentionner cette limite, ou qui n'explique pas pourquoi ce choix a été privilégié pour tel cas d'usage, s'expose à un rejet immédiat. C'est un point sur lequel un accompagnement méthodologique dédié — voir notre offre de conseil en gouvernance des modèles — permet d'anticiper la demande de justification avant même le passage de l'auditeur.
Un algorithme de scoring évolue : réentraînement périodique, dérive des données, mise à jour des variables. Beaucoup de banques produisent une documentation SHAP figée à un instant T, sans preuve que les explications restent cohérentes après réentraînement. Cela contredit directement le troisième critère ACPR — la stabilité — qui est indissociable de l'explicabilité dans la logique du superviseur. Un audit qui ne trouve qu'un rapport ponctuel, sans suivi dans le temps des valeurs de Shapley moyennes par variable, considère l'exigence de gouvernance continue comme non satisfaite.
L'erreur la plus coûteuse, car la plus structurelle, consiste à confier la production des rapports SHAP/LIME à la seule équipe data science, sans articulation avec la fonction risques ou la conformité. Or l'ACPR attend une chaîne complète. L'ACPR elle-même a besoin de développer une méthodologie ad-hoc pour l'audit des systèmes d'IA, et son Pôle Fintech-Innovation a lancé un programme de travail sur l'audit des algorithmes qui prolonge les travaux menés au cours des années précédentes. Cela signifie que le superviseur affine constamment sa grille de lecture ; les banques qui n'ont pas de procédure formalisée reliant data science, risques et conformité se retrouvent incapables de répondre aux questions transverses posées lors de l'audit — par exemple sur la traçabilité d'une décision individuelle contestée par un client.
La documentation d'explicabilité est souvent dissociée, à tort, de l'analyse des biais. Un point d'attention en matière d'équité algorithmique concerne l'étude des biais, notamment à caractère discriminatoire, qui constitue un domaine de recherche actuellement très actif. Les travaux exploratoires de l'ACPR ont montré que seuls quelques acteurs du secteur financier avaient commencé à aborder la question de la détection et de la remédiation des biais de modèles. Un rapport SHAP qui montre qu'une variable proxy — code postal, type de contrat de travail — pèse fortement sur le score, sans qu'un test de biais ait été mené sur cette variable, attire immédiatement l'attention des auditeurs.
Ce que beaucoup d'établissements ont sous-estimé, c'est que l'explicabilité imposée par l'ACPR va désormais se doubler d'obligations légales issues du règlement européen sur l'IA. Le scoring de crédit est un système d'IA à haut risque au sens du point 5 b) de l'annexe III du règlement, qui vise les systèmes destinés à évaluer la solvabilité des personnes physiques ou à établir leur note de crédit, à l'exception de ceux qui servent à détecter des fraudes financières.
Le calendrier a toutefois été ajusté récemment. Le Digital Omnibus, entré en vigueur le 27 juillet 2026, reporte l'entrée en application des obligations pesant sur les systèmes d'IA à haut risque au 2 décembre 2027 pour les systèmes autonomes de l'annexe III, tandis que la date d'application générale du règlement reste fixée au 2 août 2026, notamment pour les obligations de transparence de l'article 50. Concrètement, les banques disposent d'un délai supplémentaire pour finaliser leur documentation technique complète, mais pas pour l'obligation de littératie en IA ni pour les obligations de transparence déjà en vigueur.
Le contenu des obligations, lui, reste inchangé et directement lié à la qualité de la documentation d'explicabilité. Il inclut notamment un système de gestion des risques, une gouvernance des données et des tests de biais, une documentation technique complète, un enregistrement automatique des logs, des exigences de transparence, une supervision humaine effective et des garanties d'exactitude et de robustesse. Le risque financier associé à un manquement n'est pas négligeable : certains manquements aux obligations de l'AI Act peuvent être sanctionnés jusqu'à 15 millions d'euros ou 3 % du chiffre d'affaires annuel mondial, le montant le plus élevé étant retenu.
Les rares dossiers qui passent l'audit sans remarque majeure partagent des caractéristiques identifiables. D'abord, ils distinguent clairement trois niveaux de restitution de l'explication, à l'image de ce que l'ACPR avait elle-même expérimenté lors de son Tech Sprint : un niveau auditeur technique, détaillant la méthodologie SHAP ou LIME retenue et ses limites connues ; un niveau expert métier, traduisant les variables influentes en critères de décision compréhensibles ; un niveau client, formulant l'explication individuelle de manière actionnable — par exemple en indiquant quel levier permettrait d'améliorer un score futur.
Ensuite, ces dossiers documentent explicitement pourquoi une méthode a été choisie plutôt qu'une autre pour un cas d'usage donné, plutôt que d'appliquer SHAP ou LIME par défaut sans justification. Enfin, ils intègrent un historique de suivi de la stabilité des explications dans le temps, corrélé aux cycles de réentraînement du modèle — ce qui répond directement au critère de stabilité de l'ACPR.
Ce niveau d'exigence dépasse largement la compétence d'une seule équipe data science. Il suppose une coordination entre modélisation, risques, conformité et juridique, formalisée en amont de tout contrôle. C'est un chantier de gouvernance à part entière, que nous accompagnons dans le cadre de nos missions de conseil en IA appliquée à la finance, et qui doit être engagé bien avant la date d'un audit programmé, pas dans l'urgence qui précède.
Le report du calendrier de l'AI Act ne doit pas être interprété comme un répit. Les équipes qui attendent 2027 pour structurer leur documentation d'explicabilité prennent le risque de se retrouver, comme aujourd'hui, en échec face à des critères ACPR déjà en vigueur depuis 2020. La bonne pratique consiste à traiter dès maintenant la documentation SHAP/LIME comme un livrable de gouvernance transverse, et non comme un sous-produit technique du modèle de scoring. Les établissements qui souhaitent évaluer la maturité de leur dispositif actuel avant un contrôle peuvent nous solliciter via notre page de contact pour un diagnostic ciblé.