Une IA « sûre », ça se vérifie comment ? Lire les promesses d’un fournisseur sans naïveté
Politiques de sécurité, rapports de risque, évaluateurs externes : les éditeurs d’IA multiplient les engagements. Ce qui est vérifiable, ce qui reste déclaratif, et ce que vous contrôlez vraiment.
Vous installez un assistant, une fenêtre s’ouvre, un bouton « J’accepte » attend. Quelque part derrière ce bouton, il y a des conditions d’utilisation, une politique de confidentialité et, de plus en plus souvent, une page entière consacrée à la « sécurité de l’IA ». Presque personne ne les lit. Et pourtant, c’est là que l’éditeur écrit noir sur blanc ce qu’il s’engage à faire, et surtout ce à quoi il ne s’engage pas.
Ce texte ne cherche pas à dire quelle IA est « sûre ». Il propose une méthode pour lire ces promesses comme on lit une fiche technique : en séparant ce qu’on peut vérifier de ce qu’il faut croire sur parole.
D’abord, une mise au point
L’Établi est préparé avec Claude, l’assistant d’Anthropic. Et c’est justement Anthropic qui sert d’exemple dans la suite. Autant le poser franchement, plutôt que de le glisser dans une note.
Je me sers de Claude pour le code, de Gemini et de ChatGPT pour les illustrations, de Gemini en voiture et pour la domotique. Aucun de ces outils ne touche à mes comptes bancaires ni à des données trop sensibles : c’est ma ligne de conduite, pas une recommandation officielle. Utiliser un outil ne m’oblige pas à croire son fabricant sur parole. C’est même une raison de plus de lire ses promesses de près, avec le même œil que pour un autre.
Anthropic se prête bien à l’exercice pour une raison simple : l’entreprise publie beaucoup. Une politique de sécurité versionnée, des rapports de risque, des annonces de partenariats d’évaluation. Plus il y a de texte, plus on peut confronter les engagements aux actes. Ce n’est pas un gage de vertu, c’est un matériau de travail.
Deux sortes de promesses qui n’ont rien à voir
Quand un éditeur d’IA parle de « sécurité », il mélange souvent deux sujets.
Le premier concerne vos données : ce que l’éditeur fait de vos conversations, combien de temps il les garde, s’il s’en sert pour entraîner ses modèles. Ici, la promesse a une forme concrète, un contrat et un réglage dans les paramètres. Vous pouvez la vérifier, au moins en partie.
Le second concerne le modèle lui-même : le risque qu’une IA aide à fabriquer une arme, qu’elle échappe au contrôle de ses concepteurs ou qu’elle accélère la recherche en IA plus vite qu’on ne sait la surveiller. Ces risques-là, qualifiés de « catastrophiques » dans le jargon du secteur, font l’objet de politiques écrites par l’éditeur. Elles sont publiques, mais vous n’avez aucun moyen de les contrôler depuis votre canapé.
Une analogie aide à faire la différence. Quand vous achetez une voiture, la ceinture de sécurité et les réglages du siège sont entre vos mains. La résistance de l’habitacle en cas de choc, elle, dépend d’essais que vous ne ferez jamais vous-même. Vous comptez sur le constructeur, et sur des organismes de test indépendants quand ils existent. Pour l’IA, ces organismes indépendants commencent tout juste à apparaître.
La politique de sécurité, en clair
Chez Anthropic, le document de référence s’appelle la Responsible Scaling Policy, ou RSP : littéralement, une « politique de passage à l’échelle responsable ». L’idée de départ, en 2023, tenait en une phrase. À mesure que les modèles deviennent capables, il faut des protections plus fortes, et on ne passe pas au palier suivant sans elles.
Pensez à une habilitation électrique. On ne laisse pas quelqu’un intervenir sur une armoire haute tension avec la formation prévue pour changer une ampoule. Plus le risque monte, plus les exigences montent avec lui. La RSP applique ce raisonnement aux modèles d’IA : des seuils de capacité (ce que le modèle sait faire) déclenchent des niveaux de protection (ce que l’éditeur doit avoir mis en place).
Le document est versionné, et son historique est public. Il en est à sa neuvième version depuis septembre 2023. Le journal des modifications fait partie de ce qu’on peut vérifier : chaque version est datée et décrite.1
Février 2026 : le changement de cap
La version 3.0, publiée le 24 février 2026, est une réécriture complète. Et elle retire l’engagement le plus fort des versions précédentes.
Jusque-là, Anthropic laissait entendre qu’il cesserait d’entraîner ou de publier un modèle tant que des protections adéquates ne seraient pas prêtes. La version 3 sépare désormais deux choses : ce que l’entreprise fera quoi que fassent les autres, et ce qu’elle estime nécessaire pour l’ensemble du secteur. Son argument : certaines protections exigées aux niveaux les plus élevés sont, selon ses propres termes, « very hard to meet unilaterally », très difficiles à atteindre seule.
À la place, la nouvelle version introduit deux documents :
- une feuille de route de sécurité (Frontier Safety Roadmap), avec des objectifs publics que l’entreprise note elle-même, mais que le texte présente comme non contraignants ;
- des rapports de risque (Risk Reports), publiés tous les trois à six mois, qui décrivent les capacités des modèles, les menaces envisagées et l’état de préparation, avec des passages caviardés.
L’analyse publiée en mars par GovAI, un centre de recherche sur la gouvernance de l’IA, résume bien la tension. Sur le papier, la transparence augmente : plus de documents, plus réguliers. En pratique, l’éditeur fixe ses objectifs, évalue ses progrès et décide de ce qui sera masqué. La revue indépendante des rapports n’intervient que dans des cas précis, quand le modèle est jugé très capable et que les passages masqués sont jugés importants.
La version 3.4, en vigueur depuis le 8 juillet 2026, ajuste des détails de procédure. Les rapports publics doivent désormais indiquer où du contenu a été retiré, la version complète doit être diffusée en interne à au moins 200 salariés, et plusieurs relecteurs externes peuvent se partager les sections d’un même rapport. Ce sont de petits pas, mais vérifiables : un rapport public sans marque de caviardage serait en contradiction directe avec le texte.
Une promesse qu’on peut retirer en publiant une nouvelle version reste une promesse, pas une garantie.
Des évaluateurs dans la maison
Le 18 septembre, Anthropic a annoncé un partenariat d’« évaluation intégrée » avec Accenture. Des évaluateurs extérieurs travailleront chez Anthropic avec un accès décrit comme comparable à celui d’un salarié. Leur rôle : tester les modèles, chercher leurs failles (le red teaming, ces attaques simulées menées par une équipe qui joue l’adversaire), vérifier que les engagements de sécurité sont tenus et signaler les angles morts. Les deux entreprises prévoient chacune d’investir au moins un milliard de dollars sur cinq ans dans cette activité. Le partenariat n’est pas exclusif, et d’autres évaluateurs, dont des organismes à but non lucratif, sont en discussion.
Sur le principe, c’est exactement ce qui manquait : un regard extérieur, de l’intérieur. C’est l’équivalent du commissaire aux comptes qui vient éplucher la comptabilité d’une société.
Deux questions restent pourtant ouvertes à la lecture de l’annonce. La première tient à l’indépendance : Accenture est aussi un intégrateur qui déploie de l’IA chez ses clients, donc un partenaire commercial de l’écosystème qu’il évalue. La seconde touche à la publication : le texte dit que les évaluateurs pourront rendre compte au public, sans préciser qui publie leurs rapports, ni si Anthropic garde la main sur ce qui en sort. Ces deux points se vérifieront sur pièces, quand les premiers rapports paraîtront.
Et la loi ? Réguler n’est pas surréguler
Face à des promesses qu’un éditeur peut réécrire seul, le réflexe européen est connu : légiférer. L’Union a son règlement sur l’IA, l’AI Act. Ses interdictions s’appliquent depuis février 2025, les règles visant les grands modèles « à usage général » depuis août 2025, et l’essentiel du contrôle a démarré le 2 août 2026.
Le calendrier, lui, a déjà glissé. Proposé par la Commission en novembre 2025, un texte de simplification baptisé « omnibus numérique » est entré en vigueur le 27 juillet 2026. Il repousse les obligations des systèmes dits « à haut risque » (recrutement, notation de crédit, éducation, infrastructures critiques) à décembre 2027, et à août 2028 pour l’IA intégrée dans des produits déjà réglementés, comme les jouets ou les ascenseurs. Bruxelles elle-même a donc jugé que la marche était trop haute, trop vite.
Le constat de fond avait été posé dès septembre 2024 par Mario Draghi, dans son rapport sur la compétitivité européenne. L’Union compte alors une centaine de lois consacrées au numérique et plus de 270 régulateurs actifs dans ce domaine à travers les États membres. Le rapport souligne l’effet pervers : seules les grandes entreprises, souvent non européennes, ont les moyens d’absorber le coût de la conformité. Les jeunes pousses, elles, peuvent préférer ne pas s’installer en Europe du tout. C’est un peu comme imposer le même dossier de sécurité à un atelier de trois personnes et à une usine de 5 000 salariés : l’usine embauche un service conformité, l’atelier ferme ou déménage.
Les chiffres de production vont dans le même sens. D’après l’AI Index 2026 de l’université Stanford, les États-Unis ont publié 59 modèles d’IA jugés « notables » en 2025, et la Chine 35. La course se joue entre ces deux pays, et l’Europe la regarde de loin.
Mon avis est tranché : la surrégulation n’est pas une voie idéale pour l’Europe, qui est déjà largement à la traîne. Empiler les textes ne rendra pas plus sûrs des modèles conçus ailleurs, et risque surtout de décourager ceux qui voudraient les concevoir ici.
La position a sa contrepartie, et autant la regarder en face. Moins de loi, c’est davantage de confiance accordée aux engagements volontaires, ceux-là mêmes qu’un éditeur peut réécrire dans sa prochaine version. Raison de plus pour exiger qu’ils soient datés, vérifiables et relus par des tiers, et pour garder la main sur ce qui dépend de vous : vos réglages et ce que vous confiez.
Côté entreprise, des contrats ; côté particulier, un interrupteur
L’annonce du 1er octobre avec Barclays donne une idée de ce qu’obtient une grande entreprise. Plus de 16 000 salariés de la banque utilisent un assistant interne construit sur Claude, et l’annonce insiste sur la gouvernance, les contrôles de sécurité et la supervision humaine dans tous les déploiements. Une banque négocie un contrat, impose ses exigences, audite et peut partir avec ses données.
Le particulier, lui, n’a pas de juriste. Il a un réglage.
Et c’est là que la lecture devient payante, parce que ce réglage, lui, est vérifiable. Pour moi, c’est le point qui compte le plus : pouvoir refuser la collecte de mes données est primordial. Ce qui suit montre que ce refus n’a pas la même portée partout.
Chez Anthropic
Depuis la mise à jour des conditions grand public, effective le 28 août 2025, les utilisateurs des offres Free, Pro et Max choisissent si leurs conversations servent à entraîner les modèles. Le choix change la durée de conservation : 30 jours si vous refusez, cinq ans si vous acceptez. Le réglage se modifie à tout moment dans les paramètres de confidentialité. Les offres professionnelles et l’accès par API ne sont pas concernés par ce choix : leurs conditions sont fixées par contrat.
Chez Google
Pour Gemini, le réglage s’appelle « Conserver l’activité », dans l’Activité dans les applications Gemini. Le désactiver ne fait pas tout disparaître : l’aide de Google précise que les discussions restent stockées 72 heures dans votre compte, notamment pour la sécurité, et que des réviseurs humains peuvent intervenir même dans ce cas.
Autrement dit, « refuser » ne veut pas dire « rien n’est gardé ». Ça veut dire « gardé moins longtemps, pour moins d’usages ». La nuance compte quand on parle à un assistant en voiture ou qu’on lui confie la maison.2
Pour les curieux : où sont les réglages
Les noms changent d’une mise à jour à l’autre, mais le chemin reste à peu près le même.
Claude : Paramètres, puis Confidentialité. L’option qui autorise l’utilisation de vos conversations pour améliorer les modèles s’y active ou s’y désactive.
Gemini : la page myactivity.google.com/product/gemini, puis le paramètre « Conserver l’activité ».
Les autres : cherchez dans les paramètres une rubrique « Contrôle des données » ou « Confidentialité », et une formule du type « améliorer le modèle ». Le réflexe à garder : vérifier aussi ce qui se passe quand l’option est désactivée (durée de conservation, relecture humaine), car c’est rarement « rien ».
Une grille de lecture en cinq questions
Face à n’importe quelle promesse de sécurité, quelques questions suffisent à faire le tri.
Qui vérifie ? Si la réponse est « l’éditeur lui-même », c’est une déclaration d’intention. Si c’est un tiers nommé, avec un accès décrit, c’est déjà mieux. Si ce tiers publie lui-même ses conclusions, c’est encore mieux.
Qu’est-ce qui est daté et versionné ? Une politique avec un historique public permet de voir ce qui a été ajouté ou retiré. Une page « Notre engagement pour une IA responsable » sans date ni version ne permet rien de tel.
Qu’est-ce qui est contraignant ? Le vocabulaire trahit souvent la réponse. « Nous ferons », « nous nous engageons » n’ont pas le même poids que « nous visons », « nous nous efforcerons » ou « objectifs non contraignants ».
Que se passe-t-il quand on refuse ? C’est la question à poser pour vos données. Durée de conservation, relecture humaine, exceptions : la réponse se trouve presque toujours dans l’aide en ligne, pas sur la page d’accueil.
Qu’est-ce qu’on confie, au juste ? La seule protection totalement sous votre contrôle, c’est de ne pas confier à un outil ce que vous ne voudriez pas voir sortir. Une IA qui génère une illustration n’a pas besoin de votre relevé de compte.
Ce que ça demande, honnêtement
Cette lecture prend du temps. Une politique de sécurité comme la RSP compte des dizaines de pages, et les mises à jour arrivent plusieurs fois par an. Personne ne va relire chaque version. Le compromis raisonnable consiste à lire le journal des modifications, qui tient en quelques lignes, et à chercher les analyses indépendantes quand une version change beaucoup de choses.
Il faut aussi accepter une part d’inconnu. Les risques les plus graves dont parlent ces politiques ne se vérifient pas depuis l’extérieur, et les rapports qui les décrivent sont caviardés par ceux qui les écrivent. Les évaluateurs externes réduiront cet angle mort s’ils publient librement. Ils ne le feront pas disparaître.
Enfin, les réglages ne valent que tant qu’ils restent en place. Une mise à jour des conditions peut changer la valeur par défaut ou le nom d’une option. Repasser dans les paramètres après chaque changement de conditions d’utilisation prend deux minutes et évite les surprises.
La règle à garder
S’il ne fallait retenir qu’une chose, ce serait celle-ci : utiliser l’IA avec conscience et raison. Lire ce qui est écrit, régler ce qui peut l’être, ne confier que ce qu’on accepte de perdre, et garder en tête la part qu’on ne peut pas vérifier.
Le savoir, c’est déjà savoir que l’on ne sait pas.
Notes
-
Neuf versions entre septembre 2023 et juillet 2026 : 1.0, 2.0, 2.1, 2.2, puis 3.0 à 3.4. Le journal figure sur la page de la politique. ↩
-
Les conditions qui s’appliquent dans un véhicule ou via un appareil domotique peuvent différer de celles de l’application. Elles dépendent du constructeur ou du fabricant qui intègre l’assistant. ↩
Pour aller plus loin
- Anthropic's Responsible Scaling Policy, Anthropic
- Responsible Scaling Policy, version 3, Anthropic, 24 février 2026
- Partnering with Accenture on embedded evaluation, Anthropic, 18 septembre 2026
- Barclays scales Claude to upgrade operations and improve client experience, Anthropic, 1er octobre 2026
- Updates to our consumer terms and privacy policy, Anthropic
- Activité dans les applications Gemini, Google (aide Gemini)
- Anthropic's RSP v3.0: How it Works, What's Changed, and Some Reflections, GovAI, 5 mars 2026
- Anthropic : la sécurité de l'IA à l'épreuve de l'entreprise, ActuIA, 18 septembre 2026
- Cadre réglementaire de l'IA (AI Act), Commission européenne
- The Draghi report on EU competitiveness, Commission européenne, 9 septembre 2024
- Draghi's European Competitiveness Report: Key Findings, Tech Policy Press, 9 septembre 2024
- The 2026 AI Index Report : Research and Development, Stanford HAI