5 octobre 2026

OpenAI entraîne-t-il ses modèles sur vos données ? Ce que la course à Navier-Stokes apprend à toutes les entreprises sur la confidentialité de l'IA

OpenAI a résolu Navier-Stokes avec la même méthode rare que deux mathématiciens qui utilisaient ses outils. Ce que ça change pour vos données.

  • IA et confidentialité des données
  • souveraineté numérique
  • shadow AI

En septembre, OpenAI a annoncé avoir résolu le problème de Navier-Stokes, l’un des sept problèmes du prix du millénaire, doté d’un million de dollars. Les gros titres parlaient de maths. Moi, ce qui m’obsède, c’est tout ce qui s’est passé autour. C’est l’exemple le plus parlant à ce jour d’une question que toute entreprise devrait se poser sur l’IA et la confidentialité des données : où part mon travail une fois que je l’ai tapé ?

Ce qui s’est passé

Les équations de Navier-Stokes décrivent la façon dont les fluides se déplacent : l’air sur une aile d’avion, le sang dans une artère, l’eau dans un tuyau. La question ouverte, c’est de savoir si leurs solutions peuvent soudainement cesser d’avoir un sens. Les mathématiciens butent dessus depuis environ 90 ans.

Pendant à peu près un an, Tristan Buckmaster (NYU) et Levent Alpöge (Anthropic) s’y sont attaqués avec l’IA comme partenaire de recherche. L’essentiel de ce travail est passé par Codex, l’outil d’OpenAI, avec Claude d’Anthropic en parallèle. Ils avaient choisi une voie peu commune, l’approche dite de la « force lisse », dans le prolongement des travaux de Diego Córdoba et Luis Martínez-Zoroa. Très peu de chercheurs du domaine s’y intéressaient. Le 1er septembre, d’après la déclaration d’OpenAI elle-même, l’entreprise a eu vent de rumeurs selon lesquelles des problèmes du millénaire étaient sur le point de tomber. Elle a alors lancé un essaim d’environ 10 000 agents IA pendant près de 88 heures. Les estimations du coût de calcul vont de quelques millions de dollars à 22,5 millions, selon qui fait le calcul. Les agents d’OpenAI ont trouvé une solution. Par la même voie.

OpenAI a reconnu à Buckmaster et Alpöge la paternité d’un résultat voisin (sur les équations d’Euler en 3D) et a revendiqué pour elle le résultat sur Navier-Stokes.

Buckmaster a posé une question directe à OpenAI : ses modèles avaient-ils été entraînés sur ses sessions Codex, ou y avaient-ils eu accès ? OpenAI a répondu qu’elle n’avait pas vu leurs travaux avant leur publication et qu’elle n’avait pas utilisé leurs prompts pour orienter ses agents. Elle a aussi indiqué qu’elle ne pouvait pas exclure que des données anonymisées issues de leur utilisation aient contribué à améliorer ses modèles.

La phrase qui compte

« Ne peut pas exclure », ce n’est ni un aveu ni un démenti. C’est une description honnête de la façon dont fonctionne l’IA dans le cloud.

Sur beaucoup d’offres, les fournisseurs d’IA se réservent le droit d’entraîner leurs modèles sur vos conversations, sauf si vous vous y opposez. Une fois que ces données entrent dans un pipeline d’entraînement, elles sont anonymisées, mélangées à des millions d’autres conversations, puis transformées en poids de modèle. À partir de là, plus personne ne peut en retrouver la trace. Ni le fournisseur, ni vous. Un modèle ne garde pas de reçus.

Soyons clairs : je ne dis pas qu’OpenAI a volé quoi que ce soit. Rien ne permet de l’affirmer. Ce que je dis est plus dérangeant : il est impossible d’apporter une preuve, dans un sens comme dans l’autre. Peut-être que rien n’a fuité. Peut-être que tout a fuité. Avec l’IA cloud, vous ne pouvez pas faire la différence.

Ce n’est pas un problème de maths. C’est le vôtre.

Remplacez les mathématiciens par votre entreprise.

  • Un cabinet d’expertise comptable qui fait passer les comptes de ses clients dans un chatbot pour boucler la clôture plus vite.
  • Un cabinet d’avocats qui prépare sa stratégie contentieuse.
  • Un industriel qui affine son modèle de prix.
  • Une startup qui fait évoluer sa feuille de route R&D.

Votre concurrent utilise le même modèle que vous. Chaque conversation qui améliore ce modèle l’améliore pour tout le monde, lui compris. Pas besoin d’une fuite spectaculaire pour que ça vous coûte. Ce que vous avez mis des années à comprendre peut, sans bruit, devenir un savoir commun.

Et ce n’est pas l’histoire d’une seule entreprise peu scrupuleuse. La même question se pose pour n’importe quel fournisseur d’IA cloud, y compris celui pour lequel travaille Alpöge. Le problème, c’est l’architecture, pas l’éthique de tel ou tel acteur. Quand vos données sont hébergées chez quelqu’un d’autre, soumises à ses règles et à sa juridiction, sa promesse est la seule chose qui vous protège.

On en a déjà vu les prémices. En 2023, Samsung a restreint l’usage des outils d’IA générative après que des ingénieurs ont collé du code source interne dans ChatGPT. Rien ne prouve que ce code ait été détourné. L’entreprise ne pouvait quand même pas prendre le risque.

Pourquoi « on a désactivé l’entraînement » n’est pas une stratégie

La plupart des dirigeants que je rencontre me disent : « Pas de souci, on a désactivé l’entraînement. » Voici pourquoi c’est plus fragile qu’il n’y paraît.

  • Les réglages par défaut changent. Les conditions d’utilisation sont mises à jour. Les paramètres varient selon l’offre, le produit et la région.
  • Le shadow AI, c’est bien réel. Votre compte entreprise officiel est peut-être verrouillé, mais la moitié de votre équipe utilise un compte perso sur son téléphone.
  • Conserver n’est pas entraîner. Même avec l’entraînement désactivé, les fournisseurs gardent souvent des logs, pour détecter les abus ou pour des raisons légales.
  • La juridiction suit le fournisseur. Une entreprise américaine peut être contrainte par les autorités américaines de transmettre des données, même stockées en Europe (c’est le CLOUD Act). Pour une entreprise européenne, ça devient une question de souveraineté numérique, pas seulement de confidentialité.

Une politique de confidentialité, c’est une promesse. Une architecture, c’est une garantie.

Ce que l’IA on-premise change concrètement

C’est pour ça que j’ai créé Sceptra.

Sceptra déploie des agents IA au sein de votre propre infrastructure. Les modèles tournent chez vous. Vos prompts, vos documents et les réponses générées ne quittent jamais votre réseau. Personne ne s’entraîne sur votre travail, à part vous.

Ça change trois choses :

  1. La juridiction. Vos données relèvent de votre droit, pas de celui d’un fournisseur étranger.
  2. La chaîne de confiance. Vous connaissez chaque système par lequel passent vos données, puisqu’ils vous appartiennent tous.
  3. La responsabilité. Le déploiement est auditable. Si quelque chose tourne mal, vous pouvez savoir ce qui s’est passé. C’est justement ce que les mathématiciens n’ont jamais pu faire.

L’on-premise n’est pas fait pour tout. Si vous rédigez un article de blog public, prenez l’outil que vous voulez. Mais le travail sensible doit tourner sur une infrastructure souveraine. Dossiers clients, données financières, stratégie, recherche non publiée : rien de tout ça ne devrait dépendre d’un « nous ne pouvons pas exclure » de votre fournisseur.

5 questions à poser à votre fournisseur d’IA cette semaine

  1. Mes données servent-elles à l’entraînement par défaut, sur toutes les offres qu’utilise mon équipe ?
  2. Combien de temps conservez-vous mes prompts et vos réponses, même avec l’entraînement désactivé ?
  3. Où mes données sont-elles traitées, et sous le droit de quel pays ?
  4. Qui peut légalement vous obliger à les transmettre ?
  5. Si mes données avaient amélioré votre modèle, seriez-vous capable de me le dire ?

Si la réponse à la dernière question est « non », vous avez déjà votre réponse.

Ce qu’il faut retenir

Buckmaster et Alpöge ne sauront peut-être jamais si leur travail a aidé leur concurrent à gagner. Tout est là, dans cette incertitude. Votre entreprise, elle, n’est pas obligée de vivre avec.

Votre contexte. Vos modèles. Vos valeurs.

Sources : TechCrunch (8 sept. 2026), Fortune (8 sept. 2026), OpenAI, « On the Navier-Stokes Millennium Prize Problem » (8 sept. 2026), Quanta Magazine (8 sept. 2026), NPR (22 sept. 2026), CNBC (9 sept. 2026).