J’aime lire. C’est pas faux.
Comment passer à coté de cette polémique qui a occupé une bonne partie de nos réseaux sociaux et du monde médiatique cette semaine en France. Ce roman dont on “pense” que son auteur ne s’est pas seulement aidé d’une “IA”, c’est à dire d’un LLM en mode correcteur orthographique et grammatical comme dans votre Word -à mince maintenant y’a Copilot…-, pour rédiger son œuvre. Mais, qu’il a fait bien plus en déléguant la génération du texte de son roman quasi entièrement à cette “IA”. En réalité, cette polémique, il fallait bien qu’elle arrive. Et je suis étonné qu’elle arrive si tardivement, 4 ans après l’explosion de ChatGPT.
Je n’ai pas lu ce roman. Je n’ai aucun avis sur la qualité littéraire ou l’originalité de cet ouvrage. Je ne connais pas cet auteur, ni son travail. Je ne lis quasiment aucun auteur contemporain, à part Bret Easton Ellis et Virginie Despentes -ce qui limite fortement le nombre de romans que je lis chaque année-. Je ne me place pas sur le coté éthique ou moral dans cette histoire. Ni non plus, sur les impacts que cela doit et va avoir pour les secteurs et les professions de l’édition. Ce n’est pas mon objet ici.
Ce que je connais en revanche, c’est l’outil que l’on brandit comme enquêteur et juge pour affirmer avec toute la force que les réseaux sociaux nous permet, et de manière péremptoire -ou perpendiculaire, ça dépend, ça marche aussi- que forcément le texte de ce roman a été généré par ChatGPT ou un des ses petits camarades.
J’utilise Pangram, comme d’autres classifieurs, depuis sa disponibilité. J’ai écrit plusieurs fois ici et ailleurs sur l’état de la classification textuelle entre humain et IA. Ou si vous préférez, entre le Bio et l’Industriel dans la production de textes. Le dernière fois ici sur IA-Pulse, c’était il y a 1 an quasi jour pour jour avec “Détecter les textes générés par l’IA : promesses, limites et contournements”. J’y parlais déjà de Pangram comme étant le classifieur le plus performant. Et vous savez quoi ? Il est toujours le plus performant. Il a taux de faux positifs et de faux négatifs les plus bas du marché.
Substack, le service qui héberge la newsletter que vous lisez en moment, l’utilise aussi, et vous pouvez voir l’évaluation de Pangram de chacune des éditions que je poste. Comme, c’est le principe d’IA-Pulse depuis son lancement de mêler productions humaines et LLM, je documente à chaque parution, où, comment et de quel(s) modèle(s) je me suis servi(s). Je porte donc peu d’attention à l’intégration de cette fonctionnalité dans Substack. Tout est déjà écrit en toutes lettres et totalement revendiqué, dans un paragraphe juste après cet édito. Quoi qu’il en soi, si vous avez besoin de classifier des textes à l’échelle, le seul qui vaut le prix de son abonnement, c’est Pangram. Sans aucun doute. Et pourtant…
Pourtant passer d’un résultat de classification, ou de détection, à l’affirmation “cet auteur n’a pas écrit son roman” ou “ce journaliste n’a pas écrit son article” demande des preuves supplémentaires. Est-ce qu’une partie des enquêteurs/juges se sont intéressés à la manière dont cet outil, Pangram, fonctionne ? Comment il est entrainé pour classifier des textes ? Pourquoi il donne de meilleurs résultats que les autres outils ? Et surtout ce que signifie le taux de faux positifs ou de faux négatifs qui sont brandis comme un totem pour appuyer la mise en examen médiatique d’un auteur ?
Ces taux ne valent que pour les textes, les règles de classement et la version du détecteur testés. Certes, ils sont calculés à partir d’un gros échantillon de textes. Mais si un gros échantillon réduit l’incertitude statistique, il ne réduit pas les biais de sélection… Que savons-nous de la sélection des textes du corpus qui entrainement le modèle de Pangram ? Ah oui, parce que Pangram, c’est un modèle. C’est une IA…
Mais le piège d’interprétation le plus important reste la confusion entre taux d’erreur, positif ou négatif, et certitude individuelle qu’un texte est humain ou ne l’est pas. Pangram se trompe rarement dans les conditions de son évaluation, c’est à dire sur le corpus des textes sur lesquels il est entrainé, ce qui permet d’espérer et de projeter des performances similaires sur des textes comparables qu’on lui soumet par le suite. Mais on ne peut pas dire que Pangram se trompe aussi rarement que les taux d’erreurs nous le laissent croire, sur n’importe quel nouveau texte qui lui est soumis. Par principe, c’est un nouveau texte que le modèle n’a pas encore classifié. Il y a de fortes chances pour que l’outil classe de manière efficace ce nouveau texte. Mais ce n’est pas une certitude.
Et je vous fait grâce de toutes les autres petites subtilités comme la différences de taux entre les langues et même, entre les niveaux de langage des textes testés. Ou encore de l’impact sur ces taux de l’utilisation des “correcteurs orthographiques/grammaticaux/stylistiques” employant des technos LLM ou proches, que sont devenus Antidote ou le correcteur de Word. Ces différences ont un effet qui est loin d’être anecdotique.
En réalité dans cette histoire, il faut d’autres éléments que simplement un résultat fourni par Pangram pour en conclure quoi que ce soit. Un faible taux de faux positifs ne donne pas directement la probabilité qu’une accusation particulière soit juste. Il faudrait, par exemple et notamment ici, établir que le test fait par l’outil de classification représente correctement les romans français dans leur ensemble, mais aussi intègre dans son entrainement un représentation effective de romans de la même catégorie stylistique et publiés dans un moment historiquement proche.
Ici, comme dans d’autres domaines bousculés par les technos non-déterministes comme la mesure GEO par exemple, nous nous retrouvons avec des outils qui nous donnent des probabilités dans un environnement défini à l’avance. La question que nous pose l’utilisation à grande échelle de ces outils est : pouvons-nous les utiliser dans des cadres plus larges en faisant de leurs résultats des généralités, et de ces généralités en faire des preuves ? Lorsque les accusations s’étendent à d’autres textes, accusations diffusées à grand renfort de tweet ou de publications Linkedin avec seulement les résultats spectaculaires comme baseline, sans savoir combien de textes ont été testés ni comment ils ont été sélectionnés, l’interprétation devient des plus fragiles. Mais certes, ça fait cliquer, scroller et swiper.
Tout cela ne permet pas de déclarer l’accusation fausse dans ce cas précis. Je n’en sais rien. Cela interdit de présenter cette accusation comme démontrée par le seul score de Pangram. Pangram fourni un indice. A nous de l’utiliser correctement.
Bienvenue sur IA-Pulse Weekend. Cette édition porte le numéro 181. En vous abonnant, vous recevez tous les samedis matin, l’essentiel de ce qu’il s’est passé cette semaine autour de l’IA : un coup de gueule édito, une sélection de 3 actualités avec pour chacune un résumé rapide à lire, une liste supplémentaires d’actualités et d’études académiques, et 1 article de fond pour ouvrir l’esprit. Gérez votre abonnement.
⏱️Temps de lecture de cette newsletter par une unité carbone : 10 mins
Cette semaine la partie de cette newsletter gérée par l’IA, les 3 clusters d’articles, a été générée par GPT-6-Luna pour les résumés des sources, ainsi que la génération des clusters et des titres. Comme d’habitude j’ai fait quelques modifications, mais j’ai aussi laissé quelques tournures typiques des modèles de langage. Et bien entendu, mes commentaires éventuels sont en italique dans ces résumés. Le texte de “l’article qui fait réfléchir” est issu de GPT-6-Luna. L’image d’illustration ci-dessous a été générée par Midjourney
📰 Les 3 infos de la semaine
💸 OpenAI et Anthropic font chuter les prix : l’intelligence coûte moins cher. Vous allez donc en consommer beaucoup plus
Le 22 septembre, OpenAI et Anthropic ont presque simultanément présenté des modèles beaucoup moins chers que leurs prédécesseurs.
OpenAI a lancé GPT-6 Sol et GPT-6 Luna, deux déclinaisons de la technologie développée pour Astra. Sol coûte désormais 2 dollars par million de tokens en entrée et 10 dollars en sortie, soit deux fois moins que GPT-5.6 Sol. Luna tombe à 10 centimes en entrée et 50 centimes en sortie. OpenAI affirme que Sol rivalise sur plusieurs évaluations de travail professionnel, de code et de Computer Use avec des modèles beaucoup plus coûteux.
La baisse ne concerne d’ailleurs pas seulement le prix affiché du token. OpenAI a revu son système de cache pour les agents qui réutilisent sans cesse les mêmes instructions, outils et contextes. Les lectures de contexte déjà calculé peuvent bénéficier d’une réduction allant jusqu’à 90 %. GitHub affirme avoir ainsi réduit de plus de moitié la part des tokens nécessitant un nouveau traitement dans Copilot.
Le même jour, Anthropic a présenté Claude Opus 5.5. L’entreprise affirme qu’il atteint globalement le niveau de Fable 5.1 tout en coûtant 40 % de moins à exploiter qu’Opus 5 sur des charges typiques. Le million de tokens passe à 4 dollars en entrée et 20 en sortie, et surtout les lectures depuis le cache chutent de 50 à 20 centimes.
Pourquoi est-ce important ? Il y a encore quelques mois, le modèle frontier était le gros modèle très cher qu’on réservait aux tâches exceptionnelles. Bonne nouvelle : l’intelligence coûte moins cher depuis… ben comme toutes les 5 semaines ça baisse en fait. Mais mauvaise nouvelle quaand même pour votre DAF ou votre banquier : cela permet surtout d’en consommer beaucoup, beaucoup, beaucoup plus. Comme à chaque baisse. Comme toutes les 5 semaines. Miam !
Pour aller plus loin : OpenAI : Prompt caching, Anthropic : Claude Opus 5.5, Reuters, TechCrunch
🕶️ Muse veut sortir du smartphone. Amazon lui ferme déjà une porte
Deux semaines après son lancement, Muse commence à ressembler à autre chose qu’un nouvel assistant IA de Meta. Selon les estimations d’Apptopia, son application a été davantage téléchargée aux États-Unis et au Canada pendant ses douze premiers jours que l’application mobile ChatGPT pendant la même période après son lancement. Reuters évoque environ 2,8 millions de téléchargements en douze jours et une réaction spectaculaire des investisseurs.
Meta profite de sa conférence Connect pour faire sortir Muse de l’application mobile. L’agent doit d’abord arriver sur Mac, où il pourra utiliser directement certaines applications de l’ordinateur. Meta lui donne aussi davantage de moyens pour agir en ligne : une adresse email propre et des connexions à des services comme Notion, GitHub, Box ou Granola.
L’entreprise veut ensuite rendre Muse accessible depuis d’autres appareils. L’agent sera intégré aux lunettes connectées de Meta. Zuckerberg a également présenté Muse Charm, un petit appareil 5G dédié à Muse, qui permettrait de parler à l’agent et de lui confier des tâches sans passer par un smartphone.
Pour faire des achats, Meta a aussi branché Muse sur Link de Stripe : chez plus d’un million de commerçants compatibles, l’agent peut payer après validation de l’utilisateur ; ailleurs, Link peut lui fournir une carte virtuelle à usage unique limitée à la transaction approuvée.
Mais le monde extérieur n’appartient pas à Meta. Amazon vient de bloquer Muse, considérant son accès comme celui d’un agent non autorisé contraire à ses conditions d’utilisation. L’utilisateur peut demander à son agent d’acheter quelque chose. Cela ne signifie pas que le site en face accepte de laisser cet agent entrer.
Pourquoi est-ce important ? Comme je l’ai déjà écrit ici, Meta comme Google ont l’avantage d’être déjà présents partout. Pas besoin d’avoir le meilleur modèle, mais un bon produit pour l’utlisateur avec un modèle au niveau suffit. Et les seuls obstacles qu’ils peuvent rencontrer, ce sont des acteurs de leur taille. Amazon est un de ceux là.
Pour aller plus loin : Meta Connect 2026, TechCrunch, Reuters, The Verge, Stripe
🧑💼 Microsoft transforme Copilot en bureau où travaillent aussi des agents
Microsoft vient de réorganiser Copilot autour de trois espaces : Home, Code et Autopilot.
Home réunit Chat et Cowork. Chat reste destiné aux demandes immédiates ; Cowork prend en charge des missions plus longues. Word, Excel et PowerPoint arrivent directement dans Copilot : un document produit ou modifié dans l’interface reste synchronisé avec l’application Office correspondante. Code reprend quant à lui la technologie de GitHub Copilot pour permettre de fabriquer en langage naturel des applications internes, tableaux de bord, widgets ou automatisations, exécutés dans un environnement contrôlé par l’entreprise.
Et puis il y a Autopilot. Vous vous souvenez peut-être de Scout, l’assistant Microsoft qui « ne dormait jamais ». Il a changé de nom et gagné quelques ambitions. L’utilisateur lui attribue un rôle, un objectif et une identité. L’agent dispose de sa propre mémoire, de son ordinateur et de son espace de travail dans le cloud -harnais et computer use, les deux mamelles de l’IA 2026-. Il peut surveiller des canaux, reprendre un projet plusieurs jours plus tard ou effectuer du travail récurrent sans attendre une nouvelle instruction. Il peut apparaître dans Teams, Outlook, les documents et les conversations, selon les permissions accordées par l’entreprise. Home et Code vont commencer leur déploiement dans le programme Frontier ; Autopilot doit entrer en private preview à la fin du mois.
Petit détail économique : l’utilisation ordinaire de Chat et des applications Microsoft 365 reste comprise dans la licence utilisateur, tandis que Cowork, Code, Autopilot et les modèles frontier passent par une facturation à l’usage.
Pourquoi est-ce important ? “OS for work”, c’est nouveau slogan pour Copilot. L’idée n’est plus du tout, promis-juré, de mettre un chatbot dans Word ou Excel. C’est de mettre Word, Excel, Teams, Outlook, les données de l’entreprise, des applications fabriquées à la demande et des agents persistants dans Copilot. Peut-être aussi bientôt chez vous, dans votre PC perso. Et comme les copains, en plus de l’abonnement, on passe à la facturation à la conso pour les usages les plus sympas. La Valley est la reine pour tarifer.
Pour aller plus loin : Microsoft, TestingCatalog
🚀 🛠️💵 Les autres actus de la semaine
OpenAI révèle que ses agents ont accédé à des sites gouvernementaux américains
Anthropic facture désormais certains prompts refusés avant toute réponse
OpenAI propose des standards internationaux spécifiques à l’auto-amélioration récursive des IA - Recursive self-improvement (RSI)
La cour d’appel de Washington valide la désignation d’Anthropic comme risque pour la chaîne d’approvisionnement du Pentagone
Perplexity remplace son moteur de retrieval par Photon et annonce 68 % de coût en moins pour la recherche agentique
Google lance Gemini 3.8 Flash TTS et Flash-Lite TTS et Gemini 3.8 Live with Live Avatar
Xiaomi publie MiMo-V2.6-Pro : 1 020 milliards de paramètres
SpaceXAI lance Grok 4.7, plus performant sur les tâches agentiques longues
Alibaba publie Qwen-Image-2.1, un modèle d’image de 7 milliards de paramètres capable de générer directement de la transparence RGBA
🔬 🔭 🧪Les études de la semaine
Adapter l’argumentaire d’un chatbot aux valeurs politiques de l’utilisateur augmente à la fois son adhésion… et sa disposition à payer
Le rôle assigné à l’agent peut modifier son traitement des contenus sponsorisés
🚨🚨🚨Sur 258 expériences de sciences cognitives, les meilleurs LLM restent très loin de la cohérence observée entre humains
La productivité d’une IA se mesure aussi au travail qu’elle laisse à l’utilisateur
Pour prédire le comportement réel d’une audience, dix personas synthétiques font nettement moins bien qu’un simple LLM sans persona
Un agent personnel peut inférer que son utilisateur est riche… puis choisir une option plus chère même lorsqu’on lui demande explicitement la moins chère
🧠 L’article qui fait réfléchir - et qu’il faut absolument lire
We All Hated Busy Work. Now That It’s Disappearing, It Turns Out We Miss It.
“Tant qu’on n’exerce pas le pouvoir on n’a pas idée des concessions qu’il exige.”
Pendant des années, nous avons rêvé de supprimer le travail idiot : les tableaux à remplir, les contrats à reprendre, les lignes de code répétitives, les présentations à corriger pour la quatrième fois.
Et l’IA arrive. Elle le fait. Bonne nouvelle !
Sauf que nous découvrons maintenant que certaines de ces tâches apparemment inutiles avaient une fonction que personne n’avait vraiment mise dans le tableau Excel du ROI : elles apprenaient aux débutants à devenir bons.
Un jeune avocat ne relisait pas son cinquantième contrat uniquement parce qu’un associé avait mieux à faire. Il apprenait progressivement à voir ce qui cloche. Même chose pour le développeur qui corrige ses bugs, l’analyste qui prépare ses tableaux ou le comptable qui traite encore et encore les mêmes dossiers.
Ce travail était répétitif. Mais la répétition produisait quelque chose : de l’expérience.
Alors certaines entreprises commencent à résoudre le problème créé par l’automatisation avec… de faux problèmes. Des simulations, des jeux de rôle, des clients virtuels, des exercices fabriqués pour permettre aux juniors de pratiquer ce que l’IA fait désormais à leur place.
Nous automatisons donc le vrai travail pour gagner du temps, puis nous recréons artificiellement ce travail afin que les humains puissent apprendre à le faire.
C’est assez beau.
Le problème devient encore plus étrange lorsque le junior doit contrôler une production de l’IA qu’il n’aurait lui-même jamais appris à produire. On lui demande d’exercer du jugement avant de lui avoir laissé le temps d’en construire un.
Peut-être que toutes les tâches ingrates ne méritaient pas d’être sauvées. Mais toutes ne méritaient peut-être pas non plus de disparaître.
N’hésitez à me contacter si vous avez des remarques et suggestions sur cette newsletter, ou si dans votre entreprise vous cherchez à être accompagnés dans l’intégration d’outils IA et d’IA générative : olivier@255hex.ai
Partagez cette newsletter
Et si vous n’êtes pas abonné, il ne tient qu’à vous de le faire !
“Les gens ont peur de se retrouver sur les autoroutes de Los Angeles. C’est la première chose que j’entends quand je reviens en ville. Blair vient me chercher à l’aéroport de L.A. et marmonne ça pendant que sa voiture gravit la rampe d’accès. Elle dit: “Les gens ont peur de se retrouver sur les autoroutes de Los Angeles.” Cette phrase ne devrait pas m’ennuyer, mais elle s’incruste désagréablement dans mon esprit.” Bret Easton Ellis
















































