Vue normale

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.
À partir d’avant-hierinformatique général
  • ✇Korben
  • Coder avec l'IA sans pomper le projet d'un autre ?
    Dark Hours est à l'origine une petite web app qui vous dit ce qu'il y a à voir dans le ciel ce soir et si ça vaut le coup de mettre le museau dehors. Le développeur Terry Godier l'a construite avec l'aide de Claude et lancée début août mais au moment où j'écris ces lignes, elle n'existe plus... En effet, son site darkhours.io redirige maintenant vers DarkHours.app , un autre projet signé Miguel Beher et sous licence MIT. C'est ce dernier qui a vu le problème, et je vais vous expli

Coder avec l'IA sans pomper le projet d'un autre ?

Par : Korben ✨
11 août 2026 à 09:29

Dark Hours est à l'origine une petite web app qui vous dit ce qu'il y a à voir dans le ciel ce soir et si ça vaut le coup de mettre le museau dehors. Le développeur Terry Godier l'a construite avec l'aide de Claude et lancée début août mais au moment où j'écris ces lignes, elle n'existe plus... En effet, son site darkhours.io redirige maintenant vers DarkHours.app , un autre projet signé Miguel Beher et sous licence MIT.

C'est ce dernier qui a vu le problème, et je vais vous expliquer...

En fait, les 2 apps avaient non seulement le même nom, mais également les mêmes fonctions, et le même nom de domaine (à part le TLD). Quand Beher a signalé le souci à Godier , ce dernier a d'abord proposé de changer de nom et de différencier les fonctionnalités mais une heure plus tard il retirait tout, annulait l'app iOS qu'il préparait, et publiait un mea culpa où il parle de son "usage irresponsable de l'IA".

Et ce qui l'a décidé à tout stopper comme ça, c'est juste un bug. En effet, son application envoyait les gens observer les étoiles au milieu de champs perdus au Mexique, ou dans l'océan Pacifique et Beher avait exactement le même souci de son côté à ce moment-là (il l'a résolu depuis).

Alors se ressembler sur des fonctionnalités, ça arrive et ça ne me choque pas mais se ressembler jusque dans les bugs, là ça pique un peu beaucoup. Les procès en pompage IA, j'en ai déjà parlé , et ils se trompent souvent de coupable, et dans le cas de Godier, celui-ci n'a pas pompé le code du Dark Hours original. Non, il a juste développé son app avec Claude Code, sans se poser trop de question.

Pour lui, il est juste parti d'un code d'éphémérides qu'il a écrit en janvier mais comme Dark Hours est un projet open source, et bien ce qui s'est passé, c'est que son agent IA a récupéré de gros bouts de cette app, jusqu'à son nom pour en faire sa nouvelle app. Hé oui, la vie c'est facile quand on se repose sur le code des autres.

Dark Hours, le vrai

En effet, Claude Code, Codex et les autres sont des outils connectés. Ils lisent des pages, clonent des dépôts, fouillent GitHub quand ça les arrange, du coup, si votre demande ressemble à un truc qui existe déjà, et bien l'agent peut aller le consulter et s'en servir de modèle. Et même sans aller sur le net, comme les modèles ont été entraînés sur tout ce qui traîne publiquement sur le net, dépôts de code compris, il est capable de restituer une structure vue mille fois, sans même aller la chercher sur le net. Un peu comme les modèles de diffusion d'images qui reproduisent le style des artistes.

C'est pour ça que je trouve la mésaventure de Godier et Beher intéressante. Ça nous enseigne qu'il faut faire extrêmement attention quand on code avec l'IA. Pour limiter les risques qu'elle aille se servir dans du code libre, il faut donc indiquer expressément à l'agent de NE PAS récupérer le code source de projets open source, ne pas l'analyser, ne pas pomper du code ni les interfaces. Bref, lui dire qu'on part d'une page blanche...

C'est le même principe que celui de la clean room qui a permis à Compaq de cloner légalement le BIOS d'IBM, comme on peut le voir dans la série Halt and Catch Fire... On implémente les bonnes idées, mais jamais les lignes de code.

Ce clic autorise une connexion à Google : adresse IP transmise et traceurs possibles. En savoir plus Voir cette vidéo sur YouTube

Pour ma part, je fais quasiment que des outils internes et des bidules perso, mais je le précise quand même pour que tout soit clean. Toutefois, ça ne règle pas le problème de l'entraînement qui a été fait en amont pour forger le modèle IA.

Donc avant de coder, deux réflexes à avoir : 1/ Chercher le nom de votre app (ou de votre nouvelle entreprise) pour de vrai, ce qui vous évitera de vous lancer dans un move de contrefaçon sans le savoir. Et 2/ Installer tout ce qui existe dans le même genre pour être sûr de ne pas vous faire berner par l'IA... Sachez que rien que cette année, j'ai été victime moi-même 2 fois, de gens qui n'ont pas pris ces précautions et qui se sont attribués les noms de mes projets pour leurs propres trucs en se reposant, je le suppose, uniquement sur l'IA sans se poser la moindre question. Pour l'un des projets, VoxDrop, j'ai changé le nom en Kassis pour pas me prendre le chou car c'était un projet jeune. Mais pour l'autre problème, c'est plus épineux et je ne peux pas vous en parler encore mais rassurez-vous, dès que je le pourrais, vous ferai un article qui détaillera tout en détail pour vous raconter cette histoire hallucinante qui m'arrive.

Après, ce que je vous conseille de faire aussi c'est qu'une fois que votre projet est fini, pensez à lancer une phase de contrôle. Ça personne ne le fait, mais c'est pas mal de récupérer le code des projets qui vous ont inspiré ou projet concurrents, de le poser à côté du vôtre et faire vous-même ou demander à un agent IA une comparaison, un peu comme la passe sécurité que vous faites en fin de projet.

Reprendre une fonctionnalité qu'on trouve bien ailleurs et la réimplémenter dans son projet, c'est normal et c'est ce que tout le monde fait d'ailleurs. Mais reprendre le nom, le look de l'interface et le code, qui plus est, sans mentionner la licence, c'est vraiment moche. Et c'est exactement ce que peut faire votre agent IA dans votre dos, alors soyez vigilant parce qu'après, vous pourrez dire que vous ne le saviez pas, tout le monde vous traitera de voleur. La frontière est là, et il n'y a qu'une comparaison explicite du code et de l'interface qui vous dira de quel côté vous êtes tombé...

Source

  • ✇Korben
  • La Belgique bloque wawacity.pizza, mais les pirates se sont déjà mis au poker
    La Belgique vient de bloquer wawacity.pizza. Et wawacity.rodeo. Ah et aussi wawacity.taxi, wawacity.futbol, wawacity.motorcycles, wawacity.irish, sans oublier zone-telechargement.meme et zone-telechargement.monster ( la liste est ici ). 113 domaines au total, classés le 3 juillet dernier comme contrefaisants par le président du tribunal de l'entreprise francophone de Bruxelles dont 37 pour Wawacity et 36 pour Zone-Téléchargement . Y'a même un zone-telechargement.gratis

La Belgique bloque wawacity.pizza, mais les pirates se sont déjà mis au poker

Par : Korben ✨
17 juillet 2026 à 12:02

La Belgique vient de bloquer wawacity.pizza. Et wawacity.rodeo. Ah et aussi wawacity.taxi, wawacity.futbol, wawacity.motorcycles, wawacity.irish, sans oublier zone-telechargement.meme et zone-telechargement.monster ( la liste est ici ).

113 domaines au total, classés le 3 juillet dernier comme contrefaisants par le président du tribunal de l'entreprise francophone de Bruxelles dont 37 pour Wawacity et 36 pour Zone-Téléchargement . Y'a même un zone-telechargement.gratis, qui est au moins honnête sur le prix de la marchandise ^^ !

Sauf que depuis le 9 juillet, les deux sites tournent à nouveau sur un TLD en .poker. Soit la veille du jour où la BAPO, le service belge de lutte contre la contrefaçon en ligne, a publié sa décision d'exécution. Autrement dit, la liste était déjà obsolète avant que Telenet, Proximus, Orange Belgium, Mobile Vikings et DIGI aient eu le temps d'y toucher ! Et les anciennes adresses en .codes et .expert, ne sont pas dans la liste belge non plus.

Du coup, vous vous demandez peut-être pourquoi ces deux sites collectionnent les TLD les plus improbables du registre. Hé bien c'est pas du folklore, c'est une réponse directe à l'ARCOM. À chaque fois que les FAI français appliquent une salve de blocages DNS , les opérateurs enregistrent un nouveau domaine et redirigent leur public via des pages d'atterrissage et des canaux Telegram. La Belgique hérite donc d'un stock de domaines cramés par la France, et les bloque consciencieusement, un par un, avec plusieurs coups de retard.

Après, les ayants droit ne sont pas con non plus puisqu'ils ont explicitement demandé au tribunal de bloquer les pages "panneau indicateur", c'est à dire celles qui vous disent où le site a déménagé cette semaine.

Résultat, wawacity-info.com et zone-telechargement-info.com sont aussi dans la liste. Ces deux pages n'hébergent aucun contenu protégé et ne pointent vers aucun fichier illégal, elles se contentent de vous annoncer quelle est l'adresse active du moment. Le tribunal a validé quand même, au motif qu'elles "facilitent l'accès".

Et là, si vous mettez ces deux pages indicatrices côte à côte, vous voyez tout de suite qu'elles sont quasiment identiques. Même mise en page, même messages sur Telegram, où les deux comptes arrosent des dizaines de milliers d'abonnés avec un texte identique au mot près. Wawacity et Zone-Téléchargement, c'est donc très probablement la même équipe, ce qui explique pourquoi les deux changent de domaine en même temps, comme un couple qui déménage.

Movix, visé par la même décision, a lui aussi déjà migré vers un nouveau TLD et reste accessible. Le reste de la fournée complète les 113 comme Lookmovie et ses treize variantes, KissKH, animepahe, anime-sama, WatchSeries, voir-anime, Streamex. La liste noire belge dépasse maintenant les 1000 domaines depuis le lancement du dispositif en 2025, et elle peut être mise à jour chaque semaine avec 50 nouveaux noms.

50 par semaine, c'est impressionnant ! Face à des gars qui basculent leur trafic sur un nouveau TLD en quelques minutes, montre en main, la justice est dépassée ! Et pas parce qu'elle est nulle hein, mais parce que le blocage DNS n'a jamais empêché personne de taper une autre adresse qui renvoie vers le même service... On avait déjà vu le même théâtre quand la Belgique a censuré Internet Archive , et quand le Conseil d'État a éteint la riposte graduée d'Hadopi après 17 ans .

Prochaine étape probable, les ayants droit s'attaqueront surement aux canaux Telegram. En attendant, quelqu'un devrait leur dire que cette .pizza était déjà bien froide ^^.

Source : TorrentFreak

  • ✇Korben
  • Kim Dotcom - Son extradition aux USA se rapproche
    Le 20 janvier 2012, 76 policiers et deux hélicoptères débarquent sur le manoir de Coatesville, en Nouvelle-Zélande, pour coffrer un gros bonhomme allemand la veille de ses 38 ans. Ce bonhomme, c'est Kim Dotcom , le patron de Megaupload. Et quatorze ans plus tard, la justice néo-zélandaise vient encore de lui claquer la porte au nez ! En effet, la Cour d'Appel de Nouvelle-Zélande a rejeté ce 1er juillet la totalité de ses recours contre son extradition vers les États-Unis. Tous ses arguments, ba

Kim Dotcom - Son extradition aux USA se rapproche

Par : Korben ✨
1 juillet 2026 à 14:34

Le 20 janvier 2012, 76 policiers et deux hélicoptères débarquent sur le manoir de Coatesville, en Nouvelle-Zélande, pour coffrer un gros bonhomme allemand la veille de ses 38 ans. Ce bonhomme, c'est Kim Dotcom , le patron de Megaupload.

Et quatorze ans plus tard, la justice néo-zélandaise vient encore de lui claquer la porte au nez !

En effet, la Cour d'Appel de Nouvelle-Zélande a rejeté ce 1er juillet la totalité de ses recours contre son extradition vers les États-Unis. Tous ses arguments, balayés un par un et là, il ne lui reste plus qu'une seule cartouche à savoir la Cour suprême néo-zélandaise.

Vous vous demandez peut-être ce qu'on lui reproche exactement ?

Hé bien, aux États-Unis, Kim Dotcom traîne 12 chefs d'accusation sur les 13 du dossier initial, la charge de blanchiment ayant sauté en cours de route... Il est accusé de violation massive du copyright, de racket, de fraude électronique et j'en passe...

Le gouvernement américain parle de 175 millions de dollars de revenus criminels et de plus de 500 millions de préjudice pour les ayants droit. Et au bout du tunnel, une peine de 30 à 150 ans de prison fédérale pour lui. Donc autant dire la perpétuité.

Et c'est là que le dossier devient franchement bancal puisque ses 2 bras droits, Mathias Ortmann et Bram van der Kolk, ont plaidé coupable, eux, en Nouvelle-Zélande et ont obtenu chacun deux ans et demi de taule environ, purgés sur place. Mêmes accusations, même boîte, même raid pour Kim, sauf que lui a choisi de se battre bec et ongles. Du coup, pour punir une telle défiance, on lui promet un aller simple pour la Virginie et un demi-siècle derrière les barreaux.

Son avocat, Ron Mansfield, l'a pourtant martelé... soit on jugeait les trois en Nouvelle-Zélande, soit aucun et perso, je trouve que c'est difficile de lui donner tort sur ce point précis. Sauf que la Nouvelle-Zélande n'a pas de " forum bar ", une règle qu'on retrouve au Royaume-Uni, qui laisse un juge bloquer une extradition quand le pays aurait très bien pu organiser le procès lui-même.

Mais ça n'a pas d'importance. La réalité, c'est que la justice américaine a accepté de lâcher Ortmann et van der Kolk, mais pas Dotcom. Ils veulent sa tête car il est le visage de Megaupload et quelqu'un doit payer. Mais après tout ce temps, le bonhomme a vieilli, il a encaissé un AVC en cours de route, et vu défiler l'arrêt complet de ses sociétés, le gel de ses comptes aux quatre coins de la planète, avant finalement de relancer Mega le successeur de Megaupload en version "clean".

Alors est-ce que Dotcom est un enfant de chœur ?

Bien sûr que non.

Megaupload, c'était une belle pompe à fric qui carburait en partie au contenu piraté, tout le monde le sait. Mais j'avoue que le voir risquer 150 ans de prison alors que ses associés n'en ont pris que 30 mois, je trouve que ça manque un peu de dosage. Cette affaire sans fin ressemble plus à une vendetta que les studios d'Hollywood veulent obtenir qu'à de la justice.

Mais il lui reste la Cour suprême donc on verra bien. Encore quelques mois de sursis, peut-être un an ou deux... Force à lui.

Source : TorrentFreak

  • ✇Korben
  • NVIDIA négociait avec Anna's Archive pour entraîner ses IA... et les emails ont fuité
    Bon, celle-là elle est gratinée. NVIDIA, le géant des GPU, a directement contacté Anna's Archive pour accéder à environ 500 To de livres piratés. Contacté, négocié, payé. Comme ça, tranquillou. C'est une class action (dossier n°1:26-cv-00002 au tribunal fédéral de New York, pour ceux qui veulent aller checker) qui a fait fuiter ces fameux emails internes. En gros, un membre de l'équipe "data strategy" de NVIDIA a négocié un accès haute vitesse aux collections piratées de la bibliothèque. Et le p

NVIDIA négociait avec Anna's Archive pour entraîner ses IA... et les emails ont fuité

Par : Korben
28 janvier 2026 à 23:21

Bon, celle-là elle est gratinée. NVIDIA, le géant des GPU, a directement contacté Anna's Archive pour accéder à environ 500 To de livres piratés. Contacté, négocié, payé. Comme ça, tranquillou.

C'est une class action (dossier n°1:26-cv-00002 au tribunal fédéral de New York, pour ceux qui veulent aller checker) qui a fait fuiter ces fameux emails internes. En gros, un membre de l'équipe "data strategy" de NVIDIA a négocié un accès haute vitesse aux collections piratées de la bibliothèque. Et le plus beau dans l'histoire c'est qu'Anna's Archive les a PRÉVENUS que les données étaient illégales. Genre, texto : "Vous avez une autorisation interne pour ça ?"

La réponse est arrivée en moins d'une semaine. Feu vert. Sauf que bon, quand on lit ça avec du recul, c'est quand même sacrément culotté.

Le contexte, c'était surtout la pression de livrer pour la GTC 2023 (la Developer Conference de NVIDIA). Fallait nourrir les modèles d'IA coûte que coûte, et le dataset Books3 (196 000 bouquins issus de Bibliotik), plus LibGen, Sci-Hub, Z-Library... ça faisait un buffet de 500 To et de leur côté Anna's Archive facturait des dizaines de milliers de dollars pour l'accès rapide.

Sérieux, j'aurais aimé voir la tête du service juridique de NVIDIA en lisant cet email...

En parallèle, Anna's Archive se prend un procès complètement délirant puisque Spotify, Universal Music, Warner et Sony réclament 13 000 milliards de dollars (13 TRILLIONS, soit à peu près le PIB de la Chine). C'est en lien avec leur backup de 300 To de Spotify dont je vous avais parlé ici. Le juge Rakoff a émis une injonction mondiale le 20 janvier, ce qui a fait tomber plusieurs domaines du site .

NVIDIA plaide le "fair use" évidemment. Mouais. On verra bien ce qu'en pensera le juge, mais quand les emails prouvent qu'on t'a prévenu que c'était illégal et que t'as quand même dit "go"... c'est pas ouf comme défense.

En attendant, entre le procès Spotify et ces emails, Anna's Archive est devenue l'ennemi public numéro un de toute l'industrie du contenu sur le web.

Affaire à suivre !

Source

  • ✇Korben
  • Comment les IA se nourrissent de livres piratés ?
    Bibliotik ça vous parle ou pas ? C'est un tracker torrent privé ultra-discret comme il y en a tant d'autres, où les fans de lecture vont chopper leurs ePubs. Hé bien figurez-vous que Meta, Bloomberg, et toute une brochette de géants de la tech ont fait exactement pareil pour entraîner leurs IA. Sauf qu'eux, c'était pas pour lire du Stephen King au lit, mais pour aspirer 195 000 livres d'un coup et les transformer en "données d'entraînement". Le dataset s'appelle Books3, et c'est un peu le Nap

Comment les IA se nourrissent de livres piratés ?

Par : Korben
24 décembre 2025 à 17:27

Bibliotik ça vous parle ou pas ? C'est un tracker torrent privé ultra-discret comme il y en a tant d'autres, où les fans de lecture vont chopper leurs ePubs.

Hé bien figurez-vous que Meta, Bloomberg, et toute une brochette de géants de la tech ont fait exactement pareil pour entraîner leurs IA. Sauf qu'eux, c'était pas pour lire du Stephen King au lit, mais pour aspirer 195 000 livres d'un coup et les transformer en "données d'entraînement".

Le dataset s'appelle Books3, et c'est un peu le Napster des LLMs. Créé en 2020 par un chercheur IA nommé Shawn Presser, ce jeu de données de 37 Go compressés contient des bouquins scrapés directement depuis la bibliothèque pirate Bibliotik. L'idée de Presser était plutôt noble à la base puisqu'il voulait démocratiser l'accès aux données d'entraînement pour que les petits labos puissent rivaliser avec OpenAI et leurs mystérieux datasets "Books1" et "Books2" dont personne ne connaît le contenu.

Sauf que Books3 a fini par être intégré dans The Pile , un gros dataset de 825 Go créé par EleutherAI, et là ça a pris des proportions industrielles... Meta l'a utilisé pour entraîner LLaMA, Bloomberg pour BloombergGPT, et des dizaines d'autres projets. Le problème, c'est que ça contient des livres protégés par le copyright tels que des romans de Sarah Silverman, de George R.R. Martin, et même le bouquin de John Carreyrou sur Theranos, "Bad Blood". D'ailleurs Carreyrou vient de porter plainte avec d'autres auteurs contre six géants de l'IA dont Anthropic, Google, OpenAI, Meta, xAI et Perplexity.

Et comme vous vous en doutez, la défense de toutes ces entreprises c'est le fameux "fair use" des américains. En gros, ils disent que transformer des livres en vecteurs mathématiques pour qu'une IA apprenne à écrire, c'est pas du vol, c'est de l'apprentissage. Un peu comme quand vous lisez 500 bouquins et que ça influence votre style d'écriture. Sauf que vous, vous payez vos livres et vous avez un cerveau biologique alors que ces IA, elles, aspirent tout le web sans demander la permission à personne.

Et en juin dernier, deux juges californiens ont, sans surprise, tranché en faveur d'Anthropic et Meta sur certains points. Ils ont considéré que l'utilisation de livres protégés pour entraîner des modèles comme Claude ou Llama 2 pouvait constituer un usage "spectaculairement transformatif" donc légal. Par contre, télécharger les bouquins depuis des sites pirates, ça reste illégal... Bref, vous pouvez utiliser le butin, mais pas le voler vous-même...

De son côté, le sénateur américain Hawley n'a pas mâché ses mots en parlant du "plus grand vol de propriété intellectuelle de l'histoire américaine" et quand on voit que les auteurs ont touché environ 3000 dollars chacun dans le règlement de 1,5 milliard de dollars proposé par Anthropic alors que ces boîtes génèrent des milliards de revenus, je peux comprendre l'énervement.

Mais le pire, c'est qu'il existe des datasets alternatifs 100% légaux, ouverts, et utilisables sans risquer un procès !! J'ai par exemple découvert Common Corpus , et je kiffe le concept. C'est un projet coordonné par Pleias, une startup française, avec le soutien de HuggingFace, du Ministère de la Culture et de l'AI Alliance et ce dataset contient 500 milliards de mots, dont 180 milliards en anglais et 110 milliards en français.

Mais alors d'où viennent ces données légales ?

Hé bien du domaine public uniquement. Ce sont des millions de journaux américains qui ont été numérisés via le projet Chronicling America, des collections de patrimoine culturel, des monographies historiques...etc. Et tout a été vérifié pour s'assurer que les droits d'auteur sont bien expirés.. Donc dedans, y'a pas de livres piratés, ce qui veut dire pas de procès potentiels...etc.

Y'a aussi le dataset Dolma avec ses 3 trillions de tokens créé par l'Allen AI Institute, ou encore RedPajama qui atteint les 30 trillions de tokens, et ces projets sont open source avec tout le processus de construction documenté donc vous pouvez les auditer, les refaire, et les vérifier, contrairement aux datasets proprio où on vous dit "faites-nous confiance, on a rien fait de mal, hihihi".

Mais même si tout ces trucs open source ont l'air cool, le problème, c'est que personne (ou presque) ne les utilise parce que les vieux livres du domaine public, ça parle comme Molière ou Victor Hugo. Le vocabulaire est archaïque, les tournures de phrases sont datées... on dirait une discussion sur l'oreiller du couple Macron. Et vous l'aurez compris, un LLM entraîné là-dessus va avoir tendance à vous pondre du texte qui sent la naphtaline, alors que les livres modernes piratés, quand à eux, c'est du langage contemporain, des dialogues naturels, des références actuelles...etc.

C'est donc ça le dilemme... Choisir entre éthique ou performance. Les chercheurs de Mozilla et EleutherAI ont publié en janvier 2025 un papier sur les bonnes pratiques pour créer des datasets ouverts , et ils admettent eux-mêmes que c'est compliqué car les métadonnées sont pourries, la numérisation coûte une blinde, et il faut des compétences juridiques ET techniques pour faire les choses proprement.

Un autre paradoxe encore plus cruel c'est que les projets qui documentent proprement leurs sources deviennent des cibles faciles pour les procès. C'est comme ça que le groupe anti-piratage danois Rights Alliance a fait supprimer Books3 via des notices DMCA, forçant EleutherAI à nettoyer The Pile alors que pendant ce temps, OpenAI reste discret sur ses données d'entraînement et évite ainsi les ennuis. Faire les choses bien, ça vous expose alors que faire les choses en douce pour entrainer votre IA, ça passe tranquillou (même si ça n'immunise pas totalement contre les procès non plus, faut pas déconner).

Et de plus en plus de sites partout sur la toile, changent petit à petit leurs conditions d'utilisation pour interdire le scraping par les IA... Autant dire que le web ouvert se referme petit à petit, ce qui rend encore plus galère de construire des datasets éthiques...

Bref, on est dans une situation où les géants aspirent tout sans vergogne, et où les petits qui essaient de faire les choses proprement galèrent... Sans parler des auteurs qui se retrouvent à quémander 3000 balles pour des œuvres qui valent bien plus. Common Corpus et tous ces autres projets ouverts prouvent, certes, qu'on peut entraîner des IA sans piller le travail des autres, mais ça demande énormément plus d'efforts et ça donne des résultats incroyablement moins sexy...

Voilà, au final, la vraie question n'est donc pas technique, mais politique. Est-ce qu'on doit accepter qu'une machine qui lit pour transformer un livre en vecteur, c'est OK parce que grâce à ce petit sacrifice, on peut profiter d'IA (open source de préférence) de folie ? Ou est ce qu'on se dit que lire c'est du vol quand c'est une machine qui lit ? Et dans ce cas, on accepte d'avoir des IA qui cause comme Balzac... ?

Source

  • ✇Korben
  • OpenAI Sora - Obligés d'opt-out pour protéger vos droits
    OpenAI vient de lancer Sora 2 , son générateur de vidéos par IA et le truc, c’est que si vous êtes créateur de contenu, vous devez opt-out manuellement pour éviter que vos œuvres servent à entraîner le modèle. Pas d’opt-in par défaut, pas de respect automatique du droit d’auteur. C’est à vous de faire la démarche pour dire non. Selon Cartoon Brew , la politique d’OpenAI oblige donc les détenteurs de droits à signaler chaque violation spécifique. Pas de formulaire global genre “je refuse que vou

OpenAI Sora - Obligés d'opt-out pour protéger vos droits

Par : Korben
1 octobre 2025 à 15:22

OpenAI vient de lancer Sora 2 , son générateur de vidéos par IA et le truc, c’est que si vous êtes créateur de contenu, vous devez opt-out manuellement pour éviter que vos œuvres servent à entraîner le modèle. Pas d’opt-in par défaut, pas de respect automatique du droit d’auteur. C’est à vous de faire la démarche pour dire non.

Selon Cartoon Brew , la politique d’OpenAI oblige donc les détenteurs de droits à signaler chaque violation spécifique. Pas de formulaire global genre “je refuse que vous utilisiez mes trucs”. Non, vous devez rapporter chaque contenu un par un si vous le trouvez dans les datasets d’entraînement…

Le problème, c’est que personne sait vraiment ce qu’OpenAI a utilisé pour entraîner Sora. Il y a des rumeurs sur l’utilisation massive de vidéos YouTube, de contenus de jeux vidéo, de films, mais OpenAI reste hyper flou sur les sources. Du coup, comment vous voulez opt-out de quelque chose dont vous ignorez l’existence dans leur base de données d’entrainement ?

Et malheureusement, cette approche opt-out est la norme chez les géants de l’IA… Meta, Google, OpenAI, tous adoptent le même principe qui est on prend d’abord, et vous vous opposez après si vous avez le courage. Le fardeau de la preuve et de la protection repose donc sur les créateurs, et pas sur les entreprises qui exploitent les contenus. De quoi faire encore grincer des dents !

Maintenant, pour les personnalités publiques, OpenAI a mis en place un système de cameo … Cela veut dire que si quelqu’un veut générer une vidéo avec votre visage ou votre voix, il faut votre permission explicite. C’est un début, mais ça ne couvre que les cas évidents… Il n’y a rien de tel par exemple pour les styles artistiques, les techniques de réalisation, les univers visuels créés par des artistes et j’en passe…

Bref, les experts juridiques commencent donc à s’inquiéter car ce modèle d’opt-out pose des problèmes de droit d’auteur majeurs, surtout dans des pays comme la France où le droit moral est inaliénable. Vous ne pouvez pas par exemple renoncer à vos droits d’auteur même si vous le voulez. Donc comment une politique opt-out peut-elle être légale alors qu’elle force la main aux créateurs pour abandonner leurs droits par défaut ?

Et la situation devient encore plus complexe avec les contenus sous licence restrictive car des chaînes YouTube ont des CGU qui interdisent l’utilisation commerciale de leurs vidéos et les jeux vidéos ont des EULA qui limitent l’exploitation de leurs assets. Cela veut donc dire que Sora s’assoit sur tout ça en considérant que l’absence d’opt-out équivaut à un consentement.

Pour sa défense, OpenAI nous explique que l’entraînement d’IA relève du fair use aux États-Unis mais le problème, c’est que cette jurisprudence n’existe pas partout. En Europe par exemple, le règlement sur l’IA impose des obligations de transparence et de traçabilité sur les données d’entraînement et OpenAI le sait très bien et joue avec ce flou entre les différentes juridictions.

Puis ce système de signalement proposé par OpenAI est aussi hyper critiquable car c’est, comme je vous l’expliquais, à vous de prouver que votre contenu a été utilisé pour l’entraînement. Mais alors comment faire quand les datasets ne sont pas publics ??? Comment vérifier que Sora a bien appris à partir de vos vidéos si vous n’avez pas accès aux données d’entraînement ???

Certains créateurs envisagent donc déjà des recours collectifs car si OpenAI a effectivement utilisé des millions de vidéos YouTube sans autorisation, ce serait une violation massives du droit d’auteur… Est-ce que développer une IA générative justifie de récupérer tout ce travail créatif humain sans apporter ni compensation ni consentement ?

OpenAI sembler penser que oui et mise sur l’inertie des créateurs et la complexité de ses démarches d’opt-out pour continuer son petit business…

Mais en attendant, si vous voulez protéger vos créations de Sora, vous devez aller sur le site d’OpenAI, trouver le formulaire de signalement , prouver que vous êtes le détenteur des droits, identifier chaque contenu concerné, et espérer qu’OpenAI respecte votre demande.

C’est donc la lose pour les créateurs, c’est sûr. Comme je le disais dans un de mes précédents articles sur le sujet, ce dont on a besoin maintenant c’est de cohérence et de clarté au niveau des lois, car là on discute des détails mais la question du “vol” par ces GAMMO (Google / Anthropic / Meta / Microsoft / OpenAI) n’est pas vraiment tranchée au niveau de la loi. J’ai l’impression que ça traine et que personne n’est pressé de trancher la question car ça arrange bien tout le monde (sauf les créateurs).

❌
❌