Vue lecture

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.

Evo 2 – L'IA qui écrit de l'ADN fonctionnel

Vous pensiez que les IA génératives se contentaient de pondre des images de chats à 6 pattes façon Ghibli et des textes pompés sur Wikipédia ? Hé bien, je vais vous décevoir car des chercheurs de l’Arc Institute, Stanford, NVIDIA, UC Berkeley et d’autres viennent de pousser le concept beaucoup, beaucoup plus loin…

En effet, ils ont créé Evo 2, le plus grand modèle d’IA pour la biologie jamais rendu public, capable de lire, comprendre et même écrire de l’ADN fonctionnel. Et cerise sur le gâteau, une étude publiée cette semaine dans Nature démontre qu’on peut utiliser cette technologie pour créer des protéines totalement nouvelles qui n’ont jamais existé dans la nature… et qui fonctionnent vraiment !

Le projet Evo 2 fonctionne comme un LLM classique, sauf qu’au lieu de lui faire bouffer du texte, on lui a fait avaler 9,3 trillions de nucléotides (les fameux A, T, G, C qui composent l’ADN) provenant de plus de 128 000 génomes couvrant tous les domaines du vivant : bactéries, archées, virus, mais aussi humains, plantes et autres eucaryotes.

Leur modèle existe en deux versions : 7 milliards et 40 milliards de paramètres (comparable aux gros LLM actuels) mais sa vraie force, c’est sa fenêtre de contexte d’un million de paires de bases, soit 8 fois plus que son prédécesseur Evo 1. Pour vous donner une idée, c’est suffisant pour analyser un chromosome entier de levure ou un génome bactérien complet en une seule passe.

Pour entraîner ce monstre, il a fallu mobiliser plus de 2 000 GPU NVIDIA H100 pendant plusieurs mois sur le cloud DGX, soit environ 150 fois plus de puissance de calcul qu’AlphaFold. L’architecture utilisée, baptisée StripedHyena 2 , permet un entraînement 3 fois plus rapide que les transformers classiques sur les longues séquences et petit fun fact, Greg Brockman, cofondateur d’OpenAI, a participé au développement de cette architecture pendant son année sabbatique.

L’une des applications les plus impressionnantes d’Evo 2, c’est sa capacité à prédire si une mutation génétique risque de causer une maladie, et ce, sans aucun entraînement spécifique. Les chercheurs ont testé le modèle sur le gène BRCA1, connu pour son lien avec le cancer du sein. Résultat, Evo 2 a prédit avec plus de 90% de précision quelles mutations étaient pathogènes et lesquelles étaient bénignes.

Mieux encore, Evo 2 est actuellement le seul modèle capable de prédire l’effet des mutations dans les régions non-codantes de l’ADN (les fameuses parties qu’on pensait “inutiles” et qu’on appelait autrefois “ADN poubelle”). Pour les variants codants, il est second meilleur, mais pour les variants non-codants, il est carrément le top du top of the pop !

Et pour prouver que le modèle ne fait pas que régurgiter ses données d’entraînement, l’équipe lui a demandé d’annoter le génome du mammouth laineux, une espèce qui n’était évidemment pas dans son dataset. Et le modèle a correctement identifié la structure exons-introns du génome de ce pachyderme (aujourd’hui disparu parce que j’ai mangé le dernier), démontrant qu’il a vraiment “compris” les règles fondamentales du vivant.

Mais là où ça devient vraiment dingue, c’est ce concept de “design sémantique”. En effet, dans les génomes bactériens, les gènes qui travaillent ensemble sont souvent positionnés côte à côte, du coup, si on donne à l’IA le contexte génomique d’une fonction particulière, elle peut générer de nouveaux gènes ayant des fonctions similaires.

En gros, on prompte l’IA avec de l’ADN au lieu de texte, et comme un bon LLM qui complète vos phrases, Evo complète… vos génomes.

Pour tester cette approche, les chercheurs ont d’abord généré une toxine bactérienne basée sur une toxine connue. Ils ont ensuite utilisé cette toxine comme “prompt” pour demander à l’IA de créer des antitoxines correspondantes. Sur 10 propositions, la moitié ont réussi à neutraliser partiellement la toxine, et deux d’entre elles l’ont complètement désactivée avec 95-100% de survie cellulaire.

Et ces antitoxines n’avaient que 21 à 27% de similarité avec les protéines existantes, donc autant dire qu’Evo a inventé quelque chose de quasi-nouveau ! Et ce n’est pas du bricolage aléatoire puisque l’analyse montre que ces protéines seraient l’équivalent d’un assemblage de 15 à 20 morceaux de protéines différentes, recombinés de façon inédite.

Et ce qui est encore plus impressionnant, c’est que certaines de ces antitoxines générées fonctionnent contre plusieurs toxines différentes utilisant des mécanismes d’action distincts. L’une d’elles neutralise trois toxines naturelles, alors que l’antitoxine naturelle équivalente ne fonctionne que contre sa toxine d’origine. L’IA aurait donc identifié une compatibilité fonctionnelle plus large que ce qu’on observe dans la nature !

Les chercheurs ont aussi testé des systèmes où l’antitoxine est un ARN plutôt qu’une protéine. Là encore, le modèle a généré une antitoxine fonctionnelle avec 88% de survie, tout en conservant les caractéristiques structurelles essentielles malgré une séquence divergente.

Mais surtout, l’équipe a généré une toxine qui ne ressemble à absolument rien de connu. Aucune similarité de séquence, aucune similarité structurale, même avec les méthodes de détection les plus sensibles. Pour reconstituer tous les acides aminés de cette protéine, il faudrait recombiner des fragments de plus de 40 protéines différentes, ce qui ressemble plus à une protéine Frankenstein créée de toutes pièces qu’à une variation évolutive.

Et histoire de pousser l’idée encore plus loin, l’équipe s’est attaquée aux anti-CRISPR. Ce sont des protéines utilisées par les phages pour désactiver le système immunitaire bactérien, qui sont parmi les plus évolutives qui existent, avec une diversité de séquences et de mécanismes absolument folle.

Et 17% des protéines générées ont montré une activité anti-CRISPR mesurable, soit un taux de succès remarquable. Parmi les candidates qui fonctionnent, certaines n’ont aucune similarité de séquence détectable avec les protéines connues, et même leurs structures prédites ne ressemblent à rien dans les bases de données. Ce sont littéralement des protéines nouvelles qui font le job !

Mais Evo 2 ne s’arrête pas à la génération de protéines individuelles. Le modèle peut maintenant créer des séquences génomiques complètes de plusieurs centaines de milliers de paires de bases. L’équipe a testé trois niveaux de complexité :

  • Génomes mitochondriaux : à partir d’un fragment de 3 kb d’ADN mitochondrial humain, Evo 2 a généré des génomes complets de 16 000 bases avec le bon nombre de gènes codants, d’ARNt et d’ARNr. Les protéines générées ont été validées par AlphaFold 3 et correspondent à des complexes fonctionnels de la chaîne respiratoire.
  • Génomes bactériens : en partant de Mycoplasma genitalium (le génome bactérien minimal), le modèle a produit des séquences de 600 kb où près de 70% des gènes prédits correspondent à des domaines protéiques connus.
  • Chromosomes de levure : Evo 2 a généré 330 kb d’ADN eucaryote avec des introns, des promoteurs, des ARNt correctement positionnés, le tout ressemblant aux vrais gènes de levure.

Les chercheurs ont même encodé des messages en code Morse (“EVO2”, “LO”) dans les profils d’accessibilité de la chromatine des séquences générées, démontrant qu’on peut “programmer” l’épigénome avec ce modèle.

On nage en pleine science-fiction, mais ça fonctionne !

Pour finir en beauté, l’équipe a lâché Evo sur 1,7 million de gènes bactériens et viraux comme prompts, générant 120 milliards de paires de bases d’ADN synthétique. Cette base de données, baptisée SynGenome , est accessible gratuitement et permet de rechercher des séquences par fonction, domaine protéique, espèce ou terme Gene Ontology.

On y trouve notamment des protéines chimériques avec des fusions de domaines jamais observées dans la nature. Ces combinaisons pourraient représenter des innovations fonctionnelles à explorer pour la biologie synthétique.

Et le plus beau dans tout ça c’est que tout est open source. Les modèles (7B et 40B paramètres) sont disponibles sur Hugging Face , le code d’entraînement et d’inférence est sur GitHub , et le dataset OpenGenome2 est téléchargeable. Vous pouvez même tester Evo 2 directement dans votre navigateur via l’ API hébergée par NVIDIA ou l’interface Evo Designer.

Pour ceux qui veulent aller plus loin, NVIDIA propose aussi des tutoriels de fine-tuning via son framework BioNeMo , et une collaboration avec le labo Goodfire a produit un outil d’interprétabilité pour visualiser ce que le modèle “voit” dans les séquences génomiques.

Bien sûr, la génération autorégressive peut produire des séquences répétitives ou des “hallucinations” biologiques (des gènes réalistes mais non fonctionnels), et c’est pourquoi ce design sémantique nécessite des filtres et des validations expérimentales. De plus, cette approche est limitée aux fonctions encodées par les relations contextuelles dans les génomes prokaryotes, ce qui exclut de nombreuses applications eucaryotes… pour l’instant.

Un des génomes bactériens générés était d’ailleurs incomplet et ne fonctionnerait probablement pas si on le synthétisait et l’insérait dans une vraie bactérie. Mais l’équipe travaille déjà avec des experts en synthèse et assemblage d’ADN de l’Université du Maryland pour tester expérimentalement ces génomes générés.

Bref, on n’en est pas encore à créer des enzymes qui digèrent le plastique sur commande, mais le fait qu’une IA puisse générer des protéines fonctionnelles à partir de rien, juste en apprenant les patterns de l’évolution… c’est quand même complètement dingue. Et avec un taux de succès allant de 17 à 50% sur seulement quelques dizaines de variants testés, le design sémantique surpasse déjà de nombreuses méthodes classiques de conception de protéines.

Quoiqu’il en soit, la biologie générative vient de franchir un cap, et j’ai hâte de voir ce que les biologistes vont en faire !

Source

Memo - Le robot qui ne juge pas à quel point vous êtes crado

Et encore un robot qui plie du linge !!!

C’est comme si votre belle-mère avait emménagé chez vous, sauf que celui-là ne vous fera pas de remarques sur votre façon d’organiser le frigo ^^. La startup Sunday vient en effet, de présenter Memo, un robot domestique qui promet de vous libérer des tâches ménagères. En tout cas, avec ce truc, plus besoin de faire des gosses… Mais siii, vous savez ces mini prisonniers que vous utilisez pour vider et remplir vos lave vaisselles et que des cinglés veulent sacrifier afin de donner un sens à leur vie.

Blague à part, Memo est développé par Tony Zhao et Cheng Chi, deux diplômés de Stanford qui ont bossé chez Tesla, DeepMind, Waymo, Meta et Neuralink, s’inscrivant dans la lignée de ces autres robots domestiques innovants . L’équipe compte maintenant 25 ingénieurs et chercheurs et ce robot a été pensé différemment des autres machines du genre.

Au lieu de s’entraîner dans des simulations industrielles ou des labos aseptisés, Memo a appris en observant de vrais humains faire leurs corvées dans plus de 500 foyers réels. Et sa techno clé, c’est le gant breveté “Skill Capture Glove”.

Des volontaires ont porté ce gant pendant qu’ils faisaient leur ménage, et le système a capturé leurs mouvements. Comment ils plient le linge, comment ils rangent les chaussures dans l’entrée, comment ils chargent le lave-vaisselle, comment ils se… euh, pardon, je m’égare. Bref, Sunday a envoyé plus de 2 000 gants à ces “Memory Developers” et a collecté environ 10 millions d’enregistrements de tâches domestiques réelles. D’après eux, c’est l’une des plus grosses bases de données spécialisées pour robots domestiques qui existe !

L’idée de départ c’est que la plupart des robots domestiques sont des adaptations de machines industrielles. Ils fonctionnent bien dans des environnements structurés pour l’occasion, mais ils plantent lamentablement dès qu’ils se retrouvent face au chaos d’une vraie maison. Des chaussettes qui traînent n’importe où, des assiettes empilées n’importe comment, un chat qui passe devant eux au mauvais moment et c’est la catastrophe !

Du coup, grâce à ces millions d’exemples de situations domestiques authentiques, Memo peut gérer ce qu’ils appellent les “tâches à horizon long”. Ce sont des actions en plusieurs étapes où il faut prendre des décisions selon le contexte comme débarrasser une table, remplir et vider un lave-vaisselle, plier du linge, ranger les chaussures qui trainent dans l’entrée, et même préparer un espresso.

Bon après faudra pas lui demander de gérer un ado en crise existentielle qui n’a plus de Wifi, mais c’est déjà pas si mal.

Côté design, comme vous pouvez le voir, Memo ne ressemble pas du tout aux robots humanoïdes qui font des saltos sur scène. Il a une base roulante au lieu de jambes, ce qui lui permet de rester stable même si le courant se coupe. Donc pas de risque qu’il vous tombe dessus pendant votre sieste.

Son torse peut également monter et descendre pour atteindre des objets à différentes hauteurs et visuellement, il a vraiment un air rétrofuturiste assez mignon avec son corps blanc brillant, ses deux bras super longs, et un visage de cartoon avec des grands yeux en boutons… Ah et vous pouvez même lui mettre différentes casquettes de couleur pour lui donner un look west coast.

Ça me rappelle un peu Baymax dans Big Hero 6. Son corps est également recouvert de silicone souple, ce qui le rend plus dodu et rassurant qu’un robot humanoïde classique froid avec son look de T-1000.

La sécurité a été également bien pensée, d’après ce qu’ils expliquent. Memo est en effet conçu pour être “safe” en présence d’enfants. Si un gamin le pousse ou lui rentre dedans, il ne va pas riposter en lui mettant un coup de savate comme Nawell. Et sa stabilité passive fait qu’il ne peut pas tomber brutalement même en cas de coupure de courant, contrairement à un père de famille bourré et violent.

Et concernant la vie privée, Sunday insiste sur le fait que leur méthode d’apprentissage est respectueuse puisque le robot n’a pas besoin de vous filmer en permanence pour apprendre, vu qu’il utilise les données collectées via le fameux gant et sa bibliothèque de compétences en expansion permanente.

Voilà, le programme de bêta-test “ Founding Families ” a ouvert le 19 novembre et ils vont sélectionner 50 familles qui recevront des exemplaires numérotés de Memo avec un support rapproché de l’équipe. JE ME PORTE VOLONTAIRE POUR TESTER CE TRUC !! Et ensuite, le produit final sera commercialisé au plus tôt fin 2026 avec un prix de départ estimé autour de 20 000 dollars. Ouais, c’est pas donné, mais bon, si vous calculez le coût “d’élevage” d’un enfant jusqu’à ce qu’il soit capable de plier une chaussette correctement, vous vous rendrez compte que c’est peut-être pas si cher ^^.

Source

Je crois que l'IA n'a toujours pas volé votre emploi - Une étude de Yale qui calme le jeu

Vous vous souvenez quand ChatGPT est sorti fin 2022 ? La panique dans les open spaces, les titres clickbait sur la fin du travail tel qu’on le connaît, votre vieux cousin qui vous expliquait pépouse que dans 6 mois tous les devs seraient au chômage ?

Bon ben voilà, Yale vient de publier une étude qui remet les pendules à l’heure . Et je vous spoile un peu : 33 mois après le lancement de ChatGPT, le marché du travail n’a toujours pas implosé.

Cette étude a pris le temps d’analyser les données au lieu de surfer sur la panique ambiante et Martha Gimbel et son équipe du Budget Lab de Yale ont ainsi passé au crible l’évolution de l’emploi américain depuis novembre 2022, et leurs conclusions sont plutôt rassurantes. Enfin, rassurantes dans un sens. Parce que si vous êtes un jeune diplômé en début de carrière, l’histoire est un poil différente. Mais j’y reviens après.

L’idée de départ de l’étude est assez simple. On a vécu des bouleversements technologiques majeurs par le passé tels que l’arrivée des ordinateurs au bureau dans les années 80, l’explosion d’Internet à la fin des années 90. Et à chaque fois, c’est la même apocalypse annoncée, la même angoisse collective… Du coup, les chercheurs se sont demandé : est-ce que cette fois c’est vraiment différent ? Est-ce que l’IA générative change le marché du travail plus vite que les révolutions technologiques précédentes ?

Pour répondre à ça, nos petits chercheurs ont utilisé un truc qu’ils appellent l’indice de dissimilarité. En gros, ça mesure à quel point la répartition des métiers dans l’économie change au fil du temps. Par exemple si 7% de travailleurs en 2002 devaient changer d’occupation pour retrouver la même répartition qu’en 1996, l’indice est de 7 points de pourcentage. C’est une façon de quantifier le bordel causé par une nouvelle technologie.

Et alors, résultat des courses ?

Et bien le marché du travail américain change effectivement un peu plus vite depuis ChatGPT qu’il ne changeait pendant les périodes de comparaison, mais vraiment pas de beaucoup. On parle d’environ 1 point de pourcentage de différence par rapport à l’époque de l’adoption d’Internet. Si vous regardez les graphiques, les courbes sont presque superposées donc vraiment de quoi déclencher l’état d’urgence.

Et quand les chercheurs y ont regardé de plus près, ils se rendu compte que cette accélération avait même commencé avant la sortie de ChatGPT. En fait, dès 2021, la répartition des métiers changeait déjà à ce rythme-là, donc attribuer ces changements à l’IA générative, c’est un peu hasardeux. C’était peut-être juste la reprise post-COVID, le télétravail qui a tout boulversé, ou une combinaison de facteurs qu’on ne comprend pas encore bien.

Les chercheurs ont aussi regardé secteur par secteur pour voir si certaines industries se faisaient plus défoncer que d’autres. Logiquement, si l’IA tape fort, ça devrait se voir dans les secteurs les plus exposés : l’information (journalisme, data processing), la finance, les services aux entreprises. Effectivement, ces secteurs ont connu des changements plus marqués que la moyenne.

Rien que le secteur de l’information (auquel j’appartiens) a vu son mix d’emplois pas mal bousculé mais quand on remonte dans le temps, on se rend compte que ce secteur en particulier a toujours été volatil. Ses emplois changent constamment, depuis bien avant l’IA générative car c’est un secteur qui se transforme en permanence. Maintenant, difficile de dire si l’IA accélère vraiment la tendance ou si c’est comme d’hab…

Et histoire de mettre encore un peu plus les choses en perspective, Jed Kolko de la Harvard Business Review a démontré que les changements actuels du marché du travail sont ridiculement faibles comparés à ce qu’on a connu dans les années 40 et 50. À l’époque, les bouleversements liés à la guerre et à la reconstruction faisaient bouger les lignes à une vitesse hallucinante mais aujourd’hui, on est sur une petite brise tranquille en comparaison.

Après il y a quand même un truc qui fait peur dans cette étude. Car même si globalement le marché du travail tient le coup, il y a une catégorie de travailleurs qui morfle… Ce sont les jeunes diplômés en début de carrière . Erik Brynjolfsson, un économiste de Stanford et spécialiste de l’IA, a publié en août dernier une étude complémentaire qui fait vraiment froid dans le dos.

En analysant les données de paie d’ADP (le plus gros fournisseur de logiciels de paie aux États-Unis), il a découvert que l’emploi des jeunes travailleurs (22-25 ans) dans les métiers les plus exposés à l’IA a chuté de 6% depuis fin 2022, pendant que l’emploi des travailleurs plus âgés dans les mêmes métiers augmentait de 6 à 9%.

C’est énorme comme écart… Ça représente une baisse relative de 13% pour les débutants par rapport aux seniors. Et dans certains secteurs comme le dev logiciel et le service client, la chute est encore plus brutale. C’est environ 20% de baisse pour les juniors entre fin 2022 et juillet 2025, alors que les seniors voyaient leur emploi progresser.

Brynjolfsson explique pourquoi les jeunes sont plus touchés, et c’est plutôt logique quand on y pense. En fait, les grands modèles de langage comme ChatGPT sont entraînés sur des livres, des articles, du contenu trouvé sur Internet. C’est exactement le genre de connaissances théoriques qu’on acquiert à l’université avant d’entrer sur le marché du travail, du coup, il y a un gros chevauchement entre ce que savent les LLM et ce que savent les jeunes diplômés tout frais démoulus de la fac.

Alors que les travailleurs expérimentés, eux, ont autre chose à offrir. Des années de pratique, des soft skills, une compréhension fine des dynamiques d’entreprise, un réseau professionnel…etc. Bref, des trucs qu’un LLM ne peut pas (encore) reproduire (mais votre tour viendra aussi, soyez en certains).

Résultat, les entreprises gardent ou embauchent des seniors et utilisent l’IA pour combler le gap qui était traditionnellement comblé par des juniors.

Par contre, dans les métiers où l’IA vient juste assister les travailleurs sans les remplacer, on ne voit pas cette différence entre les jeunes et les vieux.

Les chercheurs de Yale n’ont donc trouvé aucune corrélation entre l’exposition à l’IA (données OpenAI/Anthropic) et les changements d’emploi. Les métiers très exposés ne perdent pas plus d’emplois que les autres.

Il y a également une autre étude intéressante qui est sortie récemment. OpenAI a analysé 1,5 million de conversations de ses 700 millions d’utilisateurs actifs par semaine et en juin 2024, 47% des échanges concernaient le travail. Un an plus tard, ce chiffre est tombé à 27% ce qui fait que 73% de l’usage de ChatGPT est personnel, et pas professionnel.

Alors peut-être que l’IA générative trouve plus facilement sa place dans nos vies perso (aide aux devoirs, recettes de cuisine, conseils de voyage) que dans le monde du travail où les process sont plus complexes, les enjeux de sécurité plus importants, et l’intégration plus difficile, je ne sais pas… Ou peut-être que les entreprises sont juste plus lentes à l’adopter. C’est difficile à dire.

Mais bon, maintenant on sait que pour le moment, ça ne sert à rien de paniquer car les métiers changent, oui, mais pas plus vite que lors des précédentes révolutions technologiques. Et surtout, les changements qu’on observe ont commencé avant même ChatGPT, donc difficile de tout mettre sur le dos de l’IA.

Par contre, si vous êtes un étudiant qui s’apprête à entrer sur le marché du travail, vous devez être conscient que la compétition est plus rude qu’avant car l’IA ne vole peut-être pas tous les jobs, mais elle semble voler des points d’entrée traditionnels dans certains métiers.

Quoiqu’il en soit, les chercheurs de Yale prévoient de mettre à jour leur analyse régulièrement pour suivre l’évolution car une photo à un instant T ne suffit pas pour prédire le futur, et les effets pourraient s’accélérer. Ou pas. On verra bien…

En attendant, voici mes quelques conseils à deux balles… Si vous êtes en début de carrière, ne misez pas tout uniquement sur vos connaissances théoriques. Développez des compétences pratiques, construisez un portfolio de projets concrets, apprenez à bosser en équipe, améliorez votre communication (les fameux soft skills). Bref, lancez vous dans tout ce qui vous différencie d’un LLM. Et paradoxalement, apprendre à bien utiliser l’IA pourrait aussi être un énorma plus. Si tout le monde a accès à ChatGPT mais que vous savez l’utiliser mieux que les autres, ça peut faire la différence !

Et si vous êtes une entreprise, peut-être qu’il faut réfléchir à deux fois avant de shooter tous les postes juniors. Car oui, l’IA peut faire certaines tâches de base et vous faire économiser du temps et du pognon, mais former des petits jeunes c’est aussi investir dans votre pipeline de futurs seniors. Hé ouais…

Parce que si demain, tout le monde arrête d’embaucher des débutants, dans 10 ans, il n’y aura plus d’experts…

Source

❌