Vue lecture

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.

Anthropic annonce une version améliorée de Claude 3.5 Sonnet, une nouvelle fonctionnalité “Computer Use” et le nouveau modèle Claude 3.5 Haiku

En juin dernier, Anthropic lançait Claude 3.5 Sonnet, la première version de sa famille de modèles Claude 3.5. Mardi dernier, l’entreprise a présenté les améliorations apportées à ce modèle, notamment en matière de codage, et son dernier ajout à la famille : Claude 3.5 Haiku, un modèle qui égale les performances de Claude 3 Opus, son modèle le plus puissant. Elle a également introduit Computer Use, une fonctionnalité expérimentale d’interaction avec les ordinateurs qui fait, selon elle, de Claude 3.5 Sonnet “le premier modèle d’IA de pointe à offrir une utilisation informatique en version bêta publique”.

Cette fonctionnalité d’utilisation de l’ordinateur, disponible en version bêta, permet aux développeurs de demander au modèle d’interagir avec des interfaces graphiques en simulant les actions humaines, telles que déplacer le curseur ou cliquer sur un bouton.

Claude traduit ainsi les instructions comme “utiliser les données de mon ordinateur et les données en ligne pour remplir ce formulaire” en commandes informatiques : “vérifier une feuille de calcul, déplacer le curseur pour ouvrir un navigateur Web, naviguer vers les pages Web pertinentes, remplir un formulaire avec les données de ces pages…”.

Anthropic explique :

“Lorsqu’un développeur charge Claude d’utiliser un logiciel informatique et lui donne l’accès nécessaire, Claude regarde des captures d’écran de ce qui est visible par l’utilisateur, puis compte le nombre de pixels verticalement ou horizontalement dont il a besoin pour déplacer un curseur afin de cliquer au bon endroit. Il était essentiel d’apprendre à Claude à compter les pixels avec précision. Sans cette compétence, le modèle a du mal à donner des commandes à la souris, de la même manière que les modèles ont souvent du mal à répondre à des questions simples telles que « combien de A dans le mot « banane » ?”

Des entreprises comme Asana, Canva, Cognition, DoorDash, Replit et The Browser Company, exploitent déjà cette capacité pour automatiser des processus complexes qui peuvent nécessiter des dizaines, voire des centaines d’étapes.

Sur OSWorld, qui évalue la capacité des modèles d’IA à utiliser les ordinateurs comme le font les humains, Claude 3.5 Sonnet a obtenu un score de 14,9 % dans la catégorie des captures d’écran uniquement, ce qui est nettement mieux que le score de 7,8 % du meilleur système d’IA. Lorsqu’on lui a donné plus d’étapes pour accomplir la tâche, Claude a obtenu un score de 22,0 %.

Les développeurs peuvent l’essayer via l’API d’Anthropic, Amazon Bedrock et la plateforme Vertex AI de Google Cloud. Anthropic avertit toutefois qu’à ce stade expérimental, le modèle peut être sujet aux erreurs et recommande de ne pas lui donner accès à des données sensibles. L’entreprise a fait le choix de le publier pour recueillir leurs commentaires.

Claude 3.5 Sonnet : des gains en codage et en usage d’outils

Le modèle Claude 3.5 Sonnet montre des améliorations notables par rapport à ses versions précédentes, notamment dans des domaines critiques tels que le codage et l’utilisation d’outils. Selon les benchmarks de l’industrie, Sonnet a amélioré son score sur SWE-bench Verified, un test évaluant les capacités de codage agentique, passant de 33,4 % à 49 %. Cette progression est également visible sur TAU-bench, un benchmark évaluant l’utilisation d’outils en situation réelle, où Sonnet a amélioré ses performances dans les secteurs de la vente au détail et de l’aviation.

Des entreprises comme GitLab et The Browser Company, qui ont testé Sonnet pour des tâches complexes de développement logiciel et d’automatisation de processus web, ont signalé une meilleure capacité à suivre des instructions et à résoudre des problèmes sans augmenter les délais d’exécution.

Claude 3.5 Haiku : rapidité et performance

Claude 3.5 Haiku, de son côté, se positionne comme un modèle plus rapide, tout en offrant des performances similaires à celles de Claude 3 Opus, un modèle plus volumineux de la génération précédente. Il est particulièrement efficace pour les tâches nécessitant une génération rapide de texte, ainsi que pour l’analyse et l’exploitation de grandes bases de données. Haiku se distingue par sa faible latence et son coût maîtrisé, en faisant un choix adapté pour des produits interactifs ou des tâches spécialisées à grande échelle.

Anthropic annonce une version améliorée de Claude 3.5 Sonnet, une nouvelle fonctionnalité "Computer Use" et le nouveau modèle Claude 3.5 Haiku

BitNet.cpp : le cadre open source de Microsoft pour réduire les coûts d’inférence des LLMs quantifiés à 1 bi

Microsoft a récemment publié BitNet.cpp, un cadre open-source conçu pour optimiser l’inférence des grands modèles de langage (LLM) quantifiés à 1 bit. Il permet notamment d’exécuter un modèle BitNet b1.58 de 100 milliards de paramètres sur un seul processeur, atteignant des vitesses de traitement comparables à la lecture humaine, à une cadence de 5-7 jetons par seconde, démocratisant ainsi l’accès aux LLM les plus avancés.

La taille croissante des LLM pose des défis pour leur déploiement et soulève des inquiétudes quant à leur impact environnemental et économique, principalement en raison de leur forte consommation d’énergie.

Les avantages de la quantification

Une des approches pour répondre à ces défis consiste à utiliser la quantification post-entraînement, qui vise à créer des modèles à faible précision pour l’inférence. Cette technique réduit la précision des poids et des activations, diminuant ainsi considérablement les besoins en mémoire et en ressources de calcul des LLMs.

BitNet.cpp s’appuie sur les travaux de Microsoft sur les architectures de modèles quantifiés 1 bit, notamment BitNet, et la variante LLM à 1 bit, BitNet b1.58, introduite en février dernier, dans laquelle chaque paramètre (ou poids) du LLM est ternaire {-1, 0, 1}

Contrairement aux LLMs traditionnels qui utilisent des valeurs en virgule flottante 16 bits (FP16 ou BF16) pour les opérations de multiplication de matrices, BitNet n’utilise que des additions entières, ce qui permet une économie d’énergie significative tout en maintenant les caractéristiques essentielles du modèle.

Outre le calcul, le transfert des paramètres du modèle entre la mémoire DRAM et celle d’un accélérateur sur puce (comme la SRAM) peut être coûteux. Les tentatives d’agrandissement de la SRAM pour améliorer le débit entraînent en effet des coûts élevés. En revanche, les modèles 1 bit comme ceux de BitNet ont une empreinte mémoire beaucoup plus faible, ce qui réduit à la fois le coût et le temps de chargement des poids depuis la DRAM, accélérant ainsi l’inférence.

La précision de 1,58 bits dans le système binaire conserve tous les avantages de BitNet 1 bit tout en ajoutant des capacités de filtrage de caractéristiques, grâce à l’inclusion de la valeur 0 dans les poids du modèle.

Le cadre d’inférence BitNet.cpp

Le cadre, qui gère l’exécution de ce modèle optimisé et des LLM 1 bit, offre une suite de noyaux optimisés qui prennent actuellement en charge l’inférence sans perte sur le CPU, avec des plans pour la prise en charge de NPU et GPU à l’avenir.

Actuellement, bitnet.cpp prend en charge les processeurs ARM et x86. Les vitesses d’inférence sont de 1,37 et 5,07 fois plus rapides sur les processeurs ARM, et de 2,37 à 6,17 fois sur les processeurs x86, selon la taille du modèle.

Les gains énergétiques vont quant à eux de 55,4 % à 82,2 %, selon la configuration : 55,4 % à 70,0 % sur les processeurs ARM, et 71,9 % à 82,2 % sur les processeurs x86.

Les modèles testés ci-dessous sont des configurations factices utilisées pour illustrer les capacités du framework.

BitNet.cpp prend en charge une liste de modèles 1 bit disponibles sur Hugging Face, qui sont entraînés avec des paramètres de recherche.

En réduisant la dépendance à des infrastructures énergivores, BitNet.cpp peut contribuer à diminuer l’empreinte carbone des LLM et à améliorer leur adoption dans des environnements de calcul à faible coût, où la consommation énergétique est un facteur critique. Les développeurs, les petites et moyennes entreprises, qui n’ont pas toujours les moyens d’investir dans des solutions basées sur des GPU ou des serveurs cloud puissants, pourraient ainsi en bénéficier.

Au-delà de l’impact sur la consommation d’énergie, l’exécution locale des modèles via BitNet.cpp présente aussi des avantages sur le plan de la confidentialité des données, en évitant le recours à des infrastructures cloud pour le traitement de l’information.

Des instructions détaillées pour installer et configurer bitnet.cpp sur différents systèmes d’exploitation, y compris Windows et Debian/Ubuntu, sont disponibles sur GitHub.

BitNet.cpp : le cadre open source de Microsoft pour réduire les coûts d'inférence des LLMs quantifiés à 1 bi

Anthropic annonce le lancement de Claude 3.5 Sonnet, un sérieux concurrent à GPT-4o

En mars dernier, Anthropic annonçait la dernière itération de sa famille de modèles d’IA générative Claude, se déclinant sous trois versions : Claude 3 Haiku, Claude 3 Sonnet et Claude 3 Opus, par ordre de performances. Elle lance à présent Claude 3.5 Sonnet, “sa première version de la prochaine famille de modèles Claude 3.5”. Claude 3.5 Sonnet surpasse les modèles concurrents, dont le modèle phare d’OpenAI, GPT-4o, et Claude 3 Opus sur un large éventail d’évaluations.

Claude 3.5 Sonnet est désormais disponible gratuitement sur Claude.ai et via l’application iOS Claude, il est également accessible via l’API Anthropic, Amazon Bedrock, et Google Cloud’s Vertex AI. Les abonnés aux offres Claude Pro et Team bénéficient de limites de débit plus élevées. La tarification est fixée à 3 $ par million de jetons d’entrée et 15 $ par million de jetons de sortie, avec une capacité de fenêtre contextuelle de 200 000 jetons.

Performances et intelligence avancées

Selon Anthropic:

“Claude 3.5 Sonnet montre une nette amélioration de la compréhension des nuances, de l’humour et des instructions complexes, et est exceptionnel pour écrire un contenu de haute qualité avec un ton naturel et pertinent”.

Anthropic a comparé ses performances à celles de Claude 3 Opus, jusqu’alors son modèle le plus puissant, ainsi qu’à GPT-4o, Gemini 1.5 Pro de Google et à Llama-400b de Meta. Comme on peut le voir dans le tableau ci-dessous, Claude 3.5 Sonnet établit de nouvelles références pour le raisonnement de niveau supérieur (GPQA), les connaissances universitaires (MMLU) et la maîtrise du codage (HumanEval).

De plus, il fonctionne deux fois plus vite que Claude 3 Opus, ce qui le rend idéal pour des tâches complexes comme le support client contextuel et l’orchestration de flux de travail en plusieurs étapes.

Codage et résolution de problèmes

Lors d’une évaluation interne de codage, Claude 3.5 Sonnet a résolu 64 % des problèmes, surpassant Claude 3 Opus qui en a résolu 38 %. Cette évaluation teste la capacité du modèle à corriger des bogues ou à ajouter des fonctionnalités à une base de code open source à partir d’une description en langage naturel. Claude 3.5 Sonnet peut écrire, éditer et exécuter du code de manière indépendante avec des capacités de raisonnement sophistiquées, gérant aisément les traductions de code, ce qui le rend particulièrement efficace pour la mise à jour des applications existantes et la migration des bases de code.

Vision avancée

Claude 3.5 Sonnet a également surpassé Claude 3 Opus sur les benchmarks de vision standard. Les améliorations sont particulièrement visibles dans les tâches nécessitant un raisonnement visuel, comme l’interprétation de tableaux et de graphiques. Il peut également transcrire avec précision du texte à partir d’images imparfaites, une capacité essentielle pour des secteurs comme le commerce de détail, la logistique et les services financiers.

Introduction des Artefacts

En marge du lancement de Claude 3.5 Sonnet, Anthropic annonce les Artefacts sur Claude.ai, une nouvelle fonctionnalité qui transforme l’interaction des utilisateurs avec Claude. Désormais, lorsque les utilisateurs sollicitent Claude pour la création de contenus tels que des morceaux de code, des fichiers texte ou des maquettes de sites web, ces éléments sont générés dans un volet spécial, juste à côté de leur dialogue en cours. Cet ajout offre un environnement de travail interactif où les utilisateurs peuvent non seulement visualiser mais aussi éditer et enrichir les productions de Claude en direct, ce qui leur permet d’intégrer de manière fluide le contenu généré par l’IA dans leurs projets.

Nouvelles fonctionnalités et perspectives

Anthropic déclare vouloir “améliorer la courbe de compromis entre intelligence, vitesse et coût tous les quelques mois”, Claude 3.5 Haiku et Claude 3.5 Opus qui seront lancés plus tard cette année devraient afficher eux aussi des performances nettement améliorées par rapport à leurs prédécesseurs. La start-up travaille parallèlement au développement de nouvelles fonctionnalités, notamment à celui de “Memory”, qui permettra à Claude de se souvenir des préférences des utilisateurs et de l’historique des interactions, rendant l’expérience encore plus personnalisée et efficace.

Anthropic annonce le lancement de Claude 3.5 Sonnet, un sérieux concurrent à GPT-4o
❌