Vue normale

Il y a de nouveaux articles disponibles, cliquez pour rafraîchir la page.
À partir d’avant-hierLinuxFr.org : les dépêches

Sortie de la version 7.0 de Datafari, moteur de recherche open source « intelligent » pour entreprise

Nous (France Labs, éditeur de Datafari) sommes fiers de vous annoncer la mise à disposition de Datafari 7.0

Nous avons beaucoup travaillé sur l’intégration plus avancée de l’IA au moment de la recherche, avec à présent une interface dédiée, notre « assistant intelligent », qui permet de converser avec les documents internes.

Pour rappel, Datafari est une solution de recherche pour entreprise. Où que les connaissances se trouvent et sous quelque format que ce soit, elle permet aux employés de retrouver les données utiles.

Et désormais grâce à l’IA, de « discuter » avec ses connaissances. Plus concrètement, il s’agit de récupérer et d’indexer les données et documents depuis de nombreuses sources différentes et plusieurs formats de fichiers, et de permettre aussi de chercher des documents, mais aussi d’utiliser une IA générative pour les questionner.

Pour cette dépêche, on se concentre sur la version libre et open source (licence Apache Public License v2).

Exemple de l'assistant IA Datafari

Les nouveautés et changements principaux par rapport à la version 6 :

  1. Un assistant intelligent permettant de discuter avec les documents
  2. Un mode « Retrieval Augmented Generation » permettant d’obtenir des réponses basées uniquement sur les données internes, et ne nécessitant pas d’entraîner un modèle
  3. Un mode « agentic » permettant à l’IA de raisonner sur la question posée, et de décider quelles actions prendre pour y répondre
  4. Une recherche avec plusieurs modes : par mots clés, sémantique (basée sur la recherche vectorielle dans Solr) ou hybride
  5. Des corrections, des améliorations et des mises à jour logicielles

Comment démarrer ?

Pour voir à quoi ça ressemble, nous avons téléversé une courte vidéo de démonstration (voir le lien plus bas). Pour démarrer tout de suite, le mieux est d’aller lire le quick start guide. Nous mettons gratuitement à disposition notre documentation Datafari sur Confluence, qui couvre les usages, l’administration et le développement. Attention, les modules d’IA que nous avons développés, nécessitent la disponibilité d’un serveur exposant un modèle d’IA compatible. De base, Datafari n’héberge pas localement une IA. Le plus simple pour débuter est de le connecter par exemple à Mistral pour se faire la main, et ensuite de passer à des modèles locaux hébergés par vos soins ou par des partenaires.

Pour rappel, voici les principales fonctionnalités de Datafari en tant que moteur de recherche :

Que peut-on faire avec Datafari ?

Datafari est un moteur de recherche pour entreprise enrichi à l’IA : membres de la famille des outils de gestion des connaissances, les solutions de recherche fédèrent les connaissances en analysant et indexant tous les documents d’une organisation, aussi bien leur contenu que leurs métadonnées. Pour cela, le moteur de recherche doit être multi‐sources, multi‐formats, et gérer la sécurité. En outre, il faut permettre l’administration de l’outil.

Dans la version libre, on peut, côté admin :

  1. Administrer les connecteurs vers les sources de données (nous utilisons Apache ManifoldCF avec tous ses connecteurs) ;
  2. Utiliser l’IA à l’indexation pour analyser et enrichir les contenus ;
  3. Gérer l’algorithme de pertinence qui classe les documents pour leur affichage suite à une requête ;
  4. Mettre en avant des documents pour des requêtes identifiées ;
  5. Créer des utilisateurs et leur assigner des rôles ;
  6. Voir des statistiques d’usage de l’outil ;
  7. Configurer le modèle d’IA et les paramètres de vectorisation ;
  8. Encore plein d’autres choses abordées dans la documentation Confluence.

Côté utilisateur, on peut :

  1. Chercher de façon simple ou avancée ;
  2. Poser des questions sur un ou plusieurs documents ;
  3. Laisser l’IA fouiller dans tous les documents pour répondre ;
  4. Bénéficier de la correction orthographique et de l’auto‐complétion ;
  5. Choisir et utiliser des facettes pour filtrer les résultats ;
  6. Créer des alertes par courriel quand des documents modifiés ou nouveaux correspondent à une requête ;
  7. ….

Et ensuite ?

Pour 2026 et 2027, nous continuerons de faire évoluer la partie IA. En parallèle, nous travaillons à la refonte de notre système de moissonnage des données.

Des commentaires ?

Nous sommes en permanence à l’écoute des commentaires et suggestions pour faire avancer le produit, alors profitez-en, que ce soit d’un point de vue technique ou fonctionnel, ça nous intéresse. Ha et si vous êtes déjà un utilisateur, n’hésitez pas à en parler sur le web !

Commentaires : voir le flux Atom ouvrir dans le navigateur

  • ✇LinuxFr.org : les dépêches
  • 🎙 Projets Libres saison 4 épisode 10 : l'Open Source vu par une chercheuse
    Pour ce nouvel épisode de Projets Libres, nous abordons l'Open Source par les yeux de Amel Charleux, Maître de conférences à l'Université de Montpellier. Amel nous partage : la manière dont elle travaille sa relation avec les autres chercheuses et chercheurs qui travaillent sur ces sujets comment la recherche peut aider à la réflexion ou à la mise en place de structures (avec l'exemple de l'association OpenRail Association) l'évolution des modèles économiques Open Source l'impact de l'IA et

🎙 Projets Libres saison 4 épisode 10 : l'Open Source vu par une chercheuse

Pour ce nouvel épisode de Projets Libres, nous abordons l'Open Source par les yeux de Amel Charleux, Maître de conférences à l'Université de Montpellier.

Bannière du podcast

Amel nous partage :

  • la manière dont elle travaille
  • sa relation avec les autres chercheuses et chercheurs qui travaillent sur ces sujets
  • comment la recherche peut aider à la réflexion ou à la mise en place de structures (avec l'exemple de l'association OpenRail Association)
  • l'évolution des modèles économiques Open Source
  • l'impact de l'IA
  • et plein d'autres sujets.

Bonne écoute !

Commentaires : voir le flux Atom ouvrir dans le navigateur

  • ✇LinuxFr.org : les dépêches
  • Sortie de Datafari 6.2, moteur de recherche open source pour entreprise avec de l'IA
    Nous (NdM: France Labs qui porte datafari.com) sommes fiers de vous annoncer la mise à disposition de Datafari 6.2 Pour faire court, la grosse nouveauté vient de l’intégration simplifiée des outils tiers d’IA générative. Ces travaux ont été en partis financés par le projet Européen NGI Search Neural Datafari, qui a permi du coup également d'ajouter la recherche vectorielle bout en bout au projet Apache Solr. Pour rappel, Datafari est une solution de recherche pour entreprise. Où que les connai

Sortie de Datafari 6.2, moteur de recherche open source pour entreprise avec de l'IA

Nous (NdM: France Labs qui porte datafari.com) sommes fiers de vous annoncer la mise à disposition de Datafari 6.2

Pour faire court, la grosse nouveauté vient de l’intégration simplifiée des outils tiers d’IA générative. Ces travaux ont été en partis financés par le projet Européen NGI Search Neural Datafari, qui a permi du coup également d'ajouter la recherche vectorielle bout en bout au projet Apache Solr.

Pour rappel, Datafari est une solution de recherche pour entreprise. Où que les connaissances se trouvent et sous quelque format que ce soit, elle permet aux employés de retrouver les données utiles.

Et désormais grâce à l’IA, de « discuter » avec ses connaissances. Plus concrètement, il s’agit de récupérer et d’indexer les données et documents depuis de nombreuses sources différentes et plusieurs formats de fichiers, et de permettre aussi de chercher des documents mais aussi d’utiliser une IA générative pour les questionner.

Pour cette dépêche, on se concentre sur la version libre et open source (mais il y a aussi d’autres nouveautés sur la version entreprise propriétaire).

Titre de l'image

Notre dernière dépêche datant de… Datafari 5.3, voici Les nouveautés et changements principaux par rapport à cette dernière:

  1. Ajout d’un module RAG (Retrieval Augmented Generation)
  2. Passage à Solr 9.8 avec recherche vectorielle
  3. Ajout d’un module d’appel de LLM à l’indexation
  4. Gestion automatique du chunking des documents indexés
  5. Création d’un module autonome d’analytics au lieu de Zeppelin pour optimiser les ressources
  6. Création d’un regex connector à l’indexation
  7. Refonte technique de l’interface graphique, en React
  8. Passage à la V2 des API REST de Datafari
  9. Prototype d’agent autonome pour héberger en local un modèle d’IA
  10. Du bugfix de partout

Comment démarrer ?

Pour voir à quoi ça ressemble, nous avons téléversé une courte vidéo de démonstration. Pour démarrer tout de suite, le mieux est d’aller lire le quick start guide. Nous mettons gratuitement à disposition notre documentation Datafari sur Confluence, qui couvre les usages, l’administration et le développement. Attention, les modules d’IA que nous avons développés, nécessitent la disponibilité d’un serveur exposant un modèle d’IA compatible. De base, Datafari n’héberge pas localement une IA. Le plus simple pour débuter est de le connecter par exemple à openAI pour se faire la main, et ensuite de passer à des modèles locaux hébergés par vos soins ou par des partenaires.

Pour rappel, voici les principales fonctionnalités de Datafari en tant que moteur de recherche :

Que peut‐on faire avec Datafari ?

Datafari est un moteur de recherche pour entreprise enrichi à l’IA : membres de la famille des outils de gestion des connaissances, les solutions de recherche fédèrent les connaissances en analysant et indexant tous les documents d’une organisation, aussi bien leur contenu que leurs métadonnées. Pour cela, le moteur de recherche doit être multi‐sources, multi‐formats, et gérer la sécurité. En outre, il faut permettre l’administration de l’outil.

Dans la version libre, on peut, côté admin :

  1. Administrer les connecteurs aux sources de données vers de nombreuses sources (nous utilisons Apache ManifoldCF avec tous ses connecteurs) dont Sharepoint, Confluence, Alfresco et les partages de fichiers ;
  2. Gérer l’algorithme de pertinence qui classe les documents pour leur affichage suite à une requête ;
  3. Activer les modules de recherche vectorielle et de RAG
  4. Mettre en avant des documents pour des requêtes identifiées ;
  5. Créer des utilisateurs et leur assigner des rôles ;
  6. Voir des statistiques d’usage de l’outil ;
  7. Créer l’équivalent de Google AdWords (appelés promoliens) ;
  8. Gérer des synonymes ;
  9. Plein d’autres choses accessibles depuis la documentation Confluence.

Côté utilisateur, on peut :

  1. Chercher de façon simple ou avancée ;
  2. Prévisualiser les résultats ;
  3. « Discuter » avec ses documents via le module RAG
  4. Bénéficier de la correction orthographique et de l’auto‐complétion ;
  5. Choisir et utiliser des facettes pour filtrer les résultats ;
  6. Mettre des résultats dans un panier de favoris ;
  7. Créer des alertes par courriel quand des documents modifiés ou nouveaux correspondent à une requête.

Et ensuite ?

Pour le reste de 2025, nous allons continuer à ajouter des fonctionnalités se basant sur les IA génératives pour multiplier les possibilités.

Des commentaires ?

Nous sommes en permanence à l’écoute des commentaires et suggestions pour faire avancer le produit, alors profitez-en, que ce soit d’un point de vue technique ou fonctionnel, ça nous intéresse. Ha et si vous êtes déjà un utilisateur, n’hésitez pas à en parler sur le web !

Commentaires : voir le flux Atom ouvrir dans le navigateur

  • ✇LinuxFr.org : les dépêches
  • Appel "Campus du libre 2024 (Lyon)" - Le numérique libre dans l'enseignement et la recherche
    La 7ème édition du Campus du Libre se déroulera le samedi du 23 novembre 2024 au campus de la Manufacture des Tabacs à l'Université Jean-Moulin Lyon3. Le Campus du Libre est un événement inter-établissements rassemblant plusieurs établissements lyonnais (INSA-Lyon, Université Lyon 1, Université Lyon 2, Université Lyon 3) en partenariat avec les entreprises du Ploss-RA (association d'entreprises du numérique libre en Auvergne Rhône-Alpes) avec l'objectif de promouvoir le numérique libre et éthiq

Appel "Campus du libre 2024 (Lyon)" - Le numérique libre dans l'enseignement et la recherche

La 7ème édition du Campus du Libre se déroulera le samedi du 23 novembre 2024 au campus de la Manufacture des Tabacs à l'Université Jean-Moulin Lyon3.

Le Campus du Libre est un événement inter-établissements rassemblant plusieurs établissements lyonnais (INSA-Lyon, Université Lyon 1, Université Lyon 2, Université Lyon 3) en partenariat avec les entreprises du Ploss-RA (association d'entreprises du numérique libre en Auvergne Rhône-Alpes) avec l'objectif de promouvoir le numérique libre et éthique dans l'enseignement et la recherche. Lors de cette journée, les visiteurs se retrouvent pour échanger autour de leurs expériences et leurs projets.

Le Campus Du Libre proposera

  • Un village des associations et entreprises
  • Des ateliers démonstratifs et pratiques
  • Des conférences
  • Des install-party et flash party
  • Des espaces de divertissements libristes (tournois de jeux vidéo libres, concerts, expo…)
  • Animation de réseautage

Si vous souhaitez faire des propositions pour nourrir cet événement, l'appel à contribution est en ligne pour vous accompagner : https://www.campus-du-libre.org/cfp.php

Merci d'envoyer vos propositions avant le 21 septembre à l'adresse de courriel : contact@campus-du-libre.org

L’événement est gratuit et ouvert à tous et toutes.

Comme les années précédentes en témoignent, ce sera aussi l’occasion pour les étudiants et étudiantes de se créer des relations dans le secteur et de trouver un stage ou une alternance.

Le campus du Libre s’adresse à toutes personnes voulant en apprendre plus sur l'univers du Libre. Et découvrir des alternatives, aux logiciels propriétaires et privateurs, qui puissent répondre aux besoins du quotidien.

L’équipe organisatrice vous prépare cette nouvelle édition avec impatience !

L'équipe du Campus du Libre vous remercie pour votre participation,
Au plaisir de vous lire,

Commentaires : voir le flux Atom ouvrir dans le navigateur

❌
❌