Service

Systèmes de connaissances et de données

Le savoir de votre organisation ne devrait pas rester prisonnier de dossiers et de boîtes de réception. Nous construisons des systèmes qui vous laissent poser une question et obtenir une réponse : à partir de vos propres documents, pas d'internet. Une brique de base de l'IA souveraine pour les organisations luxembourgeoises.

Réserver un appel
Système de connaissances reliant documents, recherche et IA

Ce que cela veut dire en pratique

Nous construisons des systèmes de connaissances qui deviennent plus intelligents à mesure que votre organisation grandit.

Pour les ONG

Recherche interne sécurisée dans les dossiers de cas, les rapports et la correspondance. Aide à la rédaction de demandes de subvention à partir du savoir interne. Le tout auto-hébergé, le tout souverain.

Pour les PME

Bases de connaissances clients, recherche dans la documentation interne, génération automatisée de rapports. Transformez une information éparpillée en avantage concurrentiel.

Pour les indépendants

Une gestion personnelle des connaissances qui se souvient de tout ce que vous avez écrit, recherché et appris, et qui le fait ressortir au moment où vous en avez besoin.

Comment nous travaillons ensemble

01

Audit

Cartographier vos sources de savoir existantes : documents, e-mails, bases de données, disques partagés.

02

Conception

Concevoir l'architecture du système de connaissances : recherche, récupération et traitement propulsé par l'IA.

03

Construction

Mettre en place le système avec des outils open source sur une infrastructure hébergée dans l'UE.

04

Croissance

Former votre équipe, puis poursuivre si vous le souhaitez par un partenariat continu pour développer le système.

Ce que vous obtenez

Une base de connaissances interrogeable
Un pipeline de traitement documentaire propulsé par l'IA
Formation de l'équipe et documentation
Auto-hébergé sur une infrastructure de l'UE

Modalités

Au projet, souvent à la suite d'une découverte

Peut évoluer en partenariat continu pour la maintenance et le développement à mesure que votre base de connaissances grandit.

Questions fréquentes

Qu'est-ce que le RAG (génération augmentée par récupération) ?

Le RAG permet à une IA de répondre à partir de vos propres documents plutôt que de ses données d'entraînement générales. Le système récupère d'abord les passages pertinents, puis l'IA rédige une réponse ancrée dans ces passages.

Le RAG, c'est la façon de faire répondre une IA à partir de vos propres documents plutôt que de ses données d'entraînement générales. La partie « récupération » : quand vous posez une question, le système commence par chercher dans vos documents et en extrait les passages les plus pertinents. La partie « génération » : ces passages sont transmis au modèle d'IA avec votre question, pour que sa réponse s'appuie sur votre contenu réel. Cela compte pour deux raisons. D'abord, l'IA cesse d'inventer des choses sur votre activité, puisqu'elle dispose du texte réel à lire. Ensuite, vous pouvez mettre à jour le contenu source à tout moment et les réponses de l'IA se mettent à jour avec lui. Aucun réentraînement nécessaire.

L'IA peut-elle chercher dans les documents de mon entreprise sans les divulguer ?

Oui, si l'architecture est bien pensée. Le risque de fuite vient des services d'IA publics aux conditions permissives ou aux serveurs hors UE. Un système RAG hébergé en privé sur une infrastructure de l'UE peut être plus sûr que votre serveur de fichiers.

Oui, si vous choisissez votre architecture avec soin. Le risque de fuite vient d'un endroit précis : le fait de téléverser des documents sensibles vers un service d'IA public dont les conditions d'utilisation autorisent l'usage de vos données pour l'entraînement, ou dont les serveurs se trouvent dans une juridiction que vous préféreriez éviter. Il n'y a rien dans la recherche par IA qui provoque en soi une fuite de données. Un système RAG hébergé en privé, tournant sur une infrastructure de l'UE avec un contrat clair de non-entraînement, peut être plus sûr que le serveur de fichiers que la plupart des entreprises utilisent déjà. Passer du risqué au sûr est surtout une question de modèle utilisé, du lieu où il tourne et de ce que dit le contrat.

Ai-je besoin d'une base de données vectorielle pour bâtir un système de connaissances ?

Probablement pas dès le départ. Les bases de données vectorielles conviennent pour des millions de documents. Pour quelques centaines de documents, une structure de dossiers avec recherche, ou un simple index d'embeddings, suffit.

Probablement pas comme première étape. Les bases de données vectorielles sont la réponse habituelle dans le monde de l'ingénierie IA, et pour des systèmes qui gèrent des millions de documents et des milliers d'utilisateurs, c'est la bonne réponse. Mais pour une petite organisation avec quelques centaines de documents, une configuration plus simple fonctionne très bien et ne coûte rien à faire tourner. Parfois la bonne réponse, c'est une structure de dossiers avec recherche. Parfois, c'est un index d'embeddings basique qui vit sur un seul serveur. Nous choisissons ce qui convient à l'échelle, pas ce qui fait impressionnant sur un schéma technique. Vous pourrez toujours passer à une base de données vectorielle plus tard si votre volume grandit.

En quoi est-ce différent de simplement téléverser des PDF dans ChatGPT ?

Les téléversements dans ChatGPT ne persistent pas d'une session à l'autre, tronquent les longs documents et peuvent servir à l'entraînement par défaut. Un système de connaissances bien construit garde tout indexé, gère les longs documents et applique des règles contractuelles de non-entraînement.

Trois choses. L'offre gratuite de ChatGPT ne conserve pas vos documents d'une session à l'autre, il faudrait donc tout retéléverser à chaque fois. Sa fenêtre de contexte est aussi limitée, ce qui veut dire que les documents plus longs sont tronqués ou résumés avant que le modèle ne les voie. Et par défaut, vos téléversements peuvent servir à entraîner le modèle, sauf si vous vous y êtes explicitement opposé. Un système RAG bien construit garde vos documents indexés et disponibles en permanence, gère les documents de n'importe quelle longueur en ne récupérant que les parties pertinentes, et tourne dans un environnement où la règle de non-entraînement est contractuelle. Les téléversements dans ChatGPT sont bien pour des besoins ponctuels et rapides. Un système de connaissances bien construit est un outil d'une tout autre catégorie.

Faites travailler votre savoir pour vous.

Réservez un appel de découverte gratuit de 20 minutes pour parler de ce qu'un système de connaissances pourrait faire pour votre organisation.

Réserver un appel