Thank You Future THANK YOU FUTURE

⏤ Plateforme de chat IA locale

Le chat IA de votre entreprise,
dans vos murs.

Thank You Future installe une application de chat IA à la marque de votre entreprise, fondée sur Open WebUI v0.11.x, avec les modèles de langage exécutés sur votre propre serveur GPU. Conversations, documents et index de recherche restent dans votre infrastructure.

Connexion par les comptes Microsoft 365, Active Directory, LDAP ou Google déjà en place. Accès distant par tunnel authentifiant, en HTTPS, sans aucun port publié sur internet.

Open WebUI v0.11.x Modèles exécutés sur votre serveur Neuchâtel · Suisse

Dans l’application

Une interface que vos équipes reconnaissent

Même geste que les assistants grand public : on écrit, on dépose un document, on parle. La différence est invisible pour l’utilisateur et décisive pour la direction — rien ne part chez un tiers.

  • Conversations
  • Dossiers
  • Notes
  • Espace de travail
  • Sélecteur de modèles
  • Recherche
  • Saisie vocale
  • Mode vocal
  • Recherche web activable

Qu’est-ce qu’un chat IA local en entreprise ?

Un chat IA local est une application de conversation avec un modèle de langage installée sur les serveurs de l’entreprise, et non chez un fournisseur cloud. Thank You Future livre cette plateforme fondée sur Open WebUI v0.11.x, avec les modèles servis par un serveur GPU du client. Les conversations, les documents téléversés et les index de recherche restent dans le périmètre technique de l’entreprise.

L’offre est un service, pas un achat de matériel : Thank You Future installe la plateforme sur une infrastructure Linux x86_64 disposant de Docker Compose, la raccorde à l’annuaire de l’entreprise et en assure l’exploitation. La pile de référence tourne sur un NAS, mais la procédure s’applique à tout hôte Docker doté de volumes persistants.

01

Une application à votre marque

Nom, logo et favicon de votre entreprise sur une base Open WebUI v0.11.x, dont l’image et l’empreinte sont figées — jamais l’étiquette « latest ».

02

Des modèles exécutés chez vous

Langage, embeddings, transcription et synthèse vocale sont servis par un serveur GPU de votre réseau, testé par une vraie requête avant mise en service.

03

Vos identités déjà en place

Microsoft 365 / Entra ID, Active Directory, LDAP ou Google : une seule autorité d’identité, choisie avant l’installation, avec la MFA de votre annuaire.

04

Une exploitation documentée

Sauvegardes chiffrées, restauration testée avant chaque mise à jour, recette technique signée, inventaire, matrice des flux et procédures remises au client.

⏤ Dans l’interface

Que peut faire la plateforme au quotidien ?

La plateforme installée par Thank You Future offre les conversations, les dossiers, les notes, un espace de travail, un sélecteur de modèles, la recherche, la saisie vocale, un mode vocal et une recherche web activable. Les documents personnels ne sont jamais montés automatiquement : ils sont téléversés explicitement par l’utilisateur.

Conversations

Le fil de discussion habituel, avec l’historique de chaque personne. Un utilisateur ne voit ni les conversations ni les documents d’un autre.

Dossiers et notes

Les conversations se rangent en dossiers, et les notes gardent au même endroit ce que l’on veut réutiliser d’une session à l’autre.

Espace de travail

L’espace de travail regroupe les modèles autorisés, les bases de connaissances et les outils publiés, accordés par groupe et non compte par compte.

Sélecteur de modèles

Le modèle est choisi dans une liste. Les modèles sont inscrits au registre et accordés à un groupe, pas laissés en modèle privé du premier administrateur.

Recherche documentaire

Un PDF ou un fichier texte téléversé est extrait par Apache Tika, découpé, vectorisé, puis interrogé avec citation de la source dans la réponse.

Saisie vocale

La dictée est transcrite en local par le modèle Whisper large v3 turbo servi sur votre serveur GPU. Aucun extrait audio n’est envoyé à un service tiers.

Mode vocal

La conversation peut se tenir à la voix, la réponse étant lue par le moteur de synthèse vocale local, avec la voix approuvée lors de la recette.

Recherche web activable

La recherche web se déclenche à la demande, jamais d’office, et l’utilisateur reçoit une confirmation avant que la requête ne quitte le réseau.

Comptes et groupes

Les groupes portent les droits : modèles, bases de connaissances et outils sont accordés collectivement, et le départ d’une personne se traite dans l’annuaire.

⏤ Modèles et socle technique

Quels modèles tournent en local ?

Quatre familles de modèles sont servies par le serveur GPU du client : un modèle de langage, un modèle d’embeddings pour la recherche documentaire, une transcription vocale et une synthèse vocale. Thank You Future teste chacun de ces services par une vraie requête avant la mise en service — un port ouvert n’est jamais considéré comme une preuve de fonctionnement.

Modèles exécutés sur le serveur GPU du client
Fonction Modèle de référence Ce qu’il porte
Langage Qwen 3.8, Qwen3.8-Flash-Next, Kimi K3… Rédaction, synthèse, réponse aux questions et raisonnement. Le modèle se choisit selon la machine et le besoin — il n’est pas figé, et se remplace sans rien réinstaller.
Embeddings Qwen3-Embedding-0.6B Vectorisation des documents pour la recherche documentaire, en 1024 dimensions.
Transcription whisper-large-v3-turbo Saisie vocale et transcription de fichiers audio, validées en français lors de la recette.
Synthèse vocale Moteur de synthèse local Lecture des réponses en mode vocal, avec la voix approuvée par le client à la recette.
Recherche web Firecrawl auto-hébergé Recherche et extraction de pages, activées à la demande, avec bascule de secours.

⏤ Table de référence

Quels modèles LLM en local, et dans combien de mémoire ?

Les modèles ci-dessous sont ceux qui figurent au classement Open Source LLM Leaderboard de Vellum et dont l’éditeur publie des quantisations exploitables en local. Relevé du 28 août 2026.

Comment cette page calcule la mémoire

poids ≈ paramètres totaux × 0,5 octet NVFP4 = 4 bits = ½ octet par paramètre

VRAM ≈ poids × 1,20 +20 % pour le cache KV et le surcoût d’exécution

Le contresens à ne pas commettre : totaux, pas actifs

Un modèle à mélange d’experts (MoE) n’active qu’une fraction de ses poids pour produire chaque jeton. On en déduit souvent, à tort, qu’il suffit de loger les paramètres actifs. C’est faux : le routeur peut appeler n’importe quel expert au jeton suivant, donc la totalité des poids doit résider en mémoire. Kimi K3 n’active que 104 milliards de paramètres sur 2 800 — il lui faut malgré tout de quoi loger les 2 800. Les paramètres actifs prédisent le débit, jamais l’empreinte.

La marge de 20 %, et son hypothèse

Le cache KV dépend de la longueur de contexte et du nombre d’utilisateurs simultanés : il n’existe pas de marge unique. Celle retenue ici suppose un contexte modéré (~32 000 jetons) et quelques utilisateurs simultanés (3 à 5). Elle ne tient plus pour un contexte de 1 million de jetons ou une forte concurrence : dans ces cas, le cache KV pèse davantage que les poids eux-mêmes, et c’est lui qu’il faut dimensionner en premier.

NVFP4 n’est pas disponible partout

NVFP4 est la référence de quantisation retenue ici, parce que vLLM la prend en charge. Elle n’est publiée que pour une partie des modèles : Gemma 4, Qwen3.8-27B, Muse Glimmer 30B, et Qwen3.8-Flash-Next côté dépôt DGX. Pour les autres — GLM-5.3-Flash, DeepSeek-V4, Kimi K3, Qwen3.8-2.4T — seul du GGUF 4 bits existe, parfois doublé d’un MXFP4 natif. L’ordre de grandeur mémoire est comparable, mais la colonne « disponibilité » le signale explicitement : ce n’est pas la même chose.

Les modèles, un par un

publié chiffre écrit par la source citée. calculé estimation Thank You Future, formule ci-dessus.

Modèles ouverts et empreinte mémoire, relevé du 28 août 2026
Modèle Paramètres totaux Actifs Contexte NVFP4 disponible ? Empreinte publiée VRAM NVFP4 calculée
Gemma-4-12B Unified 12 Md dense 262 144 oui NVFP4 publié (GPU NVIDIA Blackwell) NVFP4 : 11 Go · GGUF Q4 : 7–8 Go ~7 Go
Gemma-4-26B-A4B 26 Md 4 Md (MoE) 262 144 oui NVFP4 publié, 1,41× plus rapide que BF16 NVFP4 : 26 Go · GGUF Q4 : 16–18 Go ~16 Go
Qwen3.8-27B 27 Md dense 262 144 oui NVFP4 publié et servi par vLLM, ~1,5× plus rapide que BF16 GGUF Q4 : 16–19 Go · empreinte du NVFP4 : non publiée ~16 Go
Muse Glimmer 30B 30 Md dense 131 072 (jusqu’à 262 144) oui NVFP4 publié 4 bits : 17 Go et plus ~18 Go
Gemma-4-31B 31 Md dense 262 144 oui NVFP4 publié, 1,45× plus rapide que BF16 NVFP4 : 32 Go · GGUF Q4 : 17–20 Go ~19 Go
Qwen3.8-Flash-Next 125 Md 6 Md (MoE) 262 144 natif · 500 k avec YaRN oui NVFP4 publié par le dépôt DGX, absent de la page Unsloth Dépôt DGX : ~176 Md au total (125 principal + 51 n-gram), checkpoint NVFP4 de 122 Gio dont ~76 Gio résidents en GPU · Unsloth : 75 Go en 1 bit, 112 Go en 4 bits, 355 Go en BF16 ~75 Go calcul fait sur les 125 Md annoncés par Unsloth ; le dépôt DGX en compte ~176 avec la table n-gram, qu’il garde en mmap sur NVMe hors du GPU
DeepSeek-V4-Flash-0731 284 Md 13 Md (MoE) 1 048 576 non Pas de NVFP4 publié — MXFP4 natif et GGUF 4 bits 4 bits : 162 Go · 3 bits : 110–135 Go · Q8 sans perte : 169 Go ~170 Go
GLM-5.3-Flash 320 Md 18 Md (MoE) 1 048 576 non Pas de NVFP4 publié — GGUF 4 bits seulement 4 bits : 162–210 Go · 2 bits : 115 Go · BF16 : 650 Go ~192 Go
DeepSeek-V4-Pro-0813 1 600 Md 49 Md (MoE) 1 048 576 non Pas de NVFP4 publié — MXFP4 natif non publié pour cette variante ~960 Go
Qwen3.8-2.4T-A95B 2 400 Md 95 Md (MoE) 1 010 000 non Pas de NVFP4 publié — réservé au Qwen3.8-27B 1 bit : 397–508 Go · 2 bits : 657 Go · Q8 : 2,6 To · BF16 : 4,9 To ~1,44 To
Kimi K3 2 800 Md 104 Md (MoE) 1 048 576 non Pas de NVFP4 publié — MXFP4 pour les experts, BF16 pour le reste 1 bit : 610–665 Go · 2 bits : 726–880 Go · Q8 sans perte : 1,6 To ~1,68 To

Sources par ligne : Gemma-4-12B Unified — Unsloth — gemma-4 · Gemma-4-26B-A4B — Unsloth — gemma-4 · Qwen3.8-27B — Unsloth — qwen3.8 · Muse Glimmer 30B — Unsloth — muse-glimmer · Gemma-4-31B — Unsloth — gemma-4 · Qwen3.8-Flash-Next — blazux/qwen3.8-Flash-DGX + Unsloth — qwen3.8-next · DeepSeek-V4-Flash-0731 — Unsloth — deepseek-v4 · GLM-5.3-Flash — Unsloth — glm-5.3-flash · DeepSeek-V4-Pro-0813 — Unsloth — deepseek-v4 · Qwen3.8-2.4T-A95B — Unsloth — qwen3.8 · Kimi K3 — Unsloth — kimi-k3.

Ce qui tient, palier par palier

Paliers de mémoire vidéo et modèles compatibles
Palier Repère matériel Ce qui tient Marge Remarque d’usage
64 Go Une carte de 64 Go, ou deux cartes de 32 Go. Gemma-4-12B (~7 Go), Qwen3.8-27B (~16 Go), Gemma-4-26B-A4B (~16 Go), Muse Glimmer 30B (~18 Go), Gemma-4-31B (~19 Go). Très large — le plus gros occupe moins d’un tiers du palier. Le palier qui suffit à la majorité des installations : on sert le modèle de langage ET les embeddings, la transcription et la synthèse vocale sur la même carte.
96 Go Une RTX PRO 6000 Blackwell (96 Go). Les mêmes modèles qu’à 64 Go, sans changement de gamme. Les 96 Go ne débloquent pas un plus gros modèle : ils achètent du cache KV. C’est le palier du contexte long et de la concurrence — plus d’utilisateurs simultanés, des documents plus longs, à modèle constant.
128 Go Un DGX Spark ou une station Ryzen AI Max — 128 Go de mémoire unifiée. Qwen3.8-Flash-Next : checkpoint NVFP4 de 122 Gio, dont ~76 Gio résidents en GPU, la table n-gram de 44 Gio restant en mmap sur NVMe. En GGUF 4 bits, la source publie 112 Go. Faible. À 112 Go publiés sur un palier de 128, il reste peu pour le cache KV. Le premier palier qui ouvre un grand modèle à activation éparse. C’est aussi la machine de référence de nos installations.
256 Go Deux cartes de 141 Go, ou quatre de 64 Go. Multi-GPU obligatoire. DeepSeek-V4-Flash-0731 (162 Go publiés en 4 bits, ~170 Go calculés) et GLM-5.3-Flash (162–210 Go publiés, ~192 Go calculés). Correcte pour DeepSeek-V4-Flash ; plus juste pour GLM-5.3-Flash si l’on retient le haut de la fourchette publiée. Le premier palier qui ouvre un contexte de 1 million de jetons sur un modèle de premier rang au classement Vellum.
512 Go Typiquement 4 à 8 GPU. Les deux modèles précédents en contexte très long et forte concurrence. Qwen3.8-2.4T-A95B uniquement en 1 bit (397–508 Go publiés) — pas en 4 bits, qui demanderait ~1,44 To. À ce palier, le cache KV d’un contexte de 1 million de jetons pèse plus lourd que bien des modèles : c’est lui qu’on dimensionne, pas les poids. Sortie du cadre d’une PME. On y va pour du contexte extrême ou pour beaucoup d’utilisateurs simultanés.
1024 Go 8 GPU ou plus, sur une ou plusieurs machines. DeepSeek-V4-Pro-0813 en NVFP4 : ~960 Go calculés, ça tient tout juste. Qwen3.8-2.4T-A95B en 2 bits (657 Go publiés) : confortable. Kimi K3 ne tient PAS en 4 bits (~1,68 To calculés) — seulement en 1 bit (610 Go) ou 2 bits (726–880 Go), chiffres publiés. Nulle à négative pour les modèles de tête en 4 bits. C’est le palier des compromis. Recherche et évaluation. Ce n’est pas le terrain d’une plateforme de chat d’entreprise, et nous ne le proposons pas comme tel.

Et sans aucun GPU ?

Qwen3.8-Flash-Next tourne dans environ 75 Go de mémoire vive, sans carte graphique. C’est un chiffre publié par l’éditeur, pas une estimation : la source indique que le modèle fonctionne sur une machine disposant de 75 Go de RAM ou de mémoire unifiée, sans VRAM. Il n’active qu’environ 6 milliards de paramètres par jeton, ce qui rend l’exécution sur processeur envisageable. C’est plus lent qu’un GPU, et c’est une alternative sérieuse tant que la mémoire vidéo reste rare et chère.

Gemma 4 descend beaucoup plus bas

Gemma-4-26B-A4B fonctionne sur un simple processeur de bureau. Un relevé communautaire rapporte environ 7 jetons par seconde sur un Intel Core i5-8500 avec 32 Go de DDR4 et aucune carte graphique — une machine d’occasion à quelques centaines de francs. C’est la vitesse d’une lecture confortable. Le mécanisme est le même que ci-dessus : sur 25,2 milliards de paramètres, seuls 3,8 milliards s’activent par jeton.

Intel valide par ailleurs Gemma 4 — variantes E2B, E4B et 26B-A4B — sur ses processeurs Xeon avec vLLM, mais ne publie aucun chiffre de débit. Thank You Future n’en avance donc aucun : la vitesse réelle se mesure sur la machine du client, pendant la recette, jamais sur une fiche commerciale.

Sources et attribution

Classement de référence : Open Source LLM Leaderboard, publié par Vellum — consulté le 28 août 2026. Les fiches de modèles et les empreintes mémoire proviennent de la documentation Unsloth (unsloth.ai/docs/models/), le relevé processeur de terminalbytes.com, la validation Xeon publiée sur huggingface.co/blog/MatrixYao/xeon et, pour Qwen3.8-Flash-Next sur DGX Spark, du dépôt blazux/qwen3.8-Flash-DGX. Toutes consultées le 28 août 2026.

Ces chiffres sont des ordres de grandeur destinés à dimensionner une machine, pas un engagement de performance : le débit réel dépend de la machine, de la longueur de contexte et du nombre d’utilisateurs simultanés. Thank You Future teste chaque service par une vraie requête avant la mise en service.

Sur quel socle technique la plateforme repose-t-elle ?

La plateforme s’appuie sur PostgreSQL 16 avec PGVector pour la recherche documentaire, Redis pour les connexions temps réel, Apache Tika pour l’extraction des documents, et deux adaptateurs internes pour la transcription et la recherche web. Aucun de ces services ne publie de port : ils ne sont joignables que depuis le réseau interne de l’application.

PostgreSQL 16 + PGVector

Base principale de l’application et moteur vectoriel de la recherche documentaire. Aucun port publié.

Redis

Gestion partagée des connexions temps réel de l’interface, en mode persistant.

Apache Tika

Extraction du texte des documents téléversés — PDF, textes et formats bureautiques — avant vectorisation.

Adaptateurs internes

Un adaptateur de transcription et un adaptateur de recherche web à bascule, protégés par un jeton interne, sans journalisation des requêtes.

Tunnel Cloudflare

Accès distant authentifiant en HTTPS. Aucun port de l’application n’est publié sur internet.

Restic et Rclone

Sauvegarde locale et copie chiffrée vers une destination indépendante du serveur.

⏤ Authentification d’entreprise

Comment vos collaborateurs se connectent ?

Avec les comptes qu’ils ont déjà. Thank You Future raccorde la plateforme à Microsoft 365 et Entra ID en OIDC, à un Active Directory local par un courtier OIDC, à un annuaire LDAP ou LDAPS, ou à des comptes Google via Cloudflare Access. Une seule autorité d’identité est retenue par installation, et ce choix est arrêté avant la mise en production.

Quelle méthode d’identité selon votre parc informatique
Votre contexte Méthode retenue Ce que cela implique
Microsoft 365 / Entra ID OIDC direct, ou Entra derrière Cloudflare Access Open WebUI embarque un connecteur Entra dédié, mono-tenant : un identifiant de locataire, une URL de redirection exacte, et des claims de rôles pour distinguer administrateurs et utilisateurs.
Active Directory local Courtier OIDC (Authentik ou Keycloak) relié à AD Le courtier apporte la MFA moderne, un mappage contrôlé des groupes AD et des jetons courts, sans exposer les mots de passe AD à l’application.
Annuaire LDAP existant LDAP ou LDAPS natif Connexion en LDAPS validé, avec un compte de lecture seule, une base et un filtre de recherche limités à la population autorisée. La synchronisation des groupes de l’annuaire est prise en charge.
Comptes Google, petite structure Cloudflare Access et en-tête d’identité de confiance Cloudflare authentifie puis transmet l’adresse à l’application, qui crée le compte à la première visite. Le formulaire local est masqué.
Groupe multi-applications Fournisseur d’identité central en OIDC Groupes et MFA restent centralisés dans le fournisseur d’identité de l’entreprise. Un annuaire qui ne parle que SAML passe par un courtier Keycloak ou Authentik, qui le traduit en OIDC : Open WebUI ne gère pas SAML nativement, et Thank You Future préfère le dire.
Comptes Google, sans intermédiaire Connecteur Google natif Open WebUI embarque un client OAuth Google dédié, sans passer par un proxy. Utile quand l’entreprise travaille sous Google Workspace.
Provisionnement automatique des comptes SCIM 2.0 Création, mise à jour et désactivation des comptes pilotées depuis l’annuaire, sans intervention manuelle. Une arrivée ou un départ se répercute tout seul.

Pourquoi une seule autorité d’identité ?

Parce qu’empiler deux méthodes de connexion produit deux écrans d’authentification et deux sources de groupes. Les erreurs d’autorisation qui en découlent sont difficiles à diagnostiquer, et elles se manifestent au pire moment — quand un collaborateur voit ce qu’il ne devait pas voir. Thank You Future fait donc arrêter ce choix avant l’installation, et le documente dans l’inventaire du client.

Ce qui est testé avant l’ouverture

  • MFA réussie et MFA refusée
  • Utilisateur autorisé, utilisateur hors groupe
  • Compte désactivé dans l’annuaire
  • Changement de rôle après reconnexion
  • Aucun contournement par URL directe
  • En-tête de confiance non injectable depuis internet
  • Isolation vérifiée entre deux utilisateurs

⏤ Documents et droits d’accès

Qui voit quoi, exactement ?

Chaque collaborateur ne retrouve dans l’IA que ce qu’il avait déjà le droit d’ouvrir. Sur un NAS d’entreprise — UGREEN par exemple —, la TYF Search Gateway installée par Thank You Future interroge l’index existant sous le compte personnel de l’utilisateur : les droits d’accès sont appliqués par le NAS lui-même, et non réimplémentés dans l’IA. Une identité absente du mappage est refusée par défaut.

Livré avec la plateforme

Les documents que l’utilisateur dépose

Un PDF, un texte ou un document bureautique téléversé dans une conversation est extrait par Apache Tika, découpé, vectorisé dans PGVector, puis cité en réponse. La suppression du document retire aussi ses vecteurs. Aucun partage réseau n’est monté automatiquement dans l’application : le téléversement est toujours un geste explicite.

Option validée

Le NAS de l’entreprise, avec ses droits

Sur un NAS d’entreprise doté d’un index de recherche — UGREEN par exemple —, la TYF Search Gateway interroge l’index déjà constitué, sous le compte NAS personnel de l’utilisateur. Le contrôle des droits reste assuré par le système de fichiers. Rien n’est réindexé, rien n’est dupliqué, et un second index n’est pas créé dans l’application.

Chantier distinct

Messagerie et espaces collaboratifs

Gmail, Outlook 365, une messagerie locale ou SharePoint peuvent être étudiés, mais jamais branchés à la légère. Une synchronisation documentaire d’entreprise se traite comme un projet à part entière, avec sa matrice de droits, sa journalisation, sa classification des contenus et sa procédure d’effacement.

Comment les droits sont préservés, étape par étape

  1. 01 L’application transmet l’adresse de l’utilisateur connecté, côté serveur — jamais depuis le navigateur.
  2. 02 La passerelle cherche cette adresse dans un mappage explicite. Une identité inconnue est refusée : le défaut est le refus.
  3. 03 Elle ouvre une session avec le compte NAS personnel correspondant, qui porte exactement les droits de cette personne.
  4. 04 Le NAS applique ses propres listes de contrôle d’accès et ne renvoie que les résultats et extraits autorisés.

Ce que la passerelle ne fait pas

  • La passerelle est en lecture seule : elle retourne les champs et extraits fournis par l’index, pas le document complet.
  • Un extrait n’est pas le corps du document et ne doit pas être présenté comme tel.
  • L’intégration dépend d’interfaces du NAS qui ne sont pas garanties stables : les mises à jour sont manuelles et vérifiées.
  • La recette d’isolation est refaite à chaque ajout d’utilisateur, avec un test positif et un test négatif.

⏤ Comparatif

Chat IA local ou assistant en cloud ?

Un chat IA local traite les conversations sur le serveur de l’entreprise et s’appuie sur son annuaire et sur les droits de son système de fichiers. Un assistant en cloud public apporte des modèles plus vastes sans infrastructure à exploiter, mais suppose un transfert de données vers un fournisseur et un modèle de droits qui lui est propre.

Chat IA local installé par Thank You Future face à un assistant IA en cloud public
Critère Chat IA local (TYF) Assistant IA en cloud public
Où les conversations sont traitées Sur le serveur GPU de l’entreprise, dans son réseau. Sur l’infrastructure du fournisseur, fréquemment hors de Suisse.
Transfert de données vers un tiers Aucun pour l’usage courant. La recherche web est facultative et signalée. Inhérent au service, à encadrer par un contrat de sous-traitance.
Identité des utilisateurs Votre annuaire : Entra ID, Active Directory, LDAP ou Google. Comptes du fournisseur, généralement fédérés avec votre annuaire.
Droits sur les documents Appliqués par le système de fichiers d’origine, pas réimplémentés. À reconstruire dans le service, avec son propre modèle de droits.
Version du modèle Version et empreinte figées, changées lors d’une mise à jour planifiée. Mise à jour par le fournisseur, au rythme du fournisseur.
Capacité du modèle Modèle ouvert de taille intermédiaire, exécuté sur votre matériel. Modèles propriétaires de dernière génération, plus vastes.
Personnalisation de la marque Nom, logo et favicon, dans la limite de licence de 50 utilisateurs. Selon l’offre souscrite chez le fournisseur.
Ce que cela demande Un serveur GPU, un hôte Docker et une exploitation suivie. Un abonnement et une administration des comptes.

Ce qu’un assistant en cloud fait mieux

Les modèles propriétaires de dernière génération sont plus vastes que les modèles ouverts qu’une entreprise peut faire tourner sur son propre matériel à coût modéré, et ils n’exigent aucune exploitation. Une plateforme locale se choisit quand la localisation des données, le contrôle des droits et la maîtrise des versions comptent davantage que le dernier point de performance. Thank You Future ne recommande pas le local par principe.

⏤ Souveraineté et exploitation

Qu’est-ce qui garantit que vos données restent chez vous ?

Huit règles d’installation que Thank You Future s’interdit de plier, quel que soit le client. Aucun service ne publie de port, l’accès distant passe uniquement par un tunnel authentifiant en HTTPS, les versions sont figées par empreinte, l’administration des conversations est désactivée, et aucune mise à jour n’est déployée sans restauration testée au préalable.

Aucun port publié

Ni la base de données, ni le cache, ni le moteur d’extraction, ni l’application elle-même ne publient de port. Le réseau interne est déclaré fermé.

Accès uniquement authentifiant

L’accès depuis l’extérieur passe par un tunnel ou un proxy qui authentifie l’utilisateur, en HTTPS, avec la MFA gérée par votre annuaire.

Aucun secret dans un dépôt

Aucun mot de passe, jeton ni clé privée dans un dépôt Git, un partage réseau, un document de support ou une conversation avec un agent IA.

Versions et empreintes figées

Chaque image est désignée par son étiquette et son empreinte cryptographique. L’étiquette « latest » n’est jamais utilisée, et tout changement d’empreinte est revu.

Administration des chats désactivée

L’accès administrateur aux conversations, l’export administratif et le partage public sont coupés. L’inscription libre est fermée.

La limite, dite au client

L’administrateur système de la machine garde un accès technique à la base de données et aux sauvegardes. Aucun réglage logiciel ne supprime ce pouvoir, et le client en est informé.

Documents jamais montés d’office

Les partages personnels ne sont jamais montés automatiquement dans l’application. Un document entre dans l’IA parce que quelqu’un l’y a mis.

Restauration avant mise à jour

Une sauvegarde qui n’a pas été restaurée n’est pas considérée comme valide. La restauration est testée en pile isolée avant chaque mise à jour.

⏤ Licence et identité visuelle

Peut-on mettre sa propre marque sur l’application ?

Oui, dans une limite précise qu’il vaut mieux connaître avant de signer. La licence Open WebUI v0.11.x, à sa clause 4.(i), autorise le remplacement du nom, du logo et du favicon tant que l’instance compte au plus 50 utilisateurs finaux distincts — des personnes physiques disposant d’un accès direct — sur toute période glissante de trente jours.

Thank You Future contrôle ce nombre, ne présente jamais la plateforme comme un produit approuvé par Open WebUI Inc., conserve le texte de licence et les mentions de copyright avec la documentation remise au client, et refait la vérification à chaque changement de version. Ce mémo est une lecture opérationnelle de la licence, pas un avis juridique.

Au-delà de 50 utilisateurs

Thank You Future souscrira une licence Entreprise auprès d’Open WebUI pour votre installation. Le seuil se surveille, il ne se découvre pas : trois issues restent possibles, à arbitrer avant de l’atteindre.

  • Rétablir la marque Open WebUI intacte dans l’interface.
  • Obtenir une autorisation écrite du titulaire des droits.
  • Souscrire une licence Entreprise autorisant la modification.

⏤ Questions fréquentes

Les questions posées avant de se lancer.

Qu’est-ce qu’un chat IA local pour une entreprise ?

Un chat IA local est une application de conversation avec un modèle de langage installée sur les serveurs de l’entreprise, et non chez un fournisseur cloud. Thank You Future déploie une plateforme fondée sur Open WebUI v0.11.x, avec les modèles servis par un serveur GPU du client. Les conversations, les documents et les index de recherche restent dans le périmètre technique de l’entreprise.

Peut-on remplacer ChatGPT par une IA privée hébergée en interne ?

Oui pour les usages de conversation, de rédaction, de synthèse et de recherche documentaire, qui couvrent l’essentiel des besoins bureautiques. La plateforme installée par Thank You Future offre les conversations, les dossiers, les notes, un espace de travail, la saisie vocale, un mode vocal et une recherche web activable. La différence tient au modèle utilisé : un modèle local est plus petit qu’un modèle propriétaire de dernière génération.

Les collaborateurs peuvent-ils se connecter avec leur compte Microsoft 365 ou Active Directory ?

Oui. Thank You Future raccorde la plateforme à Microsoft 365 / Entra ID en OIDC, à un Active Directory local via un courtier OIDC comme Authentik ou Keycloak, à un annuaire LDAP ou LDAPS existant, ou à des comptes Google via Cloudflare Access. Une seule autorité d’identité est retenue par installation : empiler deux écrans de connexion crée des erreurs d’autorisation difficiles à diagnostiquer.

L’IA peut-elle chercher dans les documents du serveur de fichiers sans casser les droits d’accès ?

Oui, et c’est le point le plus sensible d’un projet d’IA documentaire. Sur un NAS UGREEN, la TYF Search Gateway interroge l’index de recherche existant sous le compte NAS personnel de chaque utilisateur : c’est le système de fichiers qui applique ses propres droits. Une identité absente du mappage reçoit un refus. Un collaborateur ne retrouve donc dans l’IA que ce qu’il pouvait déjà ouvrir.

Un chat IA local est-il conforme à la nLPD et au RGPD ?

Le déploiement local supprime le principal point de friction : le transfert des données vers un fournisseur d’IA étranger et le contrat de sous-traitance qui l’accompagne. Les conversations et les documents sont traités dans l’infrastructure de l’entreprise. La conformité complète reste un travail d’organisation — registre des traitements, durées de conservation, information des collaborateurs — que Thank You Future documente avec le client.

Peut-on mettre le nom et le logo de l’entreprise sur l’application ?

Oui, dans une limite qu’il faut connaître avant de signer. La licence Open WebUI v0.11.x, clause 4.(i), autorise le remplacement du nom, du logo et du favicon tant que l’instance compte au plus 50 utilisateurs distincts sur trente jours glissants. Au-delà, deux issues : rétablir la marque Open WebUI intacte, ou obtenir une licence Entreprise auprès de l’éditeur.

Que sort du réseau de l’entreprise quand l’IA cherche sur le web ?

La recherche web est facultative et l’utilisateur reçoit une confirmation avant l’envoi. Quand elle est activée, la requête et les pages demandées quittent le réseau : Firecrawl auto-hébergé contacte les sites, et les moteurs de secours reçoivent directement la requête. Sans recherche web activée, aucune conversation ni aucun document ne sort du réseau de l’entreprise.

L’administrateur peut-il lire les conversations des collaborateurs ?

Non depuis l’interface : Thank You Future livre la plateforme avec l’administration des chats et l’export administratif désactivés, le partage public coupé et l’inscription libre fermée. La limite est dite au client sans détour : l’administrateur système de la machine conserve un accès technique à la base de données et aux sauvegardes. Aucune configuration logicielle ne supprime ce pouvoir.

Comment sont faites les sauvegardes, et que se passe-t-il si le serveur tombe ?

Thank You Future s’aligne d’abord sur la politique de sauvegarde de votre entreprise, dans la mesure où elle est techniquement compatible : vos outils, vos destinations, vos durées de conservation. À défaut, ou en complément, la plateforme est sauvegardée avec Restic et Rclone — une copie locale et une copie chiffrée vers une destination indépendante, avec un dump PostgreSQL cohérent. Dans les deux cas, une sauvegarde non restaurée n’est pas considérée comme valide : la restauration est testée dans une pile isolée, et une restauration réussie est exigée avant chaque mise à jour.

Quel modèle de langage tourne sur la plateforme, et peut-on en changer ?

Le modèle n’est pas imposé et se remplace sans réinstaller la plateforme. Un modèle de la famille Qwen 3.8 couvre la plupart des usages bureautiques sur une machine unique. Qwen3.8-Flash-Next, à activation éparse, vise les configurations sans carte graphique. Les très grands modèles ouverts comme Kimi K3 approchent les modèles propriétaires de pointe, mais exigent une infrastructure lourde que peu d’entreprises justifient. Thank You Future recommande le modèle en fonction du parc, pas de la mode.

Faut-il un serveur GPU dédié pour faire tourner un chat IA local ?

Pas forcément. L’architecture sépare l’application, qui tourne sur un hôte Docker Linux ou un NAS, et l’inférence, servie par une machine joignable sur le réseau. Un serveur GPU reste le choix le plus confortable, mais les modèles à activation éparse changent la donne : Qwen3.8-Flash-Next active environ 6 milliards de paramètres par jeton sur 125 milliards au total, et tourne dans environ 75 Go de mémoire vive, sans carte graphique. C’est plus lent qu’un GPU, et une alternative sérieuse tant que la mémoire vidéo reste rare et chère. Plus bas encore : Gemma-4-26B-A4B, qui n’active que 3,8 milliards de paramètres sur 25,2, atteint environ 7 jetons par seconde sur un processeur de bureau d’occasion sans aucune carte graphique — la vitesse d’une lecture confortable. Thank You Future dimensionne la machine selon le nombre d’utilisateurs et teste chaque service par une vraie requête avant la mise en service, jamais par un simple port ouvert.

Un chat IA privé pour vos équipes ?

Thank You Future exploite déjà cette plateforme pour son propre usage. La première conversation sert à vérifier qu’elle a du sens chez vous — elle est sans engagement.

Parler de votre projet →

01

Un état des lieux

Votre annuaire, votre stockage, votre matériel disponible et la population concernée. C’est ce qui détermine l’architecture, pas l’inverse.

02

Une démonstration

La plateforme est montrée en fonctionnement, avec les fonctions réelles et les limites réelles — y compris ce qu’elle ne sait pas faire.

03

Les décisions à signer

Méthode d’identité, durée de conservation, destination des sauvegardes, services externes autorisés et nombre d’utilisateurs prévus.

Page revue le 28 août 2026 · pile de référence Open WebUI v0.11.x