📋 Cadre de l'expérimentation
➜ Quel est l'objectif de cette phase de test ?
L'expérimentation dure 6 mois, renouvelable une fois.
Elle vise à fiabiliser la plateforme en conditions réelles, avec un client volontaire disposant d'une infrastructure adaptée. Ce n'est pas une mise à disposition gratuite : c'est un partenariat technique rémunéré, où vous contribuez à la maturation du produit.
Aucun engagement d'achat ne vous est demandé à l'issue.
Sans obligation d'achat➜ Qu'est-ce que ça m'apporte concrètement ?
Vous bénéficiez d'un suivi technique dédié pendant toute la durée du test, avec des points de suivi réguliers (1 heure par semaine) pour recueillir vos retours, ajuster la plateforme et nous assurer que tout fonctionne comme prévu.
L'objectif principal est la fiabilisation du produit : nous sommes à votre écoute pour résoudre les problèmes et faire évoluer la plateforme en fonction de votre expérience terrain.
Au-delà du cadre contractuel, si le test avance dans de bonnes conditions, nous pourrons, de façon informelle et sans engagement, vous proposer des éclairages sur vos processus métier ou des formations sur les LLM — pour vous aider à identifier si l'IA peut vous être utile. Ces échanges restent à l'initiative d'OctoLLM et ne sont pas contractualisés.
À l'issue, si vous souhaitez acquérir une licence définitive, vous bénéficiez d'un avantage commercial exclusif. Mais rien ne vous y oblige.
➜ Pourquoi une licence fixe plutôt qu'un paiement à l'usage ?
La facturation au token est un modèle de dépendance. Avec OctoLLM, vous investissez dans une infrastructure que vous maîtrisez, installée sur votre serveur, sans variation de coût liée au volume d'usage.
Notre modèle repose sur une licence par serveur : vous achetez une version de l'outil, vous en obtenez le droit d'usage sur votre machine. C'est un choix de souveraineté technique et budgétaire, en cohérence avec notre charte éthique.
🖥️ Infrastructure serveur
➜ Quelle configuration serveur pour quel usage ?
OctoLLM s'installe sur un serveur dédié (physique ou loué) que nous administrons. Le dimensionnement (CPU, RAM, stockage) détermine directement le nombre de modèles que vous pouvez charger simultanément et le nombre d'utilisateurs que vous pouvez faire monter en charge.
La règle est simple :
Plus le serveur est puissant, plus vous pouvez charger d'instances de modèles et faire monter en charge le nombre d'utilisateurs. Ce n'est pas une limitation logicielle — c'est la physique du calcul : chaque requête consomme des cycles CPU et de la mémoire, chaque modèle chargé occupe de la RAM.
Repères de dimensionnement :
| RAM | CPU (cœurs) | Usage typique estimé |
|---|---|---|
| 128 Go | 8 à 12 cœurs | Équipe restreinte, sélection limitée de modèles. Minimum requis. |
| 256 Go | 16 cœurs | Usage confortable, plusieurs modèles. Recommandé pour un test sérieux. |
| 384 Go et + | 24 cœurs et + | Charge élevée, large sélection de modèles, RAG volumineux, multi-équipes. Dimensionnement sur mesure. |
Ces ordres de grandeur sont indicatifs : la quantification des modèles influence directement la consommation de RAM et de CPU — une quantification plus élevée améliore la qualité mais alourdit la charge. Les performances réelles dépendent donc du matériel, des modèles choisis et de leur quantification. Nous ne pouvons garantir un nombre précis d'utilisateurs sans connaître votre contexte exact.
Précisions techniques
- Processeur : Intel Xeon ou AMD EPYC récents. La puissance CPU impacte directement le temps de réponse, en particulier avec plusieurs utilisateurs simultanés ou du RAG actif.
- Stockage : SSD NVMe, 1 To minimum (les modèles et l'index RAG prennent de la place).
- Système : Linux (déploiement par OctoLLM).
➜ Et le GPU ?
Le support GPU est hors périmètre de l'expérimentation. OctoLLM est conçu pour fonctionner exclusivement sur CPU dans un premier temps. C'est un choix technique délibéré : la plateforme doit être déployable sur des serveurs standards, sans dépendance matérielle coûteuse ou rare.
GPU : Non supporté➜ L'architecture distribuée est-elle disponible ?
Non. L'architecture maître-esclaves est à l'étude. L'expérimentation se déroule sur un serveur unique. C'est cette architecture mono-serveur que nous stabilisons actuellement.
Distribuée : À l'étude⚙️ RAG, API et MCP
➜ Le RAG est-il disponible dans l'expérimentation ?
Oui, intégralement. Le RAG Admin (documents d'entreprise partagés) et le RAG User (documents personnels) sont tous deux opérationnels, dans le chat comme dans l'API.
Disponible➜ Quelle est la différence entre déposer un fichier et utiliser le RAG ?
Le dépôt de fichier dans le chat est ponctuel : le document est analysé pour la session en cours. Le RAG indexe durablement vos documents : l'IA ne parcourt pas tout le fichier à chaque question, elle ne sélectionne que les passages pertinents de certains fichiers.
Pour tout volume supérieur à quelques pages, le RAG est la solution adaptée.
➜ L'API est-elle compatible avec mes outils existants ?
Oui. L'API expose un endpoint compatible OpenAI. Vous pouvez donc brancher n8n, Zapier, Make, ou tout autre outil utilisant ce standard, sans modifier vos workflows. La migration se fait en quelques minutes.
Disponible➜ Le MCP est-il opérationnel ?
Non. Le Model Context Protocol est une perspective d'évolution, clairement identifiée comme telle sur le site. Il n'est pas inclus dans le périmètre de l'expérimentation.
À l'étude🔒 Données, modèles et documentation
➜ Où sont stockées les conversations ?
Nulle part. C'est un principe fondateur : les échanges sont strictement éphémères, limités à la session en cours. Aucune persistance, aucun archivage, aucune sauvegarde.
Conformément à notre charte éthique sur la minimisation des données.
Aucune persistance➜ Le management peut-il consulter les échanges des équipes ?
Non. La plateforme est conçue pour respecter la sphère professionnelle privée des utilisateurs. Il n'existe pas de fonctionnalité de supervision des conversations individuelles, ni de "mode super-admin" permettant d'y accéder.
➜ Quels modèles sont fournis pendant l'expérimentation ?
La sélection de modèles adaptés au CPU est prédéfinie pour cette phase de test : DeepSeek, Mistral, Qwen, Gemma, Phi, dans leurs versions identifiées. Ces modèles sont open-source et leurs licences sont consultables.
➜ Y a-t-il une documentation disponible ?
Oui. La documentation technique et utilisateur est intégrée au produit. Elle est accessible directement depuis le panel utilisateur, et suit les évolutions de la plateforme.
Documentation intégréeUne question non couverte par cette FAQ ?
Contactez-nous directement pour échanger sur votre projet et les modalités de l'expérimentation.
📩 Prendre contact