IA SOUVERAINE, LLM AUTO-HÉBERGÉS, DONNÉES EN UE

L'IA pour votre e-commerce, sans quitter vos serveurs.

Modèles open-weights servis sur GPU dédiés en UE, API OpenAI-compatible, RAG sur votre catalogue. Vos prompts, vos données clients, vos documents internes ne sortent jamais de notre infrastructure.

Critère API publique (OpenAI, Anthropic) Fast-Mage
data.residency US, ou multi-régions opaques UE, datacenter au choix
prompts.logging selon CGU fournisseur vos serveurs, vos logs
model.lifecycle dépréciation unilatérale vous pinnez les versions
cost.predictability par token, variable forfait GPU, prévisible

02 / SOUVERAINETÉ DONNÉES

Vos données ne quittent pas l'Europe.

Six garanties techniques, pas marketing.

Pour les e-commerçants soumis au RGPD, au secret commercial ou à une politique data interne stricte, l'auto-hébergement n'est plus une option exotique. C'est la base.

Résidence
UE uniquement

OVH, Scaleway, Hetzner, Upcloud. Datacenters Paris, Roubaix, Francfort, Helsinki.

Chiffrement
AES-256 at rest

Disques LUKS, sauvegardes chiffrées, transit TLS 1.3 strict.

Isolation
GPU dédié projet

Pas de modèle multi-tenant sur les charges sensibles. Isolation LXC, VLAN dédié.

Logs
Sans collecte tierce

Pas de télémétrie OpenAI, pas de wrapper cloud. Vos prompts restent sur nos serveurs.

Conformité
RGPD, secret comm.

DPA signé, registre des traitements fourni, droit à l'effacement opérationnel.

Auditabilité
Logs complets

Trace par requête, identité appelant, modèle servi, coût token. Export sur demande.

03 / STACK

Une stack ouverte, pas un wrapper propriétaire.

Open-weights, open-tooling, portable.

Chaque brique est documentée, remplaçable et reproductible via Ansible. Vous pouvez quitter Fast-Mage et redéployer ailleurs avec la même config.

Couche Technologies Détail
API OpenAI-compatible /v1 drop-in, vos scripts existants tournent sans réécriture
Serving vLLM, Ollama, llama.cpp continuous batching, paged attention, quant GGUF/AWQ/GPTQ
Modèles Llama, Qwen, DeepSeek, GLM, Kimi, gpt-oss, … open-weights uniquement, qualification continue des nouvelles sorties
Routing LiteLLM, custom LB, Portkey failover multi-modèles, quotas par projet, rate limit par clé
GPU NVIDIA / AMD dédiés ou mutualisés selon profil de charge
RAG Haystack indexation catalogue, docs internes, tickets support
UI Open-WebUI, Batcher.ai gestion prompts équipe, SSO, journal des conversations
Observabilité Portkey, Prometheus, Grafana traces, coût/token par projet, alertes dérive

API OpenAI-compatible : drop-in, vos clients SDK existants fonctionnent en changeant uniquement la base URL.

04 / CAS D'USAGE E-COMMERCE

Six usages déployés en production.

Catalogue, support, contenu, modération.

Pas de démo abstraite. Ces usages tournent chez nos clients hébergement, avec des volumes et des contraintes réelles.

01 / 06
+10 000
SKU / batch

Enrichissement et traduction catalogue

Génération de descriptions produit, balises SEO, traductions multilingues sur 10 000 SKU. Connexion directe à votre base Magento, Akeneo ou PIM via API. Validation humaine avant publication, diff côté staging.

02 / 06
< 2 s
latence p95

Assistance support client

Agent conversationnel branché sur votre base de connaissances, vos CGV, votre catalogue, votre historique de tickets. Réponse en français, citation des sources, escalade humaine au seuil de confiance bas. Pas de fuite vers un LLM tiers.

03 / 06
0
donnée sortie UE

RAG sur documents internes

Indexation chiffrée de vos PDF, wikis, exports Notion, contrats fournisseurs. Recherche sémantique avec attribution de source. Vos équipes interrogent leurs propres données sans qu'elles transitent par OpenAI, Anthropic ou Google.

04 / 06
99,5 %
précision sur jeu test

Modération avis et UGC

Détection automatique d'avis frauduleux, contenus injurieux, signalements RGPD. Règles métier configurables par marque. Traitement en batch nocturne ou en temps réel selon volume.

05 / 06
GPU
dédié projet

Génération de visuels et variantes

Production de visuels packshot, mises en scène contextuelles, déclinaisons multilingues pour campagnes. Modèles diffusion auto-hébergés, droits commerciaux intégrés, pas d'ambiguïté juridique sur l'entraînement.

06 / 06
10k+
prompts / run

Pipelines batch e-commerce

Notre interface Batcher.ai pilote 10 000 prompts en parallèle sur vos modèles privés ou publics. Recettes pré-construites pour les tâches catalogue récurrentes. Inclus pour les clients hébergement.

05 / STUDIO D'AGENTS IA

Des agents qui agissent sur votre métier.

Pré-construits ou sur mesure, supervisés.

Au-delà du chat et du batch, nous déployons des agents IA branchés sur vos systèmes (catalogue, CRM, helpdesk) qui exécutent des tâches récurrentes sous supervision. Construits avec vos équipes, hébergés sur votre infra privée, jamais en boîte noire.

01 / 04
Inventaire · CRM · SEO

Agents pré-construits

Bibliothèque d'agents prêts à l'emploi pour les tâches e-commerce récurrentes : synchronisation et contrôle d'inventaire, enrichissement CRM, génération et audit de métadonnées SEO. Connectés à Magento, Akeneo ou votre PIM via API.

02 / 04
Sur mesure

Workflows multi-agents

Composez des workflows personnalisés où plusieurs agents se coordonnent : récupération, raisonnement, action, validation. Orchestration compatible CrewAI ou LangChain, exécutée sur vos modèles privés.

03 / 04
Monitoring 24/7

Supervision temps réel

Chaque agent est tracé : action déclenchée, source, coût token, latence. Alerting sur dérive, boucle de validation humaine sur les actions sensibles.

04 / 04
0 donnée hors UE

Sur votre infra privée

Les agents tournent sur votre hébergement IA Fast-Mage, sur GPU dédiés en UE. Vos données catalogue et clients ne quittent jamais notre infrastructure.

06 / DÉPLOIEMENT

Clé en main, en quatre étapes.

De l'audit au passage en production.

Pas de POC qui traîne pendant six mois. Cadrage rapide, infra montée, intégration validée, mise en charge avant facturation.

01

Audit cas d'usage

Cadrage du besoin métier, volumétrie attendue, contraintes RGPD, modèles candidats. Livrable : note de cadrage et estimation GPU. Gratuit.

02

Provisioning

Mise en place GPU dédiés ou mutualisés, déploiement vLLM ou Ollama via Ansible, exposition API, clés et quotas. Délai typique : sous 5 jours ouvrés.

03

Intégration

Branchement à vos outils (Magento, CRM, helpdesk, scripts batch). Mise en place RAG si pertinent. Accompagnement de vos devs ou de votre agence.

04

Mise en charge

Tests de charge sur scénario réel, mesure latence p50/p95/p99, optimisation quantization et batching. Bascule en production avec monitoring actif.

07 / INCLUS CLIENTS HÉBERGEMENT

Vous êtes déjà hébergé chez nous ?

Trois briques offertes.

Nos clients hébergement bénéficient d'un accès aux fonctions cœur de la plateforme IA, sans surcoût.

Batcher.ai

Traitement batch tableur

Interface type Sheets, 10 000 prompts en un clic. Recettes catalogue prêtes (traduction, SEO, enrichissement). Connecté à vos API tierces ou à votre LLM privé.

Fonctions cœur incluses
Open-WebUI

Console équipe

Gestion collaborative des prompts, bibliothèque partagée, droits par utilisateur, SSO, historique conversations. Auto-hébergé sur votre instance.

Installation incluse
Deep research API

Bêta sur invitation

Web app et API de recherche profonde sur n'importe quel modèle open-source hébergé. Intégrable à vos agents IA et scripts via API. Couplable avec Batcher.ai.

Accès bêta sur demande

08, QUESTIONS FRÉQUENTES

Questions fréquentes.

Cinq points clés.

Réponses vérifiées par nos ingénieurs. Si une question manque, écrivez-nous : on répond rapidement, sans script commercial.

Q01

Pourquoi auto-héberger un LLM plutôt que d'appeler l'API OpenAI ou Anthropic ?

+

Trois raisons. Premièrement, la résidence : vos prompts contiennent souvent du catalogue, des données clients, des extraits de tickets ou de contrats. Sur une API publique, ces données quittent l'UE et entrent dans les conditions du fournisseur. Deuxièmement, le coût à fort volume : passé un certain seuil de tokens par jour, l'auto-hébergement devient compétitif et reste prévisible. Troisièmement, la stabilité : pas de changement de tarif unilatéral, pas de dépréciation forcée de modèle, pas de quota imposé.

Q02

Quels modèles open-weights supportez-vous ?

+

Côté généralistes et raisonnement : Llama, Qwen, DeepSeek, GLM, Kimi, gpt-oss. Côté code : Qwen Coder, Codestral, Devstral. Côté vision : Qwen-VL, GLM vision, Llama multimodal. Côté embeddings pour RAG : Qwen-Embedding. Côté diffusion image : FLUX, Stable Diffusion. Et d'autres familles sur demande. Nous suivons les sorties au fil de l'eau et qualifions les modèles sur nos benchs e-commerce internes avant mise en production.

Q03

Quelle latence et quel débit puis-je attendre ?

+

Sur un modèle classe 70B servi en vLLM avec une H100, comptez 40 à 60 tokens par seconde par requête et 1 500 à 2 500 tokens par seconde en charge concurrente. Sur des modèles dans la classe 7 à 14 milliards de paramètres, comptez plusieurs milliers de tokens par seconde sur la même carte. La latence p95 reste sous 2 secondes pour les charges typiques d'assistance support client.

Q04

Comment migrer un projet déjà câblé sur OpenAI ?

+

Notre endpoint expose une API OpenAI-compatible : vos appels existants sur /v1/chat/completions, /v1/embeddings et /v1/completions fonctionnent en changeant uniquement la base URL et la clé. La plupart des intégrations LangChain, LlamaIndex, CrewAI, Vercel AI SDK basculent sans modification de code applicatif.

Q05

Le RAG, comment ça marche concrètement sur mon catalogue ?

+

Nous indexons vos sources via un pipeline Haystack versionné : extraction depuis Magento, Akeneo, votre CMS, vos PDF. Chunking adapté au format, embeddings multilingues, stockage et recherche orchestrés par Haystack. À l'inférence, la requête utilisateur récupère les k passages les plus pertinents, qui sont injectés dans le prompt avec citation de source. Le réindexage est incrémental sur événement ou cron.

Q06

Qui est responsable des sorties du modèle ?

+

L'auto-hébergement ne supprime pas votre responsabilité éditoriale sur les contenus publiés. Nous fournissons l'infrastructure, les modèles, les garde-fous techniques (filtrage toxicité, watermark, journal). La validation métier reste de votre côté ou de celui de votre agence. Pour les usages sensibles, nous recommandons toujours une boucle humaine avant publication.

Une question reste sans réponse ?

Nous contacter

CONTACT, AUDIT GRATUIT

Parlons de votre projet.

Audit gratuit, réponse sous 24h ouvrées.

Décrivez votre stack et votre situation, un ingénieur Fast-Mage vous rappelle. Pas de commercial, pas de script. L'audit reste à vous, même si vous ne migrez pas.

FORMULAIRE, AUDIT 24H 4 CHAMPS

Vos données restent confidentielles. Pas de spam, pas de prospection tierce, pas de revente.