L'IA pour votre e-commerce, sans quitter vos serveurs.
Modèles open-weights servis sur GPU dédiés en UE, API OpenAI-compatible, RAG sur votre catalogue. Vos prompts, vos données clients, vos documents internes ne sortent jamais de notre infrastructure.
| Critère | API publique (OpenAI, Anthropic) | Fast-Mage |
|---|---|---|
| data.residency | US, ou multi-régions opaques | UE, datacenter au choix |
| prompts.logging | selon CGU fournisseur | vos serveurs, vos logs |
| model.lifecycle | dépréciation unilatérale | vous pinnez les versions |
| cost.predictability | par token, variable | forfait GPU, prévisible |
02 / SOUVERAINETÉ DONNÉES
Vos données ne quittent pas l'Europe.
Six garanties techniques, pas marketing.
Pour les e-commerçants soumis au RGPD, au secret commercial ou à une politique data interne stricte, l'auto-hébergement n'est plus une option exotique. C'est la base.
OVH, Scaleway, Hetzner, Upcloud. Datacenters Paris, Roubaix, Francfort, Helsinki.
Disques LUKS, sauvegardes chiffrées, transit TLS 1.3 strict.
Pas de modèle multi-tenant sur les charges sensibles. Isolation LXC, VLAN dédié.
Pas de télémétrie OpenAI, pas de wrapper cloud. Vos prompts restent sur nos serveurs.
DPA signé, registre des traitements fourni, droit à l'effacement opérationnel.
Trace par requête, identité appelant, modèle servi, coût token. Export sur demande.
03 / STACK
Une stack ouverte, pas un wrapper propriétaire.
Open-weights, open-tooling, portable.
Chaque brique est documentée, remplaçable et reproductible via Ansible. Vous pouvez quitter Fast-Mage et redéployer ailleurs avec la même config.
| Couche | Technologies | Détail |
|---|---|---|
| API | OpenAI-compatible /v1 | drop-in, vos scripts existants tournent sans réécriture |
| Serving | vLLM, Ollama, llama.cpp | continuous batching, paged attention, quant GGUF/AWQ/GPTQ |
| Modèles | Llama, Qwen, DeepSeek, GLM, Kimi, gpt-oss, … | open-weights uniquement, qualification continue des nouvelles sorties |
| Routing | LiteLLM, custom LB, Portkey | failover multi-modèles, quotas par projet, rate limit par clé |
| GPU | NVIDIA / AMD | dédiés ou mutualisés selon profil de charge |
| RAG | Haystack | indexation catalogue, docs internes, tickets support |
| UI | Open-WebUI, Batcher.ai | gestion prompts équipe, SSO, journal des conversations |
| Observabilité | Portkey, Prometheus, Grafana | traces, coût/token par projet, alertes dérive |
API OpenAI-compatible : drop-in, vos clients SDK existants fonctionnent en changeant uniquement la base URL.
04 / CAS D'USAGE E-COMMERCE
Six usages déployés en production.
Catalogue, support, contenu, modération.
Pas de démo abstraite. Ces usages tournent chez nos clients hébergement, avec des volumes et des contraintes réelles.
Enrichissement et traduction catalogue
Génération de descriptions produit, balises SEO, traductions multilingues sur 10 000 SKU. Connexion directe à votre base Magento, Akeneo ou PIM via API. Validation humaine avant publication, diff côté staging.
Assistance support client
Agent conversationnel branché sur votre base de connaissances, vos CGV, votre catalogue, votre historique de tickets. Réponse en français, citation des sources, escalade humaine au seuil de confiance bas. Pas de fuite vers un LLM tiers.
RAG sur documents internes
Indexation chiffrée de vos PDF, wikis, exports Notion, contrats fournisseurs. Recherche sémantique avec attribution de source. Vos équipes interrogent leurs propres données sans qu'elles transitent par OpenAI, Anthropic ou Google.
Modération avis et UGC
Détection automatique d'avis frauduleux, contenus injurieux, signalements RGPD. Règles métier configurables par marque. Traitement en batch nocturne ou en temps réel selon volume.
Génération de visuels et variantes
Production de visuels packshot, mises en scène contextuelles, déclinaisons multilingues pour campagnes. Modèles diffusion auto-hébergés, droits commerciaux intégrés, pas d'ambiguïté juridique sur l'entraînement.
Pipelines batch e-commerce
Notre interface Batcher.ai pilote 10 000 prompts en parallèle sur vos modèles privés ou publics. Recettes pré-construites pour les tâches catalogue récurrentes. Inclus pour les clients hébergement.
05 / STUDIO D'AGENTS IA
Des agents qui agissent sur votre métier.
Pré-construits ou sur mesure, supervisés.
Au-delà du chat et du batch, nous déployons des agents IA branchés sur vos systèmes (catalogue, CRM, helpdesk) qui exécutent des tâches récurrentes sous supervision. Construits avec vos équipes, hébergés sur votre infra privée, jamais en boîte noire.
Agents pré-construits
Bibliothèque d'agents prêts à l'emploi pour les tâches e-commerce récurrentes : synchronisation et contrôle d'inventaire, enrichissement CRM, génération et audit de métadonnées SEO. Connectés à Magento, Akeneo ou votre PIM via API.
Workflows multi-agents
Composez des workflows personnalisés où plusieurs agents se coordonnent : récupération, raisonnement, action, validation. Orchestration compatible CrewAI ou LangChain, exécutée sur vos modèles privés.
Supervision temps réel
Chaque agent est tracé : action déclenchée, source, coût token, latence. Alerting sur dérive, boucle de validation humaine sur les actions sensibles.
Sur votre infra privée
Les agents tournent sur votre hébergement IA Fast-Mage, sur GPU dédiés en UE. Vos données catalogue et clients ne quittent jamais notre infrastructure.
06 / DÉPLOIEMENT
Clé en main, en quatre étapes.
De l'audit au passage en production.
Pas de POC qui traîne pendant six mois. Cadrage rapide, infra montée, intégration validée, mise en charge avant facturation.
Audit cas d'usage
Cadrage du besoin métier, volumétrie attendue, contraintes RGPD, modèles candidats. Livrable : note de cadrage et estimation GPU. Gratuit.
Provisioning
Mise en place GPU dédiés ou mutualisés, déploiement vLLM ou Ollama via Ansible, exposition API, clés et quotas. Délai typique : sous 5 jours ouvrés.
Intégration
Branchement à vos outils (Magento, CRM, helpdesk, scripts batch). Mise en place RAG si pertinent. Accompagnement de vos devs ou de votre agence.
Mise en charge
Tests de charge sur scénario réel, mesure latence p50/p95/p99, optimisation quantization et batching. Bascule en production avec monitoring actif.
07 / INCLUS CLIENTS HÉBERGEMENT
Vous êtes déjà hébergé chez nous ?
Trois briques offertes.
Nos clients hébergement bénéficient d'un accès aux fonctions cœur de la plateforme IA, sans surcoût.
Traitement batch tableur
Interface type Sheets, 10 000 prompts en un clic. Recettes catalogue prêtes (traduction, SEO, enrichissement). Connecté à vos API tierces ou à votre LLM privé.
Console équipe
Gestion collaborative des prompts, bibliothèque partagée, droits par utilisateur, SSO, historique conversations. Auto-hébergé sur votre instance.
Bêta sur invitation
Web app et API de recherche profonde sur n'importe quel modèle open-source hébergé. Intégrable à vos agents IA et scripts via API. Couplable avec Batcher.ai.
08, QUESTIONS FRÉQUENTES
Questions fréquentes.
Cinq points clés.
Réponses vérifiées par nos ingénieurs. Si une question manque, écrivez-nous : on répond rapidement, sans script commercial.
Q01 Pourquoi auto-héberger un LLM plutôt que d'appeler l'API OpenAI ou Anthropic ?
+
Pourquoi auto-héberger un LLM plutôt que d'appeler l'API OpenAI ou Anthropic ?
Trois raisons. Premièrement, la résidence : vos prompts contiennent souvent du catalogue, des données clients, des extraits de tickets ou de contrats. Sur une API publique, ces données quittent l'UE et entrent dans les conditions du fournisseur. Deuxièmement, le coût à fort volume : passé un certain seuil de tokens par jour, l'auto-hébergement devient compétitif et reste prévisible. Troisièmement, la stabilité : pas de changement de tarif unilatéral, pas de dépréciation forcée de modèle, pas de quota imposé.
Q02 Quels modèles open-weights supportez-vous ?
+
Quels modèles open-weights supportez-vous ?
Côté généralistes et raisonnement : Llama, Qwen, DeepSeek, GLM, Kimi, gpt-oss. Côté code : Qwen Coder, Codestral, Devstral. Côté vision : Qwen-VL, GLM vision, Llama multimodal. Côté embeddings pour RAG : Qwen-Embedding. Côté diffusion image : FLUX, Stable Diffusion. Et d'autres familles sur demande. Nous suivons les sorties au fil de l'eau et qualifions les modèles sur nos benchs e-commerce internes avant mise en production.
Q03 Quelle latence et quel débit puis-je attendre ?
+
Quelle latence et quel débit puis-je attendre ?
Sur un modèle classe 70B servi en vLLM avec une H100, comptez 40 à 60 tokens par seconde par requête et 1 500 à 2 500 tokens par seconde en charge concurrente. Sur des modèles dans la classe 7 à 14 milliards de paramètres, comptez plusieurs milliers de tokens par seconde sur la même carte. La latence p95 reste sous 2 secondes pour les charges typiques d'assistance support client.
Q04 Comment migrer un projet déjà câblé sur OpenAI ?
+
Comment migrer un projet déjà câblé sur OpenAI ?
Notre endpoint expose une API OpenAI-compatible : vos appels existants sur /v1/chat/completions, /v1/embeddings et /v1/completions fonctionnent en changeant uniquement la base URL et la clé. La plupart des intégrations LangChain, LlamaIndex, CrewAI, Vercel AI SDK basculent sans modification de code applicatif.
Q05 Le RAG, comment ça marche concrètement sur mon catalogue ?
+
Le RAG, comment ça marche concrètement sur mon catalogue ?
Nous indexons vos sources via un pipeline Haystack versionné : extraction depuis Magento, Akeneo, votre CMS, vos PDF. Chunking adapté au format, embeddings multilingues, stockage et recherche orchestrés par Haystack. À l'inférence, la requête utilisateur récupère les k passages les plus pertinents, qui sont injectés dans le prompt avec citation de source. Le réindexage est incrémental sur événement ou cron.
Q06 Qui est responsable des sorties du modèle ?
+
Qui est responsable des sorties du modèle ?
L'auto-hébergement ne supprime pas votre responsabilité éditoriale sur les contenus publiés. Nous fournissons l'infrastructure, les modèles, les garde-fous techniques (filtrage toxicité, watermark, journal). La validation métier reste de votre côté ou de celui de votre agence. Pour les usages sensibles, nous recommandons toujours une boucle humaine avant publication.
Une question reste sans réponse ?
Nous contacter →CONTACT, AUDIT GRATUIT
Parlons de votre projet.
Audit gratuit, réponse sous 24h ouvrées.
Décrivez votre stack et votre situation, un ingénieur Fast-Mage vous rappelle. Pas de commercial, pas de script. L'audit reste à vous, même si vous ne migrez pas.