Les patrons d'intégration des LLM en architecture d'entreprise sont au nombre de six : API directe, passerelle LLM, RAG, appels d'outils, ajustement fin et modèles hébergés chez vous. En production, on combine surtout passerelle, RAG et appels d'outils.
Ce guide traite d'architecture et de gouvernance. Pour la mise en œuvre concrète (modèles, coûts d'API, étapes), consultez notre guide pratique d'intégration des LLM en 2026.
Quels sont les principaux patrons d'intégration des LLM?
Six patrons couvrent presque tous les cas, et ils se superposent. Un assistant interne typique utilise une passerelle, du RAG sur les politiques et des appels d'outils vers le système de billets.
| Patron | Ce que c'est | Quand l'utiliser | Risque principal |
|---|---|---|---|
| API directe | L'application appelle le fournisseur | Prototypes, données peu sensibles | Clés dispersées, pas de journal central |
| Passerelle LLM | Un service interne devant tous les modèles | Deux applications ou fournisseurs ou plus | Un composant de plus à exploiter |
| RAG | Récupérer des documents et les fournir en contexte | Savoir qui change, citations exigées | Index périmé ou trop permissif |
| Appels d'outils | Le modèle agit via des fonctions définies | Lire ou modifier CRM, ERP, billets | Actions sur de mauvaises instructions |
| Ajustement fin | Adapter les poids du modèle à vos exemples | Format ou vocabulaire précis, gros volume | Réentraîner quand le modèle de base est retiré |
| Modèle ouvert hébergé | Le modèle tourne dans votre nuage | Les données ne doivent pas sortir | Écart de capacité, coûts d'exploitation |
Deux décisions sont difficiles à défaire : la passerelle et le lieu d'exécution de l'inférence. Tranchez-les en premier.
Comment une passerelle LLM s'insère-t-elle dans l'architecture?
La passerelle se place entre vos applications et tous les fournisseurs. Les applications appellent un point d'accès interne; la passerelle choisit le modèle et consigne ce qui s'est passé.
- L'application envoie la requête avec l'identité de l'utilisateur.
- La passerelle vérifie l'appelant, masque les renseignements personnels, applique le gabarit de requête et un plafond de coût.
- Le routeur choisit le modèle : petit modèle pour classer, grand modèle pour raisonner, déploiement canadien pour les données réglementées.
- La réponse passe par des contrôles de format et de contenu.
- Le journal conserve horodatage, version du modèle, utilisateur, outils appelés et une copie masquée de la requête.
Quand choisir le RAG, les appels d'outils ou l'ajustement fin?
Le RAG sert au savoir, les appels d'outils aux actions et l'ajustement fin à la forme.
- RAG pour les politiques, contrats, documentation et dossiers. L'index doit respecter les droits d'accès du système source.
- Appels d'outils pour « trouver la commande », « créer le billet ». Schéma étroit, permissions minimales, approbation humaine pour les écritures importantes. Le Model Context Protocol (MCP) est une norme courante pour exposer ces outils.
- Ajustement fin pour un format fixe à fort volume, après avoir essayé les requêtes bien conçues et le RAG. Voir RAG ou ajustement fin.
Quelles options de fournisseurs gardent les données au Canada?
En septembre 2026, le stockage au Canada est offert à plusieurs endroits, le traitement au Canada à quelques-uns seulement. La résidence se règle modèle par modèle.
| Voie d'accès | Données au repos au Canada | Traitement au Canada | Remarques |
|---|---|---|---|
| Azure OpenAI (Microsoft Foundry) | Oui | Canada Est Standard : gpt-4o, gpt-4.1-mini, plongements. Débit provisionné régional dans Canada Centre et Canada Est pour gpt-4o, gpt-4.1, gpt-5.x et autres | Pas de zone de données Canada |
| API OpenAI et ChatGPT Enterprise | Oui, clients admissibles (via les ventes) | Non : inférence régionale en Europe, aux États-Unis et aux Émirats seulement | Exige MAM ou ZDR |
| API Anthropic | Non | Non : « global » ou « us » | « us » coûte 1,1 fois plus |
| Claude sur Amazon Bedrock (ca-central-1) | Oui : journaux, bases de connaissances | Non : le profil canadien achemine l'inférence vers les États-Unis | |
| Gemini sur Google Vertex AI (Montréal) | Oui | Oui pour Gemini 3.5 Flash, 2.5 Flash et 2.5 Pro | Les Gemini 3.6 à 3.8 Flash : États-Unis et UE seulement |
| Modèle ouvert hébergé chez vous | Oui | Oui | Capacité et mises à jour à votre charge |
Comment sécuriser une intégration LLM qui touche des données financières ou personnelles?
Par le contrat, par le chemin des données et par les journaux.
- Contrat. OpenAI et Anthropic déclarent n'utiliser par défaut ni les données de leurs offres d'affaires ni celles de leurs API pour entraîner leurs modèles. Google déclare ne pas utiliser les données de Workspace et de Vertex AI pour entraîner ses modèles sans permission ou instruction préalable. Faites-le confirmer dans l'entente de traitement des données et fixez la conservation.
- Chemin des données. Masquer noms, numéros de compte et identifiants de santé avant l'envoi; clés dans un gestionnaire de secrets; réseau privé vers le nuage; documents récupérés traités comme des entrées non fiables (injection de requêtes).
- Journaux. Version du modèle, utilisateur, outils appelés et résultat pour chaque appel.
Quelles obligations légales s'appliquent au Canada?
Au Canada, la loi sur la vie privée s'applique à toute requête contenant des renseignements personnels. Il n'existe pas de loi fédérale sur l'IA : le projet de loi C-27 et sa Loi sur l'intelligence artificielle et les données sont morts en janvier 2025.
- LPRPDE pour les renseignements personnels dans le secteur privé. Le projet de loi C-36 qui la remplacerait est en première lecture depuis le 15 juin 2026.
- Loi 25 du Québec : EFVP pour tout nouveau système (art. 3.3), EFVP et entente écrite avant une communication hors Québec (art. 17), information sur les décisions entièrement automatisées (art. 12.1).
- Institutions fédérales : Directive sur la prise de décisions automatisée du Conseil du Trésor.
Notre conformité IA : LPRPDE et Loi 25 applique ces obligations à une architecture précise avant la construction.
Comment gouverner les LLM en production?
Figer les versions, tester chaque changement, planifier les retraits de modèles.
- Version du modèle fixée dans la passerelle.
- Jeu d'évaluation d'exemples réels, lancé avant chaque changement.
- Dates de retrait suivies pour chaque modèle.
- Un responsable métier par cas d'usage, un responsable technique de la passerelle, un contact vie privée.
Par où commencer?
Dressez l'inventaire des applications qui appellent déjà des LLM, des catégories de données touchées et des fournisseurs utilisés. Décidez où l'inférence peut s'exécuter pour chaque catégorie. Placez ensuite une passerelle devant le premier cas en production.
Remolda conçoit l'intégration des LLM aux systèmes existants et accompagne le choix entre Copilot, ChatGPT Enterprise et Claude. Le travail commence par des forfaits à prix fixe dès 490 $.
Sources
- Microsoft Learn — Types de déploiement Foundry
- Microsoft Learn — Disponibilité régionale des modèles
- OpenAI — Confidentialité des données d'affaires
- Anthropic — Résidence des données
- AWS — Compatibilité régionale d'Amazon Bedrock
- Google Cloud — Résidence des données de l'IA générative
- Google Cloud — Gouvernance des données de l’IA générative (restriction d’entraînement)
- Google Workspace — Generative AI in Google Workspace Privacy Hub
- LégisQuébec — RLRQ c. P-39.1
- Parlement du Canada — Projet de loi C-36