Services

Architecture de plateforme LLM d’entreprise

Une plateforme LLM d’entreprise donne à chaque produit une seule façon gouvernée d’utiliser les modèles de fondation : une passerelle IA centrale pour l’accès aux modèles, une recherche qui cite ses sources, l’isolation des tenants dans la couche de données et des contrôles d’évaluation en CI. Je la conçois de bout en bout sur AWS, et c’est ce que je fais aujourd’hui comme architecte principal de la plateforme IA partagée d’ENSO.

Ce qu’est une plateforme LLM d’entreprise

Sans plateforme, chaque équipe produit intègre les modèles de son côté. Chacune résout alors à nouveau les mêmes problèmes : quelles régions et quels modèles sont autorisés, comment filtrer les données personnelles, comment ancrer les réponses dans des sources, comment mesurer la qualité et que faire quand un modèle est retiré.

Une plateforme règle ces questions une seule fois. Les produits appellent un contrat stable, et la plateforme décide où, comment et avec quel modèle la requête est servie. Un changement de modèle devient un changement de configuration à un seul endroit plutôt qu’un changement dans chaque produit.

Architecture de la passerelle IA Capacités produit Correction paie OCR feuilles de temps Assistants intégrés Agent de relance Passerelle IA Profils d’inférence UEFiltrage PII GuardrailsRoutage des modèles Amazon Bedrock Inférence UE SCP : inférence UE, toute l’organisation
Chaque produit accède à Amazon Bedrock via une passerelle unique qui impose l’inférence UE, le filtrage des PII et le routage des modèles.
Description textuelle du schéma

Quatre capacités produit (un assistant de correction des déclarations de paie, l’OCR des feuilles de temps, des assistants intégrés et un agent de relance de documents) envoient toutes leurs requêtes de modèle à une passerelle IA centrale. La passerelle applique des profils d’inférence limités à l’UE, le filtrage des PII par Guardrails et le routage des modèles, puis appelle Amazon Bedrock. Une politique de contrôle de service (SCP) impose l’inférence UE à toute l’organisation.

Architecture du RAG avec citations Question API de recherche Propriété de la plateforme Aurora PostgreSQL + pgvector Index HNSWRecherche hybride + reranking Row-Level Security : isolation des tenants LLM via la passerelle IA Chaque réponse cite ses sourcesou s’abstient de répondre
La recherche passe par une API dédiée, s’appuie sur PostgreSQL avec pgvector et isole les tenants dans la base. Chaque réponse cite ses sources ou s’abstient.
Description textuelle du schéma

Une question arrive sur l’API de recherche de la plateforme. La recherche s’appuie sur Aurora PostgreSQL avec pgvector, un index HNSW et une recherche hybride avec reranking, tandis que Row-Level Security isole chaque tenant dans la base de données. Le modèle est appelé via la passerelle IA, et une politique de citations stricte impose que chaque réponse cite ses sources ou s’abstienne de répondre.

Ce qui est conçu

  1. Passerelle IA

    Un chemin unique vers Amazon Bedrock avec des profils d’inférence limités à l’UE, le filtrage des PII par Guardrails et le routage des modèles, appuyé par une politique de contrôle de service au niveau de l’organisation.

  2. Recherche

    RAG sur PostgreSQL avec pgvector, recherche hybride et reranking derrière une API maîtrisée par la plateforme, avec une politique de citations : chaque réponse cite ses sources ou s’abstient.

  3. Isolation des tenants

    Des politiques Row-Level Security pour que chaque tenant n’interroge que ses propres lignes, testées au niveau des données.

  4. Évaluation et observabilité

    Des jeux de référence et des contrôles d’évaluation en CI, avec traces et gestion des prompts : une régression fait échouer le build au lieu d’atteindre les utilisateurs.

  5. Gouvernance

    Un Architecture Design Document et des décisions d’architecture (ADR), appliqués par des revues d’architecture et des contrôles de conformité, avec le RGPD et l’AI Act traités dès la conception.

Livrables types

  • Architecture Design Document et ADR de la plateforme
  • Conception de la passerelle IA : accès aux modèles, inférence UE, garde-fous et routage des modèles
  • Architecture RAG : recherche hybride, reranking, politique de citations et isolation multi-tenant
  • Approche d’évaluation et d’observabilité : contrôles sur jeux de référence, traces et gestion des prompts
  • Revues d’architecture et contrôles de conformité pour les équipes qui construisent sur la plateforme

Pour qui

  • Responsables ingénierie et produit dont les équipes construisent plusieurs fonctionnalités IA et ont besoin d’un socle commun que l’on peut auditer.
  • Équipes soumises à des contraintes de résidence des données, de RGPD ou d’AI Act, qui doivent montrer comment le comportement de l’IA est maîtrisé.
  • Organisations qui passent d’un pilote convaincant à une plateforme qui doit passer la revue de sécurité et porter de vrais utilisateurs.

Comment ça se passe

Le déroulé d’une mission

Quatre étapes, chacune avec un livrable concret.

  1. Échanger

    Un appel de 30 minutes. Vous décrivez ce que vous construisez et ce qui bloque. Je vous dis franchement si je peux aider.

  2. Cartographier

    J’examine l’existant et je conçois la cible : une architecture de référence et des décisions documentées que votre équipe peut challenger.

  3. Construire

    Je travaille au sein de votre équipe sur les points difficiles : passerelle, recherche, actions des agents, pipelines. Vous obtenez du code, pas des slides.

  4. Transmettre

    Contrôles d’évaluation, runbooks et tableaux de bord, pour que votre équipe exploite et fasse évoluer la plateforme sans moi.

Études de cas

ENSO

2026 – Aujourd’hui

Une plateforme IA, quatre produits, un seul jeu de règles

Architecte principal de la plateforme partagée qui alimente quatre capacités produit IA, de l’accès aux modèles aux actions des agents.

  • Amazon Bedrock
  • Aurora PostgreSQL
  • pgvector
  • EKS

Guides

Questions fréquentes

Qu’est-ce qu’une passerelle IA ?

Une passerelle IA est le service unique par lequel chaque produit accède aux modèles de fondation. Elle applique la politique en un seul endroit (régions autorisées, filtrage des données personnelles, routage des modèles), enregistre l’usage et permet de changer de modèle sans modifier les produits.

Pourquoi placer la recherche derrière une API maîtrisée par la plateforme ?

Pour que la politique de citations, l’isolation des tenants et la qualité de la recherche soient appliquées une seule fois. Les produits disposent d’un contrat de recherche unique, et chaque amélioration profite à tous.

Sur quelle stack la construisez-vous ?

Surtout AWS : Amazon Bedrock, EKS, Aurora PostgreSQL avec pgvector, IAM et politiques de contrôle de service, plus Keycloak pour l’identité. J’ai aussi une expérience en production sur GCP.

Peut-elle tourner en environnement réglementé ?

Oui. Je conçois dès le départ pour l’inférence limitée à l’UE, la minimisation des données et l’auditabilité, et j’ai travaillé en environnement conforme HDS et dans le médical.

Dernière mise à jour :

Vous concevez une plateforme LLM d’entreprise ?

Dites-moi ce que vos équipes construisent. Après un appel, vous saurez si je peux vous aider et ce que je vérifierais en premier.

+33 6 02 73 49 22 me@osmanrami.fr