Services

Trois façons de mettre l’IA d’entreprise en production

Choisissez le problème que vous avez. Chaque domaine a des livrables concrets, et la conception se fait avec vos ingénieurs, pas dans un diaporama.

01

Plateforme LLM d’entreprise

Un chemin unique et gouverné entre vos produits et les modèles de fondation : accès sécurisé, recherche qui cite ses sources et isolation des tenants, pensés dès le premier jour.

En savoir plus: Plateforme LLM d’entreprise →

Livrables types

  • Architecture Design Document et ADR de la plateforme
  • Conception de la passerelle IA : accès aux modèles, inférence UE, garde-fous et routage des modèles
  • Architecture RAG : recherche hybride, reranking, politique de citations et isolation multi-tenant
  • Approche d’évaluation et d’observabilité : contrôles sur jeux de référence, traces et gestion des prompts
  • Revues d’architecture et contrôles de conformité pour les équipes qui construisent sur la plateforme
Architecture de la passerelle IA Capacités produit Correction paie OCR feuilles de temps Assistants intégrés Agent de relance Passerelle IA Profils d’inférence UEFiltrage PII GuardrailsRoutage des modèles Amazon Bedrock Inférence UE SCP : inférence UE, toute l’organisation
Chaque produit accède à Amazon Bedrock via une passerelle unique qui impose l’inférence UE, le filtrage des PII et le routage des modèles.
Description textuelle du schéma

Quatre capacités produit (un assistant de correction des déclarations de paie, l’OCR des feuilles de temps, des assistants intégrés et un agent de relance de documents) envoient toutes leurs requêtes de modèle à une passerelle IA centrale. La passerelle applique des profils d’inférence limités à l’UE, le filtrage des PII par Guardrails et le routage des modèles, puis appelle Amazon Bedrock. Une politique de contrôle de service (SCP) impose l’inférence UE à toute l’organisation.

Architecture du RAG avec citations Question API de recherche Propriété de la plateforme Aurora PostgreSQL + pgvector Index HNSWRecherche hybride + reranking Row-Level Security : isolation des tenants LLM via la passerelle IA Chaque réponse cite ses sourcesou s’abstient de répondre
La recherche passe par une API dédiée, s’appuie sur PostgreSQL avec pgvector et isole les tenants dans la base. Chaque réponse cite ses sources ou s’abstient.
Description textuelle du schéma

Une question arrive sur l’API de recherche de la plateforme. La recherche s’appuie sur Aurora PostgreSQL avec pgvector, un index HNSW et une recherche hybride avec reranking, tandis que Row-Level Security isole chaque tenant dans la base de données. Le modèle est appelé via la passerelle IA, et une politique de citations stricte impose que chaque réponse cite ses sources ou s’abstienne de répondre.

02

Des agents à qui confier de vraies actions

Des agents qui agissent sur vos systèmes sans jamais dépasser les droits de l’utilisateur, avec validation, piste d’audit et conformité réglementaire.

En savoir plus: Des agents à qui confier de vraies actions →

Livrables types

  • Conception d’un serveur d’actions MCP : manifestes d’outils versionnés, validation humaine des écritures, idempotence
  • Conception de l’identité : héritage des droits via OAuth2 Token Exchange et identités de workload
  • Journal de décisions et export d’audit pour que chaque décision de l’IA soit rejouable
  • RGPD et AI Act dès la conception : résidence des données, minimisation, effacement et transparence
  • Contrôles d’évaluation des LLM en CI
Flux d’actions d’agent avec validation humaine Agent Serveur d’actions MCP Manifestes d’outils versionnés Contrôles préconditions + idempotence Validation humaine à chaque écriture Action exécutée Journal de décisions append-only Export WORM vers S3 Object Lock Identité : OAuth2 Token Exchange (Keycloak)Hérite des droits de l’utilisateur, pas plus
Un agent n’agit que via un serveur d’actions MCP unique. Toute écriture passe des contrôles et une validation humaine, et chaque décision est journalisée pour être rejouée.
Description textuelle du schéma

Un agent appelle l’unique serveur d’actions MCP, qui expose des manifestes d’outils versionnés. Chaque action passe des contrôles de préconditions et d’idempotence puis, pour toute écriture, une validation humaine. Ce n’est qu’ensuite que l’action est exécutée. Un journal de décisions en append-only rend chaque décision de l’IA rejouable, avec un export WORM vers S3 Object Lock. Tout au long du flux, l’agent hérite des droits de l’utilisateur via OAuth2 Token Exchange, sans jamais les dépasser.

03

Cloud et ingénierie de plateformes

Des plateformes hautement disponibles sur AWS et GCP, et la chaîne de livraison pour les exploiter.

En savoir plus: Cloud et ingénierie de plateformes →

Livrables types

  • Architecture multi-AZ et infrastructure as code (Terraform)
  • Standardisation Kubernetes, GitOps et CI/CD, jusqu’à l’usine logicielle d’entreprise
  • Observabilité et contrôles qualité
  • Accompagnement de migration d’un existant vers des microservices
  • Documentation d’architecture (DAT, ADR)
Schéma d’une plateforme AWS multi-AZ Utilisateurs Répartition de charge entre zones Région AWS Zone de disponibilité A Zone de disponibilité B Application Application Provisionné en code (IaC) Disponibilité garantie de 99,9 %
Une plateforme web répartie sur plusieurs zones de disponibilité AWS et provisionnée en code, garantissant une disponibilité de 99,9 %.
Description textuelle du schéma

Les utilisateurs accèdent à la plateforme via une répartition de charge entre zones de disponibilité. Au sein d’une région AWS, les instances applicatives tournent dans plusieurs zones de disponibilité, ce qu’apporte une conception multi-AZ : la plateforme continue de servir lorsqu’une zone est indisponible. L’infrastructure est provisionnée en code (IaC), et l’architecture a garanti une disponibilité de 99,9 %.

Comment ça se passe

Le déroulé d’une mission

Quatre étapes, chacune avec un livrable concret.

  1. Échanger

    Un appel de 30 minutes. Vous décrivez ce que vous construisez et ce qui bloque. Je vous dis franchement si je peux aider.

  2. Cartographier

    J’examine l’existant et je conçois la cible : une architecture de référence et des décisions documentées que votre équipe peut challenger.

  3. Construire

    Je travaille au sein de votre équipe sur les points difficiles : passerelle, recherche, actions des agents, pipelines. Vous obtenez du code, pas des slides.

  4. Transmettre

    Contrôles d’évaluation, runbooks et tableaux de bord, pour que votre équipe exploite et fasse évoluer la plateforme sans moi.

Questions fréquentes

Que produit une mission en général ?

Des documents d’architecture (Architecture Design Document et ADR), des conceptions de référence, des contrôles de revue et un pilotage technique opérationnel des équipes qui construisent la plateforme.

Avec quelles stacks cloud et IA travaillez-vous ?

AWS (Amazon Bedrock, EKS, Aurora PostgreSQL avec pgvector, IAM et SCP), GCP (Cloud Run, Pub/Sub), Kubernetes et Terraform, des runtimes d’agents comme Mastra et LangGraph, MCP, DeepEval et Langfuse.

Pouvez-vous intervenir en environnement réglementé ?

Oui. J’ai travaillé en environnement conforme HDS (Inserm) et sur une plateforme de suivi médical soumise à de fortes exigences de confidentialité (APHP), et je conçois par défaut pour le RGPD et l’AI Act.

Quelle est votre approche du RAG ?

La recherche passe par une API maîtrisée avec une politique de citations stricte : chaque réponse cite ses sources ou s’abstient, et l’isolation des tenants est assurée dans la base par Row-Level Security.

Dans quelles langues travaillez-vous ?

Français (langue maternelle), anglais et arabe (courant).

Comment démarrer ?

Envoyez-moi un message ou prenez rendez-vous depuis la page de contact. Nous parlons du problème, et je vous dis ce que je ferais en premier.

Dernière mise à jour :

Un projet IA bloqué entre la démo et la production ?

Dites-moi ce que vous construisez. Après un premier échange, vous saurez si je peux vous aider et ce que je ferais en premier.

+33 6 02 73 49 22 me@osmanrami.fr