Architecte IA à Paris · IA d’entreprise & cloud

Faites passer votre IA de la démo à la production.

Je conçois et construis les plateformes qui font tourner l’IA en entreprise : passerelles de modèles, RAG qui cite ses sources, agents qui agissent dans le cadre de vos règles. En direct avec vos équipes, sur AWS, pour passer la revue de sécurité.

Une requête à travers la plateforme (illustratif)

  1. requête un assistant pose une question
  2. garde-fous données personnelles masquées
  3. recherche sources du tenant trouvées
  4. modèle routé dans l’UE
  5. réponse cite ses sources

Livré pour et avec

Ce que je résous

Là où les projets d’IA d’entreprise se bloquent

Le modèle est rarement ce qui bloque un projet d’IA. Ce sont les éléments autour : l’accès, la confiance, le contrôle et le cloud en dessous. Ce sont ces éléments que je construis.

Chaque équipe branche son propre modèle.

Une seule porte, gouvernée, vers tous les modèles

Une passerelle IA centrale sur Amazon Bedrock impose l’inférence dans l’UE et le filtrage des PII, puis route chaque requête vers le bon modèle. Les produits ne dépendent plus d’un modèle en particulier.

  • Amazon Bedrock
  • Guardrails
  • SCP
  • Model routing
Comment ça marche

L’assistant invente des réponses.

Des réponses qui citent leurs sources, ou s’abstiennent

RAG sur PostgreSQL avec pgvector, recherche hybride et reranking. L’isolation des tenants est assurée dans la base elle-même.

  • pgvector
  • HNSW
  • Hybrid search
  • Row-Level Security
Comment ça marche

Personne ne fait confiance à un agent qui agit.

Des agents qui demandent avant d’agir

Un serveur d’actions MCP unique : outils versionnés, validation humaine à chaque écriture et journal de décisions rejouable. L’agent n’a jamais plus de droits que l’utilisateur.

  • MCP
  • OAuth2 Token Exchange
  • Keycloak
  • S3 Object Lock
Comment ça marche

Personne ne sait si la dernière modification a amélioré les choses.

Une qualité mesurée, en CI

Jeux de référence et contrôles d’évaluation dans la pipeline, avec traçage de chaque prompt et de chaque réponse : une régression fait échouer le build au lieu d’atteindre les utilisateurs.

  • DeepEval
  • Langfuse
  • Golden sets
Comment ça marche

Ça tourne sur un serveur. Puis le vrai trafic arrive.

Des fondations cloud qui tiennent

Des plateformes multi-AZ sur AWS et GCP définies en code, avec Kubernetes, GitOps et CI/CD que vos équipes exploitent sans moi.

  • AWS
  • Kubernetes
  • Terraform
  • GitOps
Comment ça marche

Vous voulez faire tourner des modèles open source vous-même.

Vos GPU, des modèles open source

De l’inférence distribuée sur un cluster GPU, avec les pipelines GenAI, le fine-tuning et l’automatisation qui vont autour.

  • RunPod
  • ComfyUI
  • n8n
  • Fine-tuning
Comment ça marche

Boîte à outils

La stack avec laquelle je travaille

Les technologies des plateformes ci-dessus et de mes propres projets.

  • Amazon Bedrock
  • AWS
  • Kubernetes
  • Terraform
  • PostgreSQL
  • pgvector
  • MCP
  • Keycloak
  • Google Cloud
  • Docker
  • Argo CD
  • Grafana
  • LangGraph
  • Mastra
  • DeepEval
  • Langfuse
  • Vespa
  • n8n
  • Spring Boot
  • TypeScript
  • Kafka
  • GitLab
  • Redis
  • Ansible

Réalisations

De vraies plateformes, de vraies contraintes

Six missions, chacune racontée par le problème et le résultat.

Inserm

2025 – 2026

Une usine logicielle pour 12 équipes

Plus de 40 projets en CI/CD automatisée et 50 % d’interventions manuelles en moins, sur une infrastructure conforme HDS.

  • GitLab Enterprise
  • Nexus
  • SonarQube
  • Kubernetes
Volkswagen Group

2025 – 2026

99,9 % de disponibilité, par conception

Une infrastructure AWS multi-AZ définie en code, garantissant 99,9 % de disponibilité pour la plateforme web GENWIN.

  • AWS
  • Multi-AZ
  • Infrastructure as code
  • Clean Architecture
SNCF

2025 – 2026

Une marketplace de données pour 90 000 utilisateurs

Des microservices Spring Boot sur des services managés GCP, avec l’observabilité intégrée dès le départ.

  • Spring Boot
  • Microservices
  • Google Cloud Platform
  • Managed services
Magik AI

2020 – 2025

L’IA open source sur un cluster GPU

Une plateforme de génération de médias interactifs sur modèles open source, déployée sur un cluster GPU RunPod, avec pipelines GenAI, agents et workflows n8n.

  • RunPod
  • Open-source models
  • RAG
  • Fine-tuning

Toutes les études de cas →

Comment ça se passe

Le déroulé d’une mission

Quatre étapes, chacune avec un livrable concret.

  1. Échanger

    Un appel de 30 minutes. Vous décrivez ce que vous construisez et ce qui bloque. Je vous dis franchement si je peux aider.

  2. Cartographier

    J’examine l’existant et je conçois la cible : une architecture de référence et des décisions documentées que votre équipe peut challenger.

  3. Construire

    Je travaille au sein de votre équipe sur les points difficiles : passerelle, recherche, actions des agents, pipelines. Vous obtenez du code, pas des slides.

  4. Transmettre

    Contrôles d’évaluation, runbooks et tableaux de bord, pour que votre équipe exploite et fasse évoluer la plateforme sans moi.

Notes de terrain

Ce que la construction de ces systèmes m’a appris

Des guides de conception avec les décisions et les compromis, sans discours marketing.

Tous les articles →

Dernière mise à jour :

Un projet IA bloqué entre la démo et la production ?

Dites-moi ce que vous construisez. Après un premier échange, vous saurez si je peux vous aider et ce que je ferais en premier.

+33 6 02 73 49 22 me@osmanrami.fr