2024-2026
KARL
Démo à la CEO d'Orange Business en juillet 2025, en prod pour les équipes produit et commerciales
Veille concurrentielle cloud automatisée et chatbot RAG en production chez Orange Business, présentés en direct à la CEO en juillet 2025. D'abord orchestré avec N8N, mis en pause début 2026 pour mise en conformité, puis refondu sur LangChain + ChromaDB avec des modèles locaux (Llama 3.3 70B, DeepSeek R1, QwQ 32B) via vLLM sur GPU H100 NVL et L40S.

fig. 01 · Juillet 2025 : démo en direct à Aliette Mousnier-Lompré, CEO d'Orange Business
KARL est le système d'intelligence cloud que j'ai développé de bout en bout au sein de l'équipe produit Cloud Avenue d'Orange Business. Tout commence par un robot de veille concurrentielle automatisée, en production depuis juillet 2025 : collecte automatisée et synthèses envoyées aux équipes, d'abord orchestrées avec N8N. C'est ce robot que j'ai présenté en direct à Aliette Mousnier-Lompré, CEO d'Orange Business, en juillet 2025 (documenté par un post LinkedIn public), et son usage a été évoqué au niveau du comité de direction en août 2025. Début 2026, je l'ai mis en pause pour le mettre en conformité, puis entièrement refondu : N8N remplacé par LangChain + ChromaDB, avec des modèles servis en local (Llama 3.3 70B, DeepSeek R1, QwQ 32B) via vLLM sur GPU H100 NVL et L40S, pour la conformité et la souveraineté. KARL est revenu en production sous cette forme, avec un agent conversationnel RAG par-dessus la veille. L'objectif n'a jamais été une démo qui impressionne : des réponses ancrées dans les sources internes, auditables et fiables, pour les équipes produit et commerciales.
Veille automatisée

fig. 02 · Illustration. Des sources collectées automatiquement à la synthèse envoyée aux équipes
Un robot de veille concurrentielle cloud remplace la veille manuelle : collecte automatisée et synthèses envoyées aux équipes produit et commerciales, en production depuis juillet 2025. La première version était orchestrée avec N8N.
Refonte sur GPU locaux

fig. 03 · Illustration. Modèles servis via vLLM sur H100 NVL et L40S, base vectorielle ChromaDB, agent conversationnel
Début 2026, pause assumée pour mise en conformité, puis refonte complète : N8N remplacé par LangChain + ChromaDB, avec Llama 3.3 70B, DeepSeek R1 et QwQ 32B servis en local via vLLM sur GPU H100 NVL et L40S. Les données restent en interne.
Réponses ancrées et auditables

fig. 04 · Illustration. Chaque réponse du RAG renvoie aux documents internes qui la fondent
Par-dessus la veille, un agent conversationnel RAG ancre ses réponses dans les sources internes. L'objectif n'a jamais été une démo qui impressionne : des réponses auditables et fiables, évaluées sur des cas réels plutôt qu'au ressenti.
Défis
- Passer d'une veille manuelle à une collecte et des synthèses automatisées fiables
- Mettre le système en conformité sans le tuer : pause assumée début 2026, puis refonte complète
- Servir plusieurs LLM en local sur GPU (H100 NVL, L40S) via vLLM pour garder les données en interne
- Obtenir des réponses auditables et fiables plutôt que séduisantes en démo
Solutions
- Première version orchestrée avec N8N : collecte automatisée et synthèses envoyées aux équipes
- Refonte complète sur LangChain + ChromaDB, modèles locaux (Llama 3.3 70B, DeepSeek R1, QwQ 32B) servis via vLLM
- Pipeline RAG pour ancrer les réponses dans les sources internes
- Évaluation des sorties sur des cas réels plutôt que de se fier au ressenti
Résultats
- Présenté en direct à la CEO d'Orange Business, Aliette Mousnier-Lompré, en juillet 2025 (post LinkedIn public)
- Usage évoqué au niveau du comité de direction en août 2025
- Veille en production depuis juillet 2025, réincarnée après une refonte complète (N8N vers LangChain + ChromaDB + GPU locaux)
- En production pour les équipes produit et commerciales d'Orange Business
Post LinkedIn
Technologies
LangChain · ChromaDB · vLLM · H100 NVL · Llama 3.3 70B · DeepSeek R1 · RAG · N8N · Python