Thème

Applications LLM en production

Concevez, déployez, observez et exploitez des applications LLM au-delà de la démonstration.

31 contenus (20 articles · 11 vidéos)

Commencez ici

Quelques bons contenus pour débuter avant de parcourir l’ensemble du flux.

Plus de contenus sur ce thème

Vidéo

Le paysage des agents – enseignements tirés de leur mise en production

Le paysage des agents – enseignements tirés de leur mise en production

Avancé
11 min de lecture
Article

LangGraph, CrewAI ou API directe : choisir un framework d’agents en 2026

En 2026, les frameworks d’agents sont plus matures, mais le choix n’est pas plus clair. LangGraph, CrewAI, Pydantic AI, OpenAI Agents SDK et les API directes conviennent chacun à certaines équipes et certains projets, jamais à tous. Voici une comparaison honnête et un cadre de décision.

Avancé
13 min de lecture
Article

Concevoir des agents qui ne bouclent pas indéfiniment

Les boucles infinies ou quasi infinies figurent parmi les défaillances les plus courantes des agents en production : ils réessaient, se dispersent et consomment des tokens sans progresser. Voici les schémas architecturaux qui garantissent leur terminaison, même pour les tâches difficiles.

Avancé
12 min de lecture
Article

Agents d'utilisation d'ordinateur et de navigation en production

Les démonstrations d'agents d'utilisation d'ordinateur et de navigation deviennent virales. Les déploiements en production à grande échelle prennent une autre forme — périmètre restreint, garde-fous solides, expérience utilisateur soigneusement conçue. Les modèles qui fonctionnent, les échecs récurrents et l'équation économique réelle.

Avancé
12 min de lecture
Article

Ingénierie du contexte : gérer des fenêtres d’un million de tokens sans dégradation

Les fenêtres de contexte d’un million de tokens existent, mais la qualité se dégrade bien avant cette limite. L’ingénierie du contexte consiste à les utiliser efficacement : quoi inclure, résumer ou rechercher à la demande, et quels schémas préservent la qualité lorsque le contexte augmente.

Avancé
12 min de lecture
Article

Optimisation des coûts d'inférence : mise en cache des prompts, routage et contrôle de la sortie

Les bonnes techniques permettent de réduire les coûts d'inférence des grands modèles de langage (LLM) de 60 à 90 %. Mise en cache des prompts, routage des modèles, contrôle des sorties, traitement par lots et quelques méthodes moins connues. Les chiffres, les modèles et la discipline de production qui distinguent une inférence bien gérée d'une facture incontrôlée.

Avancé
13 min de lecture
Article

Créer des évaluations qui détectent vraiment les régressions

La plupart des suites d’évaluation semblent impressionnantes, mais ne détectent pas les régressions réelles. Des évaluations pertinentes exigent des jeux de données soigneusement construits, des métriques sensibles, des juges étalonnés et une culture de confiance. Voici les pratiques des équipes qui maîtrisent cette discipline.

Avancé
13 min de lecture
Article

Fine-tuning en 2026 : quand LoRA surpasse le RAG et comment s’en passer de cluster

Le fine-tuning avec LoRA est désormais accessible : vous pouvez affiner un modèle sur un ordinateur portable ou louer un GPU pendant une heure. Voici les approches efficaces, les situations où le fine-tuning surpasse le RAG et un flux de travail complet, de la préparation des données à la production.

Avancé
14 min de lecture
Article

MCP à partir de zéro : créer un serveur de production en TypeScript

Créer un serveur Model Context Protocol (MCP) de production exige davantage que de relier quelques outils. Voici les schémas de conception, l’authentification, la gestion des erreurs, la diffusion continue, l’observabilité et les réalités opérationnelles qui rendent un serveur MCP utile à grande échelle.

Avancé
12 min de lecture
Article

Concevoir des outils MCP que les LLM utilisent réellement correctement

La plupart des outils MCP que nous rencontrons sont techniquement corrects, mais pratiquement inutiles. Les LLM les ignorent, les utilisent mal ou les appellent sans discernement. Voici les principes permettant de concevoir des outils qu’ils adoptent naturellement, avec des exemples d’erreurs courantes et leurs corrections.

Avancé
12 min de lecture
Article

Construire une mémoire pour les agents de longue durée

Les agents ont besoin d'une mémoire qui dépasse la fenêtre de contexte. L'architecture de la mémoire à long terme — ce qu'il faut stocker, quand le récupérer, comment oublier — détermine si les agents donnent l'impression de vous 'connaître' ou repartent de zéro à chaque conversation. Les modèles et les compromis en production.

Avancé
10 min de lecture
Article

Orchestration multi-modèle : routage selon le coût, la latence et la qualité

Utiliser un seul modèle pour tout est une erreur de débutant. Les systèmes d'IA en production routent les différentes demandes vers différents modèles — et économisent 60 à 90 % sur les coûts tout en améliorant la qualité. Les modèles, la logique de routage et les compromis.

Intermédiaire
12 min de lecture
Article

Observabilité des applications LLM : suivi, coûts, latence, dérive de la qualité

Les applications LLM présentent des modes de défaillance particuliers que l’observabilité traditionnelle ne détecte pas. Voici comment tracer les flux en plusieurs étapes, suivre des coûts pouvant varier d’un facteur 100 par appel, surveiller la dérive de qualité et analyser à grande échelle les informations inventées.

Avancé
12 min de lecture
Article

Construire un RAG de production : ingestion, embeddings, recherche, reclassement et évaluation

Un pipeline RAG de production comporte six étapes, chacune régie par des principes qui déterminent la qualité. Voici l’architecture, les choix propres à chaque étape et la discipline d’évaluation itérative qui distinguent un RAG efficace d’un système décevant.

Avancé
14 min de lecture
Article

Injection de prompt et sécurité des LLM : modèles de menaces et défense en profondeur

L'injection de prompt est une catégorie permanente de risque pour la sécurité des LLM, et non une erreur de rédaction de prompt. Un guide de production consacré aux modèles de menaces, aux frontières des données, aux autorisations des outils, aux tests de régression, à la surveillance et à la réponse aux incidents.

Avancé
12 min de lecture
Article

Choisir entre le prompting, le RAG et le fine-tuning (et quand les combiner)

Le prompting, le RAG et le fine-tuning sont les trois principaux leviers permettant d’adapter un LLM à votre problème. Chacun convient à certaines situations et non à d’autres. Voici un cadre de décision, leurs coûts réels et les architectures de production où leur combinaison excelle.

Avancé
13 min de lecture
Article

Lancer un produit fondé sur un LLM : tarification, marges et piège de l'absence de barrière concurrentielle

Les produits fondés sur un LLM ont une économie plus complexe que les SaaS traditionnels : coûts variables proportionnels à l'usage, marges comprimées par l'inférence, risque de banalisation et concurrents utilisant les mêmes modèles de fondation. Comment construire un produit réellement défendable, et quels schémas conduisent les startups d'IA à disparaître ?

Avancé
13 min de lecture
Article

Sorties structurées et appels de fonctions : les schémas adaptés à la production

Les sorties structurées et les appels de fonctions permettent de passer d’un « LLM qui génère du texte » à un « système qui exécute des tâches ». En production, les schémas, la gestion des erreurs, l’idempotence et la dégradation progressive comptent davantage que le seul mode JSON.

Avancé
Vidéo

Plongée au cœur des LLM comme ChatGPT

Plongée au cœur des LLM comme ChatGPT

Avancé
Vidéo

Andrej Karpathy : Le logiciel change à nouveau

Andrej Karpathy : Le logiciel change à nouveau

Avancé
Vidéo

LangSmith en 10 minutes

LangSmith en 10 minutes

Avancé
Vidéo

Instrumentation et évaluation des LLM

Instrumentation et évaluation des LLM

Avancé
Vidéo

Ingénierie de prompts en IA : une plongée approfondie

Ingénierie de prompts en IA : une plongée approfondie

Avancé
Vidéo

Initiation aux prompts | Code avec Claude

Initiation aux prompts | Code avec Claude

Avancé
Vidéo

Les agents IA verticaux pourraient être 10 fois plus importants que le SaaS

Les agents IA verticaux pourraient être 10 fois plus importants que le SaaS

Avancé
Vidéo

Comment l'IA réinvente les modèles économiques logiciels ft. Bret Taylor de Sierra

Comment l'IA réinvente les modèles économiques logiciels ft. Bret Taylor de Sierra

Avancé
Vidéo

OpenAI DevDay 2024 | Sorties structurées pour des applications fiables

OpenAI DevDay 2024 | Sorties structurées pour des applications fiables

Avancé
Vidéo

Pydantic est tout ce dont vous avez besoin : Jason Liu

Pydantic est tout ce dont vous avez besoin : Jason Liu

Avancé