Thème

Applications LLM en production

Concevez, déployez, observez et exploitez des applications LLM au-delà de la démonstration.

34 contenus (23 articles · 11 vidéos)

Commencez ici

Quelques bons contenus pour débuter avant de parcourir l’ensemble du flux.

Plus de contenus sur ce thème

8 min de lecture
Article

Hermes ou n8n : choisissez selon la tâche (et quand utiliser les deux)

Un cadre de décision pour Hermes Agent et n8n : la plomberie déterministe reste dans n8n, tandis qu’une étape de l’API Hermes authentifiée par jeton bearer ou un parcours webhook d’événements distinct prend en charge le travail d’agent délimité.

Intermédiaire
8 min de lecture
Article

OpenClaw vs Hermes : choisir selon la tâche, pas selon la marque

OpenClaw et Hermes sont des systèmes d’agents auto-hébergés qui se chevauchent, avec des forces opérationnelles différentes. Comparez le routage de canaux, les webhooks, les outils et les frontières d’automatisation avant de choisir l’un, l’autre ou les deux.

Intermédiaire
10 min de lecture
Article

Architecture expérimentale : deux DGX Spark, DeepSeek-V4-Flash, n8n et Hermes

Comment évaluer une solution communautaire expérimentale qui exécute DeepSeek-V4-Flash sur deux DGX Spark, avec n8n pour les opérations déterministes et Hermes pour les tâches qui exigent du jugement.

Avancé
69 minutes
Vidéo

Le paysage des agents – enseignements tirés de leur mise en production

MLOps.community. Le vice-président chargé de l'IA chez Prosus et un ingénieur en IA expliquent ce qui a réellement échoué lors du déploiement d'agents dans les entreprises du portefeuille du groupe : tests d'intrusion ciblant l'injection de prompt avant le lancement, écriture dangereuse lorsqu'un agent Jira a mal interprété une abréviation humaine, contexte périmé compensé en obligeant les agents à expliciter leurs hypothèses, et mécanismes de repli consistant à fusionner ou supprimer des agents devenus une source de charge cognitive. C'est presque le registre des défaillances de l'article rejoué sous la forme d'un retour d'incident en direct.

Avancé
11 min de lecture
Article

LangGraph, CrewAI ou API directe : choisir un framework d’agents en 2026

En 2026, les frameworks d’agents sont plus matures, mais le choix n’est pas plus clair. LangGraph, CrewAI, Pydantic AI, OpenAI Agents SDK et les API directes conviennent chacun à certaines équipes et certains projets, jamais à tous. Voici une comparaison honnête et un cadre de décision.

Avancé
13 min de lecture
Article

Concevoir des agents qui ne bouclent pas indéfiniment

Les boucles infinies ou quasi infinies figurent parmi les défaillances les plus courantes des agents en production : ils réessaient, se dispersent et consomment des tokens sans progresser. Voici les schémas architecturaux qui garantissent leur terminaison, même pour les tâches difficiles.

Avancé
12 min de lecture
Article

Agents d'utilisation d'ordinateur et de navigation en production

Les démonstrations d'agents d'utilisation d'ordinateur et de navigation deviennent virales. Les déploiements en production à grande échelle prennent une autre forme — périmètre restreint, garde-fous solides, expérience utilisateur soigneusement conçue. Les modèles qui fonctionnent, les échecs récurrents et l'équation économique réelle.

Avancé
12 min de lecture
Article

Ingénierie du contexte : gérer des fenêtres d’un million de tokens sans dégradation

Les fenêtres de contexte d’un million de tokens existent, mais la qualité se dégrade bien avant cette limite. L’ingénierie du contexte consiste à les utiliser efficacement : quoi inclure, résumer ou rechercher à la demande, et quels schémas préservent la qualité lorsque le contexte augmente.

Avancé
12 min de lecture
Article

Optimiser les coûts d’inférence : cache des prompts, routage et contrôle des sorties

Élaborez un modèle des coûts d’inférence à partir des traces, optimisez les postes mesurés les plus importants et démontrez que chaque modification préserve la qualité de la tâche.

Avancé
13 min de lecture
Article

Créer des évaluations qui détectent vraiment les régressions

La plupart des suites d’évaluation semblent impressionnantes, mais ne détectent pas les régressions réelles. Des évaluations pertinentes exigent des jeux de données soigneusement construits, des métriques sensibles, des juges étalonnés et une culture de confiance. Voici les pratiques des équipes qui maîtrisent cette discipline.

Avancé
13 min de lecture
Article

Ajustement fin en 2026 : une expérience fondée sur les preuves autour de LoRA et QLoRA

Décidez si l’ajustement fin efficace en paramètres est justifié, gouvernez les données, figez une expérience reproductible, comparez les résultats sur les données de test et ceux liés à la sécurité, puis effectuez un benchmark du déploiement avant la mise en production.

Avancé
14 min de lecture
Article

MCP à partir de zéro : créer un serveur de production en TypeScript

Créer un serveur Model Context Protocol (MCP) de production exige davantage que de relier quelques outils. Voici les schémas de conception, l’authentification, la gestion des erreurs, la diffusion continue, l’observabilité et les réalités opérationnelles qui rendent un serveur MCP utile à grande échelle.

Avancé
12 min de lecture
Article

Concevoir des outils MCP que les LLM utilisent réellement correctement

La plupart des outils MCP que nous rencontrons sont techniquement corrects, mais pratiquement inutiles. Les LLM les ignorent, les utilisent mal ou les appellent sans discernement. Voici les principes permettant de concevoir des outils qu’ils adoptent naturellement, avec des exemples d’erreurs courantes et leurs corrections.

Avancé
12 min de lecture
Article

Construire la mémoire pour les agents à longue durée de vie

Les agents à longue durée de vie nécessitent une conception de persistance maîtrisée : provenance, confirmation, isolation par locataire, tests de récupération, conservation, correction et suppression vérifiable.

Avancé
10 min de lecture
Article

Orchestration multi-modèles : routage par coût, latence et qualité

Acheminer différentes tâches vers différents modèles peut réduire les coûts ou la latence, mais seule une évaluation adaptée à la charge de travail permet de savoir si la complexité supplémentaire en vaut la peine. Les schémas, les mesures et les modes de défaillance.

Intermédiaire
12 min de lecture
Article

Observabilité des applications LLM : traçage, coûts, latence et dérive de la qualité

Étendez l’observabilité standard par des traces multi-étapes, un coût attribuable, les versions de prompt et de modèle, des signaux de qualité évalués, des contrôles de confidentialité et des alertes dérivées de la charge.

Avancé
12 min de lecture
Article

Construire un RAG de production : ingestion, embeddings, recherche, reclassement et évaluation

Un pipeline RAG de production comporte six étapes, chacune régie par des principes qui déterminent la qualité. Voici l’architecture, les choix propres à chaque étape et la discipline d’évaluation itérative qui distinguent un RAG efficace d’un système décevant.

Avancé
14 min de lecture
Article

Injection de prompt et sécurité des LLM : modèles de menaces et défense en profondeur

L'injection de prompt est une catégorie permanente de risque pour la sécurité des LLM, et non une erreur de rédaction de prompt. Un guide de production consacré aux modèles de menaces, aux frontières des données, aux autorisations des outils, aux tests de régression, à la surveillance et à la réponse aux incidents.

Avancé
12 min de lecture
Article

Choisir entre le prompting, le RAG et le fine-tuning (et quand les combiner)

Le prompting, le RAG et le fine-tuning sont les trois principaux leviers permettant d’adapter un LLM à votre problème. Chacun convient à certaines situations et non à d’autres. Voici un cadre de décision, leurs coûts réels et les architectures de production où leur combinaison excelle.

Avancé
13 min de lecture
Article

Économie unitaire d’un produit LLM : une feuille de calcul tarifaire vérifiable

Ventilez l’usage des modèles, la marge contributive, le coût des échecs, l’assistance et la fidélisation avant de fixer un prix. Cette feuille de calcul remplace les fourchettes de marché non étayées par des données vérifiées.

Avancé
13 min de lecture
Article

Sorties structurées et appels de fonctions : les schémas adaptés à la production

Les sorties structurées et les appels de fonctions permettent de passer d’un « LLM qui génère du texte » à un « système qui exécute des tâches ». En production, les schémas, la gestion des erreurs, l’idempotence et la dégradation progressive comptent davantage que le seul mode JSON.

Avancé
211 minutes
Vidéo

Plongée au cœur des LLM comme ChatGPT

Andrej Karpathy. C’est sur YouTube la meilleure explication de bout en bout de ce qu’est réellement un LLM — préentraînement, tokenisation, SFT, RLHF, apprentissage par renforcement pour le raisonnement, utilisation d’outils et hallucinations — avec le niveau de détail dont un ingénieur a besoin pour analyser les compromis entre modèles. Après l’avoir regardée, les décisions « modèles de classe GPT, modèles à poids ouverts ou modèles de raisonnement » évoquées dans l’article ne ressemblent plus à des choix de marques, mais à des choix de méthodes d’entraînement.

Avancé
40 minutes
Vidéo

Andrej Karpathy : Le logiciel change à nouveau

Y Combinator. Dans sa conférence à l’AI Startup School, Karpathy présente les LLM comme un nouveau type d’ordinateur — à la fois service public, usine de fabrication et système d’exploitation — et défend des produits à « autonomie partielle » maintenus sous contrôle humain. C’est la formulation la plus claire du modèle mental à l’échelle de la pile que suppose l’article : vous choisissez des fournisseurs d’inférence et des outils pour un socle programmable, pas pour un simple chatbot.

Avancé
9 minutes
Vidéo

LangSmith en 10 minutes

LangChain. Le cofondateur de LangChain propose une visite guidée d’une trace LLM, d’un projet et d’un jeu de données — coût des tokens, latence, taux d’erreur, agrégation des retours et exploration du span d’une seule étape de récupération. C’est l’équivalent visuel le plus proche de ce que décrit l’article lorsqu’il affirme que « chaque appel est un span » et explique pourquoi les traces structurées sont supérieures aux simples journaux produits par des instructions d’affichage.

Avancé
154 minutes
Vidéo

Instrumentation et évaluation des LLM

Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase et Shreya Shankar travaillent sur le traçage, l’analyse des journaux, les LLM utilisés comme juges et le flux d’examen de véritables données de production. Consacrez à cette vidéo la même attention qu’à un long podcast : c’est sur YouTube l’analyse la plus approfondie de la thèse « examinez vos traces » défendue dans l’article.

Avancé
77 minutes
Vidéo

Ingénierie de prompts en IA : une plongée approfondie

Anthropic. Quatre spécialistes des prompts chez Anthropic — issus de la recherche, de l’alignement, de l’IA appliquée et des relations avec les développeurs — décrivent longuement leur travail quotidien : comment ils révisent des prompts sous pression, comment ils abordent l’« honnêteté » des instructions et dans quels cas les structures XML sont utiles ou non. Le modèle en couches de l’article correspond directement à leur façon de décrire le travail ; c’est le meilleur moyen d’entendre ce modèle mental formulé à voix haute.

Avancé
25 minutes
Vidéo

Initiation aux prompts | Code avec Claude

Anthropic. L’équipe Applied AI d’Anthropic construit en direct un prompt consacré à des demandes d’indemnisation. Elle part d’une instruction vague et l’améliore jusqu’à obtenir un résultat qu’un développeur pourrait réellement livrer, en montrant les révisions des couches système et développeur décrites dans l’article. Regardez cette vidéo avant de relire la liste de contrôle de l’article sur les exemples, la structure des sorties et le traitement des refus.

Avancé
42 minutes
Vidéo

Les agents IA verticaux pourraient être 10 fois plus importants que le SaaS

Y Combinator. Les animateurs de Lightcone expliquent pourquoi les agents d'IA verticaux — plutôt que de simples interfaces horizontales autour d'un modèle — offrent une forme plus défendable aux entreprises applicatives. Des exemples concrets éclairent les catégories que les fournisseurs de modèles risquent d'intégrer eux-mêmes. C'est la version constructive du piège lié à l'absence de barrière concurrentielle décrit dans l'article.

Avancé
34 minutes
Vidéo

Comment l'IA réinvente les modèles économiques logiciels ft. Bret Taylor de Sierra

Sequoia Capital. Bret Taylor décrit le passage d'un SaaS facturé par utilisateur à une tarification fondée sur les résultats : quels indicateurs choisir — résolution, CSAT, NPS —, pourquoi les acteurs établis peinent à s'adapter et comment la spécialisation verticale renforce le pouvoir de fixation des prix. Cette analyse reflète directement les sections de l'article consacrées à la tarification et aux marges.

Avancé
41 minutes
Vidéo

OpenAI DevDay 2024 | Sorties structurées pour des applications fiables

OpenAI. La vidéo présente `strict: true`, sa différence par rapport à l’ancien mode JSON, le traitement des refus et la manière dont les appels de fonctions s’articulent avec les schémas de format de réponse. Elle est particulièrement utile parce qu’elle décrit le contrat fourni par l’API, sur lequel reposent les schémas de production de l’article.

Avancé
18 minutes
Vidéo

Pydantic est tout ce dont vous avez besoin : Jason Liu

AI Engineer. Cette présentation a cristallisé le modèle moderne « définir un modèle Pydantic, le transmettre au LLM et laisser la validation faire le reste ». Elle donne des exemples concrets d’objets imbriqués, de validateurs qui détectent les URL hallucinées et de chaîne de pensée représentée par un champ typé. Regardez-la avant de relire la section de l’article sur les validateurs : vous reconnaîtrez l’origine de ses règles de nouvelle tentative et de refus.

Avancé