Thème

Modèles et choix des outils

Choisissez entre ChatGPT, Claude, Gemini, Copilot, les modèles de raisonnement et l’inférence hébergée ou locale.

27 contenus (12 articles · 15 vidéos)

Commencez ici

Quelques bons contenus pour débuter avant de parcourir l’ensemble du flux.

Plus de contenus sur ce thème

13 min de lecture
Article

La pile LLM en 2026 : modèles, inférence, outils et compromis

Le point de vue d’un architecte en activité sur la pile LLM en 2026 : catégories de modèles, fournisseurs d’inférence, couches d’orchestration, outils d’évaluation et compromis réellement déterminants pour mettre l’IA en production. Tout ce que vous auriez aimé trouver avant de commencer.

Avancé
10 min de lecture
Article

Chaîne de pensée, autocritique, arbre de pensées — quand utiliser chaque technique

Trois techniques de raisonnement qui améliorent réellement les résultats de l'IA sur les problèmes difficiles, avec une analyse de leur rapport coût-bénéfice, des prompts concrets, des comparaisons directes et les pièges propres aux modèles de raisonnement modernes.

Intermédiaire
12 min de lecture
Article

Optimiser les coûts d’inférence : cache des prompts, routage et contrôle des sorties

Élaborez un modèle des coûts d’inférence à partir des traces, optimisez les postes mesurés les plus importants et démontrez que chaque modification préserve la qualité de la tâche.

Avancé
13 min de lecture
Article

Ajustement fin en 2026 : une expérience fondée sur les preuves autour de LoRA et QLoRA

Décidez si l’ajustement fin efficace en paramètres est justifié, gouvernez les données, figez une expérience reproductible, comparez les résultats sur les données de test et ceux liés à la sécurité, puis effectuez un benchmark du déploiement avant la mise en production.

Avancé
6 min de lecture
Article

ChatGPT gratuit ou payant : ce que finance réellement l'abonnement

Une comparaison sans jargon entre la version gratuite de ChatGPT, ChatGPT Plus et ChatGPT Pro — ce qui change avec l'abonnement et comment déterminer si vous en avez réellement besoin.

Découvrir l’IA
10 min de lecture
Article

IA locale sur votre Mac : Ollama, LM Studio et ce que les modèles 7B peuvent vraiment faire

Exécuter l'IA localement a mûri. Avec Ollama ou LM Studio et un Mac moderne, vous pouvez exécuter des modèles capables hors ligne, gratuitement et de manière privée. Ce qui fonctionne, ce qui ne fonctionne pas et les cas d'utilisation qui en bénéficient vraiment.

Intermédiaire
10 min de lecture
Article

Choisir et interroger les modèles de raisonnement

Les réglages de raisonnement modifient la qualité, la latence, le coût et parfois le comportement face aux prompts. Un guide pratique pour les choisir par l'évaluation plutôt que par les idées reçues.

Intermédiaire
12 min de lecture
Article

Choisir entre le prompting, le RAG et le fine-tuning (et quand les combiner)

Le prompting, le RAG et le fine-tuning sont les trois principaux leviers permettant d’adapter un LLM à votre problème. Chacun convient à certaines situations et non à d’autres. Voici un cadre de décision, leurs coûts réels et les architectures de production où leur combinaison excelle.

Avancé
11 min de lecture
Article

Inférence auto-hébergée ou gérée : un seuil de rentabilité vérifiable

À partir de quel volume l’auto-hébergement devient-il plus avantageux que les appels d’API ? Les calculs, les réalités opérationnelles et les critères qui distinguent les équipes qui devraient auto-héberger de celles qui devraient conserver une offre d’inférence gérée.

Avancé
211 minutes
Vidéo

Plongée au cœur des LLM comme ChatGPT

Andrej Karpathy. C’est sur YouTube la meilleure explication de bout en bout de ce qu’est réellement un LLM — préentraînement, tokenisation, SFT, RLHF, apprentissage par renforcement pour le raisonnement, utilisation d’outils et hallucinations — avec le niveau de détail dont un ingénieur a besoin pour analyser les compromis entre modèles. Après l’avoir regardée, les décisions « modèles de classe GPT, modèles à poids ouverts ou modèles de raisonnement » évoquées dans l’article ne ressemblent plus à des choix de marques, mais à des choix de méthodes d’entraînement.

Avancé
40 minutes
Vidéo

Andrej Karpathy : Le logiciel change à nouveau

Y Combinator. Dans sa conférence à l’AI Startup School, Karpathy présente les LLM comme un nouveau type d’ordinateur — à la fois service public, usine de fabrication et système d’exploitation — et défend des produits à « autonomie partielle » maintenus sous contrôle humain. C’est la formulation la plus claire du modèle mental à l’échelle de la pile que suppose l’article : vous choisissez des fournisseurs d’inférence et des outils pour un socle programmable, pas pour un simple chatbot.

Avancé
19 minutes
Vidéo

Est-ce la fin de la RAG ? La nouvelle mise en cache des prompts d'Anthropic

Prompt Engineering. Elle compare la mise en cache des prompts d'Anthropic à celle du contexte chez Gemini, en chiffrant les gains de latence et de coût selon le cas d'usage : conversation sur de longs documents, apprentissage à partir de quelques exemples et échanges en plusieurs tours. La comparaison entre le surcoût d'écriture du cache et l'économie réalisée à la lecture correspond exactement au calcul de rentabilité présenté dans l'article.

Avancé
56 minutes
Vidéo

Build Hour : Mise en cache des prompts

OpenAI. Cette session officielle d'OpenAI détaille le seuil de 1 024 tokens, l'exigence de stabilité du préfixe, les fortes remises liées à la mise en cache audio en temps réel — consultez la page tarifaire actuelle pour connaître le taux exact — et l'effet des longues entrées sur le délai avant le premier token. Elle aide à estimer l'effort technique nécessaire pour exploiter le cache de façon fiable avec vos prompts de production.

Avancé
157 minutes
Vidéo

Ajustement fin des modèles LLM – Cours sur l'IA générative

freeCodeCamp.org. Ce long cours passe de la théorie au code et couvre la quantification, LoRA, QLoRA et l’ensemble des techniques PEFT sur Llama 2 et Gemma, avec du matériel dont disposent réellement la plupart des développeurs. C’est sur YouTube ce qui se rapproche le plus de l’expérience consistant à suivre pas à pas une personne qui l’a déjà fait. Il étaye concrètement l’affirmation de l’article selon laquelle « vous n’avez pas besoin d’un cluster », avec des budgets de VRAM précis.

Avancé
59 minutes
Vidéo

Développer un LLM : Construction, entraînement, ajustement fin

Sebastian Raschka. Sebastian Raschka présente progressivement la place du fine-tuning dans le pipeline global d’entraînement des LLM — ajustement par instructions, fine-tuning de classification, méthodes économes en paramètres et compromis relevés dans l’article avant de recommander LoRA. C’est un bon étalonnage avant de commencer, surtout si votre équipe se demande encore si le fine-tuning constitue la bonne étape.

Avancé
15 minutes
Vidéo

Est-ce que ChatGPT Plus en vaut la peine ? Voici mon avis actualisé pour 2025

Ryan Doser. Ryan passe en revue toutes les fonctionnalités réservées à l'offre à 20 $ — plafonds d'utilisation, mode vocal avancé, limites d'images et de Sora, GPT personnalisés et modèles de raisonnement —, puis les compare aux solutions gratuites actuelles telles que Claude, Gemini et Perplexity. Le nombre de vues est relativement faible parce que le sujet est précis, mais c'est la comparaison la plus claire qui évite le battage médiatique. Nous l'avons donc préférée aux vidéos tapageuses affirmant que « Plus a changé ma vie ».

Découvrir l’IA
19 minutes
Vidéo

Tous les modèles d’IA expliqués

Tina Huang. Ce tour d’horizon clair du paysage actuel regroupe les modèles par catégorie — phares, légers, intermédiaires et spécialisés — et recommande des usages concrets pour chacune. C’est le volet « connaître ses options avant d’effectuer le routage » de l’article. Huang présente le rapport coût/capacités de la même manière que l’article, sans s’appuyer sur le battage autour des évaluations comparatives.

Intermédiaire
9 minutes
Vidéo

RouteLLM atteint 90 % de la qualité de GPT4o pour un coût inférieur de 80 %

Matthew Berman. La vidéo présente l’article scientifique et le code de LMSYS RouteLLM : un petit classificateur placé devant une paire composée d’un modèle performant et d’un modèle plus faible décide lequel appeler, pour atteindre environ 95 % de la qualité du modèle performant à une fraction du coût. La vidéo reste sous notre seuil habituel de 100 000 vues, mais, dans le créneau précis « montrez-moi un véritable routage de modèles, pas seulement des comparaisons », c’est l’explication la plus claire sur YouTube. Elle correspond directement à la section de l’article consacrée au compromis qualité/coût.

Intermédiaire
9 minutes
Vidéo

RAG ou fine-tuning

IBM Technology. Cette vidéo se concentre sur les deux techniques que les équipes confondent le plus souvent. Elle approfondit la fraîcheur des données, l’attribution des sources et l’avantage de vitesse à l’inférence que peut apporter le fine-tuning. Elle mérite d’être regardée si vous cherchez précisément à déconseiller un projet de fine-tuning inutile.

Avancé
13 minutes
Vidéo

RAG, fine-tuning ou ingénierie des prompts : optimiser les modèles d’IA

IBM Technology. Cette présentation claire au tableau blanc compare les trois techniques et leurs coûts respectifs — latence de récupération, calcul nécessaire à l’entraînement, oubli catastrophique et limites des solutions fondées uniquement sur les prompts — ainsi que les combinaisons réellement pertinentes en production. L’exemple final d’un système d’IA juridique utilisant les trois correspond presque exactement à l’argument « quand les combiner » de l’article.

Avancé
131 minutes
Vidéo

Comment j'utilise les LLM

Andrej Karpathy. Karpathy consacre des chapitres entiers au choix du modèle et de la gamme tarifaire, puis aux modèles de raisonnement et aux situations qui les justifient. Il alterne ensuite entre ChatGPT, Claude, Gemini, Grok et Perplexity pendant toute la démonstration. C'est ce qui se rapproche le plus d'une application en direct de l'aide-mémoire de l'article par une personne ayant des critères affirmés sur la valeur de chaque gamme.

Débutant
17 minutes
Vidéo

La nouvelle IA la plus intelligente : Claude 3 – Testé contre Gemini 1.5 + GPT-4

AI Explained. La vidéo est antérieure à l'article — mars 2024 —, mais sa méthode reste utile : un évaluateur rigoureux soumet trois modèles de pointe aux mêmes tâches difficiles — reconnaissance optique de caractères, théorie de l'esprit, respect des instructions et mathématiques — puis montre précisément les limites de chacun. Les noms des modèles ont vieilli ; le cadre de comparaison, non.

Débutant
32 minutes
Vidéo

Servir rapidement des LLM avec vLLM et PagedAttention

Anyscale. Elle explique pourquoi une implémentation naïve gaspille 60 à 80 % de la mémoire GPU, comment PagedAttention reprend le principe de pagination des systèmes d'exploitation pour y remédier et pourquoi le traitement continu par lots permet d'atteindre les gains de débit de 24× utilisés dans les calculs de l'article. L'affirmation selon laquelle « vous aurez de la chance si vous atteignez 50 % d'utilisation » devient alors concrète.

Avancé
19 minutes
Vidéo

Tous les modèles d'IA expliqués

Tina Huang. Une cartographie posée de 19 minutes des principales familles de modèles — série GPT d'OpenAI, Claude d'Anthropic, Gemini de Google et acteurs open source — ainsi que des niveaux qui méritent votre attention. Après la recommandation de l'article de choisir un outil et de l'utiliser pendant un mois, cette vidéo explique les options de son menu. Le propos assume ses préférences sans tomber dans les positions extrêmes.

Découvrir l’IA