Thème

Modèles et choix des outils

Choisissez entre ChatGPT, Claude, Gemini, Copilot, les modèles de raisonnement et l’inférence hébergée ou locale.

27 contenus (12 articles · 15 vidéos)

Commencez ici

Quelques bons contenus pour débuter avant de parcourir l’ensemble du flux.

Plus de contenus sur ce thème

13 min de lecture
Article

La pile LLM en 2026 : modèles, inférence, outils et compromis

Le point de vue d’un architecte en activité sur la pile LLM en 2026 : catégories de modèles, fournisseurs d’inférence, couches d’orchestration, outils d’évaluation et compromis réellement déterminants pour mettre l’IA en production. Tout ce que vous auriez aimé trouver avant de commencer.

Avancé
10 min de lecture
Article

Chaîne de pensée, autocritique, arbre de pensées — quand utiliser chaque technique

Trois techniques de raisonnement qui améliorent réellement les résultats de l'IA sur les problèmes difficiles, avec une analyse de leur rapport coût-bénéfice, des prompts concrets, des comparaisons directes et les pièges propres aux modèles de raisonnement modernes.

Intermédiaire
12 min de lecture
Article

Optimisation des coûts d'inférence : mise en cache des prompts, routage et contrôle de la sortie

Les bonnes techniques permettent de réduire les coûts d'inférence des grands modèles de langage (LLM) de 60 à 90 %. Mise en cache des prompts, routage des modèles, contrôle des sorties, traitement par lots et quelques méthodes moins connues. Les chiffres, les modèles et la discipline de production qui distinguent une inférence bien gérée d'une facture incontrôlée.

Avancé
13 min de lecture
Article

Fine-tuning en 2026 : quand LoRA surpasse le RAG et comment s’en passer de cluster

Le fine-tuning avec LoRA est désormais accessible : vous pouvez affiner un modèle sur un ordinateur portable ou louer un GPU pendant une heure. Voici les approches efficaces, les situations où le fine-tuning surpasse le RAG et un flux de travail complet, de la préparation des données à la production.

Avancé
6 min de lecture
Article

ChatGPT gratuit ou payant : ce que finance réellement l'abonnement

Une comparaison sans jargon entre la version gratuite de ChatGPT, ChatGPT Plus et ChatGPT Pro — ce qui change avec l'abonnement et comment déterminer si vous en avez réellement besoin.

Découvrir l’IA
10 min de lecture
Article

IA locale sur votre Mac : Ollama, LM Studio et ce que les modèles 7B peuvent vraiment faire

Exécuter l'IA localement a mûri. Avec Ollama ou LM Studio et un Mac moderne, vous pouvez exécuter des modèles capables hors ligne, gratuitement et de manière privée. Ce qui fonctionne, ce qui ne fonctionne pas et les cas d'utilisation qui en bénéficient vraiment.

Intermédiaire
10 min de lecture
Article

Ingénierie des prompts pour les modèles de raisonnement (o3, R1, réflexion étendue de Claude)

Les modèles de raisonnement ne sont pas des modèles rapides avec des étapes supplémentaires. Ils récompensent un style de prompt différent, ignorent certains schémas conventionnels et ont leurs propres pièges. Un guide pratique pour bien les utiliser.

Intermédiaire
12 min de lecture
Article

Choisir entre le prompting, le RAG et le fine-tuning (et quand les combiner)

Le prompting, le RAG et le fine-tuning sont les trois principaux leviers permettant d’adapter un LLM à votre problème. Chacun convient à certaines situations et non à d’autres. Voici un cadre de décision, leurs coûts réels et les architectures de production où leur combinaison excelle.

Avancé
11 min de lecture
Article

Inférence auto-hébergée ou hébergée : vLLM, TGI et calcul du seuil de rentabilité

À partir de quelle échelle l'auto-hébergement devient-il plus avantageux que les appels d'API ? Les calculs réels, les contraintes opérationnelles et les critères qui distinguent les équipes qui devraient auto-héberger leurs modèles de celles qui devraient continuer à payer pour une inférence gérée.

Avancé
Vidéo

Plongée au cœur des LLM comme ChatGPT

Plongée au cœur des LLM comme ChatGPT

Avancé
Vidéo

Andrej Karpathy : Le logiciel change à nouveau

Andrej Karpathy : Le logiciel change à nouveau

Avancé
Vidéo

Est-ce la fin de la RAG ? La nouvelle mise en cache des prompts d'Anthropic

Est-ce la fin de la RAG ? La nouvelle mise en cache des prompts d'Anthropic

Avancé
Vidéo

Build Hour : Mise en cache des prompts

Build Hour : Mise en cache des prompts

Avancé
Vidéo

Ajustement fin des modèles LLM – Cours sur l'IA générative

Ajustement fin des modèles LLM – Cours sur l'IA générative

Avancé
Vidéo

Développer un LLM : Construction, entraînement, ajustement fin

Développer un LLM : Construction, entraînement, ajustement fin

Avancé
Vidéo

Est-ce que ChatGPT Plus en vaut la peine ? Voici mon avis actualisé pour 2025

Est-ce que ChatGPT Plus en vaut la peine ? Voici mon avis actualisé pour 2025

Découvrir l’IA
Vidéo

Tous les modèles d’IA expliqués

Tous les modèles d’IA expliqués

Intermédiaire
Vidéo

RouteLLM atteint 90 % de la qualité de GPT4o pour un coût inférieur de 80 %

RouteLLM atteint 90 % de la qualité de GPT4o pour un coût inférieur de 80 %

Intermédiaire
Vidéo

RAG ou fine-tuning

RAG ou fine-tuning

Avancé
Vidéo

RAG, fine-tuning ou ingénierie des prompts : optimiser les modèles d’IA

RAG, fine-tuning ou ingénierie des prompts : optimiser les modèles d’IA

Avancé
Vidéo

Comment j'utilise les LLM

Comment j'utilise les LLM

Débutant
Vidéo

La nouvelle IA la plus intelligente : Claude 3 – Testé contre Gemini 1.5 + GPT-4

La nouvelle IA la plus intelligente : Claude 3 – Testé contre Gemini 1.5 + GPT-4

Débutant
Vidéo

Servir rapidement des LLM avec vLLM et PagedAttention

Servir rapidement des LLM avec vLLM et PagedAttention

Avancé
Vidéo

Tous les modèles d'IA expliqués

Tous les modèles d'IA expliqués

Découvrir l’IA