IA locale sur votre Mac : Ollama, LM Studio et ce que les modèles 7B peuvent vraiment faire
Intermédiaire10 min de lectureIA privée / locale

IA locale sur votre Mac : Ollama, LM Studio et ce que les modèles 7B peuvent vraiment faire

Exécuter l'IA localement a mûri. Avec Ollama ou LM Studio et un Mac moderne, vous pouvez exécuter des modèles capables hors ligne, gratuitement et de manière privée. Ce qui fonctionne, ce qui ne fonctionne pas et les cas d'utilisation qui en bénéficient vraiment.

Ce que vous saurez faire

En 2026, l'IA locale est assez rapide, performante et simple à installer pour mériter votre attention. Elle ne remplace pas les modèles de pointe, mais modifie considérablement le calcul pour les travaux confidentiels et l'inférence à grande échelle.

AI Expert TeamPublié: 15 mai 2026
Enregistré uniquement dans ce navigateur.
Dans cet article

En 2023, exécuter l’IA localement était une curiosité. En 2026, il s’agit d’une véritable option pour plusieurs catégories de travail. Un Mac Apple Silicon moderne ou un PC avec une carte graphique récente peut exécuter des modèles capables hors ligne, gratuitement et de manière privée. L’installation prend 15 minutes.

Cet article propose un guide pratique de l’IA locale en 2026 : possibilités réelles, limites, outils et cas d’utilisation pertinents. Nous laisserons de côté les détails matériels les plus techniques.

Ce que “IA locale” signifie en 2026

Exécuter un modèle d’IA sur votre propre machine plutôt que d’appeler une API cloud. Le modèle est stocké sous forme de fichier sur le disque — généralement 4 à 50 Go. Lorsque vous l’interrogez, le calcul s’effectue sur le processeur, la carte graphique ou le Neural Engine d’Apple. Aucune connexion Internet n’est requise et aucun tiers ne voit vos données.

Les modèles que vous pouvez exécuter localement couvrent une large gamme :

  • Modèles petits (1 à 4 milliards de paramètres) : Phi-3.5/Phi-4 mini, Gemma 3 small, Qwen 3 small. Rapides, peuvent s’exécuter sur des ordinateurs portables avec 8 à 16 Go de RAM. Capables de résumés, de rédaction simple, de classification, de questions et réponses basiques.
  • Modèles de taille moyenne (7 à 14 milliards de paramètres) : Llama 3.1 8B, Qwen 3 14B, Mistral 7B. Bonnes performances générales. Ils fonctionnent confortablement sur la plupart des Mac modernes dotés de 16 à 32 Go de mémoire et peuvent gérer le raisonnement, le code et les prompts complexes.
  • Modèles plus grands (30 à 70 milliards de paramètres et plus) : Llama 3.3 70B, Qwen 3 32B/72B, DeepSeek V3 (distillé), GPT-OSS. Requiert un matériel puissant (32 à 128 Go de RAM, souvent une carte graphique dédiée). Approchent la qualité des modèles de pointe cloud sur de nombreuses tâches.

Pour la plupart des utilisateurs en 2026, le point optimal est un modèle de 7B à 14B sur un Mac M2 / M3 / M4 avec 16 à 32 Go de mémoire unifiée. Suffisamment rapide pour être utilisable. Suffisamment capable pour être utile.

Ce qui est possible (et ce qui ne l’est pas)

Une comparaison honnête entre les modèles locaux et les modèles de pointe cloud :

Les modèles locaux sont excellents pour :

  • La rédaction et la réécriture (écriture, e-mails, résumés).
  • La classification et l’extraction (catégorisation, balisage, parsing).
  • Les suggestions de code pour les motifs courants.
  • Les bases multilingues (traduction, questions et réponses basiques dans de nombreuses langues).
  • Les questions et réponses confidentielles — tout ce que vous ne souhaitez pas exposer à un tiers.
  • L’utilisation comme composant d’un processus — un petit modèle assure le classement, puis oriente vers un modèle plus grand si nécessaire.

Les modèles locaux sont plus faibles pour :

  • Le raisonnement approfondi et la logique complexe en plusieurs étapes.
  • Les très longs contextes — plus de 32 000 jetons — même si certains modèles locaux les gèrent désormais.
  • Les connaissances spécialisées dans des domaines de niche.
  • L’utilisation d’outils et les flux de travail agentiques, en progrès mais encore moins fiables que ceux des modèles de pointe.
  • Les informations à jour (les coupures d’entraînement s’appliquent, la recherche en temps réel n’est pas disponible par défaut).

Les modèles de pointe — GPT-5, Claude Opus 4.5, Gemini 2.5 Pro — sont encore significativement meilleurs pour la raison complexe, l’écriture nuancée et les tâches agents. Mais l’écart sur les tâches courantes s’est considérablement réduit. Pour la rédaction, la classification et l’analyse de base, un modèle de 7B sur votre ordinateur portable produit un résultat qui est 80 à 90 % aussi bon que les modèles de pointe, en 200 à 500 ms, gratuitement.

Les outils

Pour les utilisateurs de Mac, deux options principales. Les deux fonctionnent ; choisissez-en une.

Ollama

Privilégie la ligne de commande. Exécutez brew install ollama (ou téléchargez depuis ollama.com). Pour exécuter un modèle :

ollama pull llama3.1:8b
ollama run llama3.1:8b

Vous obtenez un prompt de chat. Il existe également une API REST sur localhost:11434 que d’autres outils peuvent utiliser. La plupart des outils d’IA open source prennent en charge Ollama comme fournisseur par défaut — n8n, LangChain, LiteLLM, OpenRouter, etc.

Ollama est le bon choix si vous souhaitez :

  • Exécuter des modèles de manière programmée (scripts, n8n, code personnalisé).
  • Utiliser le modèle dans des workflows au-delà du chat.
  • Avoir une interface propre et scriptable.

LM Studio

Une application de bureau aboutie. Téléchargez-la, ouvrez-la, explorez les modèles, cliquez sur « charger » et commencez la conversation. Elle privilégie l’interface graphique.

LM Studio est le bon choix si vous souhaitez :

  • Une interface de chat graphique.
  • Une navigation et un téléchargement faciles des modèles depuis Hugging Face.
  • Des réglages de performance intégrés — taille du contexte, quantification et déchargement vers le GPU.
  • Un serveur local compatible avec OpenAI que vous pouvez pointer vers vos applications.

Les deux outils peuvent exécuter les mêmes modèles sous-jacents. Vous pouvez installer les deux et utiliser chacun pour ce qu’il fait de mieux. La plupart des utilisateurs avancés ont les deux.

Une première configuration pratique

Passons en revue avec Ollama :

Étape 1 : Installer.

brew install ollama

(ou téléchargez depuis ollama.com.)

Étape 2 : Choisir un modèle.

Pour un Mac avec 16 Go de RAM, commencez avec llama3.1:8b ou qwen3:8b. Les deux sont des modèles généraux capables à cette taille. (Note : Llama 3.3 est uniquement disponible en tant que modèle de 70B — trop grand pour un Mac avec 16 Go.)

ollama pull llama3.1:8b

Le téléchargement est de quelques Go ; il prend quelques minutes.

Étape 3 : Le tester.

ollama run llama3.1:8b

Vous êtes maintenant dans un prompt interactif. Essayez quelques questions. Notez la vitesse de réponse : nous avons mesuré llama3.1:8b à ~73 tokens/sec sur un Apple M4 Max (48 Go de RAM) via Ollama. Attendez un peu moins sur un M1/M2 ou moins de 16 Go de RAM.

Étape 4 : L’utiliser à partir d’autres outils.

Ollama exécute un serveur local sur le port 11434. La plupart des outils intégrant l’API d’OpenAI peuvent être pointés vers Ollama en définissant l’URL de base. Par exemple, dans n8n :

  • Définissez le “crédentiel AI” pour utiliser un point de terminaison personnalisé.
  • URL de base : http://localhost:11434/v1
  • Clé API : n’importe quoi (Ollama ne vérifie pas).
  • Nom du modèle : llama3.1:8b

Vos workflows n8n utilisent maintenant le modèle local gratuitement.

Étape 5 : Essayez un modèle plus puissant si vous avez de la marge.

Si votre Mac a 32 Go de RAM ou plus :

ollama pull qwen3:14b

Un modèle de 14B est nettement plus capable, au prix d’une vraie perte de vitesse : sur le même M4 Max, nous avons mesuré qwen3:14b à ~39 tokens/sec contre ~68 tokens/sec pour qwen3:8b. Essayez les deux côte à côte pour ressentir l’amélioration de qualité et le ralentissement.

Cas d’utilisation qui bénéficient vraiment de l’IA locale

Quelques catégories où l’IA locale est nettement meilleure que le cloud :

1. Transcription et analyse sensibles à la confidentialité.

Mémos vocaux personnels, enregistrements d’entretiens, réunions sensibles et notes de thérapie : tous les contenus que vous ne souhaitez pas stocker chez un tiers. Utilisez Whisper localement — avec MacWhisper ou un script Python — puis traitez la transcription avec un grand modèle de langage local.

2. Traitement en lots à grande échelle.

Si vous traitez 10 000 documents (classification de tickets, extraction de PDF, balisage de photos), le coût des appels API cloud s’accumule. Un modèle local traite 10 000 documents gratuitement, lentement. Les exécutions nocturnes deviennent viables.

3. Travail hors ligne.

En déplacement sans connexion Internet fiable ou dans un lieu isolé, l’IA reste disponible même lorsque le réseau ne l’est pas.

4. Outils nécessitant la confidentialité par défaut.

Si vous créez un outil pour un utilisateur — prise de notes, journal personnel ou assistant de recherche —, le passage par un fournisseur d’IA complique la protection des données. Un modèle local conserve tout sur la machine de l’utilisateur.

5. Accélérer des tâches spécifiques étroites.

Un petit modèle local qui fait une seule chose (par exemple, classer les e-mails par catégorie, extraire des données structurées d’un format spécifique) peut être plus rapide qu’un aller-retour vers un API cloud. Particulièrement vrai dans les applications sensibles à la latence.

6. Systèmes de production à coût limité.

Si votre application d’IA s’étend à de nombreux utilisateurs, les coûts cloud s’élèvent linéairement. L’inférence locale sur votre propre infrastructure réduit considérablement la courbe. (À l’échelle la plus élevée, cela devient “auto-hébergé sur un serveur GPU” plutôt que “local sur un ordinateur portable” — mais le principe est le même.)

Le calcul coût-bénéfice

Une comparaison approximative pour un cas d’utilisation typique — traitement de 1000 documents.

OptionCoûtTempsQualité
GPT-4o / Claude Sonnet API~5-20 $minutes (parallèle)excellente
Claude Haiku 4.5 API~1-3 $minutes (parallèle)très bonne
Llama 3.1 8B local~0 $ (électricité)1-2 heuresbonne
Qwen 3 14B local~0 $ (électricité)2-4 heurestrès bonne
Llama 3.3 70B local (M2 Ultra)~0 $ (électricité)4-8 heuresexcellente

Pour 1000 documents, le cloud gagne sur la vitesse. Pour 100 000 documents, le local gagne sur le coût et vous n’avez pas besoin de vous soucier du temps supplémentaire car il s’exécute la nuit.

Pour les tâches fréquentes à faible enjeu, le local a souvent du sens. Pour les tâches rares à haut enjeu, la qualité du cloud l’emporte généralement.

Schémas qui fonctionnent bien

Quelques schémas où l’IA locale brille :

Schéma 1 : Classificateur local, répondant cloud

Un petit modèle local classe et route ; un modèle cloud de pointe gère les réponses qui comptent.

Pour la triage des e-mails : un modèle local de 3B classe les e-mails entrants (urgent / routine / spam) et identifie lesquels nécessitent l’attention humaine. Les quelques-uns qui nécessitent une vraie réponse reçoivent le traitement du modèle de pointe cloud. Le coût reste bas ; la qualité reste élevée sur les choses qui comptent.

Schéma 2 : Assistant personnel de premier niveau

Exécutez un modèle local avec accès à vos documents privés, journal, calendrier, etc. Rien ne quitte votre machine. Le modèle est un véritable assistant personnel en termes de confidentialité.

C’est ce que les Modèles de Fondation d’Apple essaient de fournir par défaut ; avec des outils locaux (Ollama plus quelques serveurs MCP), vous pouvez construire une version plus riche vous-même.

Schéma 3 : Ingestion RAG à grande échelle

Pour un processus RAG qui doit résumer ou vectoriser des milliers de documents, commencer dans le cloud coûte cher. Utilisez un modèle local pour l’ingestion — résumé des segments, extraction des métadonnées et plongements —, puis réservez le cloud aux requêtes.

Schéma 4 : Modèles finement ajustés spécialisés

Pour une tâche de niche — extraction depuis votre propre format ou classement selon votre taxonomie —, l’ajustement fin d’un petit modèle local peut surpasser les modèles cloud généralistes. La configuration prend une demi-journée avec des outils comme Unsloth ou MLX-LM. Le modèle obtenu est rapide, gratuit et très performant pour cette tâche précise.

Schéma 5 : Environnements isolés

Certains environnements — défense, finance réglementée, certains contextes de santé — interdisent l’envoi de données vers des services d’IA cloud. L’IA locale devient alors la seule option. La même configuration Ollama convient.

Ce qui s’améliore rapidement

Une courte liste de ce qui change mois après mois en 2026 :

Décodage spéculatif et mise en cache. Les vitesses d’inférence continuent de progresser. Sur le même matériel, des modèles qui produisaient 20 jetons par seconde il y a un an en produisent désormais 60 à 100.

Qualité de la quantisation. Les variantes de modèles compressés (4-bit, 5-bit) produisent maintenant une qualité proche des originaux à précision complète. Vous pouvez placer des modèles plus grands et plus intelligents dans le même budget de RAM.

Contexte long. Les modèles locaux avec un contexte de 128K (et en croissance) sont maintenant courants. La limitation “le local ne peut pas gérer les documents longs” est largement disparue.

Utilisation d’outils. L’appel de fonctions et l’utilisation d’outils dans les modèles locaux ont suffisamment progressé pour être utiles. Les flux de travail agents locaux deviennent de plus en plus viables.

Multimodal. Les modèles locaux de vision (LLaVA, MiniCPM, Qwen-VL) gèrent bien les images. La compréhension audio s’améliore.

L’écart entre le local et le cloud se réduit. Pour certains cas d’utilisation, il s’est effectivement refermé. Pour les travaux les plus exigeants, le cloud de pointe reste en tête — mais s’attendez à ce que l’écart continue de se réduire.

Pièges courants

Attendre la qualité d’un modèle cloud de pointe. Un modèle local de 7B n’est pas GPT-5. Utilisez-le pour ses points forts et ne lui confiez pas une tâche que seul un modèle de pointe maîtrise.

Manquer de mémoire. Charger un modèle trop grand provoque un crash de l’application ou un ralentissement sévère. Adaptez la taille du modèle à votre RAM.

Ralentissement avec le contexte. Les modèles locaux ralentissent fortement à mesure que le contexte se remplit. Gardez des prompts raisonnables ; les longues fenêtres de contexte sont prises en charge, mais coûteuses.

Oublier de mettre à jour. Les nouvelles versions de modèles sortent chaque mois. Le “meilleur modèle 8B” de six mois plus tôt n’est plus le meilleur maintenant. Relancez périodiquement.

Le traiter comme le cloud. N’exécutez pas 10 000 requêtes locales en parallèle. L’IA locale convient au traitement séquentiel ou modérément parallèle, non à une concurrence massive.

Notes matérielles

Un rapide rappel de la réalité sur ce que vous pouvez exécuter sur quoi :

MacRAMMeilleur modèle pratique
M1 / M2 / M3 base (8 Go)8 Go3B (Phi-3.5, Gemma 2B)
M1 / M2 / M3 (16 Go)16 Go7-8B (Llama 3.1 8B, Qwen 3 8B)
M2 / M3 / M4 Pro (24-36 Go)24-36 Go14B (Qwen 3 14B)
M2 / M3 / M4 Max (32-128 Go)32-128 Go30-70B selon la RAM
M2 / M3 Ultra (192+ Go)192-512 Go70-405B (classe de pointe)

Pour les PCs, une carte graphique Nvidia avec 12 à 24 Go de VRAM est le point optimal pour une capacité similaire à un Mac avec une mémoire unifiée comparable.

Quelques habitudes à adopter

Installez Ollama et LM Studio. Utilisez Ollama pour les scripts et LM Studio pour l’exploration conversationnelle.

Essayez les nouveaux modèles 7-14B tous les quelques mois. Le rythme de progression dans cette classe de taille est surprenant. Le meilleur modèle d’aujourd’hui est souvent nettement meilleur que celui de trois mois plus tôt.

Construisez un processus hybride, local et cloud. Le local pour les tâches rapides, économiques et confidentielles ; le cloud pour les tâches difficiles et importantes.

Évaluez sur vos propres tâches. Ne vous fiez pas uniquement aux bancs d’essai généraux. Testez votre cas d’utilisation sur trois modèles locaux et choisissez celui qui donne les meilleurs résultats pour vous.

Cloud pour les choses difficiles, local pour le reste

L’IA locale en 2026 est un outil réel, pas une curiosité de hobbyiste. Pour les travaux sensibles à la confidentialité, le traitement en lots à grande échelle, l’utilisation hors ligne et les systèmes de production à coût limité, elle change considérablement les équations.

Installez Ollama ou LM Studio, téléchargez un modèle 7-14B, et utilisez-le pendant une semaine sur des tâches réelles. Cela suffit pour apprendre les catégories que l’IA locale gère bien et celles qui appartiennent encore au cloud.

L’avenir de l’IA est hétérogène — le cloud de pointe pour les choses difficiles, les modèles locaux capables pour les tâches courantes, avec un routage intelligent entre les deux. Installer le local est le premier pas vers cet avenir.

À lire ensuite

Continuez sur le même parcours d'apprentissage avec les prochains articles pratiques.