Comment installer et exécuter une IA en local sur son PC (LLM Open Source & Confidentialité)

Nicolas FORCET » Logiciels / Tutoriels informatiques » Comment installer et exécuter une IA en local sur son PC (LLM Open Source & Confidentialité)
IA locale sur PC, outils et modèles de langage LLM

Avoir sa propre Intelligence Artificielle sur son ordinateur, 100 % gratuite, illimitée et totalement respectueuse de votre vie privée numérique, c’est désormais à la portée de tous. Nous allons découvrir comment installer une IA en local, plus précisément exécuter des LLM (Large Language Model) localement avec l’accélération GPU sous Windows 11, macOS ou Linux.

Pourquoi exécuter une IA en local plutôt qu’utiliser ChatGPT ?

Parce qu’ont peut le faire ! 🤓

Je vois en premier la confidentialité et sécurité des données (100 % Privé). Les requêtes, docs et conversations quittent jamais votre disque dur. C’est la solution idéale (la seule qui soit safe pour votre boîte en vrai 😊) pour analyser des fichiers professionnels, des contrats ou des notes personnelles.

Ca tourne totalement offline : une fois le modèle téléchargé (et vous avez le choix !), vous n’avez plus besoin de connexion Internet. (Dans la même logique d’autonomie numérique, découvrez aussi comment télécharger Wikipédia en hors-ligne avec Kiwix). En bonus la gratuité et l’absence de censures / limites / pub. Car oui je pense que la pub déguisée dans les IA en ligne nous guette à très court terme !

On touche ici à la génération de texte, et c’est quand même plus abordable techniquement. Je voulais faire tourner un LLM sur mon PC pour me rendre compte des progrès effectués par l’IA générative depuis début 2023 et l’arrivée de Chat GPT pour le grand public.

On assiste depuis quelques mois à une montée en puissance des modèles linguistiques open source (LLM) dans le domaine de l’IA générative. Ces modèles, contrairement à leurs homologues propriétaires, sont accessibles au public et peuvent être librement utilisés, modifiés et distribués. Les bidouilleurs, chercheurs, développeurs et entreprises participent ainsi activement au développement de l’IA. On peut même aujourd’hui faire de la traduction locale très précise sur iPhone !

Mon PC est relativement puissant mais, monté il y a 3 ans, il se retrouve aujourd’hui dans la norme de ce qu’un gamer peut avoir aujourd’hui pour un prix correct (<1300€). Si vous avez un processeur puissant, 16 ou 32 Go de RAM et un GPU de plus de 10 Go de VRAM, vous pouvez foncer et avoir une IA locale utilisable !

Usage / ModèleCarte Graphique (GPU)RAM SystèmeModèles recommandés
Débutant6 à 8 GB de VRAM (ex: RTX 3060 / 4060)16 GBModèles 7B / 8B (Q4/Q5)
Avancé12 à 16 GB de VRAM (ex: RTX 3060 12G, 4070/4080)32 GBModèles 14B à 32B
Pro24 GB de VRAM+ (ex: RTX 3090 / 4090) 🤑64 GBModèles 70B (quantifiés) – Là ça envoie du très lourd !!!! 🔥
MacUnified Memory (M1/M2/M3/M4)18 à 36 GB+M1/M2/M3/M4 (Très performants !)

Les logiciels pour installer une IA en local (avec des LLM d’IA générative)

C’est quoi un LLM ? Les LLM sont des modèles de langage entraînés sur des milliers de gigaoctets de données textuelles. À travers ce processus d’apprentissage, ils acquièrent une connaissance approfondie de la structure du langage et de la manière dont les mots s’assemblent pour créer un sens cohérent. Et lorsqu’on leur pose une question, ils répondent avec ce qui est le plus probable au niveau statistique.

LM Studio

Une fois l’app installée, on peut directement installer notre IA en local avec les modèles Hugging Face, en quelques secondes. Attention ça prend de la place et si vous êtes curieux, avec une bonne connexion, ça remplit vite l’espace disque !

Exemple de création de contenu avec le LLM Gemma 2, en IA locale

J’utilise LM Studio au quotidien et l’apprécie pour ses options de personnalisation. Vous serez peut être gêné par l’absence de fonction permettant d’analyser les documents d’un dossier mais pour ma part, je ne me sers pas de cette fonction.

LM Studio contient un serveur API pour l’utiliser en conjonction avec d’autres softs, et je l’utilise personnellement avec AnythingLLM. Le gros point positif pour les bidouilleurs est que vous pouvez lancer plusieurs modèles de langage en même temps, pour comparer les résultats avant de faire votre choix. Pratique !

LM studio pour utiliser l'IA en local sur votre machine (Mac, Linux, PC)

Jan

Autre solution accessible, Jan.

Jan est un logiciel open source pour déployer des applications IA locales. Il est franchement facile à utiliser et offre une grande flexibilité dans la personnalisation de l’architecture et la configuration de l’IA. On trouve des modèles à télécharger que l’on peut par la suite entraîner en local.

Les résultats sont rapidement satisfaisants.

GPT4all

Peut être le plus accessible et en même temps le plus évolutif puisqu’il permet la connexion à d’autres logiciels et à VSCode. Télécharger le client

On peut en outre lui fournir le contenu d’un dossier pour le faire bosser sur de la data, en local !

Nextchat, Ollama et Llama.cpp

Je ne couvrirai pas ce soft, très bien et codé en C++ mais qui est un peu pénible à l’installation. Il n’est pas très « grand public » et s’adresse plutôt aux « barbus » de l’informatique.
Ce ne sont que quelques lignes d’invite de commande et la création d’un serveur web, mais quand même ;)

A tester si vous êtes curieux.

Les Modèles de langage (LLM)

Maintenant que nous avons une appli de gestion de modèles de langage, il faut y intégrer un ou plusieurs modules, suivant l’usage souhaité.

Il existe des outils pour comparer les LLM, comme par exemple Kiu AI. L’intérêt est de comparer tous les LLM, y compris les payants avec les gratuits pour sélectionner celui qui vous convient le mieux. Le modèle choisi sera plus ou moins pertinent pour écrire du texte brut, résumer du contenu ou écrire du code informatique. Aucun modèle n’est bon dans tous les domaines.

Il est possible d’installer des modèles gratuits sur sa machine et s’appuyer sur la puissance processeur et/ou carte graphique pour sortir du texte ou du code.
Et franchement, le résultat est impressionnant, même si c’est plus lent qu’un Chat GPT ou autre solution dans le cloud. Mais le très gros avantage reste que vos données ne quittent pas le PC, ce qui devrait intéresser les entreprises et particuliers désireux de protéger leur travail.

Llama 3.1 & 3.3 (Meta)

Si vous n’êtes pas anti Meta (Facebook etc.), ce LLM est très puissant. Le résultat final est un modèle de langage qui excelle dans une grande variété de tâches linguistiques complexes. Ici, j’ai testé le modèle Llama 3.1 8B qui offre le meilleur rapport vitesse/intelligence pour les PC grand public.

Le LLM Meta Llama 3 permet d'installer une IA générative en local, gratuitement.

Les autres

En position 2 🥈, je mettrais Mistral Small 3 / NeMo (Mistral AI) : développé en France 🐓, c’est le meilleur choix pour traiter du texte en français avec un niveau de langue irréprochable.

Je place ensuite DeepSeek-R1 & V3 car il a des modèles de raisonnement (reasoning) parmi les plus performants du moment. En local, faut pas se planter et prendre les versions distillées (DeepSeek-R1-Distill-Llama-8B ou Qwen-14B) pour bénéficier d’une capacité d’analyse logique absolument impressionnante sur un simple PC.

Enfin, Qwen 2.5 (Alibaba) est un modèle redoutable pour la génération de code informatique, les mathématiques et la logique.

Exemple avec LM Studio

  • Téléchargez LM Studio (lmstudio.ai) et installez-le.
  • Utilisez la barre de recherche intégrée pour chercher un modèle (ex: mistral-nemo ou llama-3.1-8b).
  • Téléchargez la version recommandée (au format .gguf, idéalement quantifiée en Q4_K_M ou Q5_K_M).
  • Ouvrez l’onglet Chat, sélectionnez votre modèle en haut de l’écran et commencez à discuter dans une interface similaire à ChatGPT.
LM Studio faisant tourner un LLM IA local (Mistral 7B)

Aller plus loin avec son IA LLM local

Il y a souvent confusion entre exécuter une IA et entraîner une IA :

  • L’Inférence (Exécution) : c’est ce qu’on fait ici. On utilise un modèle LLM déjà formé pour lui poser des questions. Cela nécessite peu de ressources (un GPU standard suffit).
  • L’Entraînement / Fine-tuning : cela consiste à modifier ou réentraîner un modèle sur tes propres données. Bon, fatalement, il faut un volume massif de données et des infrastructures matérielles méga coûteuses (plusieurs GPU professionnels). Le matos va vous ruiner, ça chauffe votre maison et votre facture EDF va piquer ! Pour personnaliser les réponses d’un LLM local sans l’entraîner, privilégiez plutôt le RAG (Retrieval-Augmented Generation) en utilisant des outils comme AnythingLLM cité plus haut ou Open WebUI.

Maintenant que vous maîtrisez l’exécution de LLM en local, vous pouvez étendre vos usages :

2 commentaires

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *

Ce site utilise Akismet pour réduire les indésirables. En savoir plus sur la façon dont les données de vos commentaires sont traitées.

  1. Petites corrections techniques :
    « ils répondent avec ce qui est le plus « logique ». »
    Ils répondent avec ce qui est le plus probable au niveau statistique.
    « . Il apprend les subtilités de la grammaire, du vocabulaire et même des nuances de style pour interagir avec nous de manière naturelle et cohérente. »
    En fait non. Une LLM ne sait pas ce qu’est un verbe ou un nom ou un adjectif, contrairement à d’autres types d’IA (symbolic AI). Mais comme l’énorme majorité des phrases sont composées de sujet -verbe-complément, elle reproduit cette structure. Et si on lui précise « écrit comme un enfant », elle va recalculer le texte à produire en se basant uniquement sur des textes écrits par des enfants.
    C’est une manière d’appréhender le langage complétement différente de l’être humain. C’est comme de parler une langue étrangère qu’on ne comprend pas en se basant sur ce que disent le plus souvent les gens.