LinkedInInstagramTikTokMeetupWhatsApp

27 septembre 2026

Faire tourner une IA sur sa propre machine : ce que ça demande

Installer un modèle sur son ordinateur supprime l'abonnement et garde les données chez soi. Voici ce que cela coûte en contrepartie, sans enjoliver.

L'idée revient régulièrement : faire tourner un modèle directement sur son ordinateur, sans envoyer chaque demande à un service distant. L'inférence peut alors fonctionner hors ligne, mais le logiciel choisi, ses mises à jour et les autres services de la machine doivent encore être vérifiés.

Installer coûte du temps et le matériel impose une limite réelle. La qualité dépend ensuite du modèle et de la tâche. Cet article montre comment essayer sans figer des quantités de mémoire ni des noms de modèles, qui vieillissent rapidement.

Sommaire

  1. Ce que veut dire « faire tourner une IA en local »
  2. Ce que ça demande à votre matériel
  3. Préparer l'installation avant de télécharger
  4. Essayer sans rien casser
  5. Les cas où le local est le mauvais choix
  6. Questions fréquentes

Ce que veut dire « faire tourner une IA en local »

Un modèle installé en local est un fichier posé sur votre disque, lu par un programme qui s'exécute sur votre processeur ou votre carte graphique. Le calcul principal peut se faire sans réseau ; cette propriété ne garantit pas, à elle seule, le comportement de toute l'application.

Le modèle est un fichier, pas un service

Quand vous utilisez un assistant en ligne, votre texte part sur un serveur et la réponse revient. En local, le fichier de modèle contient les paramètres appris pendant l'entraînement, et un programme les charge en mémoire pour produire la réponse. Le projet llama.cpp, l'un des moteurs les plus utilisés pour cela, décrit son objectif dans son dépôt public : permettre l'inférence avec une installation minimale et de bonnes performances sur une large gamme de matériels, en local comme dans le cloud.

Le calcul hors ligne est vérifiable, pas toute l'application

Couper le réseau permet de vérifier que le modèle continue à produire une réponse sans serveur distant. Cela ne prouve pas qu'aucune donnée ne sortira lorsque la connexion reviendra : télémétrie, synchronisation de dossiers et vérification de mises à jour relèvent du logiciel et du système autour du modèle. Pour un document sensible, testez hors ligne et contrôlez aussi ces réglages.

Ce que ça demande à votre matériel

La mémoire disponible est le facteur limitant, et elle détermine quels modèles vous pouvez charger, bien avant la vitesse du processeur. Comprendre la forme de cette contrainte vaut mieux que retenir un chiffre qui sera périmé dans six mois.

La mémoire suit le nombre de paramètres et la précision

Un modèle occupe en mémoire, en première approximation, son nombre de paramètres multiplié par la place occupée par chacun. La documentation de Hugging Face sur la quantification rappelle que les poids sont habituellement stockés en virgule flottante simple précision, que la demi-précision est devenue de plus en plus courante au vu de la taille des modèles actuels, et que certaines méthodes descendent jusqu'à des représentations entières sur 8 ou 4 bits. À modèle égal, diviser la précision de stockage divise à peu près d'autant la mémoire nécessaire : c'est ce mécanisme, et non une machine exceptionnelle, qui rend l'installation locale accessible sur du matériel ordinaire.

La quantification a un coût, et il faut le dire

La même documentation formule le compromis sans détour : la quantification réduit les besoins en mémoire en stockant les poids dans une précision inférieure, tout en essayant de préserver autant que possible la justesse du modèle. « En essayant » est le mot important. Le résultat dépend du modèle, de la méthode et de votre tâche ; il faut donc comparer sur vos propres documents. Le README de llama.cpp indique proposer des quantifications entières de 1,5 à 8 bits pour accélérer l'inférence et réduire l'usage mémoire.

Vous n'avez pas besoin de connaître ces valeurs pour commencer : la documentation de chaque outil indique les tailles disponibles, et c'est la seule source à jour.

Préparer l'installation avant de télécharger

Une installation utile commence par trois vérifications concrètes : la mémoire disponible, l'espace disque et la tâche d'essai. Ici, l'objectif est de réussir un premier essai reproductible, pas de trancher à lui seul le choix entre architecture locale et service distant.

Relever les ressources réellement disponibles

Ouvrez les informations système et notez la mémoire vive, l'espace disque libre et, si elle existe, la mémoire de la carte graphique. Ne choisissez pas encore un modèle : ces trois valeurs servent de filtre dans la documentation de l'outil. Gardez une marge pour le système et les autres applications ; charger un fichier n'est pas la seule consommation de mémoire.

Préparer un test comparable

Choisissez un document non sensible et une tâche dont vous connaissez déjà le bon résultat. Conservez exactement la même consigne, le même fichier et la réponse obtenue avec votre solution habituelle. Sans ce point de comparaison, une installation réussie techniquement ne vous dira pas si le modèle vous sert.

Essayer sans rien casser

Une première installation se fait en trois étapes. L'objectif n'est pas de basculer, mais de savoir ce que cela donne chez vous et de pouvoir revenir en arrière proprement.

Installer avec un outil guidé

Étape 1 : choisissez un outil qui gère l'installation à votre place. Des projets comme Ollama, dont la documentation publique couvre macOS, Windows, Linux et Docker, récupèrent le modèle et le lancent sans que vous ayez à compiler quoi que ce soit.

Étape 2 : commencez par un petit modèle compatible avec votre mémoire. Vous vérifiez d'abord que la chaîne fonctionne. Monter ensuite en taille permet de voir si l'amélioration justifie le temps d'attente et l'espace occupé.

Comparer sur une tâche réelle

Préparez un petit dossier de test avant l'installation : le document d'entrée, la consigne exacte, le résultat attendu et les erreurs qui rendraient la réponse inutilisable. Notez aussi le temps de génération et le temps de correction, sans chercher à produire un benchmark général. Ce dossier vous permettra de recommencer après une mise à jour ou avec une autre quantification. Sans trace, la comparaison repose vite sur une impression de fluidité ou sur le souvenir d'une réponse particulièrement réussie.

Étape 3 : testez sur une tâche réelle et comparez avec ce que vous utilisez déjà, le même jour, sur les deux. Un modèle local donne souvent une impression correcte sur des questions générales et se révèle beaucoup plus faible sur une tâche précise, ce qui ne se voit qu'en essayant pour de bon. C'est le seul verdict qui compte, parce qu'il porte sur votre usage et non sur une moyenne. Si vous cherchez d'abord à cadrer cet usage, notre article sur comment utiliser l'intelligence artificielle précède utilement cette comparaison.

Les cas où le local est le mauvais choix

Il faut dire aussi quand cette voie ne convient pas, sinon l'article vendrait une solution au lieu de la décrire.

Quand la maintenance ou la qualité bloque

Le local est un mauvais choix quand personne ne veut s'occuper des mises à jour ou quand la tâche exige une qualité que le modèle chargé n'atteint pas lors de votre test. Une installation abandonnée se dégrade comme n'importe quel logiciel non entretenu.

Ce que nous ne mesurons pas

Il faut être clair sur notre position. Nous n'installons aucune infrastructure pour le compte de qui que ce soit : nous sommes une association de vulgarisation, pas un prestataire ni un organisme de formation. Nous ne disposons donc pas d'un parc de machines permettant de généraliser les performances. Le coût certain que vous pouvez mesurer est votre temps : installation, comparaison, mises à jour et diagnostic quand une réponse déçoit. La curiosité technique reste une raison valable d'essayer, à condition de ne pas la présenter comme une économie démontrée.

Dernier point, et c'est le plus durable : tout ce qui est écrit ici sur les tailles, les formats et les outils vieillira, les mécanismes non. Pour poser les bases avant de se lancer, notre article sur comment fonctionne l'intelligence artificielle reste valable plus longtemps que n'importe quelle documentation d'outil. Et si vous avez mené l'expérience jusqu'au bout, le récit de ce qui a échoué vaut mieux que bien des démonstrations : c'est le propos de notre article sur le fait d'intervenir sur l'IA sans être chercheur.

Questions fréquentes

Faut-il une carte graphique pour faire tourner une IA en local ?

Non, et c'est la première idée fausse à écarter. Les moteurs d'inférence courants fonctionnent sur processeur seul, simplement plus lentement, et llama.cpp documente une inférence hybride répartissant le travail entre processeur et carte graphique. Une carte dédiée améliore la vitesse de réponse et reste un confort, pas une condition. Ce qui décide de ce que vous pouvez charger est la mémoire disponible.

Un modèle installé chez moi est-il aussi bon que le service que j'utilise déjà ?

Pas nécessairement. Un service hébergé peut donner accès à un modèle plus volumineux que votre machine ne peut charger, mais la taille ne prédit pas seule la qualité sur votre tâche. Comparez les deux avec le même document et la même consigne. Un modèle local peut suffire sur un travail court et cadré sans égaler le service en ligne sur d'autres usages.

Est-ce que cela garantit vraiment la confidentialité de mes données ?

Pour l'inférence, le fonctionnement hors ligne montre que la réponse est produite sur la machine. Il ne garantit pas la confidentialité de tout l'environnement : sauvegardes automatiques, synchronisation de dossiers, télémétrie et outils voisins peuvent continuer à communiquer. Examinez donc le logiciel complet et le système, pas seulement le fichier de modèle. L'installation locale ne vous dispense pas non plus des obligations applicables aux données personnelles.


Envie d'en discuter avec des gens qui ont essayé ? Consultez les prochaines rencontres, découvrez qui nous sommes, ou écrivez-nous.

Nos rencontres sont gratuites et l'adhésion reste facultative : 25 € par an, avec un tarif solidaire à 10 €. Pour soutenir les activités de l'association, vous pouvez adhérer maintenant.