Aller au contenu
PERINGER Data Solutions, retour à l’accueil

Retour

← Tous les articles

IA locale : trois profils de machines pour différents types de travaux

Publié le · mis à jour le

Faire tourner l’IA sur votre propre matériel n’est plus un projet de spécialiste. C’est une décision d’équipement, du même ordre que l’achat d’un serveur de fichiers. J’ai expliqué ailleurs pourquoi une IA interne peut avoir du sens. Voici trois configurations concrètes, avec les prix à prévoir et les conditions qui déterminent ce que chaque machine fait vraiment tourner.

La règle avant les machines

Deux chiffres tracent la première frontière :

  • La quantité de mémoire : elle plafonne la taille du modèle. À titre indicatif, les poids d’un modèle dense de 8 milliards de paramètres, quantifiés sur quatre bits, occupent environ 5–6 Go, contre 40–45 Go pour un modèle de 70 milliards. L’exécution, le cache KV et les utilisateurs simultanés prennent de la mémoire en plus.
  • La bande passante mémoire : elle fixe la vitesse de génération. C’est elle qui sépare une réponse en trois secondes d’une réponse en trente secondes.

Le calcul, l’architecture du modèle, la quantification, le contexte, la simultanéité, l’exécution, le processeur, le stockage et le réseau prennent parfois le dessus. Mesurez donc la charge réelle, puis testez le modèle et la machine ensemble.

Configuration 1 : l’armoire réseau (commune, fiduciaire)

Schéma d’une armoire réseau murale : switch, NAS de sauvegarde, Mac mini M4 Pro 64 Go et onduleur

  • Machine : Mac mini M4 Pro, 64 Go de mémoire unifiée
  • Prix : comptez 2 000 à 2 500 francs en configuration 64 Go
  • Fonctionne avec : des modèles d’environ 30 milliards de paramètres, compressés pour tenir dans moins de mémoire. Les paramètres sont les valeurs internes que le modèle a apprises pendant son entraînement. Un test indépendant rapporte 12 à 18 fragments de mots, appelés tokens, par seconde dans sa configuration ; refaites la mesure avec le modèle, la quantification, le contexte et l’exécution que vous retenez
  • Où l’installer : sur une étagère de l’armoire réseau existante ; silencieuse, sobre, aucun local dédié

La tâche : dans une administration communale, un assistant qui répond à partir des procès-verbaux, des règlements, des directives et des décisions passées, en citant ses sources, plus la transcription locale des séances du conseil. Dans une fiduciaire, l’extraction des données de factures avant la préparation des écritures. Dans les deux cas, les données des habitants ou des clients restent sur site, à condition que le réseau, les journaux, la télémétrie, les mises à jour, l’administration et les sauvegardes les empêchent réellement de sortir.

La limite tient moins à l’adaptation du modèle qu’à la simultanéité, faute de GPU dédié. Le débit convient à une petite équipe de bureau ; il ne tiendra pas forcément un service ouvert au public sans file d’attente ni solution de repli.

Configuration 2 : le local technique (site solaire, bâtiment intelligent)

Schéma d’un local technique : onduleurs photovoltaïques, compteurs et système de gestion technique liés par un switch à un DGX Spark 128 Go

  • Machine : NVIDIA DGX Spark, 128 Go de mémoire unifiée
  • Prix : 4 699 dollars
  • Fonctionne avec : NVIDIA annonce la génération de réponses avec des modèles allant jusqu’à 200 milliards de paramètres, et l’adaptation spécialisée d’un modèle, le fine-tuning, jusqu’à 70 milliards. Ces limites dépendent encore de la précision retenue, de la longueur des documents et du nombre de personnes connectées en même temps
  • Où l’installer : au local technique, à côté du système de gestion du bâtiment ou du système qui surveille et commande l’installation industrielle, souvent appelé SCADA

La tâche : sur un site solaire ou dans un bâtiment instrumenté, la machine reçoit une copie en lecture seule des données des onduleurs, des compteurs et du système de gestion. Elle rédige les rapports d’exploitation et décrit les anomalies. Elle prépare aussi les interventions de maintenance. Elle ne commande jamais l’installation : une passerelle ne laisse passer que les données autorisées, et une zone réseau séparée isole l’IA du système de commande. Des règles fixes déclenchent les alarmes, et une personne valide toute action. Pour tenir hors ligne, gardez aussi sur place les modèles, les identités, les licences et les dépendances.

La limite : la vitesse de lecture de la mémoire reste modeste pour cette catégorie de machine. La génération est correcte sans être spectaculaire, et la compatibilité de certains outils avec l’architecture de son processeur demande vérification.

Configuration 3 : le petit rack (institut, laboratoire, enseignement)

Schéma d’un petit rack : switch 10 GbE, serveur GPU 4U avec une RTX PRO 6000 Blackwell 96 Go, stockage des documents et onduleur

  • Machine : station de travail ou serveur 4U avec une RTX PRO 6000 Blackwell : 96 Go de GDDR7 ECC, 1 792 Go/s de bande passante
  • Prix : une machine complète autour de 12 000 à 15 000 francs selon le châssis
  • Fonctionne avec : les valeurs apprises par un modèle de 70 milliards de paramètres tiennent sur une seule carte lorsqu’elles sont stockées avec une précision de 8 bits. Le logiciel, la mémoire de travail des documents et les utilisateurs simultanés consomment le reste ; mesurez la charge réelle
  • Où l’installer : dans un petit rack ventilé ; la carte tire jusqu’à 600 W

La tâche : un assistant de recherche qui interroge une collection d’articles et d’archives en citant ses sources, l’adaptation d’un modèle ouvert à un domaine, ou un service partagé pour tout un institut. Apertus, le modèle des écoles polytechniques fédérales, figure parmi les modèles à évaluer. Pour les équipes dont les logiciels ne dépendent pas de CUDA, la technologie de calcul propre aux cartes NVIDIA, le Mac Studio M3 Ultra fait figure d’alternative silencieuse.

Louer d’abord, acheter ensuite

Je pars d’une charge de travail mesurée plutôt que d’une fiche technique, puis je teste le modèle et la machine ensemble.

N’achetez aucune de ces machines à l’intuition. Louez un GPU comparable pour un pilote borné, qui mesure la qualité, la latence, la simultanéité et l’effort d’exploitation. Le prix dépend du fournisseur, de la région, du stockage et du trafic. Comparez ensuite la location et l’achat sur trois ans, énergie, intégration, assistance, sécurité, remplacement, interruptions et valeur résiduelle comprises. Un retour sur investissement en quelques mois n’a rien d’automatique.

La fiche de comparaison

Notez pour chaque machine le modèle et l’identifiant exact de sa version, son niveau de compression, le logiciel d’exécution et les pilotes. Ajoutez la longueur des documents et des réponses testés, le délai avant le début de la réponse, le nombre de fragments de mots produits par seconde, le nombre d’utilisateurs simultanés, la mémoire maximale, l’énergie et le bruit. Notez enfin le coût et la procédure de reprise. Sans cette fiche, deux mesures de vitesse ne se comparent pas.

Trois profils de machines, une seule idée : taillez l’IA à la tâche, et gardez la main sur le matériel, les logiciels, les accès et les sauvegardes dont le modèle a besoin.

D’où viennent ces prix

J’ai relevé les prix et les spécifications le 14 août 2026. Ces fourchettes ne sont pas des devis. La capacité, le débit et le coût dépendent du modèle, de la précision, du contexte, de la simultanéité et de l’exploitation.

Un premier entretien, sans engagement

Quelques lignes sur votre projet ou votre question suffisent : je vous réponds directement, en général sous un jour ouvrable.

Prendre contact