Aller au contenu
PERINGER Data Solutions, retour à l’accueil

Retour

← Tous les articles

Kimi K3, Soofi S et Apertus : un instantané des modèles ouverts

Publié le · mis à jour le

L’été 2026 a apporté une nouvelle vague de modèles à poids ouverts. Moonshot AI a publié Kimi K3, tandis que le projet allemand Soofi, soutenu par des fonds publics, a présenté ses premiers résultats sans encore ouvrir un assistant de production pour un usage général. Les fournisseurs propriétaires ont mis leurs modèles à jour de leur côté. Les classements donnent un instantané utile, et fragile. L’analyste Nathan Lambert estime désormais le retard des modèles à poids ouverts à « entre 3 et 5 mois plutôt que 6 à 9 ».

Hors des laboratoires, la décision tient à quatre volets : la qualité sur vos tâches, l’état de la sortie et la licence du modèle, le trajet complet de vos données, et le coût de l’exploitation.

Une photographie de juillet 2026

Indice Artificial Analysis, juillet 2026 : Claude Fable 5 à 60, GPT-5.6 Sol à 59, puis les modèles ouverts Kimi K3 à 57, GLM-5.2 à 51, DeepSeek V4 Pro à 44 et Kimi K2.6 à 43

Le graphique reprend un instantané Artificial Analysis réalisé en juillet 2026. Les versions, les scores, les prix et les méthodes changent ; cet instantané n’est ni un résultat définitif ni un test taillé pour votre charge de travail.

Trois lectures s’en dégagent. L’écart en tête de l’indice global est faible, alors que des écarts nets subsistent sur certaines tâches de programmation. Les différences de prix sont parfois considérables, mais une comparaison loyale exige la même région, les mêmes longueurs, le même traitement du cache, la même sortie et le même niveau de service. Apertus et Soofi poursuivent enfin des objectifs d’ouverture et d’indépendance qu’aucun résultat de test ne résume.

Kimi K3 : un modèle ouvert proche des modèles de pointe

Le dépôt officiel de Kimi K3 annonce 2 800 milliards de paramètres au total et un contexte d’un million de jetons, ces fragments de texte que le modèle prend en compte d’un seul tenant. Les évaluations externes le placent près des modèles propriétaires sur certaines tâches ; ces résultats ne disent rien de son comportement sur vos documents, vos langues et vos outils.

« Poids ouverts » veut dire que les valeurs apprises par le modèle se téléchargent, non que son exécution tienne dans vos locaux. L’estimation d’environ 1,4 To suppose ces valeurs compressées à une précision d’environ quatre bits, et laisse encore de côté le logiciel d’exécution, la mémoire de travail, les copies de secours et le stockage. Une voie pragmatique existe ailleurs : Infomaniak sert le prédécesseur Kimi K2.6 depuis Genève, avec un traitement en Suisse et un engagement publié de ne pas entraîner de modèles sur vos demandes. Exigez ces garanties dans le contrat, aux côtés des accès, des sous-traitants ultérieurs, des journaux et des conditions de sortie.

Soofi S : la surprise allemande

Soofi S vient d’un consortium allemand qui réunit Fraunhofer, le DFKI et des universités. Fraunhofer a annoncé ses premiers résultats en juin 2026, mais la fiche technique décrit la version actuelle comme un objet de recherche en bêta fermée. C’est un modèle de base : personne ne l’a encore affiné ni aligné pour en faire un assistant de production.

En pratique : Soofi S est un projet à suivre et à évaluer dans un cadre de recherche, pas un assistant interne à déployer tel quel. Une future version affinée demandera des tests en allemand et en français, sur la sécurité et sous charge réelle.

Apertus : le suisse transparent

Apertus, issu de l’EPFL, de l’ETH Zurich et du CSCS, appartient au petit groupe qui vise une ouverture large : les poids, le code, la méthode et des informations sur les données d’entraînement. Il n’est ni le seul grand modèle ouvert au monde, ni forcément le plus performant dans les tests standardisés.

En pratique : Apertus mérite une évaluation quand la documentation et le contexte suisse passent avant le score : administrations, communes, écoles, tout projet où chaque composant doit rester traçable. Son aptitude à une adaptation spécialisée, le fine-tuning, dépend de la tâche et des données d’entraînement. La variante 8B tourne avec 16 Go de mémoire si le niveau de compression et le logiciel d’exécution s’y prêtent ; les documents transmis et le système d’exploitation en consomment aussi leur part.

Mistral : l’européen presque entièrement ouvert

Mistral publie ses modèles sous différentes licences et conditions de sortie. Devstral Small 2 fait un bon candidat pour examiner du code confidentiel. Sa tenue sur une carte de 24 Go dépend de son niveau de compression, de la longueur des documents, du logiciel d’exécution et des outils : mesurez-la plutôt que de tenir le choix pour évident.

Exécuter les modèles

OpenRouter rassemble de nombreux modèles derrière une seule clé et facilite une première comparaison. En revanche, vos requêtes passent par cette entreprise new-yorkaise avant d’atteindre les fournisseurs retenus. Des données synthétiques suffisent pour tester ; un dossier de patient, d’élève ou d’habitant impose d’abord de qualifier la voie choisie sur le plan contractuel, légal et technique. Une alternative hébergée en Suisse existe : les services d’IA d’Infomaniak proposent Apertus, Kimi K2.6 et Mistral Small 4 depuis la Suisse, derrière une interface compatible avec les logiciels écrits pour OpenAI.

En local, Ollama installe un modèle en une commande, avec un piège à connaître : les modèles marqués « cloud » dans sa bibliothèque tournent sur les serveurs d’Ollama, pas sur les vôtres. Pour servir un modèle à toute une équipe, la référence est vLLM. Trois configurations complètes sont détaillées dans l’article sur les machines d’IA locales.

Le rendement du local

L’électricité pour un million de jetons revient à moins d’un franc dans une configuration rapide et bien remplie, sans que ce soit une constante. Publiez la consommation électrique, le débit, le prix de l’électricité, le taux d’utilisation et le temps écoulé. Le coût total englobe le matériel, l’exploitation, le refroidissement, la sécurité, les pannes et le remplacement. À faible volume, une API revient souvent moins cher ; le local prend l’avantage à grande échelle, ou quand le contrôle prime, une fois les comptes faits.

Les autres gains dépendent de tout l’environnement. Exécuter en local supprime certains sous-traitants ultérieurs et permet de travailler hors ligne, à condition de maîtriser aussi le logiciel d’exécution, les données de surveillance, les mises à jour, l’assistance, les comptes et les sauvegardes. Un modèle téléchargé reste disponible quand un fournisseur retire un modèle de son service en ligne, comme le montrent les retraits annoncés par Anthropic. Reproduire le même résultat dans cinq ans suppose de figer le fichier du modèle, le niveau de compression, le logiciel d’exécution, les dépendances, les pilotes, les instructions données au modèle et les réglages de génération. La pérennité relève d’une pratique d’archivage, non d’une propriété des poids.

Comment décider

Je ne choisis jamais un modèle sur un classement. Je l’évalue sur le fonds documentaire du client, avec ses questions et ses droits d’accès réels.

Construisez un jeu d’évaluation représentatif, et versionnez-le. Pour chaque modèle, notez l’identifiant exact, la licence, la précision, la méthode d’accès, la qualité linguistique, le taux d’erreur, le temps avant le premier jeton, le débit, le contexte, le prix d’entrée et de sortie, le cache, l’opérateur, les lieux, les sous-traitants ultérieurs et la date de mesure. Répondez ensuite à trois questions : savons-nous l’exécuter, tient-il sur notre jeu d’essai, et savons-nous l’exploiter en sécurité et dans la légalité ?

L’instantané derrière le graphique

J’ai relevé l’état de la sortie, le catalogue et les comparaisons le 14 août 2026. Les scores et les prix bougent d’un mois à l’autre, et les modèles avec eux. Ce graphique est un instantané externe ; la décision, elle, repose sur une évaluation interne reproductible.

Un premier entretien, sans engagement

Quelques lignes sur votre projet ou votre question suffisent : je vous réponds directement, en général sous un jour ouvrable.

Prendre contact