ai campus n

Installer un modèle IA local pour les données sensibles (mise à jour octobre 2026)

Pourquoi une IA locale ?

Avec LM Studio et un modèle téléchargé sur votre ordinateur, vous pouvez résumer, traduire, reformuler un document ou poser des questions sur son contenu, hors ligne. L’application et ces modèles à poids ouverts sont gratuits, sans compte requis. Internet sert à l’installation, aux téléchargements et aux mises à jour.

À l’UNIL, les données sensibles au sens de la législation suisse, notamment la LPrD vaudoise (santé, opinions, etc.), doivent être traitées avec une solution locale autorisée et adaptée à ces données. Le questionnaire AI_GO vous aide à choisir l’outil autorisé, en complément de la FAQ IA de l’UNIL ; les consignes de votre enseignement, de votre faculté ou de l’éditeur restent à respecter. Pour le secret de fonction sans données sensibles, Copilot institutionnel avec votre compte UNIL et l’agent UNIL [Sécurisé] peut convenir, sauf pour les données RH ou personnelles délicates. Pour des données de recherche sensibles, contactez d’abord la Division calcul et soutien à la recherche (DCSR), via helpdesk@unil.ch.

Soyons honnêtes. Ces petits modèles peuvent se tromper et restent moins performants que les meilleurs modèles en ligne. Leur intérêt principal est la confidentialité, pas une économie d’énergie garantie.

Installer LM Studio

Prévoyez idéalement 16 Go de mémoire vive, environ 6 à 8 Go de disque par modèle compressé, plus l’application. Sur Mac : puce Apple Silicon (M1 ou plus récente) et macOS 14 minimum ; les Mac Intel ne conviennent pas. Sur Windows : processeur Intel/AMD compatible AVX2 ou Snapdragon X Elite (prérequis officiels). Une carte graphique dédiée peut accélérer les réponses, mais n’est pas indispensable.

  1. Sur lmstudio.ai/download, descendez jusqu’à la section LM Studio, sous Bionic, et choisissez « Download LM Studio ».
  2. Installez puis ouvrez l’application. Les intitulés varient selon la langue et la version : fiez-vous à la fonction indiquée.

Quel modèle choisir ?

En cas de doute, commencez par Qwen3.5 9B, le choix retenu dans nos essais. Sur une machine modeste, un long document peut demander plus de dix minutes : cette attente n’indique pas forcément une panne.

Modèle Quand le choisir ?
Qwen3.5 9B Bon compromis entre qualité et mémoire pour commencer sur des documents ; les réponses peuvent être lentes.
Gemma 4 E4B Pour privilégier la rapidité, avec des capacités plus limitées et sans gain de mémoire garanti.
Gemma 4 12B Pour privilégier la qualité générale : meilleur score des trois dans l’index Artificial Analysis consulté le 8 octobre 2026 (estimation). Plus exigeant en mémoire, notamment pour les longs documents.

La taille du fichier ne suffit pas : le document et la conversation utilisent aussi de la mémoire. Vérifiez l’estimation de mémoire au chargement et les avertissements de LM Studio. Vous pouvez garder plusieurs modèles installés si le disque le permet. Nos essais ont été réalisés sur un MacBook Air M1 de 16 Go, avec LM Studio 0.4.16.

Télécharger le modèle

  1. Ouvrez la loupe « Discover » et recherchez le nom complet choisi, par exemple qwen3.5 9b. Sélectionnez le résultat portant exactement ce nom.
  2. Téléchargez la version proposée par défaut si elle est annoncée compatible avec votre machine. Pour Qwen, repères en cas de choix : MLX 4bit sur Mac Apple Silicon ou GGUF Q4_K_M sur Windows. Pour un autre modèle, prenez une version 4 bits compatible. Ces versions compressées occupent moins de place, parfois au prix de la qualité.
  3. Après le téléchargement, cliquez sur « Use in New Chat » pour charger le modèle et ouvrir une conversation.
Recherche de modèles dans LM Studio, avec Gemma 4 E4B sélectionné.
Les captures illustrent Gemma 4 E4B ; pour le choix conseillé, sélectionnez Qwen3.5 9B.

Régler le contexte pour un document

Le contexte est la quantité de texte que le modèle peut garder sous les yeux, document et conversation compris. Il se mesure en tokens, des morceaux de mots. Si le document est trop long, LM Studio n’en transmet que des extraits : un résumé peut alors omettre des sections.

  1. Cliquez sur l’engrenage à gauche du nom du modèle, en haut. Si nécessaire, activez Settings → Developer pour afficher les réglages avancés.
  2. Essayez 32 000 dans « Context Length », si la mémoire le permet, puis « Reload to apply changes ». Avec Gemma 4 12B sur 16 Go, commencez plutôt vers 16 000.
  3. Si la mémoire manque, fermez les applications gourmandes ou baissez cette valeur et travaillez par sections.
Réglage Context Length à 32 000 et bouton Reload to apply changes.
Le réglage du contexte et le bouton pour recharger le modèle.

Si le modèle répond « je ne vois aucun document », vérifiez le chargement du fichier et essayez un contexte plus grand si la mémoire le permet. Après ce changement, ouvrez une nouvelle conversation, joignez le document et renvoyez la demande. 32 000 ne garantit pas un résumé complet. À chaque demande, vérifiez le détail du traitement : « inject-full-content » indique l’envoi de tout le texte extrait ; « retrieval », de quelques extraits. Pour une synthèse globale, si « retrieval » apparaît, si ce détail est invisible ou si des sections manquent, copiez-collez le texte par sections, chacune dans une nouvelle conversation. Demandez « Résume cette section », puis rassemblez les résumés et vérifiez que toutes les sections sont couvertes.

Travailler sur votre document

Pour des données sensibles, utilisez un poste à jour, avec disque et sauvegardes chiffrés et session verrouillée en votre absence. Choisissez un emplacement autorisé pour ces données, hors de OneDrive, d’iCloud ou d’un cloud non autorisé : Bureau et Documents sont souvent synchronisés. Utilisez le modèle local téléchargé, sans fonction web ou service distant ; vous pouvez couper Internet après les téléchargements.

PDF : attention au contenu ignoré. Dans ce parcours, seul le texte extrait est transmis, pas les images ni les graphiques. Les pages scannées sans texte sélectionnable peuvent être ignorées, avec une réponse incomplète ou erronée. Préférez le fichier texte d’origine ; n’envoyez pas un document sensible à un convertisseur en ligne.

Avant l’envoi, avec Qwen et un long document, essayez de couper « Think », sous la zone de saisie. Cela peut accélérer la réponse, au prix d’un raisonnement moins approfondi. Si la réflexion persiste ou si l’attente devient trop longue, travaillez par sections.

  1. Ouvrez une nouvelle conversation par document et glissez-y le fichier .pdf, .docx ou .txt. Attendez la fin de son chargement.
  2. Tapez par exemple : « Résume ce rapport en 5 points. »
  3. Comparez la réponse au document original : chiffres, noms et sections couvertes. Mentionnez l’usage de l’IA si sa contribution est significative.
Conversation avec un PDF joint, une demande de résumé et une réponse de Gemma.
Exemple avec Gemma : le PDF joint, la demande et la réponse.

Après usage. Supprimez les conversations devenues inutiles. Des copies ou extraits peuvent rester dans LM Studio : pour leur effacement, demandez l’aide du Centre informatique (helpdesk@unil.ch). Le résumé conserve la sensibilité du document source : protégez-le de la même manière.

Alternatives

Ollama permet aussi d’utiliser des modèles locaux. Pour une solution institutionnelle ou une machine insuffisante, contactez le Centre informatique (helpdesk@unil.ch).