Qu'est-ce que l'IA open-source et en quoi est-elle différente ?
L'IA open-source vous met les plans du modèle entre les mains. Voici ce que cela signifie réellement et pourquoi c'est important.

L'IA open-source signifie que le modèle sous-jacent, et souvent sa recette d'entraînement, sont publiés pour que quiconque puisse les inspecter, les copier et les modifier. Le contraire est un modèle fermé ou propriétaire, où vous ne pouvez accéder à l'IA que par une API ou une application et dont le fonctionnement interne reste secret. C'est comme un livre de recettes par rapport à un restaurant qui ne vend que le plat fini.
Qu'est-ce qui est exactement « ouvert » dans un modèle d'IA open-source ?
Au minimum, les poids du modèle sont publiés publiquement. Les poids sont les millions ou milliards de valeurs numériques que le modèle a apprises lors de l'entraînement, les chiffres qui le font réellement fonctionner. Certains projets publient également le code d'entraînement, l'ensemble de données et la documentation.
Tous les projets ne publient pas tous ces éléments à la fois. Les modèles Llama de Meta, par exemple, publient les poids et permettent un large utilisation, mais les données d'entraînement complètes ne sont pas publiées. La propre page de recherche de Meta pour Llama décrit cela en détail. Les puristes de l'open-source véritable soutiendraient que la publication de poids seuls est plus proche d'« open weights » que d'un véritable open-source, mais dans la conversation quotidienne, les termes sont utilisés de manière interchangeable.
En quoi l'IA open-source est-elle différente de l'IA fermée comme GPT-4 ?
Avec un modèle fermé, vous envoyez votre texte vers le serveur d'une entreprise, il réfléchit, et vous envoie une réponse en retour. Vous ne voyez jamais le modèle lui-même. Les modèles ouverts vous permettent de télécharger l'ensemble et de l'exécuter sur votre propre ordinateur ou serveur cloud.
Cette seule différence a de grands effets de cascade. Vous pouvez affiner (spécialiser) le modèle sur vos propres données, l'auditer pour détecter les biais ou les erreurs, et garder vos données entièrement en interne, ce qui signifie qu'elles ne quittent jamais votre bâtiment. Un hôpital, par exemple, pourrait exécuter un modèle open-source localement afin que les dossiers des patients ne contactent jamais un serveur externe.
Quels sont les vrais avantages ?
Quatre choses se démarquent. Premièrement, le coût : une fois que vous avez le modèle, l'inférence (son exécution) peut être beaucoup moins chère que de payer des frais par requête API. Deuxièmement, la personnalisation : vous pouvez remodeler le comportement du modèle de manière que ne le permet pas une API commerciale. Troisièmement, la transparence : les chercheurs peuvent étudier comment le modèle arrive à ses réponses, ce qui est extrêmement important pour la recherche en sécurité. La recherche en alignement d'Anthropic souligne pourquoi être capable d'inspecter les composants internes du modèle est précieux. Quatrièmement, pas de dépendance vis-à-vis d'un fournisseur : vous n'êtes pas dépendant d'une entreprise qui reste solvable ou qui maintient ses prix stables.
Quels sont les inconvénients et les risques ?
Les modèles ouverts peuvent être abusés plus facilement, car n'importe qui peut supprimer les garde-fous de sécurité qu'une entreprise appliquerait normalement. Ils nécessitent également des compétences techniques pour fonctionner correctement, et vous êtes responsable de leur maintien à jour et de leur sécurisation. Les petites organisations peuvent trouver le fardeau de l'infrastructure lourd.
Le cadre de gestion des risques de l'IA du NIST note que la transparence fonctionne dans les deux sens : elle aide les défenseurs à comprendre un système, mais elle aide aussi les attaquants à comprendre comment l'abuser.
IA open-source vs IA fermée : une comparaison rapide
| Caractéristique | Open-source / open weights | Fermé / propriétaire |
|---|---|---|
| Voir les composants internes du modèle | Oui | Non |
| L'exécuter sur votre propre matériel | Oui | Non |
| Personnaliser et affiner | Oui, librement | Limité ou non |
| Les données restent sur vos serveurs | Oui | Généralement non |
| Effort technique initial | Élevé | Faible |
| Modèle de coût typique | Coûts d'infrastructure | Frais par requête |
Un exemple concret d'IA open-source en action
Une startup de technologie juridique souhaite construire un assistant d'examen de documents. L'utilisation d'une API fermée signifie que chaque contrat qu'elle traite passe par les serveurs de quelqu'un d'autre, ce qui soulève des problèmes de confidentialité des clients. À la place, l'équipe télécharge un modèle open-weights, l'affine sur la langue juridique et l'exécute dans son propre environnement sécurisé. Les clients n'ont jamais besoin de le savoir, et aucune donnée ne quitte le contrôle de l'entreprise.
Qu'est-ce que la licence permet réellement ?
C'est là que les choses deviennent nuancées. « Open-source » ne signifie pas toujours « faites ce que vous voulez ». Certains modèles sont accompagnés de licences qui restreignent l'utilisation commerciale ou vous obligent à rendre open-source toute modification que vous apportez. La définition de l'Open Source Initiative exige, entre autres, que la licence ne restreigne personne à vendre ou à donner le logiciel. De nombreuses licences populaires de modèles d'IA ne répondent pas à ce critère, c'est pourquoi le terme « open weights » devient plus précis.
Lisez toujours la licence avant de construire un produit sur la base d'un modèle.
Point de confidentialité, en termes clairs
Exécuter un modèle open-source localement est en fait l'option la plus privée disponible, car vos demandes ne quittent jamais votre machine. Le hic, c'est que télécharger de gros fichiers de modèles (souvent 10 à 70 gigaoctets) et les exécuter nécessite du matériel décent. Les ordinateurs portables grand public peuvent gérer les modèles plus petits ; les grands modèles ont besoin d'un GPU puissant ou d'un serveur cloud loué.
Questions fréquemment posées
L'IA open-source est-elle gratuite à utiliser ?
Le téléchargement du modèle est généralement gratuit, mais vous payez quand même l'électricité et le matériel (ou le calcul cloud) nécessaires pour l'exécuter. Les licences commerciales sur certains modèles peuvent également exiger des frais pour une utilisation commerciale.
Puis-je faire confiance à une IA open-source pour être sûre ?
Les modèles ouverts peuvent être audités par quiconque, ce qui aide à identifier les problèmes, mais les garde-fous de sécurité peuvent aussi être supprimés par n'importe qui. La sécurité dépend largement de la façon dont vous déployez et configurez soigneusement le modèle pour votre cas d'usage spécifique.



