LLM (Large Language Model)
Un LLM, ou grand modèle de langage, est un programme entraîné sur d'énormes volumes de textes pour prédire la suite la plus probable d'une phrase. C'est ce mécanisme de prédiction, appliqué à très grande échelle, qui produit des réponses cohérentes, des traductions ou du code.
GPT, Claude, Gemini, Mistral et Llama appartiennent tous à cette famille. Ils diffèrent par leur taille, leurs données d'entraînement, leur coût et leur localisation.
Ce qu'un LLM sait et ne sait pas
Un LLM ne consulte pas une base de connaissances : il produit du texte à partir de régularités apprises. Cela à trois conséquences pratiques.
Sa connaissances s'arrête à sa date d'entraînement, sauf s'il est connecté à une recherche web. Il ne connaît pas vos documents internes, sauf si on les lui fournit. Et il peut formuler avec assurance une information fausse, ce qu'on appelle une hallucination : rien dans son fonctionnement ne distingue une réponse exacte d'une réponse plausible.
Les notions à connaître pour l'utiliser
- Le token est l'unité de découpage du texte, environ trois quarts d'un mot en français. La facturation se fait au token, en entrée comme en sortie.
- La fenêtre de contexte est la quantité de texte que le modèle peut prendre en compte en une fois. Au-delà, il faut résumer ou sélectionner.
- La température règle le degré de variabilité des réponses : basse pour de l'extraction de données, plus élevée pour de la rédaction.
- Le prompt système définit le rôle et les limites du modèle, en amont de la conversation.
Comment l'adapter à votre métier
Trois approches, par ordre croissant de coût :
- Le prompt engineering : bien formuler la demande et donner des exemples. Gratuit, immédiat, et suffisant dans une majorité de cas.
- Le RAG : brancher le modèle sur vos documents pour qu'il réponde à partir de vos sources. C'est la réponse adaptée quand la connaissances métier évolue.
- Le fine-tuning : réentraîner le modèle sur vos données. Coûteux, à réserver aux cas où il faut changer le style ou le format des réponses, pas leur contenu.
L'erreur fréquente consiste à envisager le fine-tuning alors que le besoin réel est un RAG.
Le sujet de la souveraineté
Pour une organisation française, la question de l'endroit où transitent les données se pose dès que le modèle traité autre chose que du contenu public. Les modèles européens comme Mistral, ou les modèles ouverts hébergés sur une infrastructure maîtrisée, permettent de garder les traitements dans l'Union européenne. C'est le choix que CZ Multimédia privilégie pour les projets touchant des données sensibles.
Termes associés
Agent IA
Un agent IA est un système autonome piloté par un modèle de langage, capable de raisonner, de chois...
Prompt Engineering
Le prompt engineering est la pratique qui consiste à formuler, structurer et tester les instruction...
NLP (Natural Language Processing)
Le NLP (Natural Language Processing), ou traitement automatique du langage naturel, est le domaine ...
Laravel
Laravel est un framework PHP open source, créé par Taylor Otwell, conçu pour réduire au maximum le ...
Workflow
Un workflow est une suite d'étapes ordonnées qui décrit comment une tâche se déroule du début à la ...
RPA (Robotic Process Automation)
La RPA (Robotic Process Automation) consiste à faire exécuter par un robot logiciel les gestes qu'u...
