Utiliser un modèle de langage massif pour trier des courriels ou aiguiller des tickets d’assistance revient à tirer au canon sur des mouches : c’est lent, fragile et inutilement coûteux.
Lancés sous l’impulsion de Diogo Almeida, ancien chercheur chez OpenAI au sein de la société Typeface, les modèles de décision comme Jev prennent le contre-pied de cette tendance. Au lieu de générer du texte, ils exécutent des choix réflexes immédiats à des coûts dérisoires.
Voici 7 faits majeurs pour comprendre cette catégorie d’IA et ce qu’elle change pour l’automatisation logicielle.
1. Une architecture non générative restreinte à trois sorties
Jev ne produit ni texte rédigé, ni son, ni image. Il s’agit d’un modèle spécifiquement conçu pour les arbitrages structurés. Vous lui soumettez un état (state) et une question, puis le système renvoie obligatoirement l’un des trois types de réponses suivants :
choice: sélectionne une option parmi celles fournies dans l’état (par exemple classer le sentiment d’un message client entre « en colère », « heureux » ou « neutre »).score: attribue une note ou une valeur chiffrée à l’état soumis.noul: tranche par un booléen strict, vrai ou faux.
L’équipe de Typeface le formule clairement : l’objectif n’est pas de concevoir une entité omnisciente, de résoudre des énigmes mathématiques ou de remplacer l’humain pour faire la vaisselle. Le modèle se limite à automatiser les décisions les plus rébarbatives du quotidien, sans introduire les risques de cyberattaques ou les menaces existentielles souvent prêtés aux modèles frontière.
2. Une cadence de 10 décisions par seconde pour 42 dollars par milliard de tokens
Dans la plupart des flux d’automatisation actuels, des LLM gigantesques sont mobilisés pour des actions élémentaires. Jev résout cette anomalie économique grâce à deux caractéristiques matérielles précises :
- Une fréquence de 10 Hz : le modèle prend au moins 10 décisions par seconde, autorisant un contrôle réactif en temps réel là où les LLM peinent avec leur latence.
- Un tarif d’entrée dérisoire : 42 dollars par milliard de tokens d’entrée, soit 0,00000004 dollar par token. C’est 238 fois moins cher que des solutions comme Fable ou Astra pour un niveau d’intelligence réflexe comparable.
Les tokens de sortie sont quant à eux entièrement gratuits. Il ne s’agit pas d’un rabais commercial temporaire, mais d’une réalité technique : comme le système ne génère pas de données textuelles, le volume produit en sortie est trop infime pour être mesuré et facturé.
3. Des probabilités calibrées via le RLCD face à la complaisance des LLM
Lorsqu’un assistant comme ChatGPT affirme être « sûr à 90 % », cette déclaration ne traduit aucune certitude statistique interne. Il s’agit simplement d’une suite de mots produite parce qu’elle est statistiquement fréquente dans son corpus d’apprentissage. Un énoncé faux formulé avec assurance peut obtenir une probabilité textuelle très élevée sans correspondre à la réalité.
Les LLM généralistes sont entraînés par renforcement sur les préférences humaines. Ils cherchent avant tout à satisfaire leur interlocuteur, ce qui les pousse à surestimer constamment leurs probabilités. Face à des dossiers scolaires pour évaluer le risque de décrochage d’un élève, un LLM annoncera par exemple 80 % alors que la fréquence statistique réelle n’est que de 60 %.
Jev corrige cette dérive par l’entraînement RLCD (Reinforcement Learning for Calibrated Decisions). Ce processus force les estimations numériques du modèle à s’aligner sur la fréquence réelle des événements observés : une prédiction annoncée à 80 % correspond effectivement à un événement qui se produit 8 fois sur 10.
4. Un format garanti mathématiquement sans le subterfuge du décodage contraint
Pour forcer un LLM à alimenter une API selon un schéma strict, les développeurs recourent habituellement au décodage contraint (constrained decoding). Cette méthode masque artificiellement tous les tokens impossibles au cours de la génération pour obliger le modèle à piocher dans les options autorisées.
Imaginez un écolier interrogé sur la capitale de l’Autriche. Ses probabilités internes sont : « Vienne » (15 %), « Madrid » (5 %) et « Chat » (80 %). Avant qu’il ne parle, vous lui interdisez de dire « Chat » et le forcez à choisir entre les deux villes. L’écolier choisit Vienne, mais il n’est pas plus instruit pour autant : vous avez simplement masqué son erreur.
Jev ne triche pas avec son format. Comme il ne produit que des nombres, des probabilités ou des booléens au sein d’une structure imposée dès le départ, il attribue mathématiquement 0 % de probabilité aux tokens non valides. Le modèle peut se tromper sur le fond de son évaluation, mais sa structure de réponse ne souffre d’aucun défaut syntaxique.
5. Une dynamique de « Système 1 » sans phase de raisonnement délibéré
En s’appuyant sur les distinctions établies par Daniel Kahneman, l’intelligence artificielle sépare deux modes opératoires :
- Le Système 1 : rapide, instinctif, automatique.
- Le Système 2 : lent, conscient, décomposant les étapes complexes grâce à une réflexion délibérée.
Les LLM actuels tentent de combiner ces deux approches. À ses débuts, ChatGPT ne disposait que d’un mode instantané : avec une quantité de calcul fixe par requête, il échouait systématiquement sur des opérations arithmétiques basiques dès qu’il devait répondre sans délai, tout comme un être humain forcé de calculer instantanément. Les modes de raisonnement récents ont pallié ce défaut en allongeant le temps de calcul via des chaînes de pensée.
Jev assume sa place exclusive au sein du Système 1. Il ne génère aucune chaîne de pensée et ne requiert aucun temps d’attente pour réfléchir. Face à une situation donnée, il exécute un arbitrage immédiat, semblable à un réflexe logique.
6. La réhabilitation du classificateur classique rendu généraliste
Avant la domination exclusive des LLM, l’apprentissage automatique reposait sur des outils spécialisés, moins coûteux et opérationnels sur du matériel modeste :
- Les régressions : utilisées pour estimer des valeurs numériques à partir de variables historiques (déduire le prix d’un logement en fonction de son code postal à Manhattan, de sa surface et de son nombre de salles de bain).
- Les classificateurs : dédiés à l’attribution d’une catégorie (distinguer un chat domestique d’un léopard).
Ces systèmes fonctionnaient parfaitement, mais ils restaient confinés à une tâche unique. Les modèles de fondation ont ensuite apporté la généralisation grâce à un entraînement massif sur des volumes gigantesques de données. Le texte étant le format le plus aisé à massifier, le terme « LLM » est devenu le synonyme par défaut de l’IA moderne, même lorsque des modèles récents comme GPT-6 Astra intègrent désormais la vision et l’audio.
Diogo Almeida a choisi de faire marche arrière : prouver qu’il est possible de reprendre la logique d’un classificateur traditionnel, tout en lui donnant la polyvalence d’un modèle de fondation prêt à l’emploi sans s’encombrer de texte rédigé.
7. Des applications concrètes allant des requêtes SQL aux jeux vidéo d’action
La valeur d’un modèle de décision se mesure à sa capacité à piloter des boucles logicielles concrètes en direct, avec des temps de réponse et des coûts mesurés au centime près.
| Cas d’usage concret | Vitesse ou volume traité | Coût d’exécution |
|---|---|---|
| Partie de Doom en direct (boucle de contrôle) | 10 décisions par seconde | ~7,00 $ / heure |
| Requête PostgreSQL directe (129 lignes) | ~1 seconde | 0,0009 $ |
| Recherche de vols Zurich → Londres sur Google Flights | 7,1 secondes | 0,0039 $ |
| Tri et labellisation de 500 courriels | Quelques secondes | 0,035 $ |
| Tri étendu de 1 700 courriels | Exécution continue | 0,18 $ |
| Analyse de 724 annonces publicitaires (37 marques) | 40 secondes | 0,09 $ |
| Annotation de 1 018 articles de recherche en IA | 256 ms par article | 0,08 $ |
| Partie de Super Mario Bros. sur émulateur | Temps réel | Non chiffré |
L’intégration dans PostgreSQL montre la portée pratique de l’outil : une clause SQL comme WHERE jev(people, 'could work from home') permet de filtrer 129 profils en une seconde pour moins d’un dixième de centime, sans créer d’index ni générer d’embeddings.
Cette approche ne restera pas longtemps sans rivale. Les grands fournisseurs d’infrastructures et les laboratoires majeurs préparent leurs propres déclinaisons. Google explore déjà l’usage de DiffusionGemma pour des tâches visuelles en temps quasi réel, confirmant que les architectures de diffusion représentent, elles aussi, une alternative sérieuse à la lenteur des modèles de langage autorégressifs.