
Jev contre Laya : comment les modèles de décision System One éliminent le gaspillage de jetons dans le routage d'agents IA
La crise d'inefficacité dans les plans de contrôle agentiques

Que sont les modèles de décision de Système Un dans le routage d'agents ? Les modèles de décision de Système Un sont des réseaux de neurones non autorégressifs conçus pour exécuter des jugements de flux de contrôle délimités en un seul passage direct. Plutôt que de générer du texte conversationnel ou du JSON caractère par caractère, des architectures comme Jev de TypeSafe AI et Laya de ConvAI évaluent l'état de l'application pour renvoyer des choix catégoriels calibrés, des scores numériques ou des indicateurs booléens en millisecondes, sans aucun gaspillage de jetons de sortie.
S'appuyer sur de grands modèles de langage conversationnels pour de simples étapes de routage donne toujours l'impression d'utiliser une masse pour accrocher un tableau. Chaque choix de routage déclenche une lourde boucle de génération de texte, gaspillant un contexte d'entrée précieux et brûlant des milliers de jetons de sortie juste pour récupérer un simple indicateur vrai ou faux. Cette surcharge de jetons crée des pics de latence pénibles et perturbe les fenêtres de contexte dans les boucles multi-agents. Les équipes d'ingénierie modernes résolvent ce problème en adoptant une approche à double processus. Cela sépare les modèles de décision de Système Un rapides et délimités de la lourde génération de Système Deux, ce qui reflète la division cognitive détaillée dans The Rise of Agentic AI: When Language Models Take Action. En éliminant complètement la génération de texte, les plans de contrôle fonctionnent beaucoup plus rapidement.
Fondations architecturales : Jev et Laya sous le capot

L'examen du matériel et des configurations d'entraînement derrière ces moteurs de routage révèle beaucoup de choses sur la façon dont ils gèrent les charges lourdes. TypeSafe AI a lancé Jev en septembre 2026 en tant que modèle de décision API hébergé, conçu pour un routage rapide de machine à machine. Jev fonctionne avec une fenêtre de contexte de 64k tokens, des tokens d'entrée tarifés à 0,042 $ par million et des tokens de sortie gratuits puisqu'il évite la génération de texte. Le processus d'entraînement utilise l'apprentissage par renforcement pour des décisions calibrées afin d'améliorer la précision probabiliste et d'éliminer l'excès de confiance.
De l'autre côté, ConvAI Innovations a lancé LAYA OPEN SOURCE trois jours plus tard comme une alternative sous licence Apache 2.0 avec des poids ouverts. Laya utilise une dorsale ModernBERT-large de 421 millions de paramètres associée à des têtes de décision personnalisées. Alors que Jev repose sur une configuration cloud gérée, Laya offre aux équipes un contrôle local total. Les deux outils se passent de l'autorégression de texte, mais leurs configurations s'intègrent dans des tech stacks très différentes.
Le contrat mathématique des primitives de décision

Les modèles de langage standard traitent les outputs structurés comme une simple réflexion après coup, forçant les parsers à nettoyer des chaînes JSON désordonnées. Les modèles de décision non-autorégressifs utilisent plutôt des primitives mathématiques claires. Les primitives principales incluent Choice pour le tri sur liste fermée, Score pour la mise à l'échelle numérique, et Noul pour les vérifications de probabilité booléenne vrai ou faux. Ces primitives renvoient des outputs typés accompagnés de scores de confiance au lieu de flux de texte désordonnés.
Les tests de benchmark montrent des différences nettes entre les API cloud et les configurations locales. Pour des questions uniques, Laya s'exécute en environ 32,8 millisecondes sur des GPU T4, tandis que Jev se situe dans une fenêtre de latence WAN de 136 à 276 millisecondes. Mais lors de la mise à l'échelle sur de grands lots de 50 questions parallèles, Jev reste stable à 170 millisecondes, alors que Laya grimpe jusqu'à 1 002 millisecondes sous une forte charge CPU. La vérification de la calibration et des scores de Brier garantit la fiabilité de ces modèles avant le lancement, conformément au guide de sélection disponible dans Comment choisir votre LLM : Claude, Gemini, ChatGPT et Manus.
Intégrations au niveau du système : Routage, Filtrage et Jev-Mem

Intégrer des moteurs de décision non autorégressifs dans les applications de production réduit l'utilisation de tokens jusqu'à quatre-vingt-dix pour cent. Les équipes placent ces modèles directement à l'entrée pour un filtrage rapide des intentions, redirigeant les requêtes des utilisateurs vers les agents spécialisés appropriés sans déclencher de prompts lourds. De plus, les vérifications de récupération précoce utilisent la primitive Noul pour noter la pertinence à la volée, éliminant les données inutiles avant qu'elles n'atteignent les context windows en aval.
La gestion de la mémoire bénéficie également d'une amélioration notable ici. La conception de mémoire à double plan expliquée dans Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI utilise des primitives de décision rapides pour lire et écrire des atomes d'état sans coût de génération. Pour les équipes souhaitant une aide pratique, les patterns de déploiement d'entreprise sont abordés via Custom AI Agents and Smart Chatbots.
Modes de défaillance opérationnelle et matrice de décision stratégique

L'utilisation dans le monde réel révèle des cas limites complexes que les équipes doivent surveiller avant de déployer des modèles de décision en production. Laya éprouve des difficultés avec les tâches zero-shot, présentant notamment un aveuglement scripturaire où sa précision chute à zéro sur les écritures khmers malgré des scores de confiance élevés. Les deux modèles atteignent également une limite de taxonomie où la qualité de la classification diminue si les options dépassent vingt choix.
Lorsqu'ils doivent choisir entre des configurations cloud et des checkpoints locaux, les responsables doivent évaluer la confidentialité des données, la latence et la maintenance. Jev offre des tokens de sortie à coût zéro et une mise à l'échelle facile, tandis que Laya propose une exécution locale hors ligne sur du matériel abordable. La mise en place d'outils de secours pour les problèmes de scripts protège la disponibilité du système, conformément aux conseils de gouvernance issus de Mastering the Ghost: Agentic Coding with Google Antigravity. Prêt à cesser de gaspiller des tokens en routage basique et à bâtir des pipelines d'agents rapides ? Laissez VAiiBE concevoir votre architecture IA sur mesure dès aujourd'hui.
Services associés

Agents IA et chatbots intelligents sur mesure
Je crée des agents IA et des chatbots intelligents qui connaissent votre entreprise : ils répondent à vos clients, exploitent vos documents et se connectent aux outils que vous utilisez déjà. Des tarifs pensés pour les petites entreprises

Automatisation des processus métier
Je conçois, construis et héberge des workflows automatisés qui exécutent vos opérations répétitives 24h/24 et 7j/7, connectent les applications que vous payez déjà et ajoutent des étapes de décision intelligentes là où elles rapportent