« La taxe sur l'outil » : pourquoi les agents d'IA gaspillent les jetons
Chaque appel à un grand modèle linguistique implique non seulement la demande elle-même, mais aussi l'ensemble du contexte qui y va. Lorsqu'un agent est connecté aux serveurs Model Context Protocol (MCP), le modèle reçoit le catalogue complet des outils disponibles à chaque étape : leurs noms, descriptions, paramètres et schémas. Même si l'agent n'utilise jamais la plupart d'entre eux, les jetons pour les traiter sont déjà dépensés — avant même que le modèle décide d'appeler quoi que ce soit. À Okta, cet effet est appelé la « taxe sur les outils », et il augmente avec le nombre d'outils et d'utilisateurs.
Le problème n'est pas seulement l'argent. L'agent voit les définitions de tous les outils, y compris ceux auxquels il n'a pas accès. Une tentative d'utiliser un tel outil sera bloquée au moment de l'exécution, mais les jetons pour le traiter dans l'invite sont déjà consommés — ils ne peuvent pas être retournés. Donc, d'un point de vue à la fois sécuritaire et économique, vous devez couper l'excédent avant que l'information atteigne le modèle.

Comment Okta propose de réduire les coûts
La solution d'Okta est basée sur la limitation de la liste d'outils basée sur l'identité. Au lieu de donner à l'agent l'ensemble du catalogue du serveur MCP, un administrateur spécifie via le tableau de bord Okta quels outils sont autorisés pour un agent spécifique ou l'utilisateur derrière. Okta ne retourne que cet ensemble réduit, et c'est ce qui va dans l'invite du modèle à chaque étape. En outre, le système vérifie les autorisations au moment de l'exécution, juste avant l'appel réel.
Il s'agit essentiellement d'appliquer le principe du moindre privilège au niveau des outils. L'agent ne devrait pas connaître les ressources, les bases de données ou les actions pour lesquelles il n'a pas de permission explicite. Et comme un outil ne le fait pas dans l'invite, aucun jeton n'est dépensé sur son schéma. Par rapport à l'approche précédente, où l'accès ne pouvait être limité qu'à un serveur entier, cela restreint la portée aux outils individuels au sein d'un serveur. Par exemple, avec les intégrations pour Google Workspace, Slack ou les serveurs MCP internes, un agent pourrait avoir accès en lecture seule à l'email, mais pas la permission d'envoyer des messages.
Ce que la modélisation a montré et comment l'approche diffère des passerelles
Okta n'a pas encore publié les données des déploiements réels — les estimations sont basées sur la modélisation interne. Au sein de l'entreprise, ils ont assemblé un catalogue d'outils d'entreprise, les ont cartographiés à OAuth et divisé les utilisateurs en rôles typiques: des spécialistes de support avec des droits en lecture seule aux superadmins. Dans certains scénarios, le nombre d'outils visibles a été réduit de plus de 90 %, et le coût de leurs schémas a diminué d'environ la même proportion. Les valeurs absolues en jetons ou en dollars ne sont pas divulguées, parce que le résultat dépend fortement du catalogue, de la distribution des permissions, de la taille moyenne des schémas, du volume des requêtes et du prix du modèle spécifique.
La délimitation de la portée fondée sur l'identité devrait être distinguée des contrôles des coûts des passerelles. Les passerelles peuvent limiter les budgets par la clé, l'équipe ou le groupe, et fournir des limites de taux et d'acheminement, mais elles entrent en jeu après que le modèle a déjà pris une décision coûteuse. Les autorisations fondées sur l'identité déterminent à l'avance l'ensemble des outils disponibles , au niveau de l'agent et de l'utilisateur, plutôt que pour un groupe dans son ensemble. Cela permet non seulement d'enregistrer des jetons, mais aussi de supprimer de la vue de l'agent tout ce à quoi il ne devrait pas avoir accès.

Il semble que Okta considère ce mécanisme comme faisant partie d'une stratégie plus large pour des environnements agentsiques sécurisés. L'efficacité de ces projets sera évidente après des projets pilotes avec des clients, mais l'idée elle-même — enlevant l'excédent de l'invite avant de payer pour elle — ressemble à une étape logique dans la lutte contre les contextes d'agents d'IA gonflés.



