Le NIST dévoile une nouvelle plateforme d’évaluation de l’IA

L’Institut national des normes et de la technologie a lancé lundi un nouveau programme permettant aux chercheurs d’accéder à un environnement de banc d’essai isolé pour évaluer en toute sécurité les modèles d’intelligence artificielle par rapport à diverses commandes.

L’évaluation technologique de l’IA, ou AITE, est un véhicule de test volontaire axé sur l’analyse de la sécurité des modèles d’IA. Il fournit des données aveugles que les modèles doivent traiter lors de l’exécution de tâches afin d’obtenir des informations objectives et de procéder à des évaluations des capacités du modèle. Notamment, les données d’évaluation ne sont pas destinées à servir de données de formation pour les modèles.

Dans un premier temps, l’AITE se concentrera sur la réalisation de tâches d’analyse d’images à l’aide de modèles de langage de grande vision dans trois domaines : la science quantique, la génomique et la sécurité publique. D’autres tâches seront disponibles à l’avenir.

L’objectif fondamental de l’AITE est d’offrir une rubrique universelle permettant d’évaluer efficacement les capacités des modèles d’IA et de déterminer l’état de l’art en matière de performances des modèles.

« L’infrastructure fournie par le NIST fournira des données, des mesures et des scores communs pour aider les développeurs à comprendre les performances de leurs modèles », indique le communiqué de presse.

Les fournisseurs de données et les fournisseurs de modèles travaillant avec l’AITE devront soumettre des documents liés aux tests. Les fournisseurs de données sont invités à soumettre des ensembles de données originaux inaccessibles au public, ainsi qu’une tâche « significative » adaptée aux données.

De même, les développeurs de modèles soumettront leurs modèles d’IA pour qu’ils soient testés à l’aide des ensembles de données. La première série d’évaluations débutera en août 2026.

La création de l’AITE est la dernière étape de la stratégie de l’administration Trump visant à travailler avec les principaux développeurs d’IA pour faire progresser la sécurité des modèles grâce à des soumissions volontaires de modèles.

Le ministère du Commerce a annoncé en mai un accord renégocié entre l’agence et trois sociétés – Google Deepmind, Microsoft et xAI – pour évaluer leurs modèles par l’intermédiaire du Center for AI Standards and Innovation.

A lire également