MAS-Lab Open-Source Release and arXiv Paper
Nous venons de publier MAS-Lab: A Specification-Driven Validation Framework for Reliable Multi-Agent Systems en open source sur GitHub, avec un preprint arXiv.
Depuis fin 2024, je travaille sur les systèmes agentiques et multi-agents — avec pour objectif de les rendre robustes, observables et évaluables, pas seulement rapides à prototyper. L’écosystème s’est construit incroyablement vite, mais des lacunes importantes subsistent : robustesse, observabilité, évaluation. Ces lacunes semblent évitables — les problèmes comparables sont traités depuis longtemps dans d’autres domaines de l’ingénierie, avec des pratiques établies.
Avec Aether, j’ai senti ces limites de manière concrète. Passer d’un prototype fonctionnel à quelque chose de deployable en production exige de s’articuler autour de protocoles en évolution (MCP, A2A), de l’observabilité, de toute la pile opérationnelle — des briques qu’on peut ignorer en test local, mais qui deviennent essentielles en production. Et il fallait encore l’évaluer rigoureusement pour un article scientifique.
Pour répondre à ces besoins, nous avons commencé à développer MAS-Lab. Le blog du projet détaille l’outil et ses composantes. Nous avons aussi écrit un article sur ces défis et notre approche — y compris la formalisation basée sur les machines de Mealy au cœur du runtime. Tout le code est en open source sur GitHub.
MAS-Lab repose sur quatre composantes :
Spec. Un workflow multi-agents est défini de manière déclarative — agents, rôles, schémas de délégation, outils et politiques — comme une spécification versionnée plutôt que comme une logique dispersée dans les prompts et le code. Le système acquiert une identité stable, comparable, évaluable et évolutive, indépendamment du framework ou du modèle qui implémente chaque agent.
Runtime. Le runtime exécute la spécification. Il repose sur un modèle formel basé sur les machines de Mealy : les actions passent par des garde-fous de gouvernance, l’état et les ressources externes sont médiés, et les interactions sont enregistrées avec assez de contexte pour auditer ce qui s’est passé. La conception permet aussi le multiplexage sur des connexions stateless, afin que plusieurs applications agentiques partagent la même infrastructure.
Control. Une couche de déploiement porte la même spécification du développement local aux benchmarks parallèles, jusqu’à la production. L’objectif est la continuité du cycle de vie — ne pas reconstruire le workflow à chaque étape, mais promouvoir un système déclaré unique avec les hooks d’orchestration et de gouvernance nécessaires dans chaque environnement.
Lab. Les labs fournissent des environnements d’expérience reproductibles : faire varier un facteur à la fois en gardant spec et runtime fixes, et collecter traces et artefacts comparables pour l’évaluation, la régression et les revues avant mise en production. Ils regroupent le scaffolding de benchmark et l’outillage d’analyse que la plupart des projets réécrivent sinon pour chaque nouveau scénario.
MAS-Lab est un projet d’envergure — ce que nous publions aujourd’hui n’est qu’un point de départ. Un grand merci à Giovanna Carofiglio, Giulio Grassi et Jacques Samain, qui ont été déterminants pour y arriver.