Open eval leaderboard + CI gate for autonomous coding agents (solve, score, trace).
An open, always-on leaderboard and CI gate for autonomous coding agents — every patch runs in a sandbox, every run has a public trace, every regression fails the build. ▶ Live leaderboard: forgejudge.ahmedhobeishy.tech · playground · methodology · model swap · MCP registry Current numbers (hidden-test = the agent never sees the failing test; $0 free tier; same harness, swap the model; 18 tasks ×…
Déduit des transports déclarés par cette annonce (stdio). Un client absent de cette liste n’est pas écarté pour autant — c’est simplement quelque chose que Forge ne peut pas confirmer.
La vérification confirme l’identité de l’éditeur (la propriété du dépôt), pas la sûreté du code. L’analyse de sécurité couvre les CVE connues et les scripts d’installation suspects.
Forge a lu 2 fichiers sources de l’archive du paquet publié et n’a trouvé aucun enregistrement d’outil MCP. L’extraction repose sur des motifs appliqués au code livré : un serveur qui construit sa liste d’outils à l’exécution, ou qui ne livre que du code empaqueté ou minifié, n’enregistre rien de visible ici. À lire comme « non détecté », pas comme « n’en expose aucun ».
An open, always-on leaderboard and CI gate for autonomous coding agents — every patch runs in a sandbox, every run has a public trace, every regression fails the build. ▶ Live leaderboard: forgejudge.ahmedhobeishy.tech · playground · methodology · model swap · MCP registry Current numbers (hidden-test = the agent never sees the failing test; $0 free tier; same harness, swap the model; 18 tasks × 3 seeds = 54 runs/model, 162 total): | Model | pass@1 | pass@3 | The score rises with the better…
Le résolveur de Forge ne lit que les métadonnées npm : ce paquet PyPI n'a donc pas d'arbre résolu. C'est une lacune de couverture, pas un satisfecit.