Open eval leaderboard + CI gate for autonomous coding agents (solve, score, trace).
An open, always-on leaderboard and CI gate for autonomous coding agents — every patch runs in a sandbox, every run has a public trace, every regression fails the build. ▶ Live leaderboard: forgejudge.ahmedhobeishy.tech · playground · methodology · model swap · MCP registry Current numbers (hidden-test = the agent never sees the failing test; $0 free tier; same harness, swap the model; 18 tasks ×…
Inferido de los transportes que declara este listado (stdio). Que un cliente no aparezca aquí no significa que se haya descartado: simplemente Forge no puede confirmarlo.
La verificación confirma la identidad del publicador (la propiedad del repo), no la seguridad del código. El análisis de seguridad cubre los CVE conocidos y los scripts de instalación sospechosos.
Forge leyó 2 archivos de código de tarball del paquete publicado y no encontró ningún registro de herramientas MCP. La extracción se basa en patrones sobre el código publicado: un servidor que construye su lista de herramientas en tiempo de ejecución, o que solo publica código empaquetado o minificado, no registra nada que esto pueda ver. Tómalo como «no detectado», no como «no expone ninguna».
An open, always-on leaderboard and CI gate for autonomous coding agents — every patch runs in a sandbox, every run has a public trace, every regression fails the build. ▶ Live leaderboard: forgejudge.ahmedhobeishy.tech · playground · methodology · model swap · MCP registry Current numbers (hidden-test = the agent never sees the failing test; $0 free tier; same harness, swap the model; 18 tasks × 3 seeds = 54 runs/model, 162 total): | Model | pass@1 | pass@3 | The score rises with the better…
El resolutor de dependencias de Forge solo lee metadatos de npm, así que este paquete de PyPI no tiene árbol resuelto. Es una carencia de cobertura, no un certificado de buena salud.