An open-source benchmark of how well LLMs solve nonogram puzzles, from 5x5 to 20x20.
Inferido de los transportes que declara este listado (streamable-http). Que un cliente no aparezca aquí no significa que se haya descartado: simplemente Forge no puede confirmarlo.
La verificación confirma la identidad del publicador (la propiedad del repo), no la seguridad del código. El análisis de seguridad cubre los CVE conocidos y los scripts de instalación sospechosos.
Leído del código que npm publica realmente, en el momento del análisis. El paquete nunca se ejecutó. Las herramientas registradas dinámicamente en tiempo de ejecución, o escondidas en código empaquetado o minificado, pueden pasarse por alto — así que esto es un mínimo de la superficie de herramientas, no un censo completo.
get_leaderboardNonobench models ranked by accuracy, overall or for one grid size. Effort defaults to all levels; use effort=best to match the homepage.Nonobench models ranked by accuracy, overall or for one grid size. Effort defaults to all levels; use effort=best to match the homepage.
No se publicó ningún esquema de entrada para esta herramienta.
list_providersProvider ids, names, families and variant counts.Provider ids, names, families and variant counts.
No se publicó ningún esquema de entrada para esta herramienta.
list_familiesModel families, efforts and best variants.Model families, efforts and best variants.
No se publicó ningún esquema de entrada para esta herramienta.
compare_modelsCompare two or more model ids or family names side by side.Compare two or more model ids or family names side by side.
No se publicó ningún esquema de entrada para esta herramienta.
set_filtersUpdate the visible leaderboard filters and URL.Update the visible leaderboard filters and URL.
No se publicó ningún esquema de entrada para esta herramienta.
get_model_resultsAccuracy, cost and latency for one model, per grid size.Accuracy, cost and latency for one model, per grid size.
No se publicó ningún esquema de entrada para esta herramienta.
list_puzzlesThe benchmark puzzles with ids and row/column clues.The benchmark puzzles with ids and row/column clues.
No se publicó ningún esquema de entrada para esta herramienta.
get_puzzle_resultsPer-model outcomes for a puzzle, optionally including parsed grids.Per-model outcomes for a puzzle, optionally including parsed grids.
No se publicó ningún esquema de entrada para esta herramienta.
get_model_puzzlesWhich puzzles a model solved, missed, or did not run.Which puzzles a model solved, missed, or did not run.
No se publicó ningún esquema de entrada para esta herramienta.
check_solutionCheck a nonogram grid (row-major 0/1 string) against a puzzle's clues.Check a nonogram grid (row-major 0/1 string) against a puzzle's clues.
No se publicó ningún esquema de entrada para esta herramienta.
open_puzzleShow a puzzle in the puzzle explorer on this page.Show a puzzle in the puzzle explorer on this page.
No se publicó ningún esquema de entrada para esta herramienta.
nonobenchSin descripción publicadaEsta herramienta no publicó ninguna descripción. Forge no se la inventa.
get_puzzleOne puzzle, including the clue text models were prompted with. The reference solution is only included on request; some puzzles have several valid solutions.One puzzle, including the clue text models were prompted with. The reference solution is only included on request; some puzzles have several valid solutions.
No se publicó ningún esquema de entrada para esta herramienta.
list_runsIndividual benchmark runs (one model on one puzzle), optionally with the raw prompt and model output.Individual benchmark runs (one model on one puzzle), optionally with the raw prompt and model output.
No se publicó ningún esquema de entrada para esta herramienta.
13 de 14 herramientas publicaron una descripción.
Los nombres y descripciones de las herramientas los escribe el publicador y se muestran literalmente como texto inerte. Son las cadenas que un cliente MCP pasa al modelo, así que Forge las analiza en busca de patrones de inyección de prompts — cualquier hallazgo aparece junto al análisis de seguridad de arriba. «Privilegiada» es una coincidencia de palabra clave en el nombre de la herramienta, no una auditoría de lo que hace: un nombre inofensivo puede hacer cualquier cosa.
An open-source benchmark of how well LLMs solve nonogram puzzles, from 5x5 to 20x20.
Los nombres enlazados abren el índice de Forge con todas las entradas que se observó que exponen esa herramienta. Ver todas las herramientas indexadas.
Esta entrada no publica ningún paquete de npm, así que Forge no tiene un árbol de dependencias para ella. Es una carencia de cobertura, no una afirmación de que no tenga dependencias.