An open-source benchmark of how well LLMs solve nonogram puzzles, from 5x5 to 20x20.
Déduit des transports déclarés par cette annonce (streamable-http). Un client absent de cette liste n’est pas écarté pour autant — c’est simplement quelque chose que Forge ne peut pas confirmer.
La vérification confirme l’identité de l’éditeur (la propriété du dépôt), pas la sûreté du code. L’analyse de sécurité couvre les CVE connues et les scripts d’installation suspects.
Lu dans le code que npm livre réellement, au moment de l’analyse. Le paquet n’a jamais été exécuté. Les outils enregistrés dynamiquement à l’exécution, ou cachés dans du code empaqueté ou minifié, peuvent passer inaperçus — c’est donc un plancher de la surface d’outils, pas un recensement complet.
get_leaderboardNonobench models ranked by accuracy, overall or for one grid size. Effort defaults to all levels; use effort=best to match the homepage.Nonobench models ranked by accuracy, overall or for one grid size. Effort defaults to all levels; use effort=best to match the homepage.
Aucun schéma d’entrée n’a été publié pour cet outil.
list_providersProvider ids, names, families and variant counts.Provider ids, names, families and variant counts.
Aucun schéma d’entrée n’a été publié pour cet outil.
list_familiesModel families, efforts and best variants.Model families, efforts and best variants.
Aucun schéma d’entrée n’a été publié pour cet outil.
compare_modelsCompare two or more model ids or family names side by side.Compare two or more model ids or family names side by side.
Aucun schéma d’entrée n’a été publié pour cet outil.
set_filtersUpdate the visible leaderboard filters and URL.Update the visible leaderboard filters and URL.
Aucun schéma d’entrée n’a été publié pour cet outil.
get_model_resultsAccuracy, cost and latency for one model, per grid size.Accuracy, cost and latency for one model, per grid size.
Aucun schéma d’entrée n’a été publié pour cet outil.
list_puzzlesThe benchmark puzzles with ids and row/column clues.The benchmark puzzles with ids and row/column clues.
Aucun schéma d’entrée n’a été publié pour cet outil.
get_puzzle_resultsPer-model outcomes for a puzzle, optionally including parsed grids.Per-model outcomes for a puzzle, optionally including parsed grids.
Aucun schéma d’entrée n’a été publié pour cet outil.
get_model_puzzlesWhich puzzles a model solved, missed, or did not run.Which puzzles a model solved, missed, or did not run.
Aucun schéma d’entrée n’a été publié pour cet outil.
check_solutionCheck a nonogram grid (row-major 0/1 string) against a puzzle's clues.Check a nonogram grid (row-major 0/1 string) against a puzzle's clues.
Aucun schéma d’entrée n’a été publié pour cet outil.
open_puzzleShow a puzzle in the puzzle explorer on this page.Show a puzzle in the puzzle explorer on this page.
Aucun schéma d’entrée n’a été publié pour cet outil.
nonobenchAucune description publiéeCet outil n’a publié aucune description. Forge n’en invente pas.
get_puzzleOne puzzle, including the clue text models were prompted with. The reference solution is only included on request; some puzzles have several valid solutions.One puzzle, including the clue text models were prompted with. The reference solution is only included on request; some puzzles have several valid solutions.
Aucun schéma d’entrée n’a été publié pour cet outil.
list_runsIndividual benchmark runs (one model on one puzzle), optionally with the raw prompt and model output.Individual benchmark runs (one model on one puzzle), optionally with the raw prompt and model output.
Aucun schéma d’entrée n’a été publié pour cet outil.
13 outils sur 14 ont publié une description.
Les noms et descriptions d’outils sont écrits par l’éditeur et affichés tels quels, comme du texte inerte. Ce sont les chaînes qu’un client MCP transmet à un modèle, alors Forge y recherche des motifs d’injection de prompt — tout constat apparaît avec l’analyse de sécurité ci-dessus. « Privilégié » est une correspondance de mot-clé sur le nom de l’outil, pas un audit de ce qu’il fait : un nom anodin peut tout de même tout faire.
An open-source benchmark of how well LLMs solve nonogram puzzles, from 5x5 to 20x20.
Les noms cliquables ouvrent l’index Forge de toutes les entrées observées exposant cet outil. Parcourir tous les outils indexés.
Cette entrée ne publie aucun paquet npm : Forge n'a donc pas d'arbre de dépendances pour elle. C'est une lacune de couverture — pas une affirmation qu'elle n'a aucune dépendance.