An open-source benchmark of how well LLMs solve nonogram puzzles, from 5x5 to 20x20.
Dedotto dai trasporti dichiarati da questo annuncio (streamable-http). Un client che non compare qui non è escluso — semplicemente Forge non è in grado di confermarlo.
La verifica conferma l’identità del publisher (la proprietà del repo), non la sicurezza del codice. L’analisi di sicurezza copre i CVE noti e gli script di installazione sospetti.
Letto dal codice che npm distribuisce davvero, al momento dell’analisi. Il pacchetto non è mai stato eseguito. Gli strumenti registrati dinamicamente a runtime, o nascosti in codice impacchettato o minificato, possono sfuggire — quindi questo è un limite inferiore della superficie di strumenti, non un censimento completo.
get_leaderboardNonobench models ranked by accuracy, overall or for one grid size. Effort defaults to all levels; use effort=best to match the homepage.Nonobench models ranked by accuracy, overall or for one grid size. Effort defaults to all levels; use effort=best to match the homepage.
Per questo strumento non è stato pubblicato alcuno schema di input.
list_providersProvider ids, names, families and variant counts.Provider ids, names, families and variant counts.
Per questo strumento non è stato pubblicato alcuno schema di input.
list_familiesModel families, efforts and best variants.Model families, efforts and best variants.
Per questo strumento non è stato pubblicato alcuno schema di input.
compare_modelsCompare two or more model ids or family names side by side.Compare two or more model ids or family names side by side.
Per questo strumento non è stato pubblicato alcuno schema di input.
set_filtersUpdate the visible leaderboard filters and URL.Update the visible leaderboard filters and URL.
Per questo strumento non è stato pubblicato alcuno schema di input.
get_model_resultsAccuracy, cost and latency for one model, per grid size.Accuracy, cost and latency for one model, per grid size.
Per questo strumento non è stato pubblicato alcuno schema di input.
list_puzzlesThe benchmark puzzles with ids and row/column clues.The benchmark puzzles with ids and row/column clues.
Per questo strumento non è stato pubblicato alcuno schema di input.
get_puzzle_resultsPer-model outcomes for a puzzle, optionally including parsed grids.Per-model outcomes for a puzzle, optionally including parsed grids.
Per questo strumento non è stato pubblicato alcuno schema di input.
get_model_puzzlesWhich puzzles a model solved, missed, or did not run.Which puzzles a model solved, missed, or did not run.
Per questo strumento non è stato pubblicato alcuno schema di input.
check_solutionCheck a nonogram grid (row-major 0/1 string) against a puzzle's clues.Check a nonogram grid (row-major 0/1 string) against a puzzle's clues.
Per questo strumento non è stato pubblicato alcuno schema di input.
open_puzzleShow a puzzle in the puzzle explorer on this page.Show a puzzle in the puzzle explorer on this page.
Per questo strumento non è stato pubblicato alcuno schema di input.
nonobenchNessuna descrizione pubblicataQuesto strumento non ha pubblicato alcuna descrizione. Forge non se la inventa.
get_puzzleOne puzzle, including the clue text models were prompted with. The reference solution is only included on request; some puzzles have several valid solutions.One puzzle, including the clue text models were prompted with. The reference solution is only included on request; some puzzles have several valid solutions.
Per questo strumento non è stato pubblicato alcuno schema di input.
list_runsIndividual benchmark runs (one model on one puzzle), optionally with the raw prompt and model output.Individual benchmark runs (one model on one puzzle), optionally with the raw prompt and model output.
Per questo strumento non è stato pubblicato alcuno schema di input.
13 strumenti su 14 hanno pubblicato una descrizione.
I nomi e le descrizioni degli strumenti sono scritti dal publisher e mostrati alla lettera come testo inerte. Sono le stringhe che un client MCP passa a un modello, quindi Forge vi cerca schemi di prompt injection — ogni rilievo compare insieme all’analisi di sicurezza qui sopra. «Privilegiato» è una corrispondenza di parola chiave sul nome dello strumento, non una verifica di ciò che fa: un nome innocuo può comunque fare qualsiasi cosa.
An open-source benchmark of how well LLMs solve nonogram puzzles, from 5x5 to 20x20.
I nomi collegati aprono l’indice Forge di tutte le voci osservate esporre quello strumento. Sfoglia tutti gli strumenti indicizzati.
Questa voce non pubblica alcun pacchetto npm, quindi Forge non ha un albero delle dipendenze per essa. È una lacuna di copertura, non l'affermazione che non abbia dipendenze.