An open-source benchmark of how well LLMs solve nonogram puzzles, from 5x5 to 20x20.
Abgeleitet aus den Transporten, die dieser Eintrag deklariert (streamable-http). Ein Client, der hier nicht steht, ist damit nicht ausgeschlossen — Forge kann ihn nur nicht bestätigen.
Die Verifizierung bestätigt die Identität des Publishers (die Inhaberschaft am Repo), nicht die Sicherheit des Codes. Der Sicherheits-Scan deckt bekannte CVEs und verdächtige Installationsskripte ab.
Aus dem Quellcode gelesen, den npm tatsächlich ausliefert, zum Zeitpunkt des Scans. Das Paket wurde nie ausgeführt. Tools, die zur Laufzeit dynamisch registriert werden oder in gebündeltem beziehungsweise minifiziertem Code stecken, können übersehen werden — das hier ist also eine Untergrenze der Tool-Oberfläche, keine vollständige Erhebung.
get_leaderboardNonobench models ranked by accuracy, overall or for one grid size. Effort defaults to all levels; use effort=best to match the homepage.Nonobench models ranked by accuracy, overall or for one grid size. Effort defaults to all levels; use effort=best to match the homepage.
Für dieses Tool wurde kein Eingabeschema veröffentlicht.
list_providersProvider ids, names, families and variant counts.Provider ids, names, families and variant counts.
Für dieses Tool wurde kein Eingabeschema veröffentlicht.
list_familiesModel families, efforts and best variants.Model families, efforts and best variants.
Für dieses Tool wurde kein Eingabeschema veröffentlicht.
compare_modelsCompare two or more model ids or family names side by side.Compare two or more model ids or family names side by side.
Für dieses Tool wurde kein Eingabeschema veröffentlicht.
set_filtersUpdate the visible leaderboard filters and URL.Update the visible leaderboard filters and URL.
Für dieses Tool wurde kein Eingabeschema veröffentlicht.
get_model_resultsAccuracy, cost and latency for one model, per grid size.Accuracy, cost and latency for one model, per grid size.
Für dieses Tool wurde kein Eingabeschema veröffentlicht.
list_puzzlesThe benchmark puzzles with ids and row/column clues.The benchmark puzzles with ids and row/column clues.
Für dieses Tool wurde kein Eingabeschema veröffentlicht.
get_puzzle_resultsPer-model outcomes for a puzzle, optionally including parsed grids.Per-model outcomes for a puzzle, optionally including parsed grids.
Für dieses Tool wurde kein Eingabeschema veröffentlicht.
get_model_puzzlesWhich puzzles a model solved, missed, or did not run.Which puzzles a model solved, missed, or did not run.
Für dieses Tool wurde kein Eingabeschema veröffentlicht.
check_solutionCheck a nonogram grid (row-major 0/1 string) against a puzzle's clues.Check a nonogram grid (row-major 0/1 string) against a puzzle's clues.
Für dieses Tool wurde kein Eingabeschema veröffentlicht.
open_puzzleShow a puzzle in the puzzle explorer on this page.Show a puzzle in the puzzle explorer on this page.
Für dieses Tool wurde kein Eingabeschema veröffentlicht.
nonobenchKeine Beschreibung veröffentlichtDieses Tool hat keine Beschreibung veröffentlicht. Forge erfindet keine.
get_puzzleOne puzzle, including the clue text models were prompted with. The reference solution is only included on request; some puzzles have several valid solutions.One puzzle, including the clue text models were prompted with. The reference solution is only included on request; some puzzles have several valid solutions.
Für dieses Tool wurde kein Eingabeschema veröffentlicht.
list_runsIndividual benchmark runs (one model on one puzzle), optionally with the raw prompt and model output.Individual benchmark runs (one model on one puzzle), optionally with the raw prompt and model output.
Für dieses Tool wurde kein Eingabeschema veröffentlicht.
13 von 14 Tools haben eine Beschreibung veröffentlicht.
Tool-Namen und -Beschreibungen stammen vom Publisher und werden wortgetreu als inerter Text angezeigt. Es sind die Zeichenketten, die ein MCP-Client an ein Modell übergibt, deshalb prüft Forge sie auf Prompt-Injection-Muster — jeder Befund erscheint oben beim Sicherheits-Scan. „Privilegiert“ ist ein Schlagwort-Treffer im Tool-Namen, keine Prüfung dessen, was das Tool tut: ein harmlos klingender Name kann trotzdem alles tun.
An open-source benchmark of how well LLMs solve nonogram puzzles, from 5x5 to 20x20.
Verlinkte Namen öffnen den Forge-Index aller Einträge, bei denen dieses Tool beobachtet wurde. Alle indexierten Tools durchsuchen.
Dieser Eintrag veröffentlicht kein npm-Paket, daher hat Forge keinen Abhängigkeitsbaum dafür. Das ist eine Lücke in der Abdeckung — keine Aussage, dass er keine Abhängigkeiten hat.