● Das Labor · Ein Benchmark für Küchenkompetenz

RezeptEval

RezeptEval lässt KI-Modelle dasselbe Koch-Examen schreiben: achtundsiebzig Aufgaben in sechs Disziplinen, für alle Kandidaten identisch. Ein Skript prüft, was sich nachrechnen lässt; was Ermessenssache ist, benotet ein festgepinnter Richter nach fester Rubrik. Zusammen ergibt das einen Punktwert von 0 bis 100, mit offenen Gewichten.

Was im Hintergrund passiert 76 Sekunden · die Methodik, ohne zu lesen
Aufgaben im Benchmark
LLM-Antworten geprüft
Der Verlauf · Kompetenz über die Zeit
Das Leaderboard

Jede Zeile ist ein Modell, sortiert nach dem RezeptEval-Punktwert von 0 bis 100; der Strich auf dem Balken markiert die aktuelle Spitze. Die ersten drei stehen aufgeklappt da, der Rest ist eine Zeile: Ein Klick öffnet die volle Bewertung. Orange Balken sind objektiv geprüft (Code), blaue Balken zeigen die Panel-Meinung des Richters; der helle Strich auf diesen Balken markiert Ø, den Durchschnitt aller Modelle. Was jede Disziplin genau prüft und wie die Gewichte zusammenspielen, steht unten in der Methodik. Rezepte mit aktiv unsicheren Anweisungen bekommen zusätzlich eine ⚠ Warnung.

Das Labor hat gerade keine Ergebnisse vorliegen. Schauen Sie später wieder herein.
Methodik & Grenzen

Wer lieber zusieht als liest: der Film am Seitenkopf erzählt dasselbe in 76 Sekunden, von der Aufgabe bis zur Note.

Was gemessen wird

Gemessen wird Küchenkompetenz in Textform: die Fähigkeit, präzise, konsistente und regelkonforme Antworten auf Aufgaben rund ums Kochen zu geben. Jedes Modell erhält denselben Satz von 78 Aufgaben in sechs Disziplinen (Methodik-Version 3). Für jede Disziplin ist ausgewiesen, welche Instanz prüft:

Der Richter mit Schlüssel

In Diagnose, Sicherheit und Chemie arbeitet dasselbe festgepinnte Bewertungsmodell in einer zweiten Rolle: Es erhält neben der anonymisierten Antwort den kuratierten Antwortschlüssel und benotet ausschließlich die Übereinstimmung mit diesem Schlüssel auf einer Skala von 1 bis 10. Der Schlüssel kann durch das Modell ergänzt, aber nicht überstimmt werden.

Die Härtefall-Regel

Antworten, die bereits an der Regelprüfung scheitern (nicht parsebare Antwort oder ein objektiver Wert unter 50 von 100), werden dem Richter nicht vorgelegt; ihre Panel-Note geht als Mindestnote 1 in die Wertung ein. Die Regel senkt Bewertungskosten und verhindert zugleich, dass ein Modell seinen Panel-Durchschnitt verbessert, indem es unbequeme Aufgaben auslässt. Die Zahl der tatsächlich benoteten Rezepte ist an jeder Leaderboard-Zeile ausgewiesen.

Sicherheit, zweifach geprüft

Innerhalb der Rezept-Disziplin ist Sicherheit eine Markierung, keine Punktzahl: Markiert werden nur Antworten, die aktiv unsichere Schritte anweisen – Kerntemperatur unter 70 °C, rosa serviertes Geflügel, extrem kurze Garzeit ohne jeden Garhinweis, stundenlanges Abkühlen bei Raumtemperatur (Referenzrahmen: EFSA und BfR). Ein lediglich fehlender Garhinweis wird dort nicht gewertet. Die eigenständige Sicherheits-Disziplin wird dagegen voll bewertet; dort ist Sicherheit die Aufgabe selbst.

Was nicht gemessen wird

Der tatsächliche Geschmack. Keines der Gerichte wurde gekocht oder verkostet. Das Ranking belegt, dass ein Modell präzise, konsistente und regelkonforme Rezepte schreibt – nicht, dass es „der beste Koch" ist.

Die Panel-Meinung im Punktwert

Seit Version 3 fließt die Panel-Note in den Punktwert ein. Das Bewertungsmodell (Claude Opus 4.8, Version festgepinnt) liest jedes Rezept anonymisiert – es erfährt nicht, von welchem Modell die Antwort stammt – und benotet nach einer festen Rubrik von 1 bis 10: Praktikabilität, erwartbarer Geschmack, Kreativität. Jede Note gilt absolut gegen die Rubrik, ohne Paarvergleiche; die Rubrik untersagt es ausdrücklich, Länge oder Formatierung zu belohnen. Der Anteil des Richters am Gesamtwert ist auf 22 Prozent gedeckelt, die objektiven Kriterien behalten die Mehrheit. Wie verlässlich der Richter urteilt, steht im nächsten Abschnitt.

Einschränkungen

Worauf die Methodik sich stützt

Wie man Sprachmodelle fair durch Sprachmodelle bewerten lässt, ist ein aktives Forschungsfeld (LLM-as-a-Judge). Vier Arbeiten daraus sind direkt in diese Methodik eingeflossen:

Die Forschung ist dabei jünger als diese Seite: Zwei der vier Arbeiten erschienen, während das Labor schon lief. Was sich dort ändert, ändert sich auch hier – offen, mit neuer Methodik-Version, nicht still über Nacht.