Offenlegung: GoetheCoach ist unser eigenes Produkt. Lies diesen Test also als Anbietertest. Wir veröffentlichen Testtext, Prompt und alle Ergebnisse, damit du ihn selbst wiederholen kannst. GoetheCoach und dieser Artikel stehen in keiner Verbindung zum Goethe-Institut oder zu OpenAI.
Die kurze Antwort
| Du willst … | Bessere Wahl | Warum |
|---|---|---|
| eine Grammatikregel oder ein Wort verstehen | ChatGPT | geduldig, schnell, erklärt in jeder Sprache |
| Sprechen laut üben | ChatGPT (Sprachmodus) | GoetheCoach deckt nur Schreiben ab |
| Übungsaufgaben und Mustertexte | beide | ChatGPT entwirft frei, GoetheCoach nutzt die offiziellen Aufgabenformate |
| wissen, ob dein Schreiben-Text bestehen würde | GoetheCoach | prüft jeden Leitpunkt, zählt Wörter per Code, bewertet nach festem Raster |
| für denselben Text zweimal dieselbe Bewertung | GoetheCoach | Punkte werden per Code berechnet; derselbe Text liefert dasselbe Ergebnis |
| eine echte Prüfungsnote | keins von beiden | Nur Bewertende des Goethe-Instituts vergeben die Note. Beide liefern Übungsschätzungen |
So haben wir getestet
Am 6. Oktober 2026 haben wir einen B2-Forumsbeitrag (Schreiben Teil 1) mit drei Eigenschaften geschrieben, die echten Bewertenden auffallen würden:
- 173 Wörter, also über dem Minimum von 150.
- Leitpunkt 4 fehlt. Die Aufgabe verlangt Alternativen, der Text nennt keine. Er antwortet nur auf das Gegenargument (Einsamkeit) mit Videokonferenzen.
- Zwei Grammatikfehler: die einem ständig stören (richtig: einen) und ihren Mitarbeiter mehr Vertrauen schenken (Dativ Plural: Mitarbeitern).
Der komplette Testtext:
In den letzten Jahren arbeiten immer mehr Menschen von zu Hause aus. Meiner Meinung nach sollte Homeoffice für alle Berufsgruppen dauerhaft möglich sein, soweit es die Arbeit erlaubt. Zuerst spart man viel Zeit, weil man nicht jeden Tag pendeln muss. Ich selbst habe früher fast zwei Stunden pro Tag im Zug verbracht. Diese Zeit kann man jetzt für die Familie oder für Sport nutzen. Außerdem ist man zu Hause oft konzentrierter, da es keine Kollegen gibt, die einem ständig stören. Ein weiteres Argument ist die Umwelt: Wenn weniger Leute mit dem Auto zur Arbeit fahren, gibt es weniger Stau und weniger Abgase in den Städten. Natürlich sagen manche, dass man im Homeoffice einsam wird und der Kontakt zum Team verloren geht. Das stimmt teilweise. Aber man kann sich regelmäßig in Videokonferenzen austauschen, und gute Teams finden auch online Wege, um in Kontakt zu bleiben. Zusammenfassend bin ich überzeugt, dass die Vorteile deutlich überwiegen. Firmen sollten ihren Mitarbeiter mehr Vertrauen schenken und ihnen die Freiheit geben, selbst zu entscheiden, wo sie am besten arbeiten.
Die Aufgabe: „Homeoffice sollte für alle Berufsgruppen dauerhaft möglich sein." mit vier Leitpunkten: dafür oder dagegen argumentieren, Argumente erläutern, mit einem Gegenargument umgehen, Alternativen nennen. Genau so verlieren B2-Texte am häufigsten Punkte: In unserer Leitpunkte-Analyse fehlte Leitpunkt 4 in 46 % der B2-Texte.
ChatGPT: chatgpt.com, kostenloser Plan, Standardmodell, jedes Mal ein neuer temporärer Chat (ohne Gedächtnis, ohne eigene Anweisungen), fünfmal derselbe Prompt: „Bitte bewerte meinen Text wie ein Goethe-Prüfer: Gib mir eine Punktzahl von 0 bis 100 und sag mir, ob ich bestanden hätte (Bestehensgrenze 60).", danach Aufgabe, die vier Leitpunkte und der Text.
GoetheCoach: die kostenlose Demo-Bewertung auf goethecoach.de (ohne Konto), fünf Durchläufe mit derselben Aufgabe und demselben Text. Die Demo ist unsere schlankste Version: kleineres Modell, kein Ergebnis-Cache.
Ergebnisse: je 5 Durchläufe
| Lauf | ChatGPT gesamt | ChatGPT Aufgabe | „Alle 4 Leitpunkte erfüllt"? | GoetheCoach gesamt | GoetheCoach Aufgabe | Leitpunkt 4 als fehlend erkannt? |
|---|---|---|---|---|---|---|
| 1 | 82 | 23/25 | Ja | 82 | 19/25 | Ja |
| 2 | 82 | 22/25 | Ja | 74 | 19/25 | Ja |
| 3 | 89 | 22/25 | Ja | 74 | 19/25 | Ja |
| 4 | 82 | 22/25 | Ja | 74 | 19/25 | Ja |
| 5 | 82 | 22/25 | Ja | 74 | 19/25 | Ja |
Beide Werkzeuge sagen: bestanden. Und beide schwanken: ChatGPT um 7 Punkte, die GoetheCoach-Demo um 8. „KI ist unzuverlässig, wir nicht" wäre also die falsche Schlagzeile. Der Unterschied liegt darin, woher die Schwankung kommt und was dir das Feedback sagt.
Transkript zum Video
Kann ChatGPT deine Goethe-Prüfung bewerten? Wir haben es gegen GoetheCoach getestet, mit demselben Text, je fünfmal. Der Text: ein B2-Forumsbeitrag, hundertdreiundsiebzig Wörter, zwei Grammatikfehler. Und eine Falle: Leitpunkt vier, Alternativen nennen, fehlt komplett. Wir haben ihn in fünf neue ChatGPT-Chats eingefügt. Zweiundachtzig. Zweiundachtzig. Neunundachtzig. Zweiundachtzig. Zweiundachtzig. Jedes Mal bestanden. Und jedes Mal hieß es: Alle vier Leitpunkte sind erfüllt. Ein paar Zeilen später gibt dieselbe Antwort zu, dass die Alternativen fehlen. Und die Wortzahl? Geschätzt: hundertneunzig, hundertfünfundfünfzig, hundertsiebzig. GoetheCoach hat Leitpunkt vier in allen fünf Durchläufen als fehlend markiert. Jedes Mal dieselben Punkte für die Aufgabe, und die Wörter werden gezählt, nicht geschätzt. Der Unterschied: Die KI meldet nur, was sie sieht, mit einem Zitat für jeden Leitpunkt. Die Punkte berechnet Code, nach einem festen Raster, wie in der echten Prüfung. Fairerweise: Für Grammatik und Sprechen ist ChatGPT ein super Tutor. Aber ob dein Text besteht, sagt dir ein Prüfer, kein Cheerleader. Den ganzen Test und einen kostenlosen Check für deinen eigenen Text findest du auf goethecoach Punkt de.
Was im ChatGPT-Feedback schiefging
1. Es widersprach sich bei den Leitpunkten, jedes Mal
In allen fünf Durchläufen schrieb ChatGPT, alle vier Leitpunkte seien „grundsätzlich behandelt", und später in derselben Antwort, dass der Text keine echten Alternativen nennt. Lauf 3: „Du behandelst alle vier Leitpunkte", dann „Alternativen sind allerdings nur sehr indirekt vorhanden." Die Aufgabenpunkte blieben bei 22–23 von 25, als wäre ein Viertel der Aufgabe ein Detail.
Laut offiziellem B2-Modellsatz wird darauf geachtet, „wie genau die Inhaltspunkte bearbeitet sind". Für Lernende ist genau das teuer: Oben steht „alle Leitpunkte erfüllt, 82 Punkte, klar bestanden", und du hörst auf, dich um den Punkt zu kümmern, der in der echten Prüfung am meisten kostet.
2. Es hat die Wortzahl geschätzt
Dreimal nannte ChatGPT eine Länge: etwa 190, etwa 155 und etwa 170 Wörter. Der Text hat 173. Auf B2 sind mindestens 150 Wörter gefordert; „155" heißt „knapp", „190" heißt „sicher". Ein Sprachmodell liest Text in Tokens, nicht in Wörtern. Ohne Code ist Zählen Raten.
3. Es fand in jedem Lauf andere Fehler
die einem stören wurde in allen fünf Läufen gefunden. ihren Mitarbeiter war dreimal ein Grammatikfehler, einmal ein Stilproblem („verständlich, aber stilistisch besser") und einmal gar nicht erwähnt. Gleicher Text, gleicher Prompt.
4. Es relativierte seine eigene Zahl
Lauf 4 gab 82/100 und ergänzte: Ein strengerer Prüfer würde 75–80 geben, ein wohlwollender über 80. Das ist ehrlich, zeigt aber: Die Zahl ist ein Gefühl, keine Berechnung.
5. Prüfungsfakten: meist richtig, ein erfundenes Detail
Wir fragten auch nach dem Aufbau von B2 Schreiben. Mit Websuche lag ChatGPT beim Wesentlichen richtig: zwei Teile, 75 Minuten, Forumsbeitrag mit mindestens 150 Wörtern, formelle Nachricht mit mindestens 100 Wörtern, 60 von 100 Punkten zum Bestehen. Es nannte aber auch eine feste Aufteilung von 60 Punkten für Teil 1 und 40 für Teil 2 und schrieb sie dem Goethe-Institut zu. Der offizielle B2-Modellsatz veröffentlicht keine Punkte pro Teil, und Drittquellen widersprechen sich. Ein kleines Detail, aber genau die Art selbstsicherer Aussage, die du im Chat nicht überprüfen kannst.
Was ChatGPT gut gemacht hat
Das sprachliche Feedback selbst war gut. Jeder Lauf erklärte einen vs. einem richtig, schlug natürliche B2-Formulierungen vor (Ein weiterer Vorteil besteht darin, dass …) und gab ein konkretes Beispiel für eine Alternative (hybrides Arbeitsmodell). Als Tutor statt als Prüfer ist ChatGPT nützlich.
Was GoetheCoach anders macht
Auch GoetheCoach nutzt ein Sprachmodell. Der Unterschied ist die Architektur drumherum:
- Das Modell vergibt keine Punkte. Es meldet Beobachtungen: für jeden Leitpunkt vollständig / teilweise / fehlt mit dem Satz, der ihn abdeckt, jeden Fehler mit Zitat und ein Band für Kohärenz, Wortschatz und Strukturen.
- Code macht aus den Beobachtungen die Punkte. Gleiche Beobachtungen ergeben immer gleiche Punkte. Deshalb lag die Aufgabenerfüllung in allen fünf Läufen bei 19/25: „3 vollständig, 0 teilweise, 1 fehlend".
- Wörter werden per Code gezählt, nie geschätzt.
- Temperatur 0 und Ergebnis-Cache in der App: Reichst du denselben Text noch einmal ein, bekommst du dasselbe Ergebnis, keinen neuen Würfelwurf.
- Das Bewertungsraster ist versioniert (Rubrik 1.0) und baut auf den vier offiziellen Kriterien auf: Aufgabenerfüllung, Kohärenz, Wortschatz, Strukturen. Mehr dazu in So wird Goethe-Schreiben bewertet.
So funktioniert auch die echte Prüfung. Laut den Durchführungsbestimmungen zum Goethe-Zertifikat B2 bewerten zwei unabhängige Bewertende das Modul Schreiben nach festgelegten Kriterien, und es dürfen nur die vorgegebenen Punktwerte je Kriterium vergeben werden, keine Zwischenwerte. Ein festes Verfahren ist der Kern.
Das deckt sich mit der Forschung dazu, was KI-Bewertung stabil macht. Eine Studie in Education Sciences (Garcia-Varela u. a., 2025) fand: Mit wenig Anleitung vergab ChatGPT schwankende Noten; ein Bewertungsraster verringerte die Schwankung, beseitigte sie aber nicht. Stabil wurde die Bewertung erst mit einem beispielreichen Raster, festem Ausgabeformat, niedriger Temperatur und einer Entscheidungstabelle, die Urteile in Punkte übersetzt.
Wo GoetheCoach schwächer ist
- Auch die Demo schwankte (74 vs. 82). Die Schwankung kam von einer Einschätzung bei Wortschatz und Strukturen, nicht von den Leitpunkten. Die App mit Konto nutzt ein größeres Modell und speichert Ergebnisse, aber zwei verschiedene Texte ähnlicher Qualität können trotzdem in unterschiedlichen Bändern landen.
- Nur Schreiben. Für Sprechen, Lesen und Hören brauchst du anderes Material, und der Sprachmodus von ChatGPT ist fürs Sprechen wirklich hilfreich.
- Keine offizielle Note. Kein Werkzeug kann dir dein genaues Prüfungsergebnis sagen. Behandle jede Punktzahl als Übungsschätzung; für eine zweite Meinung bietet GoetheCoach einen Lehrkraft-Check an.
Was die Forschung über ChatGPT als Bewerter sagt
| Studie | Was getestet wurde | Ergebnis |
|---|---|---|
| Seßler u. a., LAK 2025 | 20 deutsche Schulaufsätze, 37 Lehrkräfte, GPT-3.5, GPT-4, o1 und offene Modelle | o1 korrelierte gut mit den Lehrkräften (ρ = 0,74), aber die Modelle vergaben tendenziell höhere Noten und waren beim Inhalt schwächer |
| Kubesch, Huber & Havas, 2026 | 101 österreichische Deutsch-Maturaarbeiten, vier offene Modelle mit offiziellem Raster | höchstens 40,6 % Übereinstimmung in den Teilkriterien; nur 32,8 % der Endnoten stimmten mit der Expertin bzw. dem Experten überein |
| Lau, 2026 | GPT-4o-, Gemini- und Claude-Modelle als Bewerter, wiederholte Läufe | gleiche Eingabe, verschiedene Punkte, selbst bei Temperatur 0 |
| Saricaoglu & Bilki, 2025 | ChatGPT-4-Feedback zu 35 englischen B2-Aufsätzen | Fehlererkennung zu 96–99 % korrekt, aber nur 37 % des Feedbacks zur Aufgabenerfüllung waren konkret |
| Yancey u. a., BEA 2023 | GPT-4 bewertet kurze englische L2-Texte auf der GER-Skala | mit Kalibrierungsbeispielen fast so gut wie spezialisierte Systeme; Übereinstimmung variierte je nach Erstsprache |
Zwei Muster wiederholen sich. Sprachmodelle erkennen Sprachfehler gut und beurteilen schlechter, ob die Aufgabe erfüllt ist. Und ihre Punkte driften, solange kein festes Verfahren Urteile in Punkte übersetzt. Beides kostet im Goethe-Modul Schreiben Punkte, wo die Aufgabenerfüllung eines von vier Kriterien ist.
Dazu kommt der Ton. Im April 2025 nahm OpenAI ein ChatGPT-Update zurück, weil das Modell zu gefällig geworden war: zu zustimmend und zu schnell mit Lob. Das ist behoben, aber ein allgemeiner Assistent ist auf Hilfsbereitschaft und Ermutigung ausgelegt. Ein Prüfer ist darauf ausgelegt, zu finden, was fehlt.
So nutzt du ChatGPT gut für die Goethe-Vorbereitung
Wenn du ChatGPT nutzt, schließen diese Gewohnheiten die meisten Lücken aus unserem Test:
- Erst eine Leitpunkt-Tabelle, dann die Punkte. „Zitiere für jeden Leitpunkt den Satz, der ihn behandelt, oder schreib FEHLT." Ein erzwungenes Zitat macht es schwerer, „erfüllt" zu sagen, wenn nichts da ist.
- Zähl die Wörter selbst. Jeder Editor macht das mit einem Klick.
- Lass dir Fehler als Liste geben, keine Note. Fehler finden kann ChatGPT gut, Punkte vergeben nicht.
- Lass zweimal bewerten. Weichen die Punkte ab, ist keiner der beiden Werte verlässlich.
- Nutze es für seine Stärken: Erklärungen, Wortschatz, Redemittel und mündliches Üben fürs Sprechen.
- Prüfungsfakten auf goethe.de prüfen. Formate, Zeiten und Bestehensgrenzen stehen dort.
Für einen schnellen Check eines fertigen Textes gegen das Raster probier den kostenlosen Schreiben-Check oder übe eine komplette Aufgabe mit GoetheCoach.
Häufige Fragen
Kann ChatGPT meinen Goethe-Schreiben-Text verlässlich bewerten?
Nicht verlässlich. In unserem Test gab es demselben B2-Text in fünf Chats 82 bis 89 Punkte und meldete alle vier Leitpunkte als erfüllt, obwohl einer fehlte. Nutze es für Erklärungen und Fehlersuche und prüf die Leitpunkte selbst.
Ist ChatGPT gut für die Vorbereitung auf die Goethe-Prüfung?
Ja, als Tutor. Es erklärt Grammatik, schlägt Formulierungen vor, erzeugt Übungstexte, und sein Sprachmodus hilft beim Sprechen. Vorsicht bei Punktzahlen, Wortzahlen und Prüfungsfakten ohne Quelle.
Ist GoetheCoach besser als ChatGPT?
Für die Bewertung von Schreiben ja: Es prüft jeden Leitpunkt, zählt Wörter per Code und berechnet die Punkte nach einem festen Raster. Fürs Sprechen und für offene Fragen ist ChatGPT flexibler. Viele Lernende nutzen beides.
Nutzt GoetheCoach ChatGPT?
GoetheCoach nutzt ein Sprachmodell, um den Text zu lesen, aber das Modell vergibt keine Punkte. Es meldet Beobachtungen, und Code berechnet daraus die Punkte nach einem versionierten Raster auf Basis der vier offiziellen Goethe-Kriterien.
Bekomme ich in der Goethe-Prüfung dieselbe Punktzahl wie bei einem KI-Tool?
Nicht unbedingt. Nur Bewertende des Goethe-Instituts benoten die Prüfung: Schreiben wird von zwei unabhängigen Bewertenden bewertet, und liegen sie um die Bestehensgrenze auseinander, entscheidet eine dritte Bewertung. Jede KI-Punktzahl, auch die von GoetheCoach, ist eine Übungsschätzung.
Welchen ChatGPT-Plan habt ihr getestet?
Den kostenlosen Plan auf chatgpt.com mit dem Standardmodell, in temporären Chats ohne Gedächtnis, am 6. Oktober 2026. Bezahlpläne und Denkmodi können sich anders verhalten. Wiederhole den Test am besten mit deinem eigenen Text.
Quellen
- Goethe-Institut: Goethe-Zertifikat B2, Modellsatz Schreiben
- Goethe-Institut: Durchführungsbestimmungen Goethe-Zertifikat B2 (§ 4.3 Modul Schreiben)
- Seßler, Fürstenberg, Bühler & Kasneci (2025): Can AI grade your essays?, LAK '25
- Kubesch, Huber & Havas (2026): Evaluating Austrian A-Level German Essays with Large Language Models
- Lau (2026): Same Input, Different Scores
- Garcia-Varela u. a. (2025): ChatGPT as a Stable and Fair Tool for Automated Essay Scoring, Education Sciences 15(8)
- Saricaoglu & Bilki (2025): The capacity of ChatGPT-4 for L2 writing assessment, Annual Review of Applied Linguistics
- Yancey, Laflair, Verardi & Burstein (2023): Rating Short L2 Essays on the CEFR Scale with GPT-4, BEA 2023
- OpenAI (2025): Expanding on what we missed with sycophancy
Lass jeden Leitpunkt prüfen, nicht schätzen
Schreib eine B2- oder C1-Aufgabe und sieh, welche Leitpunkte erfüllt sind, wie viele Wörter du hast und warum du welche Punkte bekommst.
Kostenlos starten