Gibt ChatGPT allen dieselbe Antwort?
Im November und Dezember 2025 führten Rand Fishkin von SparkToro und Patrick O’Donnell von Gumshoe.ai eine Studie durch, für die sie 2.961 Prompts durch ChatGPT, Claude und Googles AI Overviews schickten – jeden Prompt 60- bis 100-mal wiederholt. Gefragt wurde nach Empfehlungen: die besten Kochmesser, die besten Scheidungsanwälte, die besten Noise-Cancelling-Kopfhörer. Zwei Durchläufe derselben Frage lieferten in weniger als 1 Prozent der Versuche exakt dieselbe Markenliste. Dieselbe Liste in derselben Reihenfolge kam in unter 0,1 Prozent der Fälle zurück – seltener als einmal von tausend.
Das ist die Antwort auf die Frage im Titel. ChatGPT antwortet auf zwei identische Fragen nicht zweimal nach demselben Skript.
Warum sich die Antwort zwischen zwei identischen Fragen verschiebt
Die meisten KI-Chatprodukte für Verbraucher erzeugen Text nicht, indem sie stets das wahrscheinlichste nächste Wort wählen. Sie sampeln: Jedes Wort entsteht aus einer gewichteten Schätzung unter mehreren plausiblen Kandidaten, gesteuert über eine Einstellung namens Temperatur, die festlegt, wie viel Spielraum diese Schätzung bekommt. Bei Temperatur null würde ein Modell fast deterministisch – es würde also fast immer dieselbe Antwort wiederholen. Verbraucher-Chatprodukte laufen nicht bei null. Sie laufen mit genug Spielraum, dass sich die Formulierung verschiebt, und manchmal verschiebt sich die eigentliche Markenliste mit.
Das ist kein Fehler, der irgendwann behoben wird. Es ähnelt eher einer Münze, die absichtlich ein wenig verbogen ist: Ein Modell, das immer die statistisch wahrscheinlichste Formulierung ausgäbe, würde über Millionen Gespräche hinweg steif und repetitiv wirken. Derselbe Mechanismus, der die Sprache eines Chatbots abwechslungsreich hält, lässt auch seine Markenempfehlungen schwanken.
Eine Antwort ist eine Stichprobe, kein Urteil
Ein Unternehmen, das seinen eigenen Namen einmal in ChatGPT eingibt, sich selbst erwähnt sieht und daraus schließt, in der KI-Suche „sichtbar“ zu sein, hat damit fast nichts gelernt. Das entspricht dem Befragen einer einzigen Kundin und der Verallgemeinerung auf einen ganzen Markt. Die SparkToro-Zahlen setzen genau dafür eine Größenordnung: Wenn dieselbe Frage zweimal gestellt in unter 1 Prozent der Fälle dieselbe Liste liefert, sagt eine gute Antwort heute sehr wenig darüber aus, was dieselbe Frage morgen zurückgibt.
Ehrlich lässt sich das nur messen, indem wiederholt gefragt und eine Quote berichtet wird – erkannt in 6 von 10 Antworten, zum Beispiel, statt erkannt oder nicht erkannt. KI-Sichtbarkeit auf diese Weise zu messen verhält sich weniger wie eine feststehende Tatsache und mehr wie ein Trefferquotient über eine ganze Saison, und dieselbe Logik macht aus einer rohen Erwähnungszahl so etwas wie einen Share of Voice: einen Anteil über viele Versuche, keine einzelne Ja-oder-Nein-Antwort.
Wie eine Messung mit dem Rauschen umgeht
Eine Prüfung, die das messen will, fragt nicht nur einmal. Sie stellt dieselbe Frage mehreren unterschiedlichen Modellen – nicht nur ChatGPT, sondern einem kleinen Bestand verschiedener Systeme – und fragt jedes Modell mehr als einmal, wobei das Sampling bewusst nicht auf null gestellt wird, weil genau das die gemessene Schwankung verdecken würde. Jede zurückkommende Antwort landet in einer von drei Kategorien: Sie nennt das Unternehmen klar beim Namen, sie antwortet mit einer allgemeinen Definition dessen, was der Name üblicherweise bedeutet – ein Zeichen, dass das Modell das Unternehmen gar nicht kennt und nur die Wörter interpretiert –, oder sie sagt offen, dass ihr keine Informationen vorliegen. Nur der erste Fall zählt als echtes Erkennen.
Das lässt eine Einschränkung offen, die eher ausgesprochen als verschwiegen werden sollte. Zwei Antworten pro Modell reichen aus, um zu bemerken, dass sich eine Antwort zwischen zwei Versuchen verändert hat. Sie reichen nicht aus, um eine belastbare, enge Zahl dafür festzulegen, wie oft das passiert – eine aus zwei Stichproben berechnete Quote trägt ihre eigene, reale Unsicherheit, und wer „erkannt in 1 von 2 Versuchen“ liest, sollte das als grobes Signal lesen, nicht als präzisen Wert. Eine engere Zahl bräuchte mehr Wiederholungen, als die meisten Prüfungen – auch diese Art – derzeit fahren, weil jede Wiederholung eine eigene, separat abgerechnete Anfrage an einen Modellanbieter ist. Dieser Teil einer Prüfung – eine direkte, ungestützte Frage ohne Begleitmaterial an ein Modell – läuft außerdem nur in einem tieferen, kostenpflichtigen Durchlauf. Ein kostenloser Scan überspringt ihn vollständig und bleibt bei dem, was ein Crawler bei einem einzigen Besuch von der Website lesen kann – ein anderer, engerer Beleg als die Frage, was ein Modell bereits zu wissen glaubt.
Was ein Unternehmen tatsächlich tun kann
Den Zufall selbst kann ein Unternehmen nicht abschalten. Er ist eine bewusste Eigenschaft der Art, wie diese Systeme Text erzeugen, kein verstecktes Einstellungsfeld, das nur noch gefunden werden müsste. Was sich verschieben lässt, ist die Quote: wie oft ein Modell über wiederholte Versuche hinweg bei der Erkennung eines bestimmten Unternehmens landet, statt eine allgemeine Definition eines gängigen Begriffs zu wiederholen oder zuzugeben, dass es nichts weiß. Ein Unternehmen, dessen Name, Leistungen und Standort auf der eigenen Website klar und konsistent dargestellt sind, verschafft jedem dieser wiederholten Versuche etwas bessere Chancen, bei der richtigen Antwort zu landen. Keiner davon wird dadurch garantiert. Was sich verschiebt, ist der Durchschnitt über viele Versuche – und das ist die einzige Zahl, auf die es hier je ankam. Wie ein Modell eine Seite grundsätzlich liest, bevor es überhaupt eine Frage zu einer Marke beantwortet, steckt unter diesem Durchschnitt, ganz gleich, ob die Frage einmal oder hundertmal gestellt wird.
Ein Screenshot, auf dem ChatGPT ein Unternehmen nennt – oder eben nicht –, beweist weniger, als er zu beweisen scheint. Vertrauenswürdig ist die Zahl, die aus mehrfachem Fragen entsteht, und selbst die kommt mit einer eigenen Fehlerspanne: zu wissen, dass sich eine Antwort verändert hat, ist nicht dasselbe wie zu wissen, um wie viel.
Häufig gestellte Fragen
Gibt ChatGPT jedem dieselbe Antwort?
Nein. Eine Studie, die 2.961 identische Prompts 60- bis 100-mal durch ChatGPT, Claude und Googles AI Overviews schickte, fand dieselbe Markenliste bei wiederholten Versuchen in unter 1 Prozent der Fälle – und dieselbe Reihenfolge in unter 0,1 Prozent. Zwei Personen, die dieselbe Frage stellen, sehen selten dieselbe Liste von Namen.
Warum antwortet ChatGPT bei derselben Frage jedes Mal anders?
Die meisten Verbraucher-Chatprodukte erzeugen Text durch Sampling: Jedes nächste Wort ist eine gewichtete Schätzung statt immer die wahrscheinlichste Wahl. Dieses Sampling wird absichtlich über null gehalten, sodass sich Formulierung und manchmal die genannte Markenliste zwischen zwei Durchläufen derselben Frage verschieben können.
Wenn Antworten schwanken, wie lässt sich dann überhaupt messen, ob ein Unternehmen von KI genannt wird?
Indem dieselbe Frage wiederholt gestellt und eine Quote statt einer einzelnen Ja-/Nein-Antwort berichtet wird. Eine einzelne Antwort ist eine Stichprobe, kein Urteil. Eine so aufgebaute Messung fragt mehr als ein Modell, jedes davon mehr als einmal, und berichtet, wie oft der Name eines Unternehmens auftauchte – statt einem einzigen Versuch zu vertrauen.
Tritt diese Schwankung auch bei Claude und Googles AI Overviews auf?
Ja. Dieselbe Studie fand sie bei allen drei getesteten Systemen, nicht nur bei ChatGPT. Welche Marke als Top-Antwort erscheint, kann sich je nach gefragtem System unterscheiden – zusätzlich zu der Schwankung, die ein einzelnes System schon gegen sich selbst zeigt.
Kann ein Unternehmen etwas gegen den Zufall selbst tun?
Gegen den Zufall nicht. Sampling ist eine bewusste Designentscheidung in diesen Systemen, die sich von außen nicht abschalten lässt. Beeinflussbar ist die Quote: Ein Unternehmen mit klaren, konsistenten, gut strukturierten Fakten darüber, was es anbietet und wo, wird über wiederholte Versuche hinweg tendenziell häufiger genannt – auch wenn kein einzelner Versuch je garantiert ist.
