Zum Inhalt springen

KI-Sichtbarkeit messen: Welche Kennzahlen wirklich zählen

Denselben KI-Sichtbarkeits-Scan zweimal innerhalb einer Woche über dieselbe Startseite laufen lassen, ohne dass sich an der Seite etwas geändert hat, und die beiden Berichte widersprechen sich – nicht um einen Rundungsfehler, sondern um mehrere Punkte. Die Seite ist in dieser Woche weder besser noch schlechter geworden. Ein Teil dessen, was gemessen wurde, schon.

Eine Zahl, mindestens drei verschiedene Messgrößen

Ein Sichtbarkeits-Score fasst meist Dinge zusammen, die sich völlig unterschiedlich verhalten. Ob ein KI-Crawler eine Seite erreichen kann, ist ein Fakt – entweder erlaubt oder blockiert, und das ändert sich nicht von selbst zwischen zwei Scans im Stundenabstand. Ob strukturierte Daten sich sauber auflösen, gehört in dieselbe Kategorie. Ob ein Modell ein Unternehmen zitiert oder empfiehlt, wenn danach gefragt wird, entsteht dagegen aus einer offenen, live gestellten Frage an ein Sprachmodell – und ein Modell beantwortet eine offene Frage nicht jedes Mal identisch.

Alle drei als eine gemeinsame Trendlinie zu behandeln, verschleiert, welcher Teil sich tatsächlich bewegt hat. Ein Score, der um fünf Punkte fällt, kann bedeuten, dass eine Crawler-Regel kaputtgegangen ist – oder dass ein Modell eine Empfehlungsfrage diese Woche anders beantwortet hat als letzte. Beides verlangt eine völlig andere Reaktion.

Eine Null ist nicht immer eine Null

Jede einzelne Prüfung innerhalb eines Sichtbarkeitsberichts landet bei einem von wenigen Ergebnissen: Sie hat etwas gefunden, sie hat nichts gefunden, oder sie hat gar keine Antwort bekommen. Die letzten beiden sehen auf einem Dashboard identisch aus, wenn niemand sie auseinanderhält – beide können als leeres Feld oder als Null erscheinen –, bedeuten aber das Gegenteil voneinander. “Nichts gefunden” ist eine gesicherte Antwort: Die Quelle wurde befragt und hält zu dieser Frage tatsächlich keine Daten bereit, etwa eine Domain ohne Eintrag in einem öffentlichen Register. “Keine Antwort bekommen” heißt, eine Anfrage lief ins Leere, ein Dienst dahinter meldete einen Serverfehler, oder die Zeit für den Lauf war schon abgelaufen, bevor die Prüfung überhaupt an der Reihe war. In beiden Fällen wurde nichts über die Seite gelernt – und das als bestätigte Null auszuweisen, ist ein anderer Fehler als eine echte, stabile Tatsache falsch zu berichten.

Ein sorgfältig gebauter Bericht hält diese beiden Fälle absichtlich auseinander, denn wer sie vermischt, behauptet “geprüft und sauber”, wo die ehrliche Antwort “nicht geprüft” lautet. Wer liest, “keine strukturierten Daten gefunden”, sollte erkennen können, ob das eine echte Lücke ist – oder eine Quelle, die diesmal einfach nicht geantwortet hat.

Basis-Scan und Deep Scan prüfen nicht denselben Ausschnitt der Checkliste

Dasselbe Prinzip gilt auch für den gesamten Score, nicht nur für ein einzelnes Feld darin. Ein schneller Basis-Scan und ein vollständiger Deep Scan laufen nicht dieselbe Prüfliste – ein Basis-Lauf überspringt den Crawl, das Rendern im Browser und die meisten externen Quellen –, weshalb ein Basis-Score derselben Seite nicht eins zu eins mit einem Deep-Scan-Score vergleichbar ist, auch nicht mit dem Deep-Scan-Score einer anderen Seite. Was ein GEO-Audit tatsächlich prüft beschreibt, wie sich das in der Zahl selbst niederschlägt – hier reicht die Kurzfassung: Welche Stufe hinter einem Score steckt, zählt genauso wie der Score selbst.

Zitierung und Empfehlung brauchen mehr als eine Frage

Die modellseitige Hälfte eines Sichtbarkeits-Scores zerfällt meist in zwei getrennte Größen: ob ein Modell ein Unternehmen korrekt beschreibt, wenn direkt danach gefragt wird, und ob es das Unternehmen von sich aus nennt, wenn eine Kategorie-Frage gestellt wird, die keinen Namen enthält. Weil beide aus einer offenen, live gestellten Modellfrage stammen, ist eine einzelne Antwort eine Stichprobe von eins. Eine genauere Betrachtung dieser Trennung geht darauf ein, warum ein Unternehmen die erste Prüfung bestehen und an der zweiten scheitern kann – entscheidend ist hier: Beide Werte brauchen dieselben Fragen mehrfach, in unterschiedlichen Formulierungen, über mehr als ein Modell hinweg, bevor man sie als Trend statt als Zufallstreffer eines einzelnen Tages lesen kann.

Was sich wirklich über die Zeit zu beobachten lohnt

Nicht jeder Teil eines Sichtbarkeitsberichts braucht denselben Prüfrhythmus. Crawler-Zugriffsregeln und strukturierte Daten sind nahezu binär und verändern sich nicht ohne eine bewusste Anpassung – ein kostenloser Scan deckt diese stabile Hälfte in einem Durchlauf ab, eine gelegentliche Prüfung reicht meist. Zitierrate und Empfehlungshäufigkeit stammen aus einem lebendigen, schwankenden Prozess und werden erst nach wiederholten Läufen über mehrere Formulierungen und Modelle hinweg zu einem Trend, dem man trauen kann. Jedes davon im eigenen Rhythmus zu prüfen, statt auf eine verrechnete Gesamtzahl zu starren, zeigt tatsächlich, ob sich etwas verbessert, verschlechtert oder nur anders gewürfelt hat. Die vollständige Checkliste hinter der stabilen und der abgefragten Hälfte steht in der Methodik.

Eine einzelne Zahl eignet sich gut für ein Dashboard. Als Werkzeug, um zu entscheiden, was sich verändert hat und warum, taugt sie wenig – sie kann eine echte Verbesserung nicht von einer Quelle unterscheiden, die diesmal endlich geantwortet hat, nachdem sie es zuvor nicht erreicht hat, oder von einem Modell, das eine Empfehlungsfrage eine Woche später einfach anders beantwortet. Die Teile unter der Zahl sind unordentlicher als die Zahl selbst – und genau sie erklären tatsächlich, was sich verändert hat.

Häufig gestellte Fragen

Warum liefern zwei Scans derselben, unveränderten Seite manchmal unterschiedliche Werte?

Ein Teil eines Sichtbarkeits-Scores basiert auf stabilen, binären Fakten – kann ein KI-Crawler die Seite erreichen, lösen sich strukturierte Daten sauber auf. Ein anderer Teil entsteht dadurch, dass ein echtes Modell eine offene Frage beantwortet, und Modelle liefern bei offenen Fragen nicht zweimal dieselbe Antwort. Der stabile Teil sollte sich zwischen zwei Scans nicht bewegen. Der abgefragte Teil kann es – und ein Bericht, der beides zu einer Zahl verrechnet, kann sich verschieben, obwohl an der Seite nichts geändert wurde.

Was unterscheidet eine Kennzahl mit 'nicht gefunden' von einer mit 'nicht geprüft'?

'Nicht gefunden' bedeutet: Die Prüfung hat eine gesicherte Antwort erhalten, und die Seite hat tatsächlich nichts von dem, wonach gesucht wurde – etwa keine strukturierten Daten. 'Nicht geprüft' bedeutet: Die Prüfung kam nie zu einer Antwort, weil eine Anfrage zu lange dauerte, ein Dienst dahinter einen Fehler zurückgab oder die Zeit für den Lauf schon vorbei war. Beides in dasselbe leere Feld oder dieselbe Null zu packen, suggeriert 'geprüft und sauber', wo die ehrliche Antwort 'nicht geprüft' lautet.

Reicht ein einzelner KI-Sichtbarkeits-Score, um ihn Monat für Monat zu verfolgen?

Allein nicht. Eine einzelne, verrechnete Zahl kann sich aus Gründen bewegen, die nichts mit der Seite selbst zu tun haben – etwa eine Quelle, die diesmal nicht geantwortet hat, oder ein Modell, das eine Empfehlungsfrage anders beantwortet als beim letzten Mal. Wer die einzelnen Bestandteile getrennt beobachtet, sieht, welcher Teil sich tatsächlich verändert hat – eine einzelne Zahl zeigt das nicht.

Wie oft muss eine Zitier- oder Empfehlungsprüfung laufen, damit sie etwas aussagt?

Mehr als einmal. Ein Modell, das dieselbe offene Frage im Abstand weniger Minuten gestellt bekommt, kann zwei unterschiedliche Antworten liefern – eine einzelne Antwort ist also eine Stichprobe von eins. Ein belastbares Bild braucht dieselben Fragen mehrfach, in verschiedenen Formulierungen und über mehr als ein Modell hinweg – nicht eine einzelne gute oder schlechte Antwort als letztes Wort.

Welche KI-Sichtbarkeits-Kennzahlen reichen mit gelegentlicher Prüfung, welche brauchen wiederholte Tests?

Crawler-Zugriffsregeln und strukturierte Daten sind nahezu binär und verändern sich nicht von selbst – eine gelegentliche Prüfung reicht meist aus. Ob ein Modell ein Unternehmen zitiert oder empfiehlt, entsteht aus einem lebendigen, schwankenden Prozess und wird erst nach wiederholten Tests über mehrere Formulierungen und Modelle hinweg zu einem Trend, dem man trauen kann.