Zum Inhalt springen

Share of Voice in KI-Antworten: Berechnung und Tücken

Ein Sprachmodell fragen, wer die besten Steuerberater in Leipzig sind. Die genannten Namen notieren. Dieselbe Frage noch einmal stellen – gleiches Modell, gleicher Wortlaut, gleicher Tag – und die Liste kann anders aussehen. Nicht nur umsortiert. Andere Namen.

Genau diese Beobachtung steckt im Kern dessen, was Share of Voice in KI-Antworten messen soll, und genau daran liegt es, dass die Zahl schwerer zu glauben ist, als sie aussieht. Es ist eine reale Kennzahl mit einer echten Formel dahinter, gemessen von echten Tools. Und sie wird auf eine Kommastelle genau berichtet für etwas, das sich zwischen zwei identischen Fragen nicht einmal selbst gleichbleibt.

Was soll Share of Voice in KI-Antworten eigentlich messen?

Die Definition, auf die sich die meisten Anbieter einigen: wie oft und wie prominent eine Marke in KI-generierten Antworten auftaucht, im Verhältnis zum Wettbewerb, über eine Menge von Prompts, die jemand in dieser Kategorie tatsächlich eingeben würde. HubSpots eigenes Glossar formuliert es fast identisch – der Anteil an den KI-Antworten einer Kategorie, den eine bestimmte Marke für sich gewinnt (HubSpot).

Der Begriff stammt direkt aus der klassischen Media-Planung, wo Share of Voice eine feste, prüfbare Gesamtgröße hat: das gesamte Werbebudget eines Marktes etwa, oder alle Impressions über festgelegte Kanäle. Diese Gesamtgröße existiert, ganz gleich, ob sie jemand misst oder nicht. Share of Voice in KI-Antworten übernimmt den Namen und das Prozentformat – aber nicht diese Eigenschaft. Genau dort beginnt das Problem.

Wie wird die Zahl tatsächlich berechnet?

Semrushs Leitfaden liefert die einfache Version: zählen, wie oft Antwortmaschinen Marken über eine festgelegte Prompt-Menge hinweg nennen, die Erwähnungen einer Marke durch die Gesamterwähnungen teilen, mal 100. Hundert Erwähnungen in einer Kategorie, fünfundzwanzig davon für eine Marke, ergibt einen Anteil von 25 Prozent (Semrush). Semrushs eigenes kommerzielles Tool legt darüber noch eine Positionsgewichtung – an erster Stelle genannt zu werden zählt mehr als an fünfter –, aber die Grundrechnung bleibt überall dieselbe: Erwähnungen geteilt durch Gesamterwähnungen.

Diese Formel ist unkompliziert. Die zwei Wörter, die dabei am wenigsten leisten, sind “Gesamterwähnungen”. Wie ein Modell eine Marke überhaupt liest und einordnet, spielt hier ebenfalls mit hinein – Share of Voice ist diesem Prozess nachgeschaltet, kein eigenständiges Signal, wie der KI-SEO-Ratgeber im Detail zeigt.

Warum bedeutet die Gesamtsumme nicht, was sie zu bedeuten scheint?

Weil niemand jede jemals gegebene KI-Antwort zu einer Kategorie mitzählt. Was tatsächlich gezählt wird, ist eine bestimmte, endliche Menge an Prompts, gegen eine bestimmte Menge an Modellen, an einem bestimmten Tag – und welche Konkurrenznamen in genau diesem Antwortstapel zufällig auftauchen. Andere Prompts, andere Modelle, ein anderer Tag, und die Gesamtsumme ändert sich mit – auch wenn sich am Markt selbst nichts verändert hat.

Ein Empfehlungs-Check, der in einer Visibility-Audit-Engine verbaut ist, zeigt diese Endlichkeit konkret. Für eine einzelne Kategorie stellt er drei unterschiedlich formulierte Versionen einer Kaufinteressenten-Frage – “beste X”, “wer sind die besten X-Anbieter”, “ich suche X, wen würdest du empfehlen” – an drei unabhängige Modelle, jeweils zweimal. Achtzehn Antworten für eine Kategorie, bevor überhaupt eine einzige Zahl herauskommt. Ein Konkurrenzname fließt nur ein, wenn er wortgleich in einer dieser achtzehn Antworten auftaucht – nichts wird geraten oder ergänzt. Achtzehn ist nach normalen Maßstäben keine kleine Stichprobe, und trotzdem liegt sie unter der Untergrenze von drei bis fünf Wiederholungen pro Prompt, die llmpulse.ai für einen stabilen, positionsgewichteten Wert nennt (llmpulse.ai). Was dieser Lauf an Gesamtsumme liefert, ist real – und es ist trotzdem nur die Gesamtsumme dieses einen Laufs, nicht die der Kategorie.

Warum ändert sich die Antwort bei der zweiten Anfrage?

Weil die Antwort aus einer Wahrscheinlichkeitsverteilung gezogen wird, nicht aus einem festen Datensatz abgerufen. llmpulse.ai formuliert das in seinem eigenen Leitfaden direkt: denselben Prompt zweimal stellen, und die Reihenfolge der genannten Marken ändert sich häufig – weil genau so das zugrunde liegende Modell überhaupt Text erzeugt (llmpulse.ai). Der oben beschriebene Empfehlungs-Check läuft deshalb bewusst mit einer Temperatur-Einstellung oberhalb null – absichtlich hochgesetzt, nicht einfach beim Standardwert gelassen, damit ein Bericht nicht die eine wahrscheinlichste Antwort mit einer feststehenden Tatsache über die “Meinung” eines Modells verwechselt. Eine einzelne Antwort auf eine offene Kategoriefrage ist eine Stichprobe von genau einer. Ein verwandter Blick auf die Messung von KI-Sichtbarkeit behandelt, warum diese Instabilität weit über Share of Voice hinausreicht – hier geht es um die zugespitzte Version desselben Problems, angewendet auf eine Zahl, die als Wettbewerbsranking verkauft wird.

Bedeutet eine höhere Zahl mehr Kundschaft?

Nicht von selbst. Share of Voice zählt, ob ein Modell eine Marke unaufgefordert nennt – ein Empfehlungssignal, näher an einer Erwähnung durch eine gut informierte Bekannte als an einem Klick. Über die Frage, ob die fragende Person die Website danach überhaupt besucht, angerufen oder etwas gekauft hat, sagt die Zahl nichts. Eine Marke kann in ihrer Kategorie den höchsten Share of Voice haben und trotzdem keine messbare Veränderung bei Anfragen sehen; eine Marke mit bescheidenem Anteil kann trotzdem genau die Kundschaft gewinnen, die sie über einen ganz anderen Kanal gefunden hat. Der Prozentwert beantwortet “wie oft nennt ein Modell meinen Namen”, nicht “wie oft wird daraus ein Kunde” – und die zweite Frage braucht eigene Belege, keine Ableitung aus der ersten. Ein kostenloser Scan zeigt die deterministische Hälfte dieses Bilds – Crawler-Zugriff, strukturierte Daten – ohne Kosten; die Stichproben hinter einem Share-of-Voice-Wert sind eine tiefere, kostenpflichtige Ebene darüber, kein Ersatz dafür.

Das macht die Kennzahl nicht nutzlos. Es macht sie zu einem richtungsweisenden Signal aus einer kleinen, datierten, prompt-spezifischen Stichprobe – näher an einer Umfrage als an einer Volkszählung. Und genau so sollte sie behandelt werden: als Spanne, in Abständen geprüft, über mehr als eine Formulierung und mehr als ein Modell hinweg – nicht als einzelner Prozentwert, der auf die Kommastelle mit dem Vormonat verglichen wird.

Häufig gestellte Fragen

Was ist Share of Voice in KI-Antworten?

Eine Kennzahl dafür, wie oft und wie prominent eine Marke in Antworten von ChatGPT, Gemini oder Perplexity auftaucht – im Vergleich zum Wettbewerb, über eine festgelegte Menge kategorietypischer Prompts hinweg. HubSpots Glossar definiert es fast wortgleich: der Anteil an KI-Antworten in einer Kategorie, den eine bestimmte Marke für sich verbucht.

Wie wird Share of Voice in KI-Antworten berechnet?

Die Grundformel ist Erwähnungen geteilt durch Gesamterwähnungen, mal 100: Werden Marken über eine Prompt-Menge hinweg 100 Mal genannt und entfallen 25 davon auf eine Marke, liegt ihr Anteil bei 25 Prozent. Semrushs eigenes Tool legt zusätzlich eine Positionsgewichtung darüber – wie weit oben eine Marke genannt wird, nicht nur ob überhaupt –, aber die Gesamtsumme bleibt immer die, die genau dieser eine Testlauf mit genau diesen Prompts geliefert hat.

Warum liefert derselbe Prompt beim zweiten Versuch andere Marken?

Weil die Antwort eines Sprachmodells auf eine offene Frage gezogen, nicht nachgeschlagen wird. llmpulse.ai bringt es in seinem eigenen Leitfaden zu dieser Kennzahl auf den Punkt: Denselben Prompt zweimal laufen lassen, und die Reihenfolge der genannten Marken ändert sich häufig – weil genau so ein Sprachmodell Text überhaupt erzeugt.

Macht häufigeres Fragen die Zahl verlässlicher, oder beschreibt es nur genauer, was schon da ist?

Genauer, bis zu einem gewissen Punkt – das eigentliche Problem verschwindet dadurch nicht. llmpulse.ai empfiehlt mindestens drei bis fünf Wiederholungen pro Prompt, bevor sich ein positionsgewichteter Wert stabilisiert. Mehr Wiederholungen verengen die Schwankungsbreite um einen Prozentwert. Sie machen aus der zugrunde liegenden Gesamtmenge aber keine feste, vergleichbare Größe.

Bedeutet ein höherer Share of Voice automatisch mehr Kundschaft?

Nicht unmittelbar. Die Kennzahl zählt, wie oft ein Modell eine Marke von sich aus nennt, wenn eine Kategoriefrage gestellt wird, die die Marke selbst nie erwähnt – ein Empfehlungssignal, kein Abschluss. Eine Marke kann in jeder Stichprobe genannt werden und trotzdem niemanden gewinnen, oder selten genannt werden und die Kundschaft trotzdem über einen ganz anderen Kanal finden. Die Zahl ist ein Baustein, kein Ersatz für Umsatzdaten.