Perplexity: So werden Sie dort als Quelle genannt
Wer Perplexity nach dem besten Handwerksbetrieb in einer mittelgroßen Stadt fragt oder nach dem zuverlässigsten Tool für ein kleines Team, bekommt als oberste Quelle oft nicht die Website eines Unternehmens zu sehen. Es ist ein Reddit-Thread, manchmal Jahre alt, geschrieben von einer fremden Person ohne jedes Interesse an der Antwort. Das ist kein Ausreißer. Eine Analyse von über 4 Milliarden KI-Zitaten durch Profound kommt zu dem Ergebnis: Reddit ist bei Perplexity die am häufigsten zitierte Domain überhaupt – noch vor jeder Unternehmensseite, jeder Bewertungsplattform, allem.
Warum bevorzugt Perplexity Reddit gegenüber der eigenen Firmenseite?
Perplexity rankt keine Trefferliste wie eine klassische Suchmaschine. Es ruft eine Reihe von Seiten ab, formuliert daraus eine Antwort und hängt an einzelne Aussagen darin ein Zitat. Belohnt wird dabei, was sich sauber herauslösen lässt: eine direkte Meinung, ein konkreter Vergleich, ein aktueller Erfahrungsbericht. Die Startseite eines Unternehmens sagt meist das Gegenteil – allgemeine Qualitätsversprechen, formuliert für jeden denkbaren Kunden statt für die eine gestellte Frage. Eine Reddit-Antwort auf “welches der beiden habt ihr am Ende genommen” beantwortet dagegen genau diese Frage, in einem Absatz, von jemandem ohne Grund zu übertreiben. Das passt zu Perplexitys Auswahlverfahren erheblich besser als die meisten Marketingtexte – und erklärt einen großen Teil davon, warum Reddit so oft zuerst auftaucht.
Was macht PerplexityBot auf einer Website wirklich?
Perplexitys eigene Entwicklerdokumentation beschreibt die Aufgabe genau: PerplexityBot durchsucht öffentlich zugängliche Seiten, um den Index aufzubauen, aus dem Perplexitys Suche und Antwortfunktion schöpfen – und stellt ausdrücklich klar, dass dieser Crawler nicht zum Sammeln von Trainingsdaten für die zugrunde liegenden Modelle verwendet wird. Das ist eine Aufgabe, im Voraus erledigt, nach einem Zeitplan, den niemand außerhalb Perplexitys kennt.
Ist PerplexityBot der einzige Crawler von Perplexity?
Nein, und der zweite arbeitet auf eine Weise, die einen echten Unterschied macht. Perplexity nennt einen eigenen Agenten, Perplexity-User, der eine konkrete Seite live abruft, genau in dem Moment, in dem eine Nutzerfrage Perplexity dorthin schickt – kein geplanter Durchlauf, sondern ein einzelner Abruf, gebunden an ein einzelnes Gespräch. Perplexitys Dokumentation zieht die Grenze bei der robots.txt ausdrücklich zwischen beiden: PerplexityBot hält sich daran, während Perplexity-User sie in der Regel ignoriert, weil eine Person und kein geplanter Job die Anfrage ausgelöst hat. Dieselbe Aufteilung gibt es bei Anthropics Crawlern rund um Claude – ein Trainings- oder Indexierungs-Bot, der sich an die Datei hält, und ein Live-Abrufer auf Zuruf, der ihr nicht auf dieselbe Weise unterworfen ist.
Verhindert das Blockieren von PerplexityBot ein Zitat?
Nur zum Teil, und es lohnt sich, genau zu sagen, welcher Teil. Ein Ausschluss von PerplexityBot in der robots.txt hält eine Seite aus dem vorab aufgebauten Index heraus – dort, wo die große Mehrheit der Zitate herkommt, weil die meisten Fragen keine einzelne Seite namentlich ansteuern. Er hindert Perplexity-User aber nicht daran, genau diese Seite live abzurufen und zu zitieren, wenn eine konkrete Frage direkt dorthin führt, weil dieser Abrufer die robots.txt nicht auf dieselbe Weise liest wie der geplante Crawler. Das Blockieren senkt also die Chance auf beiläufige, alltägliche Zitate. Es schließt die Tür nicht vollständig, und wer PerplexityBot ausschließt und dabei einen vollständigen Ausschluss erwartet, geht von einem unvollständigen Bild aus, wie die beiden Agenten tatsächlich arbeiten.
Wie lässt sich prüfen, ob PerplexityBot eine Seite tatsächlich erreicht?
Die robots.txt zeigt nur, was eine Website erlauben will. Sie sagt nichts darüber, was der Server tatsächlich tut, wenn eine Anfrage eintrifft. Die Audit-Engine hinter dieser Seite – die vollständige Aufschlüsselung, was genau geprüft wird, steht in der Audit-Methodik – prüft deshalb beides getrennt: Sie liest die robots.txt für das, was erlaubt sein soll, und schickt zusätzlich, für eine benannte Auswahl an Crawlern, darunter PerplexityBot, eine echte Anfrage mit dessen tatsächlichem User-Agent, um zu sehen, was der Server bei diesem Namen wirklich tut. Die beiden Antworten stimmen nicht immer überein. Eine Bot-Management-Regel im CDN kann einen Crawler stillschweigend blockieren, den die robots.txt erlaubt, ohne dass das aus der Textdatei je hervorginge. Ein robots.txt-Checker liest die Datei selbst kostenlos aus; einen Server aufzudecken, der sich heimlich nicht daran hält, braucht einen echten Test wie den oben beschriebenen.
Reicht die richtige robots.txt für ein Zitat schon aus?
Zugriff für den Crawler zu sichern räumt eine Hürde aus dem Weg. Es erzeugt aber nicht die Art von Inhalt, die Perplexity bevorzugt zitiert. Die Belege oben deuten auf eine konkrete, wenig glamouröse Antwort hin: Seiten, die eine eng gefasste Aussage klar formulieren und mit etwas Konkretem belegen, kommen dem, was ein Zitat gewinnt, näher als eine allgemeine Startseite – und eine echte Diskussion an anderer Stelle, dort, wo ein Modell tatsächlich abruft, leistet mehr als jede Änderung auf der eigenen Seite. Nichts davon entsteht allein durch eine Änderung an der robots.txt, und nichts davon kann dieses oder ein anderes Audit-Tool für eine Website herstellen – es kann nur messen, ob Crawler-Zugriff und Seitenstruktur im Weg stehen.
Dieser letzte Punkt ist eine echte Grenze, kein Zugeständnis der Ausgewogenheit halber. Ein kostenloser Scan führt hier gar keine KI-Modellabfragen durch; ein Deep Scan schon, befragt dabei aber allgemeine Chat-Modelle danach, was sie über eine Marke bereits wissen – nicht Perplexity, weil Perplexity kein festes, abfragbares Wissen besitzt wie diese Modelle. Seine Antwort auf “kennst du dieses Unternehmen” hängt davon ab, was der Index in genau diesem Moment abgerufen hat, und das kann eine Stunde später schon wieder anders aussehen. Das auf dieselbe Weise zu messen würde bedeuten, die Frage endlos neu zu stellen – gegen ein System, das genau dafür gebaut ist, sich zu verändern.
Häufig gestellte Fragen
Trainiert PerplexityBot die KI-Modelle von Perplexity?
Nein. Perplexitys eigene Entwicklerdokumentation stellt klar, dass dieser Crawler nicht zum Sammeln von Trainingsdaten für die zugrunde liegenden Modelle dient. Er baut den Index auf, aus dem Perplexitys Suche und Antwortfunktion schöpfen – das ist eine andere Aufgabe als das Training eines Modells.
Was unterscheidet PerplexityBot von Perplexity-User?
PerplexityBot ist ein geplanter Crawler, der Perplexitys Suchindex im Voraus aufbaut. Perplexity-User ruft eine konkrete Seite live ab, genau in dem Moment, in dem eine Nutzerfrage Perplexity dorthin schickt. Laut Perplexitys Dokumentation hält sich PerplexityBot an die robots.txt, während Perplexity-User sie in der Regel ignoriert, weil eine echte Nutzeranfrage den Abruf ausgelöst hat.
Verhindert ein Ausschluss von PerplexityBot in der robots.txt ein Zitat?
Nur teilweise. Die Seite fällt aus dem vorab aufgebauten Index heraus und taucht in der Masse der alltäglichen Antworten nicht mehr auf. Das hindert Perplexity-User aber nicht daran, genau diese Seite live abzurufen und zu zitieren, wenn eine konkrete Frage direkt dorthin führt – dieser Abrufer liest die robots.txt in der Regel gar nicht erst.
Warum zitiert Perplexity so oft Reddit?
Eine Analyse von über 4 Milliarden KI-Zitaten durch Profound zeigt: Reddit ist die am häufigsten zitierte Domain bei Perplexity, noch vor jeder anderen Quelle. Perplexitys Auswahl bevorzugt aktuelle, konkrete Aussagen aus erster Hand – und ein Reddit-Thread mit echten Antworten passt darauf öfter als die Marketingseite eines Unternehmens.
Kann ein kostenloser SEO-Scan zeigen, ob Perplexitys Modell ein Unternehmen bereits kennt?
Nicht direkt. Ein kostenloser Scan führt gar keine KI-Modellabfragen durch – das bleibt dem Deep Scan vorbehalten, und selbst der befragt allgemeine Chat-Modelle, nicht Perplexity selbst. Perplexity antwortet aus einer live abgerufenen Quellenlage, nicht aus festem Trainingswissen, das sich auf dieselbe Weise abfragen ließe.
