← Zurück zur Übersicht

Drei Systeme, ein Prompt: Zwei Arten, an einer Quelle zu scheitern

Perplexity, ChatGPT und eine eigene Recherche- und Prüfkette bekamen wörtlich denselben Auftrag und liefen durch dieselbe Belegprüfung. Das Ergebnis ist keine Rangliste, sondern eine Unterscheidung: Man kann eine Quelle falsch wiedergeben, und man kann sich über sie täuschen – über ihre Herkunft und ihren Wert.

Einordnung: Dieser Artikel vergleicht drei Einzelläufe zu einem Thema, geprüft nach demselben Verfahren. Das ist ein Fallbeispiel, keine Studie. Wo externe Forschung das Muster stützt oder ihm widerspricht, steht sie im Text. Er ersetzt einen früheren Artikel, der nur zwei Systeme verglich; der Vorgänger bleibt zum Nachlesen erreichbar.

Dieser Artikel ist auch auf Englisch verfügbar: Three Systems, One Prompt

Belege zum Nachlesen: die ungekürzten Rohberichte von Perplexity und ChatGPT, die zugehörigen Prüfberichte (Perplexity, ChatGPT), der Artikel unserer eigenen Pipeline und der Vorgängerartikel mit zwei Systemen.

Ein Prompt, drei Systeme

Zwei Recherchewerkzeuge haben dieselbe Frage bekommen und geben entgegengesetzte Antworten. Der eine empfiehlt, Rind durch Huhn zu ersetzen. Der andere rät ausdrücklich davon ab. Beide Berichte lesen sich abgeklärt, beide führen Quellen, und am Text ist nicht zu erkennen, welcher recht hat.

Wir haben nachgesehen. Zwei Recherchewerkzeuge und eine selbstgebaute Recherche- und Prüfkette bekamen wörtlich denselben Auftrag, im englischen Original:

„Analyze the implications of eating meat for health, animal wellbeing, environmental impact. Come up with the best strategy to achieve the best compromise along those three axes.“

System eins: Perplexity Deep Research – ein Recherchemodus, der mehrere Suchläufe automatisch zu einem Bericht mit Quellenangaben zusammenfasst –, am 29. August 2026, ein Durchlauf im Pro-Abo. Ergebnis: rund 1.400 Wörter mit 32 Quellen, fertig in Minuten.1

System zwei: ChatGPT Deep Research, am 30. August 2026, ein Durchlauf im Plus-Abo. Ergebnis: rund 2.700 Wörter mit einem eigenen Quellenregister von fünfzehn Einträgen, ebenfalls in Minuten.2

System drei: unsere eigene Kette. Fünf unabhängige Recherche-Agenten – getrennt laufende KI-Instanzen, die nichts voneinander wissen –, dann Gliederung, Entwurf und eine sechsstufige Prüfkette. Ergebnis: 2.763 Wörter mit 35 Fußnoten, rund 20 Agentenläufe, etwa 1,7 Millionen Agenten-Token. Ein Token ist die Verarbeitungs- und Abrechnungseinheit für KI-Text und entspricht grob einem Wortbestandteil. Dauer: ein Arbeitstag.3

Anschließend liefen alle drei Ergebnisse durch dieselbe Belegprüfung. Sie arbeitet mit Rohextrakten: Ein Agent sichert den Wortlaut der Quelle zeichengenau, ohne die zu prüfende Behauptung zu kennen; ein zweiter vergleicht Behauptung und Extrakt ohne Netzzugang.4 Was dabei die Freigabe blockiert, nennen wir Klasse A – inhaltliche Falschaussage, falsche Zahl oder Bezugsgröße, falsche Zuschreibung, nicht offengelegte Interessenbindung einer Quelle, Erfundenes.

Der Maßstab stammt nicht von uns. Perplexity verspricht im eigenen Launch-Text „expert-level analysis across a range of complex subject matters“ und die Erledigung der meisten Rechercheaufgaben „in under 3 minutes“.5 Wir messen die Produkte an ihrem Anspruch, nicht an unserem Aufwand.

Und die These dieses Artikels lautet: Zitieren ist nicht Belegen – und es gibt zwei Arten, daran zu scheitern. Man kann sich in einer Quelle irren – sie also falsch wiedergeben – und man kann sich über sie täuschen: darüber, wer sie erhoben hat und was sie wert ist. Wer unter eigenem Namen veröffentlicht, braucht einen Prüfschritt, der beides abfängt – auch beim eigenen Prüfer.

Die Erkenntnis war in Minuten da

Zuerst das, was Vergleiche dieser Art gern übergehen: In der Sache kamen alle drei fast am selben Punkt heraus. Unabhängig voneinander fanden sie den Drei-Achsen-Konflikt, die Erkenntnis, dass keine Fleischart bei Gesundheit, Tierwohl und Umwelt zugleich gewinnt, die Trennlinie zwischen verarbeitetem und unverarbeitetem Fleisch, und alle drei landeten bei „weniger Fleisch“ statt „anderes Fleisch“. Auch die Geflügelfalle fanden alle: Der Wechsel von Rind zu Huhn verbessert die Klimabilanz, vervielfacht aber die Zahl der betroffenen Tiere je Fleischmenge, in der Größenordnung des Zweihundertfachen.6

Und dann der Widerspruch vom Anfang, der Angelpunkt dieses Artikels: Perplexity macht Geflügel zur primären tierischen Proteinquelle seiner Empfehlung, ChatGPT rät davon ab.

Die Kern-Erkenntnis war also in Minuten zu haben. Die Verlässlichkeit im Detail nicht – und der Unterschied ist beim Lesen unsichtbar.

Zwei Arten, an einer Quelle zu scheitern

Genau hier setzt die Prüfung an, und ihr Ergebnis ist nicht, dass ein Bericht mehr Fehler hatte als der andere. Es ist, dass die Fehler anders geartet sind.

Perplexity irrt in den Quellen. Der Bericht gibt die Quelle falsch wieder – nicht unbedingt den Sachverhalt.

Drei Beispiele. Er schreibt, ein Kilogramm Rindfleisch benötige „roughly 15,400 cubic meters of water“ – das wären 15,4 Millionen Liter. Die zitierte Quelle sagt 15.400 Kubikmeter je Tonne, also 15.400 Liter je Kilo.7 Die eigene Tabelle des Berichts führt daneben die korrekte Einheit; Text und Tabelle widersprechen sich, und niemand hat es gesehen. Zweitens behauptet er, die zusammengeführten Daten von sechs US-Langzeitgruppen hätten Geflügel nicht mit Herz-Kreislauf-Erkrankungen verknüpft. Die zitierte Studie fand das Gegenteil: Geflügel war statistisch auffällig mit Erkrankungen verknüpft – ein Zusammenhang, keine nachgewiesene Ursache: Hazard Ratio 1,04, ein Maß für das relative Risiko im Zeitverlauf; die Studie beziffert die absolute Differenz auf rund einen Prozentpunkt über dreißig Jahre.8 Der Effekt ist klein, und die Studienautoren waren wegen möglicher Zubereitungseffekte selbst zurückhaltend9 – der Fehler liegt in der Wiedergabe, nicht zwingend in der Schlussfolgerung.

Drittens nennt er aus einer UK-Biobank-Studie den auffälligsten Teilbefund und verschweigt, dass dieselbe Studie bei der Gesamtsterblichkeit keinen Zusammenhang fand.10 Insgesamt bleiben nach unseren Hausregeln fünf blockierende Befunde: die drei genannten, dazu eine als Faktum präsentierte Schätzung und ein Punkt zur Quellenqualität. Die Zählung folgt unseren Redaktionsregeln und ist kein objektives Maß.

ChatGPT irrt über die Quellen. Hier fand die Prüfung keine einzige falsche Zahl. Sämtliche geprüften Werte stehen zeichengenau in ihren Quellen, einschließlich der Bezugsgrößen. Der schwerwiegendste Befund betrifft die Herkunftsangabe: Die Fleischausbeuten von 360 Kilogramm je Rind und 1,7 Kilogramm je Huhn, auf denen die tragende Zweihundert-Rechnung steht, weist der Bericht als „Our World in Data synthesis using FAO/LCA data“ aus. Die Metadaten der zitierten Seite nennen als Quelle dieser Werte Faunalytics, eine Tierschutzorganisation.11 Die Zahlen stimmen; das Etikett wertet ihre Herkunft auf. „FAO-Daten“ liest sich als UN-Statistik. Dazu eine zweite blockierende Beanstandung – eine Aussage über die Nährstoffdeckung ohne Fleisch, belegt mit einer Seite der Deutschen Gesellschaft für Ernährung, die sich dazu nicht äußert – und, unter anderem, ein leichterer Punkt: drei Zusätze zu einem Weidehaltungs-Bericht, deren Kern gedeckt ist, während die Zusätze auf der verlinkten Übersichtsseite nicht stehen.

Unabhängige Forschung findet an dieser Produktklasse dasselbe Profil. Die Zitiergenauigkeit von Perplexity Deep Research liegt in einem wissenschaftlichen Vergleichstest bei 90,24 Prozent.12 Die Schwächen sitzen tiefer: Eine Audit-Studie zu dieser Produktklasse misst Zitiergenauigkeiten zwischen 40 und 80 Prozent bei hoher Einseitigkeit,13 eine andere trennt bei den stärksten Modellen Link-Validität von über 94 Prozent von faktischer Genauigkeit zwischen 39 und 77 Prozent – über alle vierzehn getesteten Modelle reicht die faktische Genauigkeit von 24 bis 77 Prozent, Perplexity ist nicht darunter.14 Die Forschung misst inzwischen genau die Ebene, auf der beide Berichte gescheitert sind: nicht, ob der Link lädt, sondern ob die Quelle den Satz trägt.

Beide Fehlerarten haben eines gemeinsam: Ein funktionierender Link fängt keine von beiden ab. Die Quellen existieren, die Adressen laden, die Zahlen sind meist da. Der Bruch passiert auf dem Weg von der Quelle zum Satz. Wer daraus liest, das eine System sei das schlechtere, liest zu schnell: Der Bericht mit der besseren Belegdisziplin ist der zweite – und genau er trägt den härteren Befund.

Was der ChatGPT-Bericht besser macht als wir

Der zweite Fremdbericht verdient einen eigenen Abschnitt, und zwar nicht aus Höflichkeit.

Die Prüfung fand bei ihm zwei blockierende Befunde, davon einen harten – und keine einzige falsche Zahl. Er kennzeichnet eigene Schlussfolgerungen ausdrücklich als solche: „This is a reasoned inference, not a validated scientific ranking across species.“ Er trennt Gefährdungs- von Risikoeinstufung und stellt klar, dass die Krebs-Einstufung von verarbeitetem Fleisch nicht bedeutet, es sei so gefährlich wie Rauchen. Er hat einen eigenen Unsicherheiten-Abschnitt und einen weiteren, der offenlegt, unter welcher Gewichtung der drei Achsen die Empfehlung kippen würde. Er führt ein Quellenregister mit Abrufdaten. Und beim Wasserfußabdruck warnt er ausdrücklich vor genau der Falle, in die der andere Bericht gelaufen ist: „scarcity matters more than liters alone“.2

Zwei dieser Punkte macht unser eigener Artikel nicht: Wir kennzeichnen eigene Ableitungen nicht durchgängig, und wir führen kein eigenes Quellenregister – unsere Abrufdaten stehen nur in den Fußnoten.

Am meisten beeindruckt, was er nicht weggelassen hat. Bei einer Umweltstudie übernimmt er die Vorbehalte der Autoren zu Wasser und Biodiversität, obwohl das Weglassen seine eigene Aussage stärker gemacht hätte.15 Genau an dieser Stelle war der andere Bericht gescheitert.

Vollkommen ist er nicht: Absolute Risiken stellt auch er nicht neben die relativen, Interessenlagen kennzeichnet er nicht systematisch, und mehrfach zeigen seine Belege auf Übersichtsseiten statt auf das Dokument, das die Aussage trägt.

Und trotzdem trägt ausgerechnet dieser Bericht ein falsches Etikett auf seiner wichtigsten Zahl. Das ist der eigentliche Beleg für die These: Sorgfalt ersetzt die Prüfung nicht. Der disziplinierteste der drei Texte scheitert an der Ebene, die Disziplin allein nicht abdeckt.

Der Blick in den Spiegel

Auch wer bis hierher den Eindruck gewonnen hat, wenigstens einer der beiden könne es, liest zu schnell. Unsere eigene Pipeline hat beide Fehlerarten selbst produziert.

In der Quelle geirrt haben wir so: Bei Perplexity trug die Studie den Satz über Geflügel nicht – wir schrieben „plötzlicher Herztod“ in eine Aussage über ein EFSA-Gutachten, in dem der Begriff nicht vorkommt.

Über die Quelle geirrt haben wir so: ChatGPT etikettierte Zahlen einer Interessenorganisation als FAO-Daten – wir schrieben der Gesamtstudie eine Übereinstimmungsquote von 60 Prozent zu, obwohl sie nur für einen ihrer beiden Datensätze gilt,16 und behaupteten eine Bevorzugung von Modellen derselben Familie – ein Punkt, den das zitierte Papier ausdrücklich als offene Frage führt und nicht als Befund.17

Am Fleisch-Artikel fing die Prüfkette sechzehn Klasse-A-Befunde ab, verteilt über alle Stufen: vier im ersten Schnell-Audit, einer in der Wortbedeutungs-Prüfung, sieben in der Belegprüfung, drei im strengen End-Audit und einer in dessen zweiter Runde, ein Folgefehler unserer eigenen Korrektur. Am Vergleichs-Artikel selbst kamen elf weitere dazu.18 Das ist keine Gegenrechnung. Es ist der Beleg, dass unsere Kette dieselben zwei Fehlerarten produziert wie die beiden Fremdsysteme – sie fängt sie nur vorher ab.

Der Unterschied zwischen den Systemen ist nicht, wer die Fehler macht. Er ist, wessen Fehler den Leser erreichen.

Der aufschlussreichste Fall: Der Prüfbericht macht den Fehler, den er beanstandet

Der aufschlussreichste Fall betrifft uns selbst.

Unser Prüfbericht über den Perplexity-Text führte ursprünglich sechs Befunde. Nummer sechs: ein angeblicher Widerspruch, weil dort „über 80 Milliarden geschlachtete Landtiere“ steht und an anderer Stelle „mehr als 97,6 Milliarden“. Das klingt nach Widerspruch, ist aber keiner. 97,6 ist größer als 80, beide Sätze können gleichzeitig wahr sein, und zwischen beiden Werten liegt die Schätzung, die eine Tierschutzorganisation unter Berufung auf die FAO nennt: 92,2 Milliarden Landtiere, die jährlich gehalten und geschlachtet werden.19

Kein Fehler in einer Quelle und keiner über eine Quelle, sondern einer über den eigenen Befund – die dritte Stelle, an der Zitieren nicht Belegen ist. Gefunden hat das nicht der Prüfer. Gefunden hat es ein Red Team – ein getrennter Agent mit dem ausdrücklichen Auftrag, unsere eigene These anzugreifen. Der Befund wurde herabgestuft. Unser Prüfbericht hatte damit genau den Fehler gemacht, den er beanstandete: eine dramatische Diagnose, die der eigenen Prüfung nicht standhält.

Es war nicht der einzige Vorfall. Beim strengen End-Audit erfand das Abruf-Modul des Prüf-Agenten selbst eine Zeitangabe, die in der Quelle nirgends steht. Gestoppt hat das kein klügeres Modell, sondern der zeichengenaue Rohextrakt.18

Verifikation ist keine Einrichtung, die man einmal aufsetzt und der man dann vertraut. Sie ist eine Disziplin, sie muss auch gegen den Prüfer laufen, und ihr verlässlichstes Mittel ist das einfachste: der wörtliche Rohtext der Quelle.

Was dieser Vergleich nicht beweist

Wenn sogar der Prüfbericht irrt – was beweist dieser Vergleich dann überhaupt? Weniger, als die Überschrift verspricht. Vier Grenzen, die wir lieber selbst aufschreiben.

Erstens: Es sind drei Läufe. Ein Thema, keine Wiederholung, keine vorab festgelegte Auswertung. Der Fall illustriert ein Muster, das unabhängige Forschung an dieser Produktklasse findet. Er beweist es nicht.

Zweitens: Unsere Prüfer haben dieselben blinden Flecken – aber der Einwand ist jetzt kleiner geworden. Im Vorgängerartikel mussten wir einräumen, dass hier möglicherweise ein Claude-Prüfer einen Claude-Bericht prüfte: Perplexity Deep Research nutzt laut Help Center „Opus 4.6 Thinking“ im Max-Abo und „4.5 Thinking“ im Pro-Abo,20 Modellnamen, die die Fachpresse der Claude-Familie zuordnet.21 Unser Lauf war im Pro-Abo; welches Modell er konkret traf, ist nicht dokumentiert.1 Der ChatGPT-Bericht stammt aus einer anderen Modellfamilie, nicht aus der unserer Prüfer, und unsere Kette fand auch dort Klasse-A-Befunde. Das ist ein stärkeres Ergebnis, keine Auflösung.

Die Forschungslage bleibt unbequem – auf einem von zwei untersuchten Datensätzen stimmten falsche Antworten von Modellpaaren im Mittel zu 60 Prozent überein, gegen eine Zufallserwartung von einem Drittel, und ausgerechnet genauere Modelle korrelieren stärker, auch über Anbietergrenzen hinweg.16 Bewertet ein KI-Modell Antworten verschiedener Modelle, bevorzugt es häufig die eigenen – verbreitet, aber uneinheitlich; Effekte innerhalb einer Modellfamilie führt die Studie ausdrücklich als offene Frage.17

Drittens: Der Vergleich war nicht blind. Unsere Prüfer hatten eine Woche Themen-Vorwissen aus dem eigenen Artikel, samt 21 fertigen Rohextrakten und einer Liste bekannter Problemzahlen. Mindestens ein Befund war nur deshalb auffindbar.

Viertens: Es gibt einen echten Gegenbeleg. Bei der Literatursuche werden von Menschen zusammengestellte Literaturlisten deutlich unterboten: Nur 51 Prozent der menschlichen Zitate wurden von einem neutralen KI-Bewerter als mindestens moderat relevant eingestuft, gegenüber 86 bis 88 Prozent bei den stärksten KI-gestützten Sortierverfahren. Und menschliche Autoren zitieren 2,5-mal häufiger als diese Verfahren sich selbst oder direkte Ko-Autoren.22 Auch unsere Quellenauswahl ist kein verlässlicher Maßstab.

Ein Durchgang gegen eine fremde Modellfamilie ist ein Datenpunkt, keine Entwarnung – unsere Prüfer sind weiterhin alle aus einem Haus.

Was der Aufwand rechnerisch wert ist – und warum diese Summe nie in Rechnung ging

Bleibt die Frage, die ein Entscheider wirklich stellt: Rechnet sich der Aufwand trotzdem? Der Kostenunterschied gehört auf den Tisch, und zwar korrekt bezeichnet.

Perplexity Pro kostet 20 US-Dollar im Monat, ChatGPT Plus ebenfalls. Einen Euro-Preis haben wir bei keinem der beiden belegen können; die Beträge, die in der Presse kursieren, sind Umrechnungen.23 Beide Berichte waren in Minuten fertig.

Unsere Seite kostete einen Arbeitstag und rund 1,7 Millionen Agenten-Token. Für den Erstellungstag weist unsere Auswertung 188 US-Dollar aus,24 inklusive anderer Arbeiten dieses Tages; auf den Artikel entfiel davon grob ein Drittel bis die Hälfte. Und auch das ist keine Rechnung, sondern ein Gegenwert: der Betrag, den dieselbe Token-Menge über die Programmierschnittstelle gekostet hätte. Bezahlt wurde davon nichts. Die Arbeit lief in einem Monatsabo zum Festpreis von rund 100 Euro.24 Der Vorgängerartikel nannte diese Zahl eine Tagesabrechnung; das war falsch, und die Korrektur gehört hierher.

Der Abstand zwischen beiden Zahlen ist selbst der Befund. Für den gesamten August summiert unsere Auswertung 1.831,93 US-Dollar rechnerischen Gegenwert, umgerechnet rund 1.573 Euro.24 Gegen ein Abo für rund 100 Euro ist das gut das Fünfzehnfache. Wer so arbeitet, zahlt derzeit einen Bruchteil dessen, was dieselbe Leistung über die Schnittstelle kostet.

Die Verteilung innerhalb der Kette ist dabei unbequemer, als uns lieb wäre: Die Prüfung kostete knapp das Dreifache der Recherche, und der teuerste Einzelschritt war ausgerechnet der Belegabgleich.3 Das lag allerdings an einem Fehler im Abruf-Modul – der prüfende Agent las einen 27.000-Zeilen-Extrakt am Stück, statt darin zu suchen. Der Agent durchsucht den Extrakt seither, statt ihn zu lesen; wie stark das den Preis senkt, haben wir nicht nachgemessen. Der Preis eines Prüfschritts ist also weder fix noch technisch vorgegeben: Er hängt an der Umsetzung des Prüfschritts und an einer Anbieterentscheidung.

Nach dem Maßstab „Erkenntnis je Euro und Minute“ gewinnen die Werkzeuge diesen Vergleich klar. Das steht hier ausdrücklich so.

Für Texte, die unter eigenem Namen erscheinen, zählt ein anderer Maßstab. Ein Faktor-1.000-Fehler in einem internen Rechercheergebnis kostet eine Korrektur. Derselbe Fehler in einem veröffentlichten Text kostet Glaubwürdigkeit. Nach „Erkenntnis je Euro und Minute“ gewinnen die Werkzeuge. Nach „Fehlern je Unterschrift“ nicht.

Daraus folgt kein Ranking, sondern eine Arbeitsteilung. Das Zusammentragen gehört dem Werkzeug; darin ist es um Größenordnungen schneller und billiger, und die Kern-Erkenntnis liefert es zuverlässig. Die Belegprüfung gehört einem getrennten Prüfschritt – gleich ob der Text von Perplexity stammt, von ChatGPT, von einer eigenen Pipeline oder von einem Menschen.

Recherchetiefe wird zugeteilt, und der Maßstab der Forschung verschiebt sich

Dass der Preis dieser Arbeitsteilung eine Anbieterentscheidung ist, lässt sich nicht nur behaupten. Die Bewegung ist datierbar.

Beim Start am 14. Februar 2025 bewarb Perplexity Deep Research als kostenlos für alle, mit unbegrenzten Läufen für Pro-Abonnenten.5 Anfang Februar 2026 wurde dieses Kontingent auf rund 20 Läufe pro Monat gekürzt; die Ausgangszahl liegt je nach Quelle bei 500 bis 600 pro Tag, die Kürzung traf Bestandskunden mitten im Abrechnungszeitraum.25 Die Begründung im Help Center lautet wörtlich: „Usage limits have been adjusted to allocate more computing power per session, so you get deeper insights and higher-quality results.“20 Ob die Qualität je Lauf tatsächlich stieg, ist offen; eine unabhängige Vorher-Nachher-Messung existiert nicht.

Parallel wandert die Messlatte der Forschung: Die neueren Vergleichstests trennen zunehmend „funktioniert der Link“ von „trägt die Quelle die Aussage“.1214

Und die Produkte unterscheiden sich darin bereits: Dass der ChatGPT-Bericht von sich aus ein Quellenregister mit Abrufdaten und einen Unsicherheiten-Abschnitt liefert, tut der Perplexity-Bericht aus derselben Woche nicht. Das legt nahe, dass die Anbieter erste Hilfen zur Nachprüfbarkeit einbauen, wenn auch ungleichmäßig – belegt ist hier allerdings nur ein Unterschied zwischen zwei Läufen. Diese Hilfen ersetzen die Prüfung noch nicht – das falsche Herkunftsetikett steht im selben Bericht.

Verdichtet auf drei Fragen, bevor ein Rechercheergebnis nach draußen geht:

  1. Trägt jede tragende Quelle den Satz, der auf ihr steht – geprüft am Rohtext, nicht am funktionierenden Link?
  2. Stimmt auch die Zuschreibung: Wer hat die Zahl erhoben, welches Interesse hat er, und steht neben jedem relativen Risiko die absolute Zahl?
  3. Lief die Prüfung auch gegen den Prüfer – mit einem Auftrag gegen die eigene These?

Frage eins fängt die Fehler in den Quellen ab, Frage zwei die über die Quellen. Frage drei stellt beide noch einmal – an den Prüfer. Zitieren ist nicht Belegen: Zwei Arten zu scheitern heißen zwei Fragen an jeden Text, der den eigenen Namen trägt, und eine an den, der ihn prüft.

Zum Schluss das Transparenzangebot, das wir von jedem Fremdbericht verlangen würden: Beide Rohberichte stehen im Wortlaut online, beide Prüfberichte (Perplexity, ChatGPT) ebenso, einschließlich des Befunds, der unserer eigenen Prüfung nicht standgehalten hat. Die Rohextrakte sämtlicher Quellen liegen vor und werden auf Anfrage offengelegt. Dieselbe Nachprüfbarkeit, die dieser Artikel einfordert.

Welcher der beiden Berichte vom Anfang recht hatte, war am Text nicht zu entscheiden. Am Rohtext war es zu entscheiden – in beide Richtungen.

Das Recherchewerkzeug liefert den Rohstoff. Erst die Prüfung gegen den Rohextrakt macht daraus etwas, das man unterschreiben kann.

Quellen

  1. Perplexity-Deep-Research-Bericht vom 29.08.2026, ein Durchlauf im Pro-Abo, Modus Deep Research, ohne Nachbearbeitung. Welches Modell den Lauf konkret bediente, ist nicht dokumentiert. Der ungekürzte Bericht steht im Wortlaut auf diesem Blog. ↩ ↩2

  2. ChatGPT-Deep-Research-Bericht vom 30.08.2026, ein Durchlauf im Plus-Abo, ohne Nachbearbeitung. Der ungekürzte Bericht steht im Wortlaut auf diesem Blog, der vollständige Prüfbericht mit allen Befunden ebenfalls. Die Wortzahl ist eine eigene Auszählung am Rohbericht einschließlich seines Quellenregisters; das Register umfasst fünfzehn Einträge. ↩ ↩2

  3. „Nicht welches Fleisch, sondern wie viel“ (A16), dieser Blog – der Artikel, den unsere Pipeline aus demselben Prompt erzeugte. Aufwandszahlen aus internen Ablauf- und Prüfprotokollen; Offenlegung auf Anfrage. ↩ ↩2

  4. Methodik-Referenz: zweistufige Belegprüfung. Ein Agent sichert den Wortlaut der Quelle, ohne die zu prüfende Behauptung zu kennen; ein zweiter vergleicht Behauptung und Extrakt ohne Netzzugang. Prompt-Vorlagen im offenen Repository: https://github.com/flodido/agentic-research-vault ↩

  5. Perplexity: „Introducing Perplexity Deep Research“, 14.02.2025. Original-URL https://www.perplexity.ai/hub/blog/introducing-perplexity-deep-research (blockiert automatisierte Abrufe); wörtlich geprüft am Wayback-Snapshot vom Launch-Tag: https://web.archive.org/web/20250214203504/https://www.perplexity.ai/hub/blog/introducing-perplexity-deep-research (Abruf 30.08.2026). Anbieter-Selbstauskunft, entsprechend interessengeleitet. ↩ ↩2

  6. Bryant Research: „The Small Body Problem“, https://bryantresearch.co.uk/insight-items/small-body-problem/ (Rohextrakt 30.08.2026): „about 200 chickens are required to produce the same amount of meat gained from slaughtering one cow“; die Quelle nennt für dieselbe Fleischmenge selbst die Alternativwerte 150:1 und 192:1; ihr Wert 223:1 bezieht sich dagegen auf die jährlich geschlachtete Gesamtzahl, nicht auf gleiche Fleischmenge. Ritchie, H.: „What are the trade-offs between animal welfare and the environmental impact of meat?“, Our World in Data, 10.06.2024, https://ourworldindata.org/what-are-the-trade-offs-between-animal-welfare-and-the-environmental-impact-of-meat (Rohextrakt 30.08.2026): 360 kg je Rind, 1,7 kg je Huhn, „200 times as many chickens as cows“. Aus den Ausbeuten gerechnet ergäben sich 212. Im Text als Größenordnung geführt. ↩

  7. Water Footprint Network: „What can consumers do?“, https://www.waterfootprint.org/time-for-action/what-can-consumers-do/ (Rohextrakt 30.08.2026). Dort: 15.400 m³/t für Rindfleisch. ↩

  8. Zhong, V. W. et al.: „Associations of Processed Meat, Unprocessed Red Meat, Poultry, or Fish Intake With Incident Cardiovascular Disease and All-Cause Mortality“, JAMA Internal Medicine, 03.02.2020, https://jamanetwork.com/journals/jamainternalmedicine/fullarticle/2759737 (Rohextrakt 30.08.2026). Geflügel: je zwei zusätzliche Portionen pro Woche HR 1,04 (95-%-KI 1,01–1,06) für inzidente kardiovaskuläre Erkrankung, absolute 30-Jahres-Differenz 1,03 Prozentpunkte; keine signifikante Assoziation mit der Gesamtmortalität. ↩

  9. Northwestern Feinberg School of Medicine (Pressestelle der Studieninstitution): „Meat Consumption Raises Risk of Heart Disease and Death“, 03.02.2020, https://news.feinberg.northwestern.edu/2020/02/03/meat-consumption-raises-risk-of-heart-disease-and-death/ (Abruf 30.08.2026): „the evidence so far is not sufficient to make a clear recommendation about poultry intake.“ ↩

  10. „Red meat consumption and all-cause and cardiovascular mortality: results from the UK Biobank study“, European Journal of Nutrition, DOI 10.1007/s00394-022-02807-0; Übersichtsseite der UK-Biobank-Publikationen: https://www.ukbiobank.ac.uk/publications/red-meat-consumption-and-all-cause-and-cardiovascular-mortality-results-from-the-uk-biobank-study/ (Rohextrakt 30.08.2026): erhöhte kardiovaskuläre Teilrisiken, „but not all-cause mortality“. ↩

  11. Chart-Metadaten der in Fußnote 6 genannten OWID-Seite, Datensatz „kilograms-meat-per-animal“: Quelle „Faunalytics (2023) – Impact of Replacing Animal Products“, Advocacy-Organisation. Die FAO wird für diese Werte nicht genannt; die Emissionsdaten desselben Diagramms stammen laut unserem Prüfbericht aus Poore und Nemecek (2018); in den vorliegenden Metadaten-Extrakten der Seite ist dieser Zusatz nicht enthalten. ↩

  12. DeepResearch Bench: „A Comprehensive Benchmark for Deep Research Agents“ (arXiv:2506.11763), https://deepresearch-bench.github.io/ (Abruf 30.08.2026). FACT-Framework, 100 Aufgaben auf Promotionsniveau in 22 Fachgebieten: 90,24 Prozent Citation Accuracy für Perplexity Deep Research. ↩ ↩2

  13. Venkit, Laban et al. (Salesforce AI Research): „DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence“, https://arxiv.org/abs/2509.04499 (Abruf 30.08.2026). Anbieter-Nähe beachten: Salesforce betreibt ein eigenes Agenten-Geschäft. ↩

  14. „Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents“ (arXiv:2605.06635), https://arxiv.org/html/2605.06635 (Abruf 30.08.2026): „even the strongest frontier models maintain link validity above 94% and relevance above 80%, yet achieve only 39–77% factual accuracy“; über alle vierzehn getesteten Modelle reicht die faktische Genauigkeit von 24 Prozent (OSS-120B) bis 77 Prozent (Claude Opus 4.5). Perplexity ist nicht darunter. Ergänzend zur Produktklasse: „DEER“ (arXiv:2512.17776) und DeepResearch Bench II (arXiv:2601.08536), beide Abruf 30.08.2026 – auch die stärksten Agenten bleiben deutlich hinter Experten-Bewertungsrastern zurück. ↩ ↩2

  15. Scarborough, P. et al.: „Vegans, vegetarians, fish-eaters and meat-eaters in the UK show discrepant environmental impacts“, Nature Food, 20.07.2023, https://www.nature.com/articles/s43016-023-00795-w (Rohextrakt 30.08.2026). Der Bericht übernimmt sowohl die Kernbefunde als auch den Vorbehalt der Autoren zu Wasser und Biodiversität. ↩

  16. Kim, Garg, Peng, Garg: „Correlated Errors in Large Language Models“, ICML 2025, https://arxiv.org/abs/2506.07962 (Abruf 30.08.2026). Über 350 Modelle auf zwei Ranglisten und einer Bewerbungs-Screening-Aufgabe. Der 60-Prozent-Wert gilt für den Helm-Datensatz mit 71 Modellen; auf der zweiten Rangliste liegt der Mittelwert bei 42,3 Prozent. Das Papier nennt die Zufallserwartung von einem Drittel für den Helm-Datensatz selbst: „choosing between incorrect answers uniformly at random would lead to an agreement rate of 1/3“. Genauere Modelle korrelieren „even with distinct architectures and providers“. ↩ ↩2

  17. „Quantifying and Mitigating Self-Preference Bias of LLM Judges“, https://arxiv.org/abs/2604.22891 (Abruf 30.08.2026): verbreitet, aber nicht einheitlich selbstbevorzugend – von 20 Modellen 8 positiv, 9 negativ, 3 neutral verzerrt. Familieneffekte über Modellgrenzen hinweg nennt das Papier ausdrücklich als offene, nicht entwirrte Limitation. ↩ ↩2

  18. Prüfprotokolle der beiden vorangegangenen Artikel; Offenlegung auf Anfrage. Enthalten die Stufenaufteilung der Befunde sowie die dokumentierte Halluzination des Abruf-Moduls im strengen End-Audit. ↩ ↩2

  19. Humane World for Animals: „More animals than ever before – 92.2 billion – are used and killed each year for food“, https://www.humaneworld.org/en/blog/92-billion-animals-used-killed-meat-each-year (Abruf 30.08.2026). NGO-Quelle mit Advocacy-Interesse; hier ausschließlich als Beleg für eine zwischen beiden Werten liegende Schätzung herangezogen, die die Organisation ohne Bezugsjahr angibt. ↩

  20. Perplexity Help Center: „What’s New in Advanced Deep Research“. Original-URL blockiert automatisierte Abrufe; wörtlich geprüft am Wayback-Snapshot vom 11.02.2026: https://web.archive.org/web/20260211012137/https://www.perplexity.ai/help-center/en/articles/13600190-what-s-new-in-advanced-deep-research (Abruf 30.08.2026). Die Seite trägt kein absolutes Änderungsdatum. ↩ ↩2

  21. Dataconomy: „Perplexity Upgrades Deep Research Tool With Claude Opus 4.5 Integration“, 05.02.2026, https://dataconomy.com/2026/02/05/perplexity-upgrades-deep-research-tool-with-claude-opus-4-5-integration/ (Abruf 30.08.2026). ↩

  22. Sahu, Charlin, Pal: „Rethinking Literature Search Evaluation: Deep Research Helps, and Human Citation Lists Are Not a Ground Truth“, https://arxiv.org/pdf/2605.29234 (Abruf 30.08.2026). Wörtlich: „only 51% of human citations are judged moderately relevant or higher, against 86–88% for the strongest AI-based re-rankers“ und, im Fließtext der Studie, „At d=0 (direct co-authorship) humans are 2.5× more likely than the strongest re-rankers to cite themselves or a co-author (5.13% vs. 1.9–2.1%)“. Zur Abgrenzung: Die ebenfalls in der Studie genannte Recall-Steigerung von unter 20 auf über 80 Prozent misst etwas anderes, nämlich die eigene Pipeline gegenüber reiner API-Suche, und ist hier bewusst nicht verwendet. ↩

  23. OpenAI: „What is ChatGPT Plus?“, Help Center, https://help.openai.com/en/articles/6950777-what-is-chatgpt-plus, geprüft am Wayback-Snapshot vom 22.08.2026 (Abruf 30.08.2026): „ChatGPT Plus is a subscription plan that provides enhanced access to the ChatGPT web app for $20/month.“ Weder dort noch auf der Preisseite von OpenAI (letzter inhaltlich verwertbarer Archivstand vom 04.09.2025) findet sich ein Euro-Preis oder eine Angabe zur Mehrwertsteuer. Der Preis von Perplexity Pro ist über den Limit-Tracker in Fußnote 25 belegt, der „Pro ($20/mo)“ ausweist; eine Perplexity-Preisseite haben wir nicht extrahiert, ein Euro-Preis ist uns dort nicht bekannt. ↩

  24. Eigene Auswertung der lokalen Nutzungsprotokolle mit dem Auswertungsprogramm ccusage, Stand 30.08.2026, 20:51 Uhr; Rohausgabe archiviert. Das Werkzeug berechnet, was die verbrauchten Token über die Programmierschnittstelle gekostet hätten – es ist ausdrücklich keine Rechnung. August 2026: 1.831,93 US-Dollar Gegenwert. Umrechnung zum EZB-Referenzkurs vom 28.08.2026 (0,85889 EUR/USD) ergibt rund 1.573 Euro. Der Abopreis von rund 100 Euro monatlich ist eine Selbstauskunft des Kontoinhabers. Das Verhältnis ist nur währungsbereinigt aussagekräftig. ↩ ↩2 ↩3

  25. MakeUseOf: „If you bought an annual Perplexity subscription, you were lied to“, Februar 2026, https://www.makeuseof.com/bought-annual-perplexity-subscription-lied/ – der Autor ist selbst betroffener Jahresabonnent („including myself“); die Kürzungszahlen sind unabhängig bestätigt durch den anhand der Wayback Machine überprüften Limit-Tracker https://ailimit.watch/tools/perplexity/ (Stand 06.06.2026, Abruf 30.08.2026), der die Kürzung als unangekündigt markiert. ↩

Transparenzhinweis: Dieser Beitrag wurde KI-gestützt erstellt und vor Veröffentlichung redaktionell geprüft.