Zitieren ist nicht Belegen: Ein Prompt, zwei Systeme und die Ebene darunter
Perplexity Deep Research und eine mehrstufige Prüf-Pipeline bekamen wörtlich denselben Auftrag. Beide lieferten echte Quellen – und beide machten dieselbe Klasse von Fehlern. Der Unterschied ist kein besseres Modell, sondern ein Prüfschritt, der auch gegen sich selbst läuft.
Einordnung: Dieser Artikel vergleicht einen einzelnen Perplexity-Deep-Research-Lauf mit einem einzelnen Durchlauf unserer eigenen Recherche- und Prüf-Pipeline – am selben Prompt, am selben Thema. Das ist ein Fallbeispiel, keine Studie. Wo externe Forschung das Muster stützt oder ihm widerspricht, steht sie im Text.
Nachfolger und Korrektur (30.08.2026): Dieser Artikel wurde durch Drei Systeme, ein Prompt ersetzt, der einen dritten Rechercheautomaten einbezieht. Er bleibt hier als Beleg erreichbar. Bei der Arbeit am Nachfolger fand unsere Belegprüfung im Abschnitt über die Literatursuche einen eigenen Fehler, den sie beim ersten Durchgang übersehen hatte: Zwei verschiedene Messungen derselben Studie waren vermengt. Der Absatz ist unten korrigiert.
This article is also available in English: Citing Is Not Verifying
Belege zum Nachlesen: der ungekürzte Perplexity-Bericht im Wortlaut und der Artikel unserer eigenen Pipeline, über den hier gesprochen wird.
Ein Prompt, zwei Systeme
Am 29. August 2026 haben wir ein Experiment gemacht. Zwei Systeme bekamen wörtlich denselben Auftrag, im englischen Original:
„Analyze the implications of eating meat for health, animal wellbeing, environmental impact. Come up with the best strategy to achieve the best compromise along those three axes.“
System eins: Perplexity Deep Research, ein automatisches Recherchesystem, das selbstständig Dutzende Suchen ausführt, Quellen liest und daraus einen Bericht mit Quellenangaben baut. Ergebnis: rund 1.400 Wörter mit 32 Quellen, fertig in wenigen Minuten. Ein Durchlauf im Pro-Abo, Modus Deep Research, keine Nachbearbeitung; welches Modell dabei konkret lief, haben wir nicht dokumentiert – dazu später mehr.1
System zwei: unsere eigene Artikel-Pipeline. Fünf unabhängige Recherche-Agenten – getrennt laufende KI-Instanzen, die nichts voneinander wissen –, dann Gliederung, Entwurf und eine sechsstufige Prüfkette. Ergebnis: 2.763 Wörter mit 35 Fußnoten, jede tragende Aussage gegen den Rohtext ihrer Quelle abgeglichen – mit vier dokumentierten Ausnahmen, die als solche im Prüfprotokoll stehen.2 Aufwand: rund 20 Agenten-Läufe, etwa 1,7 Millionen Agenten-Token – ein Token, die Verarbeitungs- und Abrechnungseinheit für KI-Text, entspricht grob einem Wortbestandteil – und ungefähr ein Arbeitstag.3
Der Maßstab für den Vergleich stammt nicht von uns. Perplexity selbst verspricht im Launch-Text „expert-level analysis across a range of complex subject matters“ und die Erledigung der meisten Rechercheaufgaben „in under 3 minutes“.1 Wir messen das Produkt also an seinem eigenen Anspruch – und, wie sich zeigen wird, unsere Pipeline gleich mit.
Denn die These dieses Artikels lautet: Zitieren ist nicht Belegen. Deep-Research-Werkzeuge liefern echte Quellen und scheitern eine Ebene tiefer – bei der Frage, ob die Quelle den Satz trägt, der auf ihr steht. Wer unter eigenem Namen veröffentlicht, braucht deshalb einen getrennten Prüfschritt. Das gilt für Perplexity, für unsere eigene Pipeline und für Menschen.
Die Erkenntnis gab es in drei Minuten
Zuerst das, was in vielen Vergleichen dieser Art unterschlagen wird: In der Sache kamen beide Systeme fast am selben Punkt heraus. Unabhängig voneinander, aus demselben Prompt, fanden beide den Drei-Achsen-Konflikt (kein Fleisch gewinnt bei Gesundheit, Tierwohl und Umwelt zugleich), beide die Geflügelfalle (der Wechsel von Rind zu Huhn verbessert die Klimabilanz, vervielfacht aber die Zahl der betroffenen Tiere je Fleischmenge – auf etwa das Zweihundertfache),4 beide die Trennlinie zwischen verarbeitetem und unverarbeitetem Fleisch, und beide landeten bei „weniger Fleisch“ statt „anderes Fleisch“ als tragendem Rahmen.
Mehr noch: Der Perplexity-Bericht macht drei Dinge besser als unser Artikel. Er behandelt Fisch als eigene Kategorie, er nennt das Nährstoffdetail Vitamin B12, und seine Gegenüberstellungstabelle der Zielkonflikte ist didaktisch stark.
Die Kern-Erkenntnis war also in drei Minuten zu haben. Die Verlässlichkeit im Detail nicht – und das ist keine Kleinigkeit, denn genau im Detail entscheidet sich, ob man einem Text trauen kann, den man nicht selbst nachrecherchiert.
Was die Prüfung fand – ehrlich gezählt
Wir haben den Perplexity-Bericht durch dieselbe Belegprüfung geschickt wie unsere eigenen Artikel: Jede tragende Aussage wird gegen einen Rohextrakt geprüft – eine zeichengenaue Kopie des Quellen-Rohtextes, die ein getrennter Agent zieht, der die zu prüfende Behauptung nicht kennt.5 Vorweg das wichtigste Ergebnis: Fast alle zitierten Zahlen stehen wirklich in den Quellen. Die Quellen existieren, die Links funktionieren. Der Bericht scheitert eine Ebene tiefer.
Ehrlich gezählt bleiben fünf Befunde nach unseren Hausregeln – und diese Zählung ist eine Konvention, kein objektives Maß. Nur zwei davon sind harte, nachrechenbare Fehler:
Erstens ein Einheitenfehler um den Faktor 1.000. Der Bericht schreibt, ein Kilogramm Rindfleisch benötige „roughly 15,400 cubic meters of water“ – das wären 15,4 Millionen Liter je Kilo. Die zitierte Quelle, das Water Footprint Network, sagt 15.400 Kubikmeter je Tonne, also 15.400 Liter je Kilo.6 Die Pointe daran: Die eigene Tabelle des Berichts führt daneben die korrekte Einheit. Text und Tabelle widersprechen sich, und niemand hat es gesehen.
Zweitens trägt eine Quelle den Satz nicht, der auf ihr steht. Der Bericht behauptet, die zusammengeführten Daten von sechs US-Langzeit-Beobachtungsgruppen (Kohorten) hätten Geflügel nicht mit Herz-Kreislauf-Erkrankungen verknüpft. Die zitierte Studie (Zhong et al. 2020, JAMA Internal Medicine) fand das Gegenteil: Geflügelkonsum war signifikant mit Herz-Kreislauf-Erkrankungen assoziiert – Hazard Ratio 1,04, die Erkrankungsrate lag also um vier Prozent höher, bei einer absoluten 30-Jahres-Differenz von rund einem Prozentpunkt.7 Präzise formuliert: Der Fehler liegt in der Wiedergabe, nicht zwingend in der Schlussfolgerung – der Effekt ist klein, und die Studienautoren waren wegen möglicher Zubereitungseffekte selbst zurückhaltend.8 Aber der Bericht macht Geflügel zur primären tierischen Proteinquelle seiner Empfehlung – gestützt auf eine Quelle, die das Gegenteil des wiedergegebenen Satzes sagt, zwei Absätze nach der eigenen Beschreibung der Geflügelfalle.
Dazu kommen zwei Befunde, die nach unseren Hausregeln blockieren, über die man aber streiten kann: eine Leidens-Schätzung (sinngemäß: „Masthühner verbringen den Großteil ihres Lebens unter Schmerzen“), die als Faktum präsentiert wird, obwohl eine Nachprüfung der zugrunde liegenden Methodik 2025 nur geringe Überlappung zwischen unabhängigen Bewertern fand und deren Schätzungen als überpräzise („overprecise“) einstufte;9 und eine Rosinenpickerei bei einer UK-Biobank-Studie – der Bericht nennt die dramatischste Teilzahl (101 Prozent erhöhtes Schlaganfall-Sterberisiko) und verschweigt, dass dieselbe Studie bei der Gesamtsterblichkeit keinen Zusammenhang fand.10 Schließlich ein Punkt zur Quellenqualität: Eine „10- bis 100-fach“-Aussage stützt sich als einzigen Beleg auf einen LinkedIn-Post.
Quer durch alle Befunde zwei Muster: kein einziger Interessenkonflikt gekennzeichnet – als Beleg für Fleisch-Nährwerte dient unter anderem ein Geflügelzüchter – und durchgehend relative Risiken ohne absolute Übersetzung.
Das deckt sich mit dem, was unabhängige Forschung über die Werkzeugklasse sagt: Die Zitiergenauigkeit von Perplexity Deep Research ist hoch – ein akademischer Benchmark, also ein standardisierter Vergleichstest, misst 90,24 Prozent korrekt zugeordnete Zitate.11 Die Schwachstellen liegen eine Ebene tiefer, bei der Beleg-Deckung – also der Frage, ob die Quelle die Aussage inhaltlich deckt – und bei der Einseitigkeit – dort, wo eine Audit-Studie zur Werkzeugklasse durchgängig Lücken findet.12
Der Blick in den Spiegel: Sechzehn eigene Fehler, intern abgefangen
Wer bis hierher „Perplexity kann es eben nicht“ gelesen hat, hat falsch gelesen. Unsere eigene Fehlerliste am selben Thema ist lang genug.
Unsere Pipeline hat beim Schreiben des Fleisch-Artikels auf jeder Prüfstufe eigene Fehler der Klasse A erzeugt oder gefunden – Klasse A heißt bei uns: inhaltliche Falschaussage, Quelle trägt den Satz nicht, erfundene oder ungedeckte Zahl. Insgesamt 16 Befunde, bevor der Text einen Leser erreichte: vier im ersten Schnell-Audit, einer in der Wortbedeutungs-Prüfung, sieben in der zweistufigen Belegprüfung, drei im strengen End-Audit und einer in dessen zweiter Runde – ein Folgefehler unserer eigenen Korrektur.3
Die Fehlerklassen sind dieselben wie beim Perplexity-Bericht. „Quelle trägt den Satz nicht“: Perplexity schrieb Geflügel gesund, wo die Studie das Gegenteil fand – wir schrieben „plötzlicher Herztod“ in eine Aussage über ein EFSA-Gutachten, in dem dieser Begriff nicht vorkommt. „Zahl ohne tragenden Beleg“: Beim Perplexity-Bericht steht eine 97,6-Milliarden-Tierzahl ohne Beleg und Bezugsjahr – bei uns standen Milliardenbeträge zu Subventionen im Entwurf, die in keinem unserer Rohextrakte vorkamen. Gestrichen wurden beide.
Der Unterschied zwischen den Systemen ist also nicht, wer weniger Fehler macht. Der Unterschied ist, wessen Fehler den Leser erreichen.
Die Pointe: Der Prüfbericht begeht den Fehler, den er anprangert
Der aufschlussreichste Moment dieses Vergleichs betrifft uns selbst.
Unser Prüfbericht über den Perplexity-Bericht führte ursprünglich sechs Befunde. Nummer sechs: ein angeblicher interner Widerspruch, weil im Text „über 80 Milliarden geschlachtete Landtiere“ steht und an anderer Stelle „mehr als 97,6 Milliarden“. Klingt nach einem Widerspruch – ist aber keiner. 97,6 ist größer als 80; beide Sätze können gleichzeitig wahr sein. Und zwischen beiden Werten liegt die Schätzung, die Humane World for Animals unter Berufung auf die FAO nennt: 92,2 Milliarden Landtiere, die jährlich gehalten und geschlachtet werden („kept and slaughtered“).13
Gefunden hat das nicht der Prüfer. Gefunden hat es ein Red Team – ein getrennter Agent mit dem expliziten Auftrag, unsere eigene Vergleichs-These anzugreifen. Der Befund wurde herabgestuft; berechtigt blieb nur, dass die 97,6 Milliarden in ihrer Quelle ohne Beleg und Bezugsjahr stehen. Unser Prüfbericht hatte damit genau den Fehler begangen, den er anprangerte: eine dramatische Diagnose, die die Prüfung der eigenen Aussage nicht überlebt.
Es war nicht der einzige Vorfall dieser Art. Beim strengen End-Audit unseres eigenen Fleisch-Artikels erfand das Abruf-Werkzeug des Prüf-Agenten eine Zeitangabe („Frühjahr 2023“), die in der Quelle nirgends steht. Gestoppt hat das kein klügeres Modell, sondern der zeichengenaue Rohextrakt, gegen den jede Aussage laufen muss.3
Die Lehre aus beiden Vorfällen: Verifikation ist keine Instanz, die man einmal einrichtet und der man dann vertraut. Sie ist eine Disziplin – und sie muss auch gegen den Prüfer selbst laufen. Ihr verlässlichstes Werkzeug ist dabei das dümmste: der wörtliche Rohtext der Quelle, an dem sich jedes Modell, jeder Prüfer und jeder Autor messen lassen muss.
Was dieser Vergleich nicht beweist
Wenn sogar der Prüfbericht irrt – was beweist dieser Vergleich dann überhaupt? Weniger, als die Überschrift verspricht. Vier Grenzen, die wir lieber selbst aufschreiben, bevor es ein Leser tut.
Erstens: Das ist ein Einzelfall. Ein Prompt, ein Lauf, ein Thema. Er illustriert ein Muster, das unabhängige Forschung an der Werkzeugklasse findet – funktionierende Links und hohe Zitiergenauigkeit, aber schwache Beleg-Deckung, Einseitigkeit und deutlicher Abstand zu Experten-Maßstäben.12 14 Er beweist es nicht.
Zweitens: Unsere Pipeline hat korrelierte blinde Flecken. Sie besteht durchgehend aus Claude-Modellen. Die Forschung zeigt, dass Sprachmodelle gemeinsam irren: Eine Untersuchung von über 350 Modellen fand, dass Modelle desselben Anbieters oder derselben Basisarchitektur stärker korrelierte Fehler machen – auf einem der beiden untersuchten Leaderboard-Datensätze (71 Modelle) stimmten Modellpaare im Irrtumsfall im Mittel zu 60 Prozent überein – und dass ausgerechnet genauere Modelle noch stärker korrelieren, auch über Anbietergrenzen hinweg.15 Dazu kommt, dass KI-Richter die eigenen Erzeugnisse verzerrt bewerten: Manche bevorzugen sie systematisch, andere benachteiligen sie.16 „Intern abgefangen“ beweist deshalb nicht „nichts übersehen“. Unser Gegenmittel sind die modellunabhängigen Rohextrakte – sie mildern das Problem, beseitigen es aber nicht.
Eine Randnotiz dazu: Laut Perplexitys Help Center nutzt Deep Research die Modelle „Opus 4.6 Thinking“ (Max-Abo) beziehungsweise „4.5 Thinking“ (Pro-Abo)17 – Modellnamen aus der Claude-Familie, wie die Fachpresse berichtet, die die Umstellung auf Anfang Februar 2026 datiert.18 Unser Testlauf lief im Pro-Abo; welches Modell er konkret traf, haben wir nicht dokumentiert. Möglicherweise sind hier also zwei Claude-basierte Systeme gegeneinander angetreten – was die Korrelationsfrage eher verschärft als entkräftet.
Drittens: Der Vergleich war nicht blind. Unsere Prüfer hatten eine Woche Themen-Vorwissen aus der Arbeit am eigenen Fleisch-Artikel, samt 21 fertigen Rohextrakten und einer Liste bekannter Problemzahlen. Mindestens ein Befund – die Leidens-Schätzung – war nur deshalb auffindbar. Der Vergleich misst also teils Domänen-Vorsprung, nicht Pipeline-Überlegenheit.
Viertens: Es gibt einen echten Gegenbeleg. Bei der Literatursuche werden von Menschen zusammengestellte Literaturlisten deutlich unterboten: Nur 51 Prozent der menschlichen Zitate wurden als mindestens moderat relevant eingestuft, gegenüber 86 bis 88 Prozent bei den stärksten KI-gestützten Sortierverfahren; zugleich zitieren menschliche Autoren 2,5-mal häufiger die eigenen Ko-Autoren.19 Auch menschliche – auch unsere – Quellenauswahl ist kein verlässlicher Maßstab, keine „Ground Truth“.
Bleibt die Frage, die ein Entscheider wirklich stellt: Rechnet sich der Aufwand trotzdem?
Die Rechnung: Wann sich welcher Weg lohnt
Die Kostenasymmetrie ist erheblich – und sie gehört auf den Tisch. Perplexity Pro kostet 20 US-Dollar im Monat – umgerechnet etwa 17,50 Euro; einen offiziellen Euro-Listenpreis konnten wir nicht belegen.20 Der Bericht war in Minuten fertig. Unser Weg kostete rund einen Arbeitstag und etwa 1,7 Millionen Agenten-Token; die Tagesabrechnung des Erstellungstages lag bei 188,49 US-Dollar, umgerechnet rund 162 Euro – davon entfiel grob ein Drittel bis die Hälfte auf den Artikel, der Rest auf andere Arbeiten.3
Nach der Metrik „gefundene Fehler pro Euro und Minute“ gewinnt Perplexity diesen Vergleich klar. Das steht hier ausdrücklich so.
Unsere These verlangt eine andere Metrik. Für Texte, die unter eigenem Namen erscheinen oder Entscheidungen tragen, zählt nicht der Preis pro gefundenem Fehler, sondern ob ein Fehler mit dem eigenen Namen darüber erscheint. Ein Faktor-1.000-Fehler in einem internen Rechercheergebnis kostet eine Korrektur. Derselbe Fehler in einem veröffentlichten Text kostet Glaubwürdigkeit – die Währung, in der Berater, Fachautoren und Entscheider bezahlt werden.
Daraus folgt eine einfache Arbeitsteilung: Deep Research zum Erkunden, für interne Orientierung, als Startpunkt – dafür ist es hervorragend und um Größenordnungen günstiger. Und ein getrennter Prüfschritt für alles, was veröffentlicht wird – unabhängig davon, ob der Text von Perplexity, von einer eigenen Pipeline oder von einem Menschen stammt.
Der Markt bepreist die Tiefe gerade
Dass Tiefe Rechenzeit kostet, ist dabei keine Behauptung von uns. Der Anbieter selbst lässt sich die Tiefe seit diesem Jahr bezahlen – die Entwicklung lässt sich Schritt für Schritt datieren:
Beim Start am 14. Februar 2025 bewarb Perplexity Deep Research als kostenlos für alle, mit „unlimited Deep Research queries“ für Pro-Abonnenten.1 Anfang Februar 2026 wurde das Pro-Kontingent auf rund 20 Läufe pro Monat gekürzt – die Ausgangszahl liegt je nach Quelle bei rund 500 bis 600 Läufen pro Tag, die Kürzung selbst ist mehrfach unabhängig belegt und traf Bestandskunden mitten im Abrechnungszeitraum.21 Die offizielle Begründung im Help Center: „Usage limits have been adjusted to allocate more computing power per session, so you get deeper insights and higher-quality results.“17 Ob die Qualität pro Lauf tatsächlich gestiegen ist, ist offen – eine unabhängige Vorher-Nachher-Messung existiert nicht.
Parallel verschiebt sich die Messlatte der Forschung: Die neueren Benchmarks trennen zunehmend „funktioniert der Link“ von „trägt die Quelle die Aussage“ – genau die Ebene, um die es in diesem Artikel geht.11 14
Beides läuft auf denselben Punkt zu: Der Markt bewegt sich von „viel und schnell“ zu „weniger, dafür tiefer“ – und die Bewertungsmaßstäbe wandern von der Zitier-Oberfläche in die Beleg-Tiefe. Wer heute eine Veröffentlichungs-Pipeline baut, sollte diese Bewegung ernst nehmen: Das Recherchesystem liefert den Rohstoff. Die Prüfung gegen den Quellen-Rohtext – getrennt, wiederholbar, auch gegen sich selbst – macht daraus etwas, das man unterschreiben kann.
Verdichtet auf drei Fragen, bevor ein Deep-Research-Bericht nach draußen geht:
- Trägt jede tragende Quelle den Satz, der auf ihr steht – geprüft am Rohtext der Quelle, nicht am funktionierenden Link?
- Sind Interessenlagen der Quellen gekennzeichnet, und steht neben jedem relativen Risiko die absolute Zahl?
- Lief die Prüfung auch gegen den Prüfer – mit einem Rechercheauftrag gegen die eigene These?
Wer alle drei mit Ja beantwortet, darf unterschreiben. Denn Zitieren ist nicht Belegen – der zweite Schritt ist der, für den man mit seinem Namen einsteht.
Zum Schluss das Transparenzangebot, das wir von jedem Fremdbericht verlangen würden: Der ungekürzte Perplexity-Bericht ist als Belegdokument veröffentlicht (verlinkt am Artikelanfang); sämtliche Quellen-Rohextrakte und unser vollständiges Prüfprotokoll – einschließlich des Befunds, den unser eigener Prüfbericht nicht überlebt hat – liegen vor und werden auf Anfrage offengelegt. Dieselbe Falsifizierbarkeit, die dieser Artikel einfordert.
Quellen
-
Perplexity: „Introducing Perplexity Deep Research“, Blogpost vom 14.02.2025. Original-URL https://www.perplexity.ai/hub/blog/introducing-perplexity-deep-research (blockiert automatisierte Abrufe); wörtlich geprüft am Wayback-Snapshot vom Launch-Tag: https://web.archive.org/web/20250214203504/https://www.perplexity.ai/hub/blog/introducing-perplexity-deep-research (Abruf 30.08.2026). Wörtliche Zitate daraus: „expert-level analysis across a range of complex subject matters“, „completing most research tasks in under 3 minutes“, „Pro subscribers get unlimited Deep Research queries“. Anbieter-Selbstauskunft, entsprechend interessengeleitet. Randnotiz zur Sorgfalt von Sekundärquellen: Der Launch-Blogpost nennt für den Benchmark „Humanity’s Last Exam“ 20,5 Prozent; die Tech-Presse und Perplexitys eigener X-Kanal verbreiteten 21,1 Prozent – schon die Selbstauskunft existiert also in zwei Versionen. ↩ ↩2 ↩3
-
„Nicht welches Fleisch, sondern wie viel: Warum der beste Kompromiss ein Mengenziel ist – und kein Label“ (A16), dieser Blog. Der Artikel, den unsere Pipeline aus demselben Prompt erzeugte. ↩
-
Interne Ablaufprotokolle (Harness-Protokolle) und Prüfprotokolle der Artikel-Erstellung (Agenten-Läufe, Token-Abrechnung, Befundlisten aller sechs Prüfstufen, Tagesabrechnung vom 29.08.2026). Offenlegung auf Anfrage; Euro-Umrechnung zum EZB-Referenzkurs vom 28.08.2026 (0,85889 EUR/USD). ↩ ↩2 ↩3 ↩4
-
Bryant Research: rund 200 Hühner ersetzen die Fleischmenge eines Rinds; im A16-Artikel gegen die Quelle geprüft. Siehe die dortige Fußnote samt Quellenangabe. ↩
-
Methodik-Referenz: zweistufige Belegprüfung – ein Agent extrahiert die Quelle blind (kennt die zu prüfende Behauptung nicht), ein zweiter vergleicht Behauptung und Extrakt ohne Netzzugang. Prompt-Vorlagen im offenen Repository: https://github.com/flodido/agentic-research-vault ↩
-
Water Footprint Network: „What can consumers do?“, https://www.waterfootprint.org/time-for-action/what-can-consumers-do/ (Rohextrakt vom 30.08.2026). Dort: 15.400 m³/t für Rindfleisch. Der geprüfte Bericht schreibt „roughly 15,400 cubic meters of water“ je Kilogramm – das Tausendfache. ↩
-
Zhong, V. W. et al.: „Associations of Processed Meat, Unprocessed Red Meat, Poultry, or Fish Intake With Incident Cardiovascular Disease and All-Cause Mortality“, JAMA Internal Medicine, 03.02.2020. https://jamanetwork.com/journals/jamainternalmedicine/fullarticle/2759737 (Rohextrakt vom 30.08.2026). Geflügel: HR 1,04 (95-%-KI 1,01–1,06) für inzidente kardiovaskuläre Erkrankung; keine signifikante Assoziation mit der Gesamtmortalität. ↩
-
Northwestern Feinberg School of Medicine (Pressestelle der Studieninstitution): „Meat Consumption Raises Risk of Heart Disease and Death“, 03.02.2020. https://news.feinberg.northwestern.edu/2020/02/03/meat-consumption-raises-risk-of-heart-disease-and-death/ (Abruf 30.08.2026) – bestätigt den Geflügel-Befund und die Zurückhaltung der Autoren (mögliche Zubereitungseffekte, Hühnerhaut). ↩
-
McAuliffe, W.: Replikationsversuch der Cumulative-Pain-Schätzungen, Rethink Priorities, 03.11.2025. https://rethinkpriorities.org/research-area/cumulative-pain-framework/ (Abruf 29.08.2026). Drei unabhängige Fachleute replizierten vier Schätzungen; die Überlappung der Schätzintervalle war gering („Overlap in average time in pain was fairly low, suggesting that raters’ raw estimates were overprecise“). Die zugrunde liegende Methodik stammt vom Welfare Footprint Institute (Advocacy-nahe Forschung). ↩
-
UK Biobank: „Red meat consumption and all-cause and cardiovascular mortality: results from the UK Biobank study“. https://www.ukbiobank.ac.uk/publications/red-meat-consumption-and-all-cause-and-cardiovascular-mortality-results-from-the-uk-biobank-study/ (Rohextrakt vom 30.08.2026). Die Studie fand erhöhte kardiovaskuläre Teilrisiken, „but not all-cause mortality“. ↩
-
DeepResearch Bench: „A Comprehensive Benchmark for Deep Research Agents“ (arXiv:2506.11763), 2025. https://deepresearch-bench.github.io/ – FACT-Framework: 90,24 Prozent Citation Accuracy für Perplexity Deep Research; andere Perplexity-Modi deutlich darunter (Sonar Reasoning Pro: 39,36 Prozent). Unabhängige akademische Quelle, Methodik offengelegt (100 Aufgaben auf Promotionsniveau, 22 Fachgebiete). ↩ ↩2
-
Venkit, Laban et al. (Salesforce AI Research): „DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence“. https://arxiv.org/abs/2509.04499 (Abruf 30.08.2026). Befund über mehrere Systeme: Zitationsgenauigkeit 40–80 Prozent, hohe Einseitigkeits-Werte. Anbieter-Nähe beachten: Salesforce betreibt ein eigenes Agenten-Geschäft. ↩ ↩2
-
Humane World for Animals: „More animals than ever before – 92.2 billion – are used and killed each year for food“. https://www.humaneworld.org/en/blog/92-billion-animals-used-killed-meat-each-year (Abruf 30.08.2026). NGO-Quelle (Advocacy); hier ausschließlich als Beleg für eine zwischen beiden Werten liegende Schätzung herangezogen („An estimated 92.2 billion land animals are kept and slaughtered annually in the global food system, according to the Food and Agriculture Organization“ – ohne Bezugsjahr). ↩
-
„DEER: A Benchmark for Evaluating Deep Research Agents on Expert Report Generation“ (arXiv:2512.17776) und DeepResearch Bench II (arXiv:2601.08536, beide Abruf 30.08.2026): Auch die stärksten Deep-Research-Agenten bleiben in Experten-Bewertungsrastern deutlich hinter Fachleuten zurück. Ergänzend zur Werkzeugklasse: „Cited but Not Verified“ (arXiv:2605.06635) trennt funktionierende Links von tatsächlicher Beleg-Deckung; Perplexity selbst wird dort nicht getestet. ↩ ↩2
-
Kim, Garg, Peng, Garg: „Correlated Errors in Large Language Models“, ICML 2025. https://arxiv.org/abs/2506.07962 (Abruf 30.08.2026) – Analyse von über 350 Modellen über zwei Leaderboards und eine Bewerbungs-Screening-Aufgabe. Auf dem Helm-Datensatz (71 Modelle) stimmen falsche Antworten von Modellpaaren im Mittel zu 60 Prozent überein (Zufallserwartung: ein Drittel). Modelle desselben Anbieters oder derselben Basisarchitektur korrelieren stärker; individuell genauere Modelle korrelieren „even with distinct architectures and providers“ noch stärker. ↩
-
„Quantifying and Mitigating Self-Preference Bias of LLM Judges“. https://arxiv.org/abs/2604.22891 – Misst die Selbstpräferenz-Verzerrung von KI-Richtern gegenüber den eigenen Ausgaben: verbreitet, aber nicht einheitlich selbstbevorzugend (von 20 Modellen 8 positiv, 9 negativ, 3 neutral verzerrt); Familien-Effekte über Modellgrenzen hinweg nennt das Paper ausdrücklich als offene, nicht entwirrte Limitation. ↩
-
Perplexity Help Center: „What’s New in Advanced Deep Research“. Original-URL https://www.perplexity.ai/help-center/en/articles/13600190-what-s-new-in-advanced-deep-research (blockiert automatisierte Abrufe); wörtlich geprüft am Wayback-Snapshot vom 11.02.2026: https://web.archive.org/web/20260211012137/https://www.perplexity.ai/help-center/en/articles/13600190-what-s-new-in-advanced-deep-research (Abruf 30.08.2026). Wörtlich: „Max subscribers get Opus 4.6 Thinking“, „Pro subscribers get 4.5 Thinking gradually“, „Usage limits have been adjusted to allocate more computing power per session, so you get deeper insights and higher-quality results.“ Die Seite trägt kein absolutes Änderungsdatum. ↩ ↩2
-
Dataconomy: „Perplexity Upgrades Deep Research Tool With Claude Opus 4.5 Integration“, 05.02.2026. https://dataconomy.com/2026/02/05/perplexity-upgrades-deep-research-tool-with-claude-opus-4-5-integration/ (Abruf 30.08.2026) – ordnet die Modellnamen des Help Centers der Claude-Familie von Anthropic zu. ↩
-
Sahu, Charlin, Pal: „Rethinking Literature Search Evaluation: Deep Research Helps, and Human Citation Lists Are Not a Ground Truth“. https://arxiv.org/pdf/2605.29234 (Abruf 30.08.2026). ↩
-
GIGA.de: „Perplexity-Abos im Check“, 06.01.2026. https://www.giga.de/tech/perplexity-abos-im-check-wann-sich-das-upgrade-wirklich-lohnt—01JYE759P51Z7MWWKCRSEA55VF (Abruf 30.08.2026). Die Euro-Angabe (~17,50 €/Monat) ist erkennbar eine Umrechnung des US-Preises von 20 $, kein eigener EU-Listenpreis; Mehrwertsteuer-Behandlung ungeklärt. Der Artikel ist als „Anzeige“ gekennzeichnet und enthält einen Affiliate-Link-Hinweis der Redaktion. ↩
-
MakeUseOf: „If you bought an annual Perplexity subscription, you were lied to“, Februar 2026. https://www.makeuseof.com/bought-annual-perplexity-subscription-lied/ – unabhängig bestätigt durch den anhand der Wayback Machine überprüften Limit-Tracker https://ailimit.watch/tools/perplexity/ (Stand 06.06.2026, Abruf 30.08.2026: „Deep Research quota slashed ~500/day → 20/mo“, als unangekündigt markiert). Die Ausgangszahl liegt je nach Quelle bei rund 500 bis 600 pro Tag (MakeUseOf: „500 to 600 Deep Research queries per day“); die Kürzung auf ~20/Monat und die fehlende Vorab-Information der Bestandskunden sind mehrfach unabhängig belegt. ↩
Transparenzhinweis: Dieser Beitrag wurde KI-gestützt erstellt und vor Veröffentlichung redaktionell geprüft.