Gegenläufige Kurven: Warum zwischen lokalem LLM und GitHub Copilot die Datenklassifizierung entscheidet – nicht der Preis
Festpreis-Vergleiche und Datenschutz-Pauschalen sind 2026 als Entscheidungsgrundlage weggebrochen. Was bleibt, ist die Frage, welche Datenklassen mehr brauchen als EU-Residency – und nur für diesen Rest ist der lokale Betrieb begründbar.
Eine Frage, die 2026 zweimal neu gestellt wurde
Die Folie ist schnell gebaut. Links: GitHub Copilot Business, 19 Dollar pro Kopf und Monat, ein sauberer Balken. Rechts: eine Workstation mit dicker GPU, abgeschrieben über drei Jahre, daneben ein Ollama-Logo. Darunter der Satz, der in deutschen IT-Runden jede Diskussion beendet: „Unser Code darf sowieso nicht in die Cloud.“ Die Runde nickt, die Entscheidung vertagt sich auf das nächste Budget-Meeting. Beide Hälften dieser Folie sind in diesem Jahr verfallen.
Zweimal binnen weniger Wochen hat sich die Grundlage verschoben. Seit dem 1. Juni 2026 rechnet GitHub Copilot nicht mehr zum Festpreis ab, sondern nutzungsbasiert über „AI Credits“ – tokenbasiert, nach den publizierten API-Preisen je Modell, angekündigt am 27. April 2026.1 Und seit April/Mai 2026 bietet Copilot EU-Data-Residency: Inferenz und zugehörige Daten bleiben auf Wunsch in der EU-Region.2 Der linke Balken der Folie hat keinen festen Wert mehr, und der Satz darunter ist als Pauschale nicht mehr haltbar.
Die zentrale These dieses Artikels lautet: Weder der Preis noch das Pauschalverbot „sensibler Code darf nicht in die Cloud“ taugt 2026 noch als Entscheidungsgrundlage – beides ist in diesem Jahr weggebrochen. Was bleibt, ist die Frage, die vor jeder Werkzeugwahl steht: Welche Klasse von Code und Daten braucht mehr als EU-Data-Residency? Nur für diesen Rest ist der lokale Betrieb begründbar – und wer ihn fährt, fährt Hybrid: als Mehraufwand mit Begründungspflicht, nicht als Kompromiss.
Das ist ausdrücklich eine normative Aussage, keine Beschreibung des Ist-Zustands – in der Unternehmensrealität läuft die KI-Einführung der Governance meist davon, dazu später mehr. Der Artikel nimmt beide klassischen Sichtweisen ernst: die CFO-Sicht (der Preis entscheidet) und die CISO-Sicht (der Datenschutz entscheidet). Beide werden geprüft. Beide halten nicht mehr.
Wer die Lokal-oder-Copilot-Frage mit den Argumenten von 2025 beantwortet, beantwortet eine Frage, die es so nicht mehr gibt.
Wenn die alten Anker weggebrochen sind, muss man prüfen, was sie ersetzt – zuerst der scheinbar härteste: der Preis.
Was nicht mehr trägt: Festpreis-Rechnungen und ROI-Versprechen
Der klassische Kostenvergleich lautete: 19 Dollar pro Seat und Monat gegen die Abschreibung eigener Hardware. Diese Rechnung existiert seit dem 1. Juni 2026 nicht mehr. Copilot rechnet in AI Credits ab; ein Credit entspricht 0,01 Dollar, verbraucht wird nach Token zu den API-Tarifen des jeweils gewählten Modells.1 Code-Completions und Next-Edit-Suggestions bleiben bei allen Bezahlplänen ohne Credit-Verbrauch unbegrenzt enthalten – die Kernfunktion ist also weiterhin im Seat-Preis abgedeckt.3 Aber Chat, Agenten und Code-Review laufen über Credits, und agentische Workloads können den Verbrauch nach oben treiben, ohne feste Obergrenze. GitHub selbst begründet die Umstellung damit, das alte Premium-Request-Modell sei angesichts gestiegener Inferenzkosten „no longer sustainable“ gewesen – eine Selbstauskunft des Anbieters, aber eine aufschlussreiche.1
Wer Copilot-Planpreise zitiert, sollte sie tagesaktuell prüfen. Genau das ist der Punkt. Die Planpreise, Stand 15. August 2026: Free 0 Dollar (2.000 Completions/Monat), Pro 10 Dollar inklusive 15 Dollar Credits, Pro+ 39 Dollar inklusive 70 Dollar, Max 100 Dollar inklusive 200 Dollar, Business 19 Dollar pro Seat, Enterprise 39 Dollar pro Seat; Bestandskunden in Business und Enterprise erhalten vom 1. Juni bis 1. September 2026 erhöhte Übergangs-Credits (30 bzw. 70 Dollar).3 Bemerkenswert: Die April-Ankündigung nannte für Pro noch 10 Dollar Inklusiv-Credits, die Plans-Seite weist im August 15 Dollar aus – die Volumina wurden offenbar nachgebessert; warum, ist nicht belegt.
Auf der anderen Seite ist der Self-Hosting-Break-even alles andere als eine feste Größe. Pan, Chodnekar, Roy und Wang (Carnegie Mellon) rechneten 54 Szenarien durch: Kleine Unternehmen erreichen den Break-even mit einer einzelnen RTX 5090 in 0,3 bis 3 Monaten, mittlere mit Dual-A100-Setups in 3,8 bis 34 Monaten, große Cluster in 3,5 bis 69,3 Monaten – gegen aggressive API-Preise teils in über 5 Jahren. Ihr Kernbefund: Schon moderate API-Preisänderungen führen zu großen Ausschlägen in der Kosteneffizienz („large swings in cost-effectiveness“).4 Praktiker-Faustformeln bestätigen die Spreizung: Gegen die APIs der Spitzenmodelle (Frontier-APIs) liegt die Schwelle grob bei 160 bis 256 Millionen Tokens pro Monat, gegen günstige Open-Weight-APIs bei 2,5 bis 7 Milliarden – für Einzelteams „praktisch unerreichbar“; die Schwellen variieren je nach Quelle um Größenordnungen und taugen nur als Spanne, nie als Punktwert.5 Ein Preisvergleich zwischen beiden Pfaden hat 2026 eine Halbwertszeit von Monaten. Er kann die Entscheidung nicht tragen.
Die CFO-Position „real entscheidet der Preis“ hat dabei einen wahren Kern: Der Preis entscheidet dort, wo er stabil vergleichbar wäre. Genau das ist er 2026 auf beiden Seiten nicht mehr. Hinzu kommt eine Lücke, die auffällig ist: Unabhängige Daten, wie viele Credits ein durchschnittlicher Entwickler pro Monat tatsächlich verbraucht – ob also das Inklusivvolumen eines Business-Seats reicht –, existieren öffentlich schlicht nicht. Wer heute kalkuliert, kalkuliert mit Herstellerangaben und Hoffnung.
Und die ROI-Seite? Sie ist noch brüchiger. Die vielzitierte Zahl „376 Prozent ROI“ stammt aus einer von GitHub beauftragten Forrester-TEI-Studie – und zwar zu GitHub Enterprise Cloud insgesamt (Composite-Organisation: 85,9 Millionen Dollar Nutzen gegen 18,1 Millionen Dollar Kosten über drei Jahre), nicht zu Copilot allein. In Sekundärquellen wird sie regelmäßig fälschlich als „Copilot-ROI“ geführt.6 Die härteste unabhängige Messung zeigt in die Gegenrichtung: Becker, Rush, Barnes und Rein (METR) fanden 2025 in einem randomisierten kontrollierten Experiment, dass 16 erfahrene Open-Source-Entwickler über 246 reale Tasks mit KI-Unterstützung 19 Prozent langsamer waren – obwohl sie vorher 24 Prozent Beschleunigung erwartet und hinterher 20 Prozent zu spüren geglaubt hatten. Die Vorbehalte gehören zwingend dazu: n=16, sehr erfahrene Entwickler in vertrauten Repositories, Tooling-Stand Anfang 2025 (Cursor Pro mit Claude 3.5/3.7 Sonnet); METR selbst stuft das Ergebnis inzwischen als überholt ein („historical“) und warnt vor Verallgemeinerung.7 Dem stehen anbietervermittelte Erfolgszahlen gegenüber, etwa aus dem GitHub/Accenture-Deployment – durchweg anbieternahes Material, dessen Originalstudien hier nicht unabhängig geprüft werden konnten; es taugt als Gegenstimme, nicht als Beleg.8
Daraus folgt: Wer die Werkzeugwahl auf Produktivitätszahlen baut, baut auf Sand – und wer sie auf einen Preisvergleich baut, baut auf Treibsand.
Seit dem 1. Juni 2026 gibt es den Copilot-Festpreis nicht mehr – und einen belastbaren Copilot-ROI gab es nie.
Wenn Preis und ROI die Entscheidung nicht determinieren, bleibt die Frage mit tatsächlich harten, binären Konsequenzen: Was darf wohin? Die Datenfrage.
Der wahre Entscheider: Was Datenschutz 2026 noch erzwingt – und was nicht mehr
Das Pauschalargument „sensibler Code darf nicht in die Cloud“ war jahrelang der stärkste Hebel für den lokalen Pfad. Seit Mai 2026 ist es in dieser Form überholt. GitHub Copilot bietet Data Residency für die USA und die EU (EU-Region seit 1. Mai 2026 inklusive der EFTA-Staaten): Sämtliche Inferenz und zugehörige Daten bleiben in der gewählten Region, alle Copilot-GA-Features sind abgedeckt – Agent-Modus, Chat, Review, CLI –, dazu FedRAMP Moderate für US-Behördenkontexte.2 Das ist keine reine Anbieterbehauptung mehr: Analysten (Futurum Group) und unabhängige Praktiker haben Umfang und Funktionsweise bestätigt.9
Aktiviert wird das Ganze als Opt-in über die Admin-Policy „Restrict Copilot to data residency compliant models“ – standardmäßig deaktiviert –, und es kostet laut GitHub-Doku einen Aufschlag von 10 Prozent auf den Credit-Verbrauch.10 Die Modellpalette der EU-Region umfasst laut aktueller GitHub-Doku inzwischen auch Gemini-Modelle; nur die US-Region listet sie nicht.10
Für die DSGVO-Frage kommt hinzu, was GitHub zur Datenverarbeitung zusagt. Die wörtlich zitierfähige Formulierung findet sich derzeit nur in einem Microsoft-Learn-Modul (Stand 28. Juli 2025): „GitHub Copilot in the code editor does not retain any prompts like code or other context used for the purposes of providing suggestions to train the foundational models. It discards the prompts once a suggestion is returned.“ Für Copilot Chat außerhalb des Editors gilt demnach typischerweise eine Retention von 28 Tagen.11 Wichtig zur Einordnung: Das ist eine dokumentierte Herstellerzusage, unabhängig nicht verifizierbar – das Copilot Trust Center als Primärort war zum Recherche-Stand nicht automatisiert abrufbar (Details in den Redaktionellen Hinweisen). Mehr als diese Zusage lässt sich derzeit seriös nicht behaupten. Und unabhängige Sicherheitsforscher (GitGuardian, 2025) weisen darauf hin, dass Copilot in der IDE kontinuierlich den Code als Kontext liest und wirklich sicher nur ist, wer Klartext-Secrets ganz aus dem Code eliminiert – ein reales Expositionsrisiko, das Konfigurationsdisziplin verlangt; die GitHub-Doku selbst dokumentiert zudem Grenzen der Content Exclusions: Semantische Informationen aus ausgeschlossenen Dateien können indirekt über die IDE einfließen, Symlinks und Remote-Dateisysteme sind nicht abgedeckt.12
So weit die eine Hälfte des Befunds: Die Residency-Anforderung – Daten bleiben in der EU – ist 2026 per Copilot lösbar, für zehn Prozent mehr Credit-Verbrauch.
Jetzt die andere Hälfte, und sie ist der Kern: Residency ist nicht Souveränität. Anton Carniaux, Directeur des affaires publiques et juridiques von Microsoft France, sagte am 18. Juni 2025 unter Eid vor der Untersuchungskommission des französischen Senats, er könne nicht garantieren, dass Daten französischer Bürger niemals ohne Zustimmung an US-Behörden übermittelt werden – unter dem CLOUD Act muss Microsoft begründeten US-Anfragen unabhängig vom Speicherort nachkommen.13 Der Speicherort beantwortet also die Frage „Wo liegen die Daten?“, nicht die Frage „Wer kann Zugriff erzwingen?“.
Damit zerfällt das Wort „sensibel“ in zwei Klassen, die bisher pauschal in einen Topf geworfen wurden: Datenklassen mit DSGVO-/Residency-Anforderung – 2026 per Copilot-Opt-in abdeckbar – und Datenklassen mit Souveränitäts-, Geheimschutz- oder CLOUD-Act-Anforderung, für die keine Cloud-Zusage der Welt genügt und der lokale Betrieb sachlich begründet bleibt. Der stärkste Gegenbeleg gegen die alte Datenschutz-Pauschale stützt so ausgerechnet den Kern der These: Diese Unterscheidung treffen kann nur, wer seine Daten klassifiziert hat. Die Klassifizierung ist der eigentliche Entscheidungsschritt – nicht die Werkzeugwahl.
Eine Randnotiz zum EU AI Act, bewusst nur eine Randnotiz: Wer die Governance-Pflicht mit Regulierungsdruck begründen will, argumentiert auf wackligem Boden. Die Digital-Omnibus-Einigung vom Mai 2026 verschiebt die High-Risk-Pflichten (Annex III) auf den 2. Dezember 2027, und Codeassistenz fällt ohnehin in aller Regel nicht in den Hochrisiko-Bereich.14 Zugleich gilt: Verschoben heißt nicht gestrichen – die GPAI-Pflichten werden seit dem 2. August 2026 durchgesetzt, mit Bußgeldern bis 3 Prozent des weltweiten Jahresumsatzes oder 15 Millionen Euro; sie treffen allerdings primär die Modell-Anbieter, nicht die nutzenden Unternehmen.15 Die Begründung für Datenklassifizierung ruht deshalb nicht auf dem AI Act, sondern auf Datenschutz, Geheimschutz und – dazu im Abschnitt „Hybrid mit Begründungspflicht“ – Shadow AI.
Daraus folgt: Die CISO-Position „die Datenschutz-Prämisse ist überholt“ hat recht – und zieht die falsche Konsequenz. Gerade weil Residency die DSGVO-Klasse abdeckt, wird die Klassifizierungspflicht schärfer, nicht lockerer: Man muss jetzt begründen können, welche Daten in die verbleibende, kleinere Sonderklasse fallen.
EU-Residency beantwortet die DSGVO-Frage für zehn Prozent mehr Credit-Verbrauch – die Souveränitätsfrage beantwortet sie nicht. Welche der beiden Fragen Ihr Code stellt, sagt Ihnen nur Ihre Datenklassifizierung.
Erst wenn feststeht, welche Datenklassen den Cloud-Pfad verlassen müssen, lohnt der Blick auf die Werkzeuge – und der Optionsraum ist größer und gestufter, als „lokal vs. Copilot“ suggeriert.
Der Optionsraum 2026: drei Pfade, nicht zwei – und die BYOK-Brücke
Die Debatte tut so, als gäbe es zwei Optionen. Es sind drei – und die Unterscheidung entscheidet darüber, ob „lokal ist konkurrenzfähig“ wahr oder falsch ist.
Eine Randnotiz zur Abgrenzung vorweg: Cursor, Windsurf, JetBrains AI, Tabnine oder Amazon Q bilden einen eigenen Vergleichsraum, der hier bewusst ausgeklammert bleibt – dieser Artikel vergleicht den Copilot-Pfad mit dem Selbstbetrieb.
Pfad 1: Frontier-Cloud. Copilot mit Spitzenmodellen. Anbieter-Vergleiche (Faros.ai, Stand Juli 2026) verorten das führende Closed-Modell bei knapp 89 Prozent auf SWE-bench Verified (Claude Opus 4.8: 88,6 %), mit klarem Vorsprung gerade bei komplexer, mehrstufiger agentischer Arbeit.16
Pfad 2: Cluster-Open-Weight. Offene Modelle wie DeepSeek-V4-Pro, MiniMax M3 oder Kimi K2.6 erreichen laut denselben Vergleichen rund 80 Prozent – aber das sind Modelle der 700B+-Klasse, die Rechenzentrums-Hardware brauchen, teils mehrere H100-Beschleuniger oder mehr.16 „Open Weight“ heißt nicht „läuft auf der Workstation“.
Pfad 3: Workstation-lokal. Was tatsächlich auf einer einzelnen 24-GB-GPU oder einem gut ausgestatteten Mac läuft – die Qwen-Coder-Klasse und Verwandte –, liegt eine Qualitätsklasse darunter, in den Anbieter-Vergleichen bei rund 70 Prozent.16 17
Alle drei Zahlen stammen aus derselben Quelle, vom selben Benchmark, zum selben Stand (Juli 2026) – nur so sind sie vergleichbar. Und alle drei tragen denselben Vorbehalt, denn das Benchmark-Vertrauen selbst ist 2026 beschädigt: OpenAI veröffentlicht seit Februar 2026 keine SWE-bench-Verified-Ergebnisse mehr und rät von der Nutzung ab – der Benchmark wurde nicht zurückgezogen, aber Sekundäranalysen dokumentieren massive Qualitäts- und Kontaminationsprobleme: Laut dem dort referierten OpenAI-Audit konnten alle großen Frontier-Modelle für manche Aufgaben die Original-Lösungspatches wörtlich reproduzieren, und 59,4 Prozent der schwersten ungelösten Aufgaben hatten fehlerhafte Testfälle.18 Ob auch der Nachfolger SWE-bench Pro noch empfohlen ist, ist zwischen den Quellen strittig – eine offene Frage, die hier offen bleibt. Dekontaminierte Alternativen wie SWE-rebench existieren als Forschungsansatz.19 Für den Artikel heißt das: Die Dreiteilung ist als Größenordnung belastbar, jede Einzelzahl ist es nicht.
Das Praktiker-Bild deckt sich mit der Dreiteilung. In einem vielstimmigen Hacker-News-Thread vom Oktober 2025 – Vorbehalt zum Erhebungszeitpunkt: Modelle sind seither besser geworden – lautete das Konsensurteil: „for coding there is a big gap between the quality of models you can run at home and those you can’t“; lokale Modelle taugen für Routine, für agentisches Multi-Turn-Coding liegen die Frontier-Modelle klar vorn. Zwei Stimmen aus dem Thread zeigen die Spannweite: Ein Entwickler ließ gpt-oss-120b auf einem MacBook Pro mit 128 GB RAM laufen – „shockingly usable“. Ein anderer betrieb dasselbe Modell auf einem i7 mit 64 GB RAM und einer alten 8-GB-NVIDIA-GPU: Ein 50-Fragen-Quiz, das ChatGPT in 6 Minuten löste, brauchte lokal über eine Stunde – bei sogar leicht besserem Ergebnis (47 statt 46 richtige Antworten).20
Verbindendes Element der drei Pfade ist BYOK („Bring your own key“): Seit dem 22. April 2026 können Copilot-Business- und Enterprise-Organisationen in VS Code eigene Modell-Schlüssel einbinden – standardmäßig aktiviert, per Admin-Policy abschaltbar.21 Die Provider-Liste umfasst neben Anthropic, OpenAI, Gemini und Azure ausdrücklich auch Ollama, also lokale Modelle; BYOK funktioniert ohne GitHub-Login und vollständig offline.22 Abgerechnet wird direkt beim gewählten Provider, nicht über Credits.21 Ein Praxishinweis am Rande: Der eingebaute Ollama-Provider in VS Code wird zugunsten einer offiziellen Ollama-Extension aus dem Marketplace abgelöst.23
Aber – und dieser Vorbehalt gehört an den Anfang jeder BYOK-Überlegung –: BYOK gilt nicht für Code-Completions, Inline-Vorschläge, semantische Suche und Embeddings. Nur für Chat und Agenten.21 22 Die Kernfunktion, mit der Copilot groß geworden ist, bleibt Cloud. Wer „Copilot mit lokalem Modell“ plant, plant einen Teil-Copilot.
Daraus folgt: Pauschalaussagen wie „lokal ist (nicht) konkurrenzfähig“ sind in beide Richtungen falsch – es kommt darauf an, welcher der drei Pfade gemeint ist. Und die Brücke zwischen ihnen ist schmaler, als das BYOK-Etikett verspricht.
„Open Weight“ ist nicht „lokal“: Die 80-Prozent-Modelle laufen im Rechenzentrum – auf der Workstation läuft eine Klasse darunter. Und BYOK bringt lokale Modelle in den Copilot-Chat, aber nicht in die Completions.
Der dritte Pfad sieht auf dem Papier attraktiv aus – was er im Betrieb wirklich kostet und verlangt, zeigt der nächste Abschnitt.
Selbstbetrieb ohne Illusionen: Betriebslast, Kosten, Sicherheit
Der lokale Pfad ist kein Einkauf, sondern ein Betriebsmodell. Das lässt sich beziffern – mit offenen Annahmen.
Kosten. Eine eigene Beispielrechnung auf Basis der BDEW-Strompreisanalyse und aktueller Hardware-Preistracker (ausdrücklich: Beispielrechnung mit setzbaren Annahmen, kein Marktfakt): Eine RTX-5090-Workstation unter Entwicklerlast – etwa 600 Watt, 8 Stunden, 21 Arbeitstage – verbraucht rund 101 kWh im Monat; beim BDEW-Industriestrompreis für kleine und mittlere Betriebe von 16,7 ct/kWh (Neuabschlüsse 2026) sind das etwa 17 Euro Strom pro Monat.24 Die Hardware selbst: Eine RTX 5090 kostete zum Marktstart im Januar 2025 laut Liste 1.999 Dollar – im August 2026 liegt der Straßenpreis je nach Tracker bei 4.600 bis 4.700 Dollar, rund 130 bis 135 Prozent über MSRP, mit Preissprüngen von 27 bis 39 Prozent allein im August; Treiber sind die explodierenden Speicherpreise.25 Eine ~6.000-Euro-Workstation, über 36 Monate abgeschrieben, ergibt rund 167 Euro pro Monat, zusammen also etwa 184 Euro pro Monat und Arbeitsplatz – gut das Zehnfache eines Copilot-Business-Seats. Selbst die Sparvariante mit gebrauchter RTX 4090 (rund 2.500 Dollar, Stand 15. August 2026) landet bei etwa 123 Euro monatlich, dem Siebenfachen.25 Personal ist da noch gar nicht eingerechnet.
Die Rechnung kippt unter zwei Bedingungen – und nur unter diesen: wenn geteilte, hoch ausgelastete Mehrbenutzer-Infrastruktur die Fixkosten auf viele Köpfe verteilt oder wenn die Datenklasse den Cloud-Pfad ausschließt und der Preisvergleich damit gegenstandslos wird. Der Hebel dahinter ist die Auslastung, und die Arithmetik ist unbarmherzig: Bei 60 Prozent Auslastung kostet dieselbe Infrastruktur das 1,7-Fache, bei 25 Prozent das Vierfache der Vollauslastungsrechnung – eine gemietete GPU kostet im Leerlauf dasselbe wie unter Volllast („A rented GPU costs the same whether it’s idle or fully loaded“), die effektiven Kosten pro Token steigen also umgekehrt proportional zur Auslastung.5
Personal. Der Ops-Aufwand des Selbstbetriebs liegt nach Praktiker-Schätzungen in der Größenordnung des 1,3- bis 2-Fachen der reinen GPU-Kosten, bei komplexen Setups deutlich darüber; andere Quellen taxieren ihn auf 20 bis 30 Prozent einer Senior-Engineering-Stelle.5 26 Belastbar ist an diesen Zahlen nur die Spanne und die Richtung: Der Personalanteil ist erheblich und wird systematisch unterschätzt – das ist die berechtigte Kernaussage der IT-Betriebs-Perspektive.
Betriebsrealität. Die Werkzeugebene ist gestuft: Ollama ist Einzelplatz-Tooling; Team- und Produktions-Serving läuft 2026 über vLLM oder SGLang, mit allem, was dazugehört – GPU-Speicherplanung, Parallelitäts-Tuning, Kapazitätsmanagement.27 Dokumentierte Abbrüche folgen einem wiederkehrenden Muster: Ein Einzelentwickler bilanzierte nach drei Monaten Self-Hosting über 420 Dollar Kosten plus 40 Stunden Debugging für einen Workload, der per API unter einem Dollar im Monat gelegen hätte – wobei dieser Bericht mit Vorsicht zu lesen ist, der Autor bewirbt am Ende ein eigenes API-Produkt.28 Das Muster „Prototyp mit Ollama ist leicht, Produktion braucht mehr Engineering als erwartet“ ist mehrfach beschrieben, aber nur auf Einzel- und Teamebene belegt. Und hier steckt ein Befund, der selbst einer ist: Erfolgsgeschichten des Selbstbetriebs sind anbietervermittelt, Scheitern ist anekdotisch dokumentiert – öffentliche Enterprise-Postmortems fehlen schlicht. Diese Asymmetrie gehört zur ehrlichen Entscheidungsgrundlage dazu; die Einzelfälle taugen jedenfalls nicht als Gegenstück zu Enterprise-Erfolgszahlen, das hieße, Äpfel mit Birnen zu vergleichen – Einzelentwickler- mit Unternehmensebene.
Sicherheit. Der härteste Beleg dafür, dass Selbstbetrieb Governance nicht ersetzt, kam am 29. Januar 2026: SentinelLABS und Censys fanden 175.108 öffentlich exponierte Ollama-Instanzen in 130 Ländern – ohne jede Authentifizierung, 48 Prozent mit aktiviertem Tool-Calling, Deutschland unter den Top-Ländern; dokumentiert ist ein regelrechtes LLMjacking-Geschäftsmodell mit Weiterverkauf gekaperter Rechenleistung.29 Die Ursache ist keine Schwäche der Technologie, sondern der Betriebspraxis: Der Ollama-Default ist localhost; exponiert wird, wer OLLAMA_HOST auf 0.0.0.0 stellt und keine Authentifizierungsschicht davorsetzt – die Software bringt keine eigene mit.29
Daraus folgt: Der lokale Pfad ist teuer, personalintensiv und sicherheitstechnisch anspruchsvoll. Er lohnt nur für Datenklassen, die ihn erzwingen – und er ersetzt Governance nicht, er verlagert sie nach innen.
175.000 offene Ollama-Instanzen sind kein Argument gegen Self-Hosting – sie sind der Beweis, dass Self-Hosting die Governance-Pflicht nicht abschafft, sondern ins eigene Haus holt.
Wenn beide Pfade Governance verlangen – der Cloud-Pfad Klassifizierung und Policies, der lokale Ops-Reife und Härtung –, dann ist die eigentliche Bauaufgabe die Zuordnung: welche Datenklasse auf welchen Pfad, und wer trägt die Last.
Hybrid mit Begründungspflicht: welche Datenklasse auf welchen Pfad
„Hybrid“ ist die bequemste Antwort der Beraterbranche – und genau deshalb verdächtig. Ein Satz, der immer stimmt, entscheidet nichts. Hybrid wird erst dann keine Floskel, wenn es als Zuordnungsregel formuliert ist. Hier ist ein Vorschlag:
| Datenklasse | Pfad | Konkrete Ausgestaltung |
|---|---|---|
| K1 – Öffentlicher und unkritischer Code | Copilot Standard | Completions inklusive nutzen, Credits budgetieren (Budgetkontrollen auf Organisations-/Kostenstellen-Ebene)3 |
| K2 – Interner Code mit DSGVO-/Residency-Anforderung | Copilot mit EU-Residency-Opt-in | Admin-Policy aktivieren (+10 % Credit-Verbrauch laut GitHub-Doku), Content Exclusions konfigurieren – im Wissen um deren dokumentierte Grenzen10 12 |
| K3 – CLOUD-Act-exponiert, Geheimschutz, KRITIS-Kern | Lokaler Pfad | Geteilter, gehärteter vLLM-Server (nicht Einzelplatz-GPUs; Authentifizierungsschicht, kein 0.0.0.0), BYOK für Chat/Agents – und bewusster Verzicht auf Cloud-Completions für diese Repositories21 29 |
Die K3-Zeile ist der Preis der Souveränität, und er ist ehrlich zu benennen: Weil BYOK keine Completions abdeckt, verzichten K3-Repositories auf die Copilot-Kernfunktion – das ist kein Konfigurationsdetail, sondern eine bewusste Funktionseinbuße für eine Datenklasse, die sie rechtfertigen muss. Durchgesetzt wird eine solche Matrix technisch über eine Gateway- und Routing-Schicht zwischen Entwicklung und Inferenz – Erkennung sensibler Inhalte, Policies, Budgets, Audit-Log. Dieses Muster ist 2026 vielfach beschrieben; eine belastbare Referenzarchitektur dafür steht allerdings noch aus und ist als Lücke in den Redaktionellen Hinweisen vermerkt.30
Zwei Gegenpositionen verdienen es, nicht entkräftet, sondern eingebaut zu werden. Erstens der IT-Betrieb: „Hybrid verdoppelt die Governance- und Betriebslast.“ Ja. Genau das tut er – zwei Stacks, zwei Update-Pfade, doppelte Policy-Durchsetzung. Deshalb ist Hybrid hier nicht als Mittelweg positioniert, sondern als Mehraufwand mit Begründungspflicht: Der zweite Stack wird nur gebaut, wenn die Klassifizierung K3-Datenklassen tatsächlich ausweist. Wer keine hat, braucht kein Hybrid – und sollte auch keins betreiben.
Zweitens die Entwicklersicht: „Governance-first treibt in Shadow AI.“ Auch das trifft einen realen Nerv. Die PagerDuty-Erhebung vom 11. Juni 2026 – 1.250 Non-IT-Professionals in Unternehmen ab 500 Millionen Dollar Umsatz, erhoben in USA, UK, Australien und Japan, ausdrücklich nicht im DACH-Raum – fand: 66 Prozent nutzen KI-Tools ohne Genehmigung, 88 Prozent teilen Arbeitsinformationen mit öffentlichen KI-Tools, 77 Prozent empfinden Firmen-Restriktionen als Bremse für ihre berufliche Entwicklung, 75 Prozent würden für bessere KI-Ausstattung den Job wechseln.31 Restriktive Governance erzeugt das Datenrisiko, das sie verhindern soll. Die Konsequenz für die Matrix: Sie muss ermöglichen, nicht nur verbieten – für jede Datenklasse muss ein genehmigter, funktionierender Pfad existieren, sonst suchen sich die Entwickler einen eigenen.
Ein ehrlicher Vorbehalt zum Schluss dieses Abschnitts: Die Matrix setzt voraus, dass Unternehmen Datenklassifizierung überhaupt leisten können. Deskriptiv spricht wenig dafür, dass das die Regel ist – Branchenerhebungen deuten darauf, dass die KI-Einführung der Governance-Kapazität in den meisten Organisationen davonläuft (diese Zahlen sind hier nur Indiz, die Originalstudien konnten nicht geprüft werden; sie zeigen zudem den Ist-Zustand, widerlegen also nicht die normative Forderung).32 Diese Spannung lässt sich nicht wegargumentieren, nur benennen: Der Artikel verordnet eine Medizin, deren Einnahme selten gelingt – aber die Alternative ist, die Entscheidung von weggebrochenen Ankern treffen zu lassen. Eine gekennzeichnete Leerstelle bleibt außerdem: DACH-Spezifika wie Mitbestimmung des Betriebsrats und die konkrete Auftragsverarbeitungs-Konstellation für Copilot sind hier nicht recherchiert; die zitierten Shadow-AI-Zahlen sind nicht DACH-erhoben.
Daraus folgt: Die Matrix löst das Thesen-Versprechen ein – Klassifizierung bestimmt den Pfad, und der teure Sonderweg braucht einen ausgewiesenen Grund.
Hybrid ist kein Kompromiss, sondern eine Rechnung: Wer Datenklassen hat, die mehr als Residency brauchen, bezahlt einen zweiten Stack – wer keine hat, sollte auch keinen betreiben.
Die Matrix beantwortet das Heute. Bleibt die Frage, ob die gegenläufigen Kostentrends sie morgen kippen.
Ausblick und Fazit: Gegenläufige Kurven – warum die Klassifizierung bleibt, wenn die Preise sich drehen
Zwei Kostenkurven laufen 2026 gegeneinander, beide datiert belegbar.
Die erste fällt: Der Stanford AI Index 2025 hält fest, dass die Inferenzkosten für ein System auf GPT-3.5-Niveau zwischen November 2022 und Oktober 2024 auf weniger als ein 280stel gefallen sind („dropped over 280-fold“, ~285×) – von 20,00 Dollar auf 0,07 Dollar pro Million Tokens; Bezugsgröße ist GPT-3.5-äquivalente Leistung auf MMLU, Endpunkt der Messung ist Gemini 1.5 Flash-8B, und die zugrunde liegenden Epoch-AI-Daten zeigen, dass die Preise je nach Task um den Faktor 9 bis 900 pro Jahr fallen – es gibt keine einheitliche Preiskurve.33 Mitte 2026 liefern Open-Weight-APIs GPT-4-Qualität für unter 0,50 Dollar pro Million Tokens – dieser Wert allerdings nur laut Marktbeobachtungen aus Sekundärquellen.34 Was daraus nicht folgt: dass Self-Hosting gleichermaßen billiger wird – im Gegenteil, siehe die zweite Kurve – und auch keine lineare Fortschreibung.
Die zweite steigt: Die RTX 5090 startete im Januar 2025 mit 1.999 Dollar Listenpreis und steht im August 2026 bei einem Median um 4.700 Dollar, mit 27 bis 39 Prozent Aufschlag allein im August.25 Was daraus nicht folgt: dauerhafte Knappheit – Speicherzyklen haben historisch immer wieder gedreht. Dahinter steht die Speicherkrise: DRAM-Kontraktpreise stiegen laut TrendForce im ersten Quartal 2026 um 90 bis 95 Prozent gegenüber dem Vorquartal (Richtungswert, hier nur sekundär belegt), und Apple strich zwischen März und Mai 2026 erst die 512-GB-, dann die 128-GB-Speicheroption des Mac Studio – ausgerechnet der Maschine, die als lokale LLM-Plattform beliebt ist.35
Dazwischen bewegen sich drei weitere datierte Anker. Copilot wird seit dem 1. Juni 2026 tokenbasiert abgerechnet – was nicht heißt, dass die Seat-Preise stabil bleiben.1 Copilot öffnet sich zugleich für lokale Modelle – BYOK von der Preview im Oktober 2025 zur GA im April 2026 bis zur Offline-Fähigkeit im Juni –, aber ohne Completions; „Copilot setzt künftig primär auf lokale Modelle“ folgt daraus gerade nicht.21 Und das Benchmark-Vertrauen erodiert seit Februar 2026 – was Modellvergleiche nicht unmöglich macht, aber jede Einzelzahl unter Kontaminations-Vorbehalt stellt.18 Die Regulierungs-Zeitleiste schließlich bleibt ambivalent: GPAI-Durchsetzung seit dem 2. August 2026, High-Risk-Pflichten verschoben auf den 2. Dezember 2027 – kein Dringlichkeits-, aber auch kein Entwarnungssignal.15 14
Und jetzt die Wendung, die aus diesen Kurven folgt: Man könnte meinen, bei so viel Bewegung solle man einfach abwarten, bis der Preis entscheidet. Das Gegenteil ist richtig. Gerade weil beide Preiskurven in Bewegung sind, ist jede preisbasierte Entscheidung eine Momentaufnahme mit Monatsfrist – die Datenklassifizierung ist die einzige Entscheidungsgrundlage, die Preisbewegungen übersteht. Für K1-Datenklassen darf am Ende gern der Preis entscheiden; die Matrix hat dafür ausdrücklich Platz. Für alles andere entscheidet die Klasse, nicht die Kurve.
Zurück zur Folie vom Anfang: Links der Balken mit dem Festpreis, rechts die Workstation, darunter die Cloud-Pauschale. Alle drei Elemente gehören ersetzt – durch eine einzige Frage in der Kopfzeile: Welche unserer Datenklassen braucht mehr als EU-Residency? Wer sie beantworten kann, hat die Werkzeugwahl fast schon getroffen. Wer sie nicht beantworten kann, hat kein Werkzeugproblem, sondern ein Klassifizierungsproblem.
Cloud-Inferenz wird billiger, lokale Hardware teurer – wer heute nach Preis entscheidet, entscheidet auf Basis einer Momentaufnahme. Die Datenklassifizierung ist die einzige Grundlage, die beide Kurven überlebt.
Fünf Fragen vor der Werkzeugwahl
- Welche Datenklassen haben wir – und wer hat sie wann klassifiziert? Ohne dokumentierte Klassifizierung ist jede Pfad-Entscheidung ein Bauchgefühl mit Budget.
- Welche dieser Klassen brauchen mehr als EU-Residency? CLOUD-Act-Exposition, Geheimschutz, KRITIS-Kern – nur diese Klassen begründen den lokalen Pfad. „Sensibel“ allein ist keine Antwort mehr.
- Haben wir die Copilot-Stellschrauben tatsächlich gesetzt? Residency-Opt-in ist standardmäßig deaktiviert; dazu Content Exclusions, Budget-Controls und ein Monitoring des realen Credit-Verbrauchs – die Inklusivvolumina sind Stand 15. August 2026 dokumentiert, aber nicht garantiert stabil.
- Können wir einen zweiten Stack wirklich betreiben – und wer bezahlt ihn? Geteiltes vLLM-Serving statt Einzelplatz-GPUs, Authentifizierung vor jeder Instanz, Ops-Personal in der Kalkulation. Wenn die Antwort Nein lautet, ist K3 nicht ehrlich beantwortet – dann ist die Klassifizierung zu überarbeiten oder die Datenklasse gehört nicht ins KI-Tooling.
- Erzeugt unsere Governance Pfade oder Umwege? Für jede Datenklasse muss ein genehmigter, funktionierender Weg existieren – sonst liefern die Shadow-AI-Zahlen die Vorschau auf das eigene Audit.
Wer die Lokal-oder-Copilot-Frage 2026 seriös beantworten will, beantwortet zuerst eine andere: die nach den eigenen Daten. Alles Weitere ist Beschaffung.
Glossar
- AI Credits: GitHubs Abrechnungseinheit für Copilot seit 01.06.2026; 1 Credit = $0,01, Verbrauch tokenbasiert nach den API-Preisen je Modell.
- AI Act (EU): EU-Verordnung zur KI-Regulierung; gestufte Pflichten nach Risikoklassen, Zeitleiste 2026 durch den Digital Omnibus teilweise verschoben.
- Annex III: Anhang des AI Act, der Hochrisiko-Anwendungsfälle definiert; Codeassistenz fällt in aller Regel nicht darunter.
- BYOK (Bring Your Own Key): Einbindung eigener Modell-Zugänge (auch lokaler Modelle via Ollama) in Copilot/VS Code; gilt nur für Chat/Agents, nicht für Completions.
- Break-even: Punkt, ab dem sich eigene Hardware gegenüber API-Nutzung rechnet; abhängig von Volumen, Auslastung und API-Preisen.
- CLOUD Act: US-Gesetz, das US-Anbieter zur Herausgabe von Daten an US-Behörden verpflichten kann – unabhängig vom Speicherort der Daten.
- Code-Completions: Inline-Codevorschläge während des Tippens; Copilot-Kernfunktion, bei Bezahlplänen ohne Credit-Verbrauch, nicht per BYOK ersetzbar.
- Content Exclusions: Copilot-Funktion, um Dateien/Repositories von der Kontextnutzung auszuschließen; mit laut GitHub-Doku dokumentierten Grenzen (indirekt einfließende semantische Informationen; Symlinks und Remote-Dateisysteme nicht abgedeckt).
- Data Residency / EU Data Boundary: Zusage, dass Verarbeitung und Speicherung in einer definierten Region (z. B. EU inkl. EFTA) verbleiben; beantwortet die Speicherort-, nicht die Zugriffsfrage.
- DSGVO: EU-Datenschutz-Grundverordnung; reguliert die Verarbeitung personenbezogener Daten.
- Frontier-Modell: Modell der obersten Leistungsklasse großer Anbieter (Closed Weights, Cloud-Betrieb).
- GPAI (General-Purpose AI): KI-Modelle mit allgemeinem Verwendungszweck; deren AI-Act-Pflichten treffen primär die Modell-Anbieter.
- Inferenz: Ausführung eines trainierten Modells zur Beantwortung von Anfragen (im Gegensatz zum Training).
- Kontamination (Benchmark-): Testaufgaben oder Lösungen sind in den Trainingsdaten enthalten – Benchmark-Ergebnisse messen dann Erinnerung statt Fähigkeit.
- KRITIS: Kritische Infrastrukturen im Sinne der deutschen Regulierung; erhöhte Schutzanforderungen.
- LLM-Gateway: Routing-Schicht zwischen Anwendungen und Modellen, die Anfragen nach Policies (Schutzbedarf, Budget, Verfügbarkeit) auf lokale oder Cloud-Modelle verteilt und auditierbar macht.
- LLMjacking: Kapern fremder, offen erreichbarer LLM-Infrastruktur zur unbefugten (Weiter-)Nutzung der Rechenleistung.
- MMLU: Multi-Task-Benchmark für Sprachverständnis; im AI Index Bezugsgröße für „GPT-3.5-äquivalente Leistung“.
- Ollama: Populäres Werkzeug zum lokalen Betrieb von LLMs; Einzelplatz-orientiert, ohne eingebaute Authentifizierung.
- Open-Weight-Modell: Modell mit frei verfügbaren Gewichten; nicht gleichbedeutend mit „lokal lauffähig“ – Spitzenmodelle dieser Klasse brauchen Rechenzentrums-Hardware.
- RCT (Randomized Controlled Trial): Randomisiertes kontrolliertes Experiment; methodischer Goldstandard für Wirkungsmessung.
- Retention: Aufbewahrung von Nutzerdaten (z. B. Prompts) durch den Anbieter nach der Verarbeitung.
- Shadow AI: Nutzung nicht genehmigter KI-Tools durch Mitarbeitende an der offiziellen Governance vorbei.
- SWE-bench (Verified/Pro): Benchmark-Familie für das Lösen realer Software-Issues; 2026 wegen Kontaminationsbefunden umstritten.
- Token: Kleinste Abrechnungs- und Verarbeitungseinheit von Sprachmodellen (Wortbestandteile).
- vLLM: Open-Source-Serving-System für den produktiven Mehrbenutzer-Betrieb von LLMs.
- VRAM: Grafikspeicher; limitierender Faktor dafür, welche Modelle auf einer Workstation-GPU laufen.
Recherche-Stand und Grenzen
Alle Quellen wurden am 15./16. August 2026 abgerufen. Preise, Inklusiv-Credits und Hardware-Punktwerte sind Momentaufnahmen: Sowohl die Copilot-Plans-Seite als auch die GPU-Preistracker haben sich in den Wochen vor Redaktionsschluss mehrfach bewegt – wer auf dieser Grundlage rechnet, sollte die Zahlen am Tag der Entscheidung nachschlagen.
Was bewusst nicht in den Text eingeflossen ist: Marktzahlen zu „Sovereign AI“ aus Anbieter-Blogs, deren Primärstudien hinter einer Bezahlschranke liegen; anbietervermittelte Produktivitäts-Punktwerte aus Copilot-Fallstudien, deren Originalstudien nicht einsehbar waren; Einzel-Benchmarkwerte lokaler Modelle, weil das Benchmark-Vertrauen 2026 selbst beschädigt ist; sowie eine viel zitierte Studie zu gescheiterten KI-Pilotprojekten, deren Methodik umstritten ist. Diese Angaben hätten den Text an mehreren Stellen zugespitzt – belegen ließen sie sich nicht.
Drei Lücken bleiben offen und sind im Text an Ort und Stelle benannt: Wie viele Credits ein Entwickler pro Monat real verbraucht, ist öffentlich nirgends dokumentiert – das ist die größte Einzellücke dieser Recherche. Eine belastbare Referenzarchitektur für die Gateway-Schicht existiert nur in Ansätzen. Und die wörtlichen Retention-Zusagen für Copilot Business und Enterprise ließen sich nicht am Primärort prüfen: Das Copilot Trust Center rendert ohne JavaScript leer, die frühere Doku-Seite leitet dorthin um. Die Retention-Aussage im Text stützt sich deshalb ausschließlich auf ein Microsoft-Learn-Modul und ist als Herstellerzusage gekennzeichnet – nicht als unabhängig geprüfte Tatsache.
Nicht recherchiert wurden außerdem: konkurrierende Werkzeuge wie Cursor, Windsurf, JetBrains AI, Tabnine oder Amazon Q (der Artikel vergleicht Copilot mit dem Selbstbetrieb, nicht den Assistenzmarkt), DACH-Spezifika wie Mitbestimmung und Auftragsverarbeitung sowie chinesischsprachige Primärdokumentation zu den offenen Modellen.
Quellen
-
GitHub Blog, “GitHub Copilot is moving to usage-based billing”, https://github.blog/news-insights/company-news/github-copilot-is-moving-to-usage-based-billing/, 27.04.2026 (Umstellung wirksam 01.06.2026), abgerufen am 2026-08-15. [Interessengeleitete Anbieterquelle] – Zweitbelege: GitHub Docs, “Request-based billing (legacy): what changed with billing”, https://docs.github.com/en/copilot/reference/copilot-billing/request-based-billing-legacy/what-changed-with-billing, abgerufen am 2026-08-15; Xebia, “GitHub Copilot: going from Premium Request Units to usage-based billing”, https://xebia.com/blog/github-copilot-going-from-premium-request-units-to-usage-based-billing/, abgerufen am 2026-08-15. ↩ ↩2 ↩3 ↩4
-
GitHub Changelog, “Copilot data residency in US, EU, and FedRAMP compliance now available”, https://github.blog/changelog/2026-04-13-copilot-data-residency-in-us-eu-and-fedramp-compliance-now-available/, 13.04.2026 (aktualisiert 24.04.2026); EFTA-Erweiterung: “EU data residency region expanding to include EFTA countries”, https://github.blog/changelog/2026-03-31-eu-data-residency-region-expanding-to-include-efta-countries/ (wirksam 01.05.2026), beide abgerufen am 2026-08-15. [Interessengeleitete Anbieterquelle, Faktencharakter Produktverfügbarkeit] ↩ ↩2
-
GitHub, “Copilot Plans & Pricing”, https://github.com/features/copilot/plans, Stand 15.08.2026, abgerufen am 2026-08-15. [Interessengeleitete Anbieterquelle] – Ergänzend: GitHub Docs, “Plans for GitHub Copilot”, https://docs.github.com/en/copilot/get-started/plans, abgerufen am 2026-08-15. Dokumentierte Diskrepanz: April-Ankündigung nannte Pro inkl. $10 Credits, Plans-Seite im August inkl. $15; Übergangs-Credits Business/Enterprise 01.06.–01.09.2026. ↩ ↩2 ↩3
-
Pan, Chodnekar, Roy, Wang (Carnegie Mellon University), “A Cost-Benefit Analysis of On-Premise Large Language Model Deployment”, arXiv:2509.18101 (v3), https://arxiv.org/html/2509.18101v3, abgerufen am 2026-08-15. 54 Szenarien; Break-even-Spannen SME 0,3–3 Monate, mittlere Unternehmen 3,8–34 Monate, große Cluster 3,5–69,3 Monate bis >5 Jahre; Original-Wortlaut zur Preissensitivität: „large swings in cost-effectiveness“. ↩
-
Cloudzy, “Self-Hosting Open-Weight LLMs on a GPU VPS: Cost Analysis”, https://cloudzy.com/blog/self-hosting-open-weight-llm-gpu-vps-cost/, 08.07.2026, abgerufen am 2026-08-16. [IG-Nähe: VPS-Anbieter] – Original-Wortlaut: „A rented GPU costs the same whether it’s idle or fully loaded, so your effective cost per token scales inversely with utilization“; Break-even-Schwellen (u. a. ~2,5–7+ Mrd. Tokens/Monat gegen Budget-Open-Weight-APIs) und Auslastungs-Arithmetik (1/0,6 ≈ 1,7; 1/0,25 = 4 – arithmetisch nachgerechnet); Schwellenwerte quellenübergreifend stark streuend, daher nur als Spanne verwendet. ↩ ↩2 ↩3
-
Forrester Consulting (im Auftrag von GitHub), “The Total Economic Impact™ of GitHub Enterprise Cloud”, https://tei.forrester.com/go/github/enterprisecloud/ sowie https://github.com/resources/whitepapers/forrester, abgerufen am 2026-08-15. [Interessengeleitete Auftragsstudie] – 376 % ROI beziehen sich auf GitHub Enterprise Cloud insgesamt (Composite-Organisation, $85,9 Mio. Nutzen vs. $18,1 Mio. Kosten über 3 Jahre), nicht auf Copilot; Fehlzuschreibung in Sekundärquellen dokumentiert. ↩
-
Becker, Rush, Barnes, Rein (METR), “Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity”, arXiv:2507.09089, https://arxiv.org/abs/2507.09089; Blogfassung: https://metr.org/blog/2025-07-10-early-2025-ai-experienced-os-dev-study/, 10.07.2025, abgerufen am 2026-08-15. RCT, n=16, 246 Tasks, −19 % mit KI; Vorbehalte der Autoren: nicht generalisierbar (erfahrene OSS-Entwickler, vertraute Repos, Tooling Anfang 2025); METR-Einstufung als überholt („historical“, Update Feb 2026). ↩
-
GitHub-nahe Erfolgsberichte (u. a. zum Accenture-Deployment), wiedergegeben in Sekundärquellen (exceeds.ai, jellyfish.co, getpanto.ai), abgerufen am 2026-08-15. [Interessengeleitete Kette; Originalstudien nicht unabhängig geprüft, nur Snippet-Tiefe – hier ausschließlich als gelabelte Gegenstimme neben METR geführt, Einzelwerte bewusst nicht übernommen.] ↩
-
Unabhängige Zweitbelege zur Copilot-Data-Residency: Futurum Group (Mitch Ashley), “GitHub Copilot’s Compliance Breakthrough”, https://futurumgroup.com/insights/github-copilots-compliance-breakthrough-enterprise-procurement-barriers-fall-not-just-features-added/, 15.04.2026; Jesse Houwing (Microsoft MVP), “GitHub Copilot: now with Data Residency in Europe”, https://jessehouwing.net/github-copilot-now-with-data-residency-in-europe/, 15.04.2026; nerova.ai, “GitHub Copilot Data Residency & FedRAMP”, https://nerova.ai/news/github-copilot-data-residency-fedramp-enterprise-coding-agents-2026, 18.04.2026; alle abgerufen am 2026-08-15. ↩
-
GitHub Docs, “GitHub Copilot with data residency”, https://docs.github.com/en/enterprise-cloud@latest/admin/data-residency/github-copilot-with-data-residency, abgerufen am 2026-08-15. [Interessengeleitete Anbieterquelle] – Wörtlich: „Copilot requests processed with this enforcement in place include a 10% increase on AI credits consumption“; Policy „Restrict Copilot to data residency compliant models“, standardmäßig deaktiviert; Modellliste EU-Region inkl. Gemini-Modelle (Stand 15.08.2026). Der +10-%-Aufschlag ist unabhängig nur schwach referiert (nerova.ai) – daher Formulierung „laut GitHub-Doku“. ↩ ↩2 ↩3
-
Microsoft Learn, Modul “GitHub Copilot data” (Kurs “Introduction to prompt engineering with GitHub Copilot”), https://learn.microsoft.com/en-us/training/modules/introduction-prompt-engineering-with-github-copilot/4-github-copilot-data, Stand 28.07.2025, abgerufen am 2026-08-15. [Interessengeleitete Anbieterquelle; dokumentierte Herstellerzusage, unabhängig nicht verifizierbar – siehe Redaktionelle Hinweise zur Trust-Center-Lücke.] ↩
-
GitGuardian, “GitHub Copilot Security and Privacy Concerns”, https://blog.gitguardian.com/github-copilot-security-and-privacy/, 27.03.2025, abgerufen am 2026-08-16. [IG-Nähe: Security-Anbieter] – Als Paraphrase verwendet; Original-Wortlaut: „if you have integrated Copilot into your IDE or editor, it is always reading your code“ sowie „The only true way to prevent any secrets from leaking into a code assist tool, or anywhere else, is to eliminate any plaintext credentials from the code“. Eine „Garantie“-Formulierung zu Content Exclusions steht weder dort noch wörtlich in den GitHub-Docs; die dokumentierten Grenzen der Content Exclusions stammen aus GitHub Docs, “Content exclusion”, https://docs.github.com/en/copilot/concepts/context/content-exclusion, abgerufen am 2026-08-16 („It’s possible that Copilot may use semantic information from an excluded file if the information is provided by the IDE indirectly“; Symlinks/Remote-Dateisysteme nicht abgedeckt). Die dortige 6,4-%-Zahl ist nicht zweitbelegt und wird hier bewusst nicht verwendet. ↩ ↩2
-
The Register, “Microsoft admits it cannot guarantee French citizens’ data stays out of US hands”, https://www.theregister.com/2025/07/25/microsoft_admits_it_cannot_guarantee/, 25.07.2025, abgerufen am 2026-08-15. Senatsaussage von Anton Carniaux (Microsoft France) am 18.06.2025; korroboriert u. a. durch Forbes. ↩
-
Gibson Dunn, “EU AI Act Omnibus Agreement: Postponed High-Risk Deadlines and Other Key Changes”, https://www.gibsondunn.com/eu-ai-act-omnibus-agreement-postponed-high-risk-deadlines-and-other-key-changes/, Mai 2026, abgerufen am 2026-08-15. Digital-Omnibus-Einigung (provisorisch 06.05.2026, bestätigt 13.05.2026): High-Risk-Pflichten (Annex III) auf 02.12.2027 verschoben; korroboriert durch Cooley und DLA Piper. ↩ ↩2
-
Latham & Watkins, “EU AI Act: GPAI Model Obligations in Force and Final GPAI Code of Practice in Place”, https://www.lw.com/en/insights/eu-ai-act-gpai-model-obligations-in-force-and-final-gpai-code-of-practice-in-place; ergänzend: artificialintelligenceact.eu, “Code of Practice Overview”, https://artificialintelligenceact.eu/code-of-practice-overview/, beide abgerufen am 2026-08-15. GPAI-Durchsetzung seit 02.08.2026, Bußgelder bis 3 % des weltweiten Jahresumsatzes oder €15 Mio. (Art. 101). ↩ ↩2
-
Faros.ai, “Open-Weight Models: State of Play”, https://www.faros.ai/blog/open-weight-models, Juli 2026, abgerufen am 2026-08-16. [Interessengeleitet: Analytics-Anbieter; Verifikation am SWE-bench-Leaderboard scheiterte technisch] – Dreiteilung knapp 89 % (Frontier-Closed: Claude Opus 4.8 88,6 %, GPT-5.5 82,6 %) / ~80 % (Cluster-Open-Weight: DeepSeek-V4-Pro 80,6 %, MiniMax M3 80,5 %, Kimi K2.6 80,2 %) / ~70 % (Workstation-Klasse: Qwen3-Coder 80B 70,6 %) auf SWE-bench Verified, Stand Juli 2026; Original-Wortlaut zum Frontier-Vorsprung: „frontier closed models still lead on the most complex, multi-step agentic work“ – hier ausschließlich als „laut Anbieter-Vergleichen“ mit Kontaminations-Vorbehalt geführt. ↩ ↩2 ↩3
-
pinggy.io, “Best Open Source Self-Hosted LLMs for Coding”, https://pinggy.io/blog/best_open_source_self_hosted_llms_for_coding/, 11.08.2026, abgerufen am 2026-08-15. Workstation-Klasse (u. a. Qwen-Coder-Reihe, ~17–22 GB VRAM auf 24-GB-GPUs); Einzel-Benchmarkwerte bewusst nicht übernommen (Kontaminations-Vorbehalt). ↩
-
CodeAnt, “SWE-bench Scores: What Happened”, https://codeant.ai/blogs/swe-bench-scores, abgerufen am 2026-08-16; Gegencheck: benchmarkingagents.com, “SWE-bench”, https://benchmarkingagents.com/swe-bench/ (älterer Stand, erwähnt den Reporting-Stopp nicht – dokumentierter Widerspruchsversuch), abgerufen am 2026-08-15. Aktuell dort belegt (Stand 2026-08-16): „OpenAI’s internal audit found that every major frontier model […] could reproduce verbatim gold patches for some SWE-bench Verified tasks“ sowie „59.4% of the hardest unsolved Verified problems had flawed test cases“; die früher dort referierte Drittel-Zahl (~32,67 % Solution Leakage) ist nach Aktualisierung der Seite nicht mehr enthalten und wird nicht mehr verwendet. Primärquelle OpenAI, “Why we no longer evaluate SWE-bench Verified”, https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/, weiterhin nicht abrufbar (403) – Einzelprozente daher nur sekundär belegt; Formulierung bewusst: „veröffentlicht keine Ergebnisse mehr und rät ab“, nicht „zurückgezogen“. ↩ ↩2
-
“SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation”, arXiv:2505.20411, https://arxiv.org/pdf/2505.20411, abgerufen am 2026-08-15. Preprint, nicht peer-reviewed. ↩
-
Hacker News, “Ask HN: Who uses open LLMs and coding assistants locally?”, https://news.ycombinator.com/item?id=45771870, 31.10.2025 (350 Punkte, 192 Kommentare), abgerufen am 2026-08-16 via hn.algolia.com. Praktiker-Stimmungsbild; Vorbehalt zum Erhebungszeitpunkt: Modellstand Oktober 2025. Zitat „big gap“: User garethsprice. Zitat „shockingly usable“: User juujian (gpt-oss-120b auf MacBook Pro mit 128 GB RAM). Quiz-Beispiel: User fm2606 (i7, 64 GB RAM, NVIDIA-GPU mit 8 GB VRAM; ChatGPT 46/50 in 6 Minuten vs. gpt-oss-120b 47/50 in über einer Stunde) – zwei verschiedene Nutzer auf verschiedener Hardware. ↩
-
GitHub Changelog, “Bring your own language model key in VS Code now available”, https://github.blog/changelog/2026-04-22-bring-your-own-language-model-key-in-vs-code-now-available/, 22.04.2026, abgerufen am 2026-08-15. [Interessengeleitete Anbieterquelle] – GA für Business/Enterprise, standardmäßig aktiviert, per Policy abschaltbar; keine Completions/Embeddings; Abrechnung direkt beim Provider. ↩ ↩2 ↩3 ↩4 ↩5
-
VS Code Blog, “Bring Your Own Key (BYOK) in VS Code”, https://code.visualstudio.com/blogs/2026/06/18/byok-vscode, 18.06.2026, abgerufen am 2026-08-15. [Interessengeleitete Anbieterquelle] – Provider-Liste inkl. Ollama (lokal), Nutzung ohne GitHub-Login und vollständig offline; Grenze „nur Chat/Agents, keine Completions“ identisch zur Changelog-Angabe. ↩ ↩2
-
microsoft/vscode, Issue “[Test] BYOK Ollama Provider Deprecation” (#323394, geschlossen 13.08.2026), via GitHub-Issue-Tracker; ergänzend VS-Code-Doku-Hinweis auf die offizielle Ollama-Extension, abgerufen am 2026-08-15. ↩
-
BDEW, “BDEW-Strompreisanalyse”, https://www.bdew.de/service/daten-und-grafiken/bdew-strompreisanalyse/, 15.04.2026, abgerufen am 2026-08-15. Kleine/mittlere Industriebetriebe 16,7 ct/kWh (Neuabschlüsse 2026). ↩
-
videocardprices.com, “NVIDIA RTX 5090 Price Tracker”, https://videocardprices.com/card/nvidia-rtx-5090, Stand 01.08.2026 (neu $4.598,90, ~130 % über MSRP $1.999); Tom’s Hardware, “GeForce RTX 50-series GPU prices spike as much as 39 percent”, https://www.tomshardware.com/pc-components/gpus/geforce-rtx-50-series-gpu-prices-spike-as-much-as-39-percent-as-blackwell-price-hikes-hit-the-us-rtx-5070-gets-a-36-percent-hike-rtx-5060-up-27-percent-at-the-median-of-newegg-listings, August 2026; TechPowerUp #351508 (Median $4.699,99; nur Snippet, 403); gebrauchte RTX 4090: resaleprices.com, https://www.resaleprices.com/gpu/nvidia-rtx-4090, Ø/Median $2.500, Stand 15.08.2026; alle abgerufen am 2026-08-15. Punktwerte schwanken täglich – vor Publikation tagesaktuell prüfen. ↩ ↩2 ↩3
-
Cloudzy (s. o., T1: Ops ≈ 1,3–2× der GPU-Kosten); die 20–30 %-einer-Senior-Stelle-Spanne stammt aus SitePoint-TCO-Analysen, die nur als Snippet zugänglich waren (403) – beide Werte werden ausschließlich als Spanne/Richtung verwendet, nicht als Punktwerte. Abgerufen am 2026-08-15. ↩
-
premai.io, “Self-Hosted LLM Guide: Setup, Tools, Cost Comparison 2026”, https://www.premai.io/blog/self-hosted-llm-guide-setup-tools-cost-comparison-2026/; SitePoint, “vLLM Production Deployment Guide 2026”, https://www.sitepoint.com/vllm-production-deployment-guide-2026/ (nur Snippet-Tiefe, 403); beide abgerufen am 2026-08-15. Werkzeug-Einordnung (Ollama Einzelplatz, vLLM/SGLang Team-/Produktions-Serving) mehrfach konsistent beschrieben; Parallelitäts-Details vor Publikation an der Primärdoku verifizieren (siehe Redaktionelle Hinweise). ↩
-
shadie_ai, “Why I Stopped Self-Hosting AI Models (And You Probably Should Too)”, https://dev.to/shadie_ai/why-i-stopped-self-hosting-ai-models-and-you-probably-should-too-lod, 19.07.2026, abgerufen am 2026-08-15. Einzelfall-Postmortem; [IG-Verdacht: Autor bewirbt eigenes API-Produkt] – als anekdotisches Muster auf Einzelentwickler-Ebene geführt, nicht als Kostenbeleg. ↩
-
The Hacker News, “Researchers Find 175,000 Publicly Exposed Ollama Instances”, https://thehackernews.com/2026/01/researchers-find-175000-publicly.html, 29.01.2026 (referenziert SentinelLABS/Censys-Primärforschung), abgerufen am 2026-08-15. Zweitbeleg: Security Boulevard, “Exposed Ollama Servers: Security Risks of Publicly Accessible LLM Infrastructure”, https://securityboulevard.com/2026/03/exposed-ollama-servers-security-risks-of-publicly-accessible-llm-infrastructure/, März 2026, abgerufen am 2026-08-15. 175.108 Instanzen, 130 Länder, 48 % mit Tool-Calling, LLMjacking „Operation Bizarre Bazaar“; Ursache OLLAMA_HOST=0.0.0.0 ohne Auth, Default ist localhost. ↩ ↩2 ↩3
-
SitePoint, “Hybrid Cloud-Local LLM: The Complete Architecture Guide 2026”, https://www.sitepoint.com/hybrid-cloudlocal-llm-the-complete-architecture-guide-2026/ (nur Snippet-Tiefe, 403); getmaxim.ai, “Top 5 Enterprise AI Gateways for Multi-Model Routing in 2026”, https://www.getmaxim.ai/articles/top-5-enterprise-ai-gateways-for-multi-model-routing-in-2026/; beide abgerufen am 2026-08-15. Das Routing-Muster (Schutzbedarf/Komplexität/Verfügbarkeit) ist mehrfach unabhängig beschrieben; eine belastbare Referenzarchitektur liegt nur in Snippet-Tiefe vor – als Lücke ausgewiesen. ↩
-
PagerDuty, “Shadow AI Workplace Survey 2026”, https://www.pagerduty.com/newsroom/shadow-ai-workplace-survey-2026/, 11.06.2026, abgerufen am 2026-08-15. [Interessengeleitet: Incident-Management-Anbieter, aber eigene Primärerhebung mit ausgewiesener Methodik] – 1.250 Non-IT-Professionals, Unternehmen ≥$500 Mio. Umsatz, US/UK/AU/JP (nicht DACH); 66 % ungenehmigte Tools, 88 % teilen Arbeitsinfos, 77 % Policies als Karrierebremse, 75 % Wechselbereitschaft. ↩
-
IBM IBV (Juni 2026, via larridin.com, https://larridin.com/blog/ai-governance-adoption-gap) und Smarsh-Studie 2026 (via marketscale.com, https://www.marketscale.com/industries/software-and-technology/only-26-of-enterprises-say-ai-governance-keeps-pace-with-deployment-smarsh-study-finds), beide abgerufen am 2026-08-15. Nur Indiz: Originalstudien nicht geöffnet (Snippet-Tiefe); zeigt den Ist-Zustand (77 % Adoption überholt Governance / 26 % Governance hält Schritt), widerlegt nicht die normative Forderung. ↩
-
Stanford HAI, “AI Index Report 2025”, https://hai.stanford.edu/ai-index/2025-ai-index-report (Report-PDF: https://hai.stanford.edu/assets/files/hai_ai_index_report_2025.pdf), Takeaway #7: „the inference cost for a system performing at the level of GPT-3.5 dropped over 280-fold between November 2022 and October 2024“; Datenquelle: Epoch AI, “LLM inference prices have fallen rapidly but unequally across tasks”, https://epoch.ai/data-insights/llm-inference-price-trends ($20,00/M Tokens 11/2022 → $0,07/M 10/2024 ≈ 285×; Bezugsgröße GPT-3.5-Level auf MMLU, Endpunkt Gemini 1.5 Flash-8B; die Preise fallen je nach Task um den Faktor 9 bis 900 pro Jahr); beide abgerufen am 2026-08-15. ↩
-
Marktbeobachtung via Sekundärquelle: valueaddvc.com, “How AI Inference Costs Have Dropped 95% in Two Years”, https://valueaddvc.com/blog/how-ai-inference-costs-have-dropped-95-in-two-years-and-what-happens-next, abgerufen am 2026-08-15. Der Wert „GPT-4-Qualität <$0,50/M Tokens aus Open-Weight-APIs, Mitte 2026“ ist nicht primär geprüft und wird ausdrücklich nur als Richtungsangabe geführt. ↩
-
MacRumors, “Mac Studio No Longer Available With 512GB RAM Upgrade”, https://www.macrumors.com/2026/03/05/mac-studio-no-512gb-ram-upgrade/, 05.03.2026; Tom’s Hardware, “Apple quietly axes 128GB Mac Studio amid supply constraints”, https://www.tomshardware.com/desktops/apple-quietly-axes-128gb-mac-studio-amid-supply-constraints-and-local-ai-frenzy-highest-memory-capacity-reduced-to-96gb-two-months-after-discontinuation-of-512gb-model, Mai 2026; beide abgerufen am 2026-08-15. TrendForce-DRAM-Zahl (+90–95 % QoQ Q1/2026) nur über Sekundär-Snippets belegt – als Richtungsanker, nicht als Punktwert geführt. ↩
Transparenzhinweis: Dieser Beitrag wurde KI-gestützt erstellt und vor Veröffentlichung redaktionell geprüft.