Konzeptpapier · Gesprächsgrundlage

Trainingsdaten mit Herkunftsnachweis, nicht mit Herkunftsproblem.

Datenrente verbindet verifizierte, einwilligende Menschen mit europäischen KI-Initiativen, die deutsch- und europäischsprachige Daten brauchen — lizenziert, nachvollziehbar, mit laufender Vergütung statt Einmalverkauf.

Status
Konzeptphase
Modell-Nr.
DR–01
Fokus
DE / EU-Sprachen

01 — Das Problem

Europäische Sprachmodelle haben zu wenig echte europäische Sprache.

Deutsch- und europäischsprachige Trainingsdaten sind dokumentiert knapp — Forschungsprojekte greifen deshalb zunehmend auf synthetisch erzeugte Texte als Ersatz zurück, weil echte menschliche Daten fehlen.

Gleichzeitig verschiebt sich die gesamte Branche gerade aus rechtlichem Zwang von unlizenziertem Scraping zu bezahlter Lizenzierung: über 35 aktive Trainingsdaten-Klagen laufen aktuell, Anthropic zahlte allein 1,5 Mrd. USD Vergleich an Autoren. Lizenzausgaben der großen Labore lagen 2025 bereits bei 1,5–3 Mrd. USD.

Die bestehenden Lösungen decken das nicht sauber ab: Verlagsdeals sind Institution-zu-Institution, Krypto-native Plattformen scheuen den Massenmarkt, und etablierte Crowdwork-Anbieter zahlen pro Aufgabe — nicht als laufende Beteiligung an eigenen Daten.

02 — Das Modell

Verifiziert. Lizenziert. Laufend vergütet.

1

Verifizierung

Beitragende werden als echte, einwilligende Menschen bestätigt — über eine sorgfältig geprüfte Verifizierungslösung (aktuell iDenfy, später erweiterbar auf die EUDI-Wallet), mit eigener Datenminimierungsschicht: Käufer sehen nie die volle Identität, nur ein Pseudonym.

2

Lizenzierung

Sprach-, Text- und Wissensbeiträge werden strukturiert erfasst und gezielt für den vereinbarten Zweck freigegeben — nachvollziehbar dokumentiert, DSGVO-konform.

3

Laufende Vergütung

Beitragende erhalten eine Beteiligung bei jeder Nutzung ihrer Daten — nicht nur beim ersten Verkauf. Vorbild: das Verwertungsgesellschafts-Prinzip aus der Musikindustrie, übertragen auf Daten.

03 — Warum jetzt

Der Markt bewegt sich bereits — nur nicht in diese Richtung.

01

RLHF- und Datenannotationsmarkt: heute 12–15 Mrd. USD, Wachstum 28–35 % pro Jahr

Surge AI (~25 Mrd. USD Bewertung) und Scale AI (~29 Mrd. USD) dominieren — beide zahlen pro Aufgabe, keiner bietet individuelle Beteiligung.

02

Neutralität ist ein belegtes Kaufkriterium, keine Vermutung

Nach Metas 49 %-Übernahme von Scale AI (Juni 2025) sprangen Google, OpenAI und xAI innerhalb weniger Wochen ab. Surge AI wurde dadurch praktisch über Nacht zur neutralen Standardwahl.

03

Das Royalty-Prinzip existiert bereits — nur nicht europäisch verifiziert

PLM Network (USA) zahlt Mikro-Tantiemen für Expertenwissen bei jeder KI-Abfrage — "BMI für KI-Wissen". Kein Äquivalent mit EU-Verifizierung und Sprachfokus.

04

Verifizierungsschicht bewusst DSGVO-sauber gewählt, nicht die naheliegendste

World ID wurde geprüft und verworfen: die bayerische Datenschutzaufsicht stellte im Dezember 2024 fest, dass es nicht DSGVO-konform ist. Gewählt wurde iDenfy, ohne Datenschutz-Vorfälle. Die EUDI-Wallet bleibt die Zielinfrastruktur ab 2. Januar 2027.

04 — Die Nische

Nicht generisch. Deutsch, europäisch, souverän.

Englischsprachige Trainingsdaten sind vergleichsweise gesättigt. Der Bedarf an souveränen, europäischen Modellen — wegen DSGVO und Datenschutz-Anforderungen oft zwingend außerhalb US-gehosteter Infrastruktur trainiert — trifft auf einen dokumentierten Mangel an genau den Sprachdaten, die dafür gebraucht werden.

Ein konkreter, öffentlich finanzierter Anknüpfungspunkt: Das OpenGPT-X-Konsortium (Fraunhofer, DFKI, IONOS, TU Dresden u. a., ~14 Mio. € BMWK-Förderung) baut mit Teuken-7B explizit ein europäisches Sprachmodell für alle 24 EU-Sprachen.

Auch die EU selbst plant im Rahmen ihrer "Data Union Strategy" für Q2 2026 eine Crowdsourcing-Initiative für Daten in kleineren europäischen Sprachen — ein Signal, dass die Richtung stimmt, unabhängig davon, wer sie am Ende umsetzt.

05 — Der nächste Schritt

Kein Verkaufsgespräch — eine ehrliche Prüfung.

Datenrente ist ein Konzept, kein laufender Betrieb. Bevor irgendetwas gebaut wird, suchen wir Gespräche mit Menschen, die Trainingsdaten-Beschaffung für europäische oder deutschsprachige KI-Modelle verantworten — um zu hören, ob verifizierte, lizenzierte Sprachdaten mit laufender Vergütung für Sie ein echtes Kaufkriterium wären.