Die Frage, die mir in Betrieben zuerst gestellt wird und selten sauber beantwortet ist: Wenn ich hier etwas hineinschreibe, wo landet das?
Ich unterscheide vier Wege, und der Unterschied liegt nicht in der Technik, sondern darin, wer die Daten sieht und wer dafür geradesteht.
Weg 1: Das kostenlose Chatfenster
Jemand öffnet ein KI-Werkzeug im Browser und fügt einen Vertragsauszug ein. Die Daten gehen an den Anbieter. Anthropic beschreibt für seine Privatprodukte Claude Free, Pro und Max eine Einstellung, mit der sich die Verwendung neuer Unterhaltungen für künftiges Modelltraining abschalten lässt; für die kommerziellen Produkte gilt diese Seite ausdrücklich nicht (Anthropic, Privacy Center1).
Diesen Weg hat in den Betrieben, die ich kenne, niemand offiziell beschlossen, gegangen wird er trotzdem. Für einen Werbetext halte ich das für unbedenklich, für Kundendaten, Personalunterlagen oder Vertragsinhalte nicht: Da gehen Betriebsinterna an einen Dritten, ohne dass es irgendwo steht.
Der erste Schritt ist für mich deshalb nicht die Einführung von KI, sondern das Aufschreiben dessen, was hier nicht hineingehört. Bei mir passt das auf eine halbe Seite.
Weg 2: Der Geschäftszugang
Dieselben Werkzeuge gibt es in Geschäftsvarianten. Was dort zugesagt wird, steht in den Bedingungen des Anbieters und unterscheidet sich nach Produkt, Tarif und Region. Anthropic schreibt, Eingaben und Ausgaben aus den kommerziellen Produkten würden standardmäßig nicht zum Training der Modelle verwendet. Microsoft schreibt dasselbe für die über Azure verkauften Modelle und nennt den Ort: Gespeicherte Daten liegen in der vom Kunden gewählten Geografie, für die Verarbeitung gilt das bei den Bereitstellungsarten Global und DataZone nicht in derselben Enge.
Für die meisten Betriebe halte ich das für den vernünftigen Weg. Ich lese dabei die Bedingungen des Tarifs, den ich wirklich buche, und sehe wieder nach, wenn sich etwas ändert.
Belege: Anthropic, Privacy Center2, Microsoft, Foundry-Dokumentation3.
Weg 3: Das Modell über eine Schnittstelle im eigenen Ablauf
Hier ruft eine eigene Anwendung im Hintergrund ein Modell auf. Der Bestand bleibt in der Anwendung, hinaus geht der Ausschnitt, den die Frage braucht, und für den gilt dasselbe wie in Weg 2. Kontrolliert wird also nicht, ob etwas hinausgeht, sondern was.
So habe ich meine Wissensdatenbank gebaut: Nicht der ganze Ordner geht hinaus, sondern die paar Absätze, die zur Frage passen. Der Aufwand ist höher, dafür weiß ich, welcher Text das Haus verlässt.
Weg 4: Das Modell im eigenen Haus
Ein Teil der Modelle wird mit offenen Gewichten veröffentlicht und läuft auf eigener Hardware. Offen heißt dabei nicht bedingungslos: Für Llama 3.3 räumt Meta eine gebührenfreie Lizenz zur Nutzung, Vervielfältigung und Änderung ein, gebunden an eine Nutzungsrichtlinie, an den Hinweis „Built with Llama“ und ab 700 Millionen monatlich aktiven Nutzern an eine gesonderte Lizenz von Meta (Llama 3.3 Community License4).
Das Modell selbst schickt nichts hinaus, der übrige Aufbau schon: Telemetrie der Oberfläche, Einbettungen über eine fremde Schnittstelle oder ein Fernwartungszugang tragen Daten hinaus, ohne dass das Modell etwas damit zu tun hätte. Ich sehe deshalb den ganzen Aufbau an, nicht nur das Modell.
Der Preis ist echt: Hardware, Betrieb, Aktualisierung. Nach meiner Erfahrung sind die frei verfügbaren Modelle bei anspruchsvollen Aufgaben schwächer als die großen kommerziellen. Wo Daten das Haus nicht verlassen dürfen, sehe ich trotzdem meist keinen anderen Weg, sonst halte ich den Aufwand für überzogen.
Wie ich entscheide
Zwei Fragen genügen mir meistens.
Was steht in den Daten? Nichts Vertrauliches: Weg 1 oder 2. Personenbezogenes oder Betriebsgeheimnisse: mindestens Weg 2 mit Vertrag, eher 3 oder 4. Das ist meine Vorsortierung, keine Rechtsprüfung. Ob personenbezogene Daten hinausdürfen, hängt an Rechtsgrundlage, Auftragsverarbeitung, Zweckbindung und Drittlandübermittlung und entscheidet sich am Einzelfall, nicht am Weg.
Wie oft passiert das? Einmal im Monat ein Text: Assistent. Jeden Tag hundertmal derselbe Ablauf: eigene Anwendung, weil ich dort Datenfluss und Kosten im Griff habe.
Einen Kostendeckel baue ich in jedem Fall ein, Tageslimit und Monatslimit, und zwar bevor das System in Betrieb geht.
Die rechtliche Seite steht im Beitrag zur DSGVO. Was an einem echten Prüfbericht tatsächlich hinausgeht, je nachdem, welchen Weg man wählt, lässt sich in der Station Was verlässt den Betrieb der KI-Werkstatt durchklicken.
Quellen
- 1Anthropic, Privacy Center privacy.claude.com
- 2Anthropic, Privacy Center privacy.claude.com
- 3Microsoft, Foundry-Dokumentation learn.microsoft.com
- 4Llama 3.3 Community License developer.meta.com