Zum Inhalt springen
ma-ki.io

Alle Beiträge

Grundlagen · 8 von 10 Nr. 0008

Warum KI nicht nur Text kann

Von Martin Kirschner · · 4 Minuten Lesezeit · Belege geprüft am

Das Chatfenster gibt Sätze aus. Ein Modell kann aber genauso eine Zahl, eine Zuordnung, eine Gruppe, eine Handlung oder ein Bild liefern. Wer nach dem sortiert, was hinten herauskommt, weiß schneller, welches Werkzeug er braucht.

Wer heute „KI" sagt, meint fast immer das Chatfenster: Man tippt eine Frage, es kommt ein Text zurück. In der Gebäudetechnik ist Text aber selten das, was man wirklich braucht. Wer eine Lüftungsanlage betreibt, will wissen, wie viel Strom sie nächste Woche zieht, zu welchem Gewerk eine Störmeldung gehört und ob der Regler nachgestellt werden muss. Keine dieser Antworten ist ein Absatz Prosa.

Sortieren nach dem, was hinten herauskommt

Im ersten Beitrag ging es darum, wie ein Modell lernt. Hier geht es um das andere Ende: Was gibt es aus? Danach sortiert fällt fast alles, was unter dem Wort KI läuft, in fünf Fächer.

Eine Zahl. Verbrauch der Anlage nächste Woche, Vorlauftemperatur in drei Stunden, Restlaufzeit eines Filters. Messwerte hinein, ein Wert heraus. Statistiker nennen das Regression.

Eine Klasse. Die Störmeldung „Druckdifferenz Zuluft zu niedrig" gehört zur Lüftung, nicht zur Heizung. Die Rechnung ist ein Nachtrag und keine Teilrechnung. Das Modell wählt aus vorgegebenen Fächern eines aus. An dieser Aufgabe ist die heutige Bilderkennung groß geworden.

Eine Gruppe. Angenommen, in einer Mängelliste stehen achthundert Einträge, die niemand je sortiert hat. Ein Modell legt sie nach Ähnlichkeit zusammen, ohne dass vorher jemand Fächer definiert hat: hier zwanzig Meldungen zum selben Kondensatablauf, dort dreißig zu Brandschutzklappen. Es findet Muster, benennt sie aber nicht. Das Benennen bleibt beim Menschen.

Eine Handlung. Die Ausgabe ist keine Beschreibung, sondern ein Eingriff: Ventil um zwei Prozent auf, Sollwert um ein halbes Grad herunter. Woher der Eingriff kommt, ist damit noch nicht gesagt. Er kann aus einer festen Regel stammen, aus einer Klasse, die eine Aktion auslöst, oder aus einem Modell, das aus der Rückmeldung lernt, ob die Lage danach besser war. In der Gebäudetechnik ist das der heikelste der fünf Fälle, weil das Ergebnis nicht auf dem Bildschirm bleibt, sondern in der Anlage ankommt.

Ein Bild oder ein Ton. Ein Modell kann aus einer Beschreibung ein Bild erzeugen. Und umgekehrt aus einer Aufnahme Text: Wer auf der Baustelle ins Handy diktiert, benutzt genau das. Die Ausgabe ist hier kein Wert und keine Klasse, sondern wieder ein Rohstoff, mit dem man weiterarbeitet.

Das Sprachmodell, um das es im Beitrag über Sprachmodelle geht, liegt am nächsten bei der zweiten Art, ist aber kein sauberer Fall davon. Es ordnet nicht in ein vorgegebenes Fach ein, sondern berechnet für jedes mögliche nächste Textstück eine Wahrscheinlichkeit und zieht daraus eines, sehr oft hintereinander. Deshalb kann dieselbe Frage zweimal eine andere Antwort ergeben. Dass daraus Sätze werden, ist Ergebnis, nicht Zweck.

Der Beleg

Zahl und Gruppe, also Regression und Clustering, behandelt ein frei zugängliches Lehrbuch ausführlich: Hastie, Tibshirani, Friedman, The Elements of Statistical Learning, 2. Auflage 20091. Für die Klasse steht die Arbeit, mit der 2012 die Bilderkennung ihren Sprung machte: ein Netz, das 1,3 Millionen Fotos in tausend Klassen einordnete (Krizhevsky, Sutskever, Hinton, NeurIPS 20122). Für die gelernte Handlung ein Modell, das allein aus den Bildschirmpixeln lernte, Atari-Spiele zu steuern (Mnih u. a. 2013, arXiv:1312.56023). Für das Bild aus einer Beschreibung eine Arbeit zu genau dieser Aufgabe (Ramesh u. a. 2021, arXiv:2102.120924), für Ton zu Text ein Spracherkennungsmodell, das auf 680.000 Stunden Aufnahmen trainiert wurde (Radford u. a. 2022, arXiv:2212.043565). Dass ein vortrainiertes Sprachmodell eine Zuordnung auch ohne Nachtraining leistet, wenn die Aufgabe nur im Text beschrieben ist, wurde an einem Modell mit 175 Milliarden Parametern gezeigt (Brown u. a. 2020, arXiv:2005.141656).

Was das praktisch heißt

Bevor ich über ein Werkzeug rede, schreibe ich einen Satz auf: Was soll hinten herauskommen, eine Zahl, eine Klasse, eine Gruppe, eine Handlung, ein Text? Dieser eine Satz hat mir bisher mehr geholfen als die Produktwahl.

Darauf achte ich dabei:

  • Für eine Zahl aus der eigenen Anlage brauche ich Beispiele mit richtiger Antwort, und zwar aus einer Anlage, die sich so verhält wie meine; das Chatfenster hat die Messwerte nie gesehen. Bei einer Klasse liegt es anders: Ein vortrainiertes Modell ordnet Texte oft schon zu, ohne dass jemand es dafür nachtrainiert hat. Ob es das im eigenen Haus gut genug tut, weiß ich erst, wenn ich es an eigenen Fällen messe, bei denen die richtige Antwort feststeht.
  • Eine Gruppe ist für mich ein Anfang, kein Ergebnis: Was das Modell zusammenlegt, schaue ich an und benenne es selbst.
  • Einer Handlung an einer Anlage gebe ich eine Grenze und einen Menschen davor. Warum, steht im Beitrag über falsch schaltende Steuerungen.
  • Text ist oft nur die Verpackung. Hinter „die KI soll uns sagen, ob …" steckt nach meiner Erfahrung meist eine Klasse oder eine Zahl, und die verlangt ein anderes Werkzeug als das Chatfenster.

Bei den Besprechungsprotokollen, die ich heute in höchstens zehn Minuten fertig habe statt in sechzig bis neunzig, arbeiten zwei dieser Fächer hintereinander: erst Ton zu Text, dann Text zu Text.

Quellen

  1. 1Hastie, Tibshirani, Friedman, The Elements of Statistical Learning, 2. Auflage 2009 hastie.su.domains
  2. 2Krizhevsky, Sutskever, Hinton, NeurIPS 2012 papers.nips.cc
  3. 3Mnih u. a. 2013, arXiv:1312.5602 arxiv.org
  4. 4Ramesh u. a. 2021, arXiv:2102.12092 arxiv.org
  5. 5Radford u. a. 2022, arXiv:2212.04356 arxiv.org
  6. 6Brown u. a. 2020, arXiv:2005.14165 arxiv.org

Teilen

Dazu passt

Nächste Grundlage Was ein Sprachmodell nicht kann