Freitagnachmittag, Rundgang durch drei Geschoße mit dem Bauleiter des Auftragnehmers. Am Ende sind es dreihundert Fotos am Handy: die tropfende Verschraubung am Verteiler, die fehlende Brandschutzmanschette, der Kabelkanal ohne Deckel, dazu die Übersichten. Bis Montag soll die Mängelliste beim Auftragnehmer sein, mit Ort, Gewerk und Frist. Der Abend am Rechner ist gesetzt.
Der Gedanke liegt nahe, den ganzen Stapel der KI zu geben. Ich zerlege ihn vorher in vier Teile, weil für jeden etwas anderes gilt.
Was keine KI braucht
Meistens trägt ein Foto die Aufnahmezeit in der Datei mit, wenn das Handy es erlaubt auch den Ort. Das sind die Exif-Daten, festgelegt im Standard DC-008 der japanischen Kameraindustrie. Verlassen kann ich mich darauf nicht: Felder können fehlen, die Uhr am Handy falsch gehen, und was mir ein Kollege über einen Messenger schickt, kommt regelmäßig ohne diese Angaben an. Ich sehe deshalb an zwei, drei Fotos nach, ob die Zeitstempel zum Rundgang passen. Danach sortiert jeder Dateimanager nach Zeit, und wer Geschoß für Geschoß gegangen ist, hat den Rundgang in der richtigen Reihenfolge. Das ist keine KI-Leistung. Für mich bringt dieser Schritt die meiste Ordnung und kostet am wenigsten.
Beleg: CIPA, Verzeichnis der Exif-Spezifikationen1
Was ein Sprachmodell erledigt
Was ich mir angewöhnen will: zu jedem Mangel zwei Sätze ins Handy sprechen, gleich beim Foto. „Zweites Obergeschoß, Technikraum, Verschraubung am Verteiler tropft, Heizung." Aus Ton wird Text, aus dem Text macht ein Sprachmodell den Listeneintrag mit Ort, Gewerk, Beschreibung und Fotonummer. Dieselbe Arbeit wie beim Besprechungsprotokoll aus der Aufnahme, nur in kleineren Stücken. Der Inhalt kommt von dem, der vor dem Mangel gestanden ist. Das Modell bringt ihn in Form. Wie sich das prüfen lässt, welcher Satzteil von welcher Notiz gedeckt ist, zeigt die Station Aus Stichworten wird ein Absatz in der KI-Werkstatt.
Wo ein Bildmodell hilft, und wo nicht
Doppelte finden, weil dasselbe Loch dreimal fotografiert wurde, und grob nach Gewerk vorsortieren: Rohr, Kanal, Kabel. Das traue ich einem Bildmodell zu, mit Fehlern rechne ich. Ein Fehler kostet hier meist nur Zeit. Die aussortierten Doppelten sehe ich trotzdem durch, weil sonst ein eigener Mangel mitverschwindet.
Warum dann nicht gleich das Bildmodell die Mängel finden lassen? Ein System, das eigens auf diese Art Mängel unter Baustellenbedingungen trainiert und an echten Fotos geprüft wurde, kann das leisten; dann geht es um Fehlerrate und Einsatzgrenze. Nur habe ich so ein System nicht. Ich habe ein allgemeines Bildmodell, und bei dem sehe ich von außen nicht, woran es seinen Treffer festmacht.
Ein Bildmodell lernt aus Beispielen und kann dabei Merkmale lernen, die mit der Sache nichts zu tun haben. Ribeiro, Singh und Guestrin haben 2016 einen Klassifikator absichtlich verdorben: zwanzig Trainingsbilder, alle Wölfe mit Schnee im Hintergrund, alle Huskys ohne. Vorgelegt haben sie ihn 27 Studierenden, die maschinelles Lernen gehört hatten. Vor der Erklärung vertrauten 10 von 27 dem Modell trotzdem, und nur 12 nannten von selbst den Schnee. Nach der Erklärung vertrauten noch 3, und 25 nannten den Schnee. Ein absichtlich verdorbenes Modell, eine kleine Stichprobe: Das zeigt, dass so ein Fehler auch geübten Leuten entgeht, nicht, wie oft er vorkommt. Dass er auch ohne Absicht vorkommt, zeigen Lapuschkin und Kollegen 2019 an fertig trainierten Modellen, deren Treffer auf aufgabenfremden Merkmalen beruhten. Geirhos und Kollegen 2020 fassen das als Shortcut Learning zusammen.
Belege: arXiv 1602.049382, arXiv 1902.101783, arXiv 2004.077804
Auf die Baustelle übertragen, als gedachtes Beispiel: Hat ein Modell Mängel an rostigen Flecken und schlechtem Licht gelernt, weil die Trainingsfotos so aussahen, dann findet es die lockere Verschraubung im ausgeleuchteten Neubau nicht, und ich merke es erst, wenn ich jedes Foto selbst anschaue. Dann kann ich es gleich selbst machen. Meine Regel daraus: Solange ich für genau diese Mängel unter diesen Bedingungen keinen geprüften Datensatz und keine Fehlerrate kenne, lasse ich ein Bildmodell vorsortieren, aber nicht allein entscheiden.
Bevor irgendetwas hochgeladen wird: Auf dreihundert Fotos sind auch Monteure, Kollegen, ein Firmenbus samt Kennzeichen. Personenbezogen sind diese Daten, sobald sie sich auf eine identifizierte oder identifizierbare natürliche Person beziehen, beim Kennzeichen zunächst auf den Zulassungsbesitzer, der sich mit verhältnismäßigem Aufwand feststellen lässt (Art. 4 Nr. 1 DSGVO5, Datenschutzbehörde GZ 2024-0.112.4766). Wer am Steuer saß, ist eine andere Frage, und bei einem Firmenfahrzeug ist im Einzelfall zu klären, ob überhaupt eine natürliche Person dahintersteht. Geht der Stapel an einen Dienst außerhalb des Hauses, kläre ich vorher, wo die Daten landen. Dass ohne Namen nicht anonym heißt, habe ich in Ohne Namen heißt nicht anonym aufgeschrieben.
Darauf achte ich
- Zeitstempel stichprobenweise prüfen, dann nach Exif-Zeit sortieren, bevor ein Modell die Fotos sieht.
- Zu jedem Mangel gesprochener Text. Das Modell soll nur formatieren; ob im Eintrag etwas steht, das ich nicht gesagt habe, sehe ich beim Gegenlesen.
- Bildmodell nur zum Vorsortieren, jeden Treffer und jeden aussortierten Doppelten nachsehen.
- Personen und Kennzeichen vor dem Hochladen prüfen.
- Die Liste unterschreibe ich, und was ich unterschreibe, will ich selbst gesehen haben.
Der Abend am Rechner wird kürzer. Er fällt nicht weg.
Quellen
- 1CIPA, Verzeichnis der Exif-Spezifikationen cipa.jp
- 2arXiv 1602.04938 arxiv.org
- 3arXiv 1902.10178 arxiv.org
- 4arXiv 2004.07780 arxiv.org
- 5Art. 4 Nr. 1 DSGVO eur-lex.europa.eu
- 6Datenschutzbehörde GZ 2024-0.112.476 ris.bka.gv.at