Automatisiert wird nicht das Schwierige, sondern das Prüfbare
Welche Aufgaben zuerst an die KI gehen, entscheidet nicht die Schwierigkeit. Zwei Achsen, eine belegte Messung und was das für Ihre Reihenfolge heißt.
Die übliche Frage lautet: Was ist bei uns kompliziert genug, dass KI sich lohnt? Sie führt zuverlässig in die Irre. Die Reihenfolge, in der Arbeit automatisiert wird, hängt kaum an der Schwierigkeit.
Sie hängt daran, ob jemand das Ergebnis prüfen kann. Und daran, wie lange ein kompetenter Mensch für die Aufgabe braucht.
Für beides gibt es inzwischen eine Messung statt einer Meinung.
Die Messung, die das Muster sichtbar macht
Das Forschungsinstitut METR hat KI-Agenten und menschliche Fachleute dieselben Aufgaben bearbeiten lassen, unter demselben Zeitbudget. 61 Fachleute, 71 Durchläufe über je acht Stunden. Getestet wurden damals o1-preview und Claude 3.5 Sonnet. Das Ergebnis hängt fast vollständig am Zeitbudget.
- Zwei Stunden Budget: Die besten Agenten erreichen die vierfache Punktzahl der Fachleute.
- Acht Stunden Budget: Die Menschen liegen wieder vorn, allerdings knapp.
- 32 Stunden Budget: Die Menschen erreichen die doppelte Punktzahl des besten Agenten.
Die Kurve dreht sich also. In der kurzen Distanz ist der Agent überlegen, in der langen der Mensch. METR nennt den Grund nüchtern: Menschen haben derzeit den besseren Ertrag aus zusätzlicher Zeit. Agenten kommen schnell weit und werden dann langsamer. Fachleute starten zäh und ziehen danach an.
Dazu kommt ein Verhältnis, das die Richtung erklärt: Ein Agent erzeugt und testet Lösungsvarianten mehr als zehnmal so schnell wie ein Mensch, zu einem Bruchteil der Kosten. Wo Durchprobieren hilft, gewinnt er. Wo man erkennen muss, dass der ganze Ansatz in die falsche Richtung läuft, hilft Durchprobieren wenig.
Das ist im Betrieb gut zu beobachten. Lassen Sie einen Agenten zwanzig Varianten einer Produktbeschreibung schreiben, bekommen Sie zwanzig brauchbare Varianten in zwei Minuten. Lassen Sie ihn entscheiden, ob dieses Produkt überhaupt ins Sortiment gehört, bekommen Sie eine Begründung, die gut klingt und auf nichts beruht. Dieselbe Maschine, zwei völlig verschiedene Ergebnisqualitäten. Der Unterschied liegt darin, ob sich die Frage durch Ausprobieren beantworten lässt.
Warum Prüfbarkeit die eigentliche Schwelle ist
Der zweite Teil ist wichtiger als die Zahlen, und er stammt von METR selbst. Moderne Modelle werden mit bestärkendem Lernen trainiert, und dafür braucht es eine automatische Bewertung. Alles, was sich maschinell benoten lässt, kann zur Trainingsumgebung werden.
Daraus folgt zweierlei. Erstens wird Arbeit, deren Ergebnis sich eindeutig bewerten lässt, bevorzugt trainiert und deshalb zuerst gut. Zweitens warnt METR im selben Atemzug davor, aus guten Benchmark-Werten auf die Wirklichkeit zu schließen: Gerade weil Bewertbarkeit die Voraussetzung ist, überschätzen bewertbare Aufgaben die Leistung in der echten Welt.
Für Ihre Reihenfolge heißt das: Nicht die Komplexität entscheidet, sondern die Frage, ob es einen Maßstab gibt. Eine Rechnungsposition stimmt oder stimmt nicht. Ein Lieferantengespräch nicht.
Und es gibt eine zweite Folgerung, die zu Ihren Gunsten wirkt. Die Arbeit, für die es keinen Maßstab gibt, ist genau die Arbeit, die Ihre Leute unersetzbar macht. Wer Lieferanten auswählt, einen Konflikt im Team löst oder entscheidet, welches von drei Angeboten zum Kunden passt, arbeitet in einem Feld, in dem Durchprobieren nichts bringt. Das ist keine Durchhalteparole. Es folgt aus derselben Kurve.
Was diese Zahlen nicht hergeben
Ich nenne die Grenzen, weil sie in jeder zweiten Präsentation fehlen und weil METR sie selbst benennt.
- Die Untersuchung ist von November 2024. Die Modelle sind seitdem deutlich besser geworden. Belastbar ist die Form der Kurve, nicht der genaue Abstand.
- Geprüft wurden Software- und Forschungsaufgaben, keine Büroarbeit. Die Aufgaben waren in sich geschlossen, ohne Rückfragen, ohne Abstimmung, ohne Firmenkontext.
- Zwischen Anwendungsfeldern liegen Größenordnungen. Bei Aufgaben, die einen Bildschirm ansehen und bedienen müssen, liegt die Leistung um das 40- bis 100-Fache niedriger als bei Softwareaufgaben.
- METR räumt eine Auswahlverzerrung ein: Wer Benchmarks baut, baut bevorzugt Aufgaben, die Modelle heute noch nicht können und in ein bis zwei Jahren vielleicht schon.
Wer Ihnen aus solchen Zahlen ausrechnet, wie viele Stellen in Ihrer Buchhaltung wegfallen, rechnet mit einer Messung, die für etwas anderes gemacht wurde. Die Richtung stimmt. Die Übertragung auf Ihren Betrieb ist eine Analogie und keine Berechnung.
Was die Messung trotzdem trägt, ist die Richtung der Kurve und ihre Begründung. Dass kurze Abschnitte dem Agenten liegen und lange dem Menschen, folgt aus dem Trainingsverfahren und nicht aus dem Zufall einer Modellgeneration. Diese Aussage überlebt den nächsten Versionssprung. Die Faktoren vier und zwei überleben ihn nicht. Nehmen Sie das Muster für die Reihenfolge Ihrer Projekte und keine Zahl aus dieser Studie in Ihre Wirtschaftlichkeitsrechnung.
Zwei Achsen, vier Felder, Ihre Reihenfolge
Nehmen Sie Ihre Aufgabenliste und tragen Sie jede Position auf zwei Achsen ein. Erste Achse: Wie lange braucht eine eingearbeitete Person? Zweite Achse: Kann jemand in kurzer Zeit feststellen, ob das Ergebnis stimmt?
- Kurz und prüfbar: Hier fängt jede sinnvolle Einführung an. Stammdaten abgleichen, Belege vorsortieren, Prüfprotokolle auswerten, Texte nach festem Schema erzeugen, Übersetzungen. Der Fehler fällt sofort auf und kostet wenig.
- Lang und prüfbar: Lohnt sich, aber erst nach dem Zerlegen. Ein Vorgang über vier Stunden wird zu sechs Teilschritten mit je einem eigenen Prüfpunkt. Die Kurve oben sagt, warum: In der kurzen Distanz ist der Agent stark.
- Ein Beispiel für so einen Prüfpunkt: Beim Zerlegen eines Angebotsprozesses ist der Schritt "Stückliste aus der Zeichnung ziehen" prüfbar, weil die Zahl der Positionen gegen die Zeichnung zählbar ist. Der Schritt "Risikoaufschlag festlegen" ist es nicht.
- Kurz und nicht prüfbar: Die gefährlichste Ecke. Das Ergebnis liegt schnell vor, sieht sauber aus, und niemand kann es gegen etwas halten. Hier entsteht der Eindruck von Produktivität ohne Beleg.
- Lang und nicht prüfbar: Bleibt beim Menschen. Angebotsstrategie, Lieferantenauswahl, das Gespräch mit dem Kunden, der abspringen will.
Die meisten Betriebe fangen in der dritten Ecke an, weil sie dort am beeindruckendsten aussieht. Deshalb fällt die Bilanz nach einem halben Jahr so dünn aus.
Ein Praxisfall aus einem Fertigungsbetrieb, anonymisiert. Dort hat der Vertrieb ein halbes Jahr lang Angebotstexte erzeugen lassen. Schnell, gut formuliert, alle waren zufrieden. Auf die Frage, ob die Angebote dadurch häufiger angenommen wurden, gab es keine Zahl, weil vorher keine erhoben worden war. Parallel lief in der Arbeitsvorbereitung ein unscheinbarer Abgleich von Stammdaten gegen Lieferantenlisten. Dort war die Fehlerquote vorher bekannt und nachher messbar. Nur der zweite Fall ließ sich der Geschäftsführung belegen.
Die Frage ist nicht, was bei Ihnen schwierig ist. Die Frage ist, woran Sie in einer Minute erkennen, ob das Ergebnis stimmt. Finden Sie darauf keine Antwort, ist die Aufgabe noch nicht reif.
Prüfbar heißt nicht geprüft
An dieser Stelle kippt die Sache regelmäßig. Eine Aufgabe ist prüfbar, also wird sie automatisiert, und dann prüft trotzdem niemand. Der Maßstab existiert theoretisch und wird nie angelegt.
ISO/IEC 42001 hat dafür eine eigene Maßnahme. A.6.2.4 regelt Verifizierung und Validierung von KI-Systemen und ist der Ort, an dem die akzeptablen Leistungsgrenzen festgeschrieben werden. Zwei Fragen daraus stelle ich in jedem Audit:
- Welche Freigabekriterien haben Sie vorab festgelegt, und wer hat sie freigegeben?
- Welche akzeptable Fehlerquote gilt für dieses System, und woraus leiten Sie sie ab?
Die typische Abweichung sieht so aus: Testergebnisse liegen vor, vorab festgelegte Freigabekriterien und Fehlerquoten fehlen. Das Ergebnis wird nachträglich als ausreichend bewertet. Damit ist die Maßnahme unwirksam, und die Verbesserung nach Kapitel 10.2 kann Nichtkonformitäten am System gar nicht erkennen. Wer den Maßstab nach dem Ergebnis festlegt, misst nichts.
Zwei Antworten auf die Frage nach der Fehlerquote kenne ich gut. Die schwache lautet: Wir schauen uns die Ergebnisse regelmäßig an und greifen ein, wenn etwas auffällt. Die belastbare lautet: Zulässig sind zwei Prozent falsch zugeordnete Positionen im Monat, erhoben an einer Stichprobe von fünfzig Vorgängen, gemessen seit März, zuletzt bei 1,4 Prozent; bei Überschreitung geht die Zuordnung zurück an die Sachbearbeitung, bis die Ursache steht. Die erste Antwort ist eine Haltung. Die zweite ist ein Nachweis.
Praktisch heißt das: Die Fehlerquote wird vor dem ersten Produktivlauf aufgeschrieben, zusammen mit der Frage, was passiert, wenn sie gerissen wird. Zwei Sätze genügen. Sie müssen nur vorher dastehen.
Was Sie am Montag tun können
Nehmen Sie einen Bereich, nicht den ganzen Betrieb. Drei Schritte, eine Stunde.
- Listen Sie zehn wiederkehrende Aufgaben auf und schätzen Sie je die Zeit einer eingearbeiteten Person. Minuten genügen, keine Zeitstudie.
- Schreiben Sie hinter jede Aufgabe, woran man erkennt, dass das Ergebnis stimmt. Finden Sie nichts, machen Sie einen Strich. Die Striche sind die Antwort.
- Werfen Sie die Zeilen mit Strich nicht weg. Sie sind die Liste der Arbeit, bei der ein Mensch entscheiden muss, und damit auch die Liste, auf der Ihre Personalplanung steht.
- Nehmen Sie aus den Zeilen ohne Strich die kürzeste. Das ist Ihr erster Fall, unabhängig davon, wie unspektakulär er aussieht.
Vor dem Start brauchen Sie noch zwei Zahlen: wie oft die Aufgabe heute falsch läuft, und wie oft sie künftig falsch laufen darf. Die erste erheben Sie über zwei Wochen. Die zweite entscheiden Sie, bevor das System läuft.
Rechnen Sie damit, dass Sie die erste Zahl nicht haben. In den meisten Betrieben ist unbekannt, wie oft ein Vorgang heute schiefgeht, weil Fehler stillschweigend repariert werden. Das Erheben fühlt sich nach Bürokratie an und ist der Teil, der später den Unterschied macht. Ohne Ausgangswert können Sie nach einem Jahr nur behaupten, dass es besser geworden ist.
Das ist weniger aufregend als ein Agent, der selbständig Angebote schreibt. Es ist der Teil, der nach einem halben Jahr noch läuft und sich belegen lässt. Und es ist der Teil, mit dem Sie im nächsten Audit nicht ins Schwimmen kommen, wenn jemand nach dem Nachweis fragt.
Häufige Fragen
Heißt das, komplexe Aufgaben sind für KI ungeeignet?+
Nein. Komplexität allein ist kein Ausschluss. Entscheidend sind zwei andere Dinge: wie lange die Aufgabe am Stück dauert und ob das Ergebnis sich gegen einen Maßstab halten lässt. Eine komplexe, aber klar prüfbare Aufgabe ist ein guter Kandidat. Eine einfache Aufgabe ohne jeden Prüfpunkt ist ein schlechter, weil Sie den Nutzen später nicht belegen können.
Kann ich lange Vorgänge trotzdem automatisieren?+
Ja, nach dem Zerlegen. Die Messung von METR zeigt, dass Agenten in kurzen Abschnitten stark sind und bei langen Zeitbudgets zurückfallen. Schneiden Sie einen langen Vorgang in Teilschritte mit je einem eigenen Prüfpunkt, arbeiten Sie wieder in der kurzen Distanz. Das kostet Vorarbeit und ist der Unterschied zwischen einem Pilotprojekt, das läuft, und einem, das versandet.
Taugen diese Zahlen für eine Wirtschaftlichkeitsrechnung?+
Nicht direkt. Die Untersuchung stammt von November 2024 und betrachtet Software- und Forschungsaufgaben, die in sich geschlossen sind. METR weist selbst darauf hin, dass sich Anwendungsfelder um Größenordnungen unterscheiden und dass automatisch bewertbare Aufgaben die Leistung in der Wirklichkeit eher überschätzen. Belastbar ist das Muster, nicht der Faktor. Ihre eigene Rechnung braucht Ihre eigenen Messwerte.
Was verlangt ISO/IEC 42001 konkret, bevor ein System produktiv geht?+
Maßnahme A.6.2.4 verlangt dokumentierte Maßnahmen zur Verifizierung und Validierung samt Kriterien für ihre Anwendung. Dazu gehören Testmethoden, die Auswahl der Testdaten und ihre Begründung, Freigabekriterien, akzeptable Fehlerquoten und der Umgang mit Faktoren, die die Leistung mindern. Entscheidend ist der Zeitpunkt: Die Kriterien müssen vor der Freigabe feststehen. Werden sie nachträglich an das Ergebnis angepasst, ist die Maßnahme nicht wirksam.
Autor & fachliche Prüfung: Lars Zimmermann · ISO/IEC 42001 Senior Lead Auditor & Senior Lead Implementer · ISO/IEC 27001 Lead Auditor & Lead Implementer (PECB)
Auditor mit Stallgeruch, Geschäftsführer eines produzierenden Mittelständlers, der KI-Managementsysteme und Informationssicherheit prüft und aufbaut. Autor von „Stallgeruch“. Qualifikation auf Credly verifizieren · Mehr über mich.
Stand: 10. Oktober 2026. Inhalt nach bestem Wissen recherchiert und fachlich geprüft; ersetzt keine Rechtsberatung im Einzelfall.
Quellen & weiterführend
Konkrete Fragen zu Ihrem Fall?
Im kostenlosen 15-Minuten-Erstgespräch ordnen wir Ihren Stand zu ISO 42001, ISO 27001 und dem EU AI Act ein, ehrlich und ohne Verkaufsdruck.