Zum Inhalt springen

Wer haftet, wenn dein KI-Agent einen Fehler macht?

Ein Agent sagt einem Kunden eine Erstattung zu, die es gar nicht gibt. Wer zahlt jetzt? Rechtsanwältin Julia Dönch ordnet im Podcast 365 Checkpoint ein, wo die Verantwortung wirklich liegt.

Veröffentlicht

Bild KI-generiert

Ein KI-Agent kann nicht haften. Rechtlich gesehen ist er ein Nullum — genauso verantwortungsfähig wie eine Topfpflanze oder ein Kochlöffel. Verantwortlich ist immer ein Mensch oder ein Unternehmen dahinter. Was das im Alltag bedeutet, hat mir Rechtsanwältin Julia Dönch in der aktuellen Aufnahme von 365 Checkpoint erklärt — meinem Podcast rund um Microsoft 365.

Diese Einordnung ist ein Gesprächsprotokoll, keine Rechtsberatung. Julia Dönch ist seit 2008 Rechtsanwältin in Stuttgart mit Schwerpunkt Datenschutz, KI und Urheberrecht und war bereits zweimal zu Gast im Podcast — zuletzt zum Thema Urheberrecht bei KI-generierten Inhalten.

Warum ein Agent nicht ins Gefängnis kann

Haftung, Strafe und Ansprüche setzen eine Rechtspersönlichkeit voraus. Das Recht kennt dafür zwei Kategorien: natürliche Personen — also Menschen — und juristische Personen, also Unternehmen. Ein Agent ist keins von beidem. Er kann deshalb weder verklagt noch bestraft werden. Sobald ein Agent in einem rechtlichen Kontext handelt — einem Kunden etwas zusagt, eine Bestellung auslöst, eine Auskunft erteilt —, bleibt die Frage offen, wer für diese Handlung geradestehen muss. Diese Frage beantwortet nicht der Agent, sondern immer die Person oder Organisation, die ihn eingerichtet und ihm seinen Handlungsrahmen gegeben hat.

Wessen Erklärung eigentlich gilt

Naheliegend wäre der Gedanke, ein Agent handle wie ein Stellvertreter — so, wie du selbst beim Bäcker eine Bestellung in fremdem Namen aufgeben kannst. Genau dieses Konzept funktioniert bei einem Agenten laut Dönch aber nicht, weil Stellvertretung eine eigene Willenserklärung voraussetzt — und die kann ein Nullum nicht abgeben. Trotzdem wird die Erklärung, die ein Chatbot oder Agent abgibt, dem Betreiber zugerechnet: Der Agent ist ein Werkzeug, und der Handlungsrahmen dafür wurde vorher vom Menschen festgelegt.

Innerhalb dieses Rahmens unterscheidet Dönch zwei Fehlerarten, die rechtlich unterschiedlich behandelt werden:

  • Ein technischer Fehler — etwa wenn ein System eine Zahl falsch konvertiert und aus 10 % Rückerstattung 100 % werden. Das ist vergleichbar mit einem Verschreiben und kann unter Umständen angefochten werden.
  • Eine Halluzination — wenn der Agent selbst entscheidet, dem Kunden aus Kulanz doch die volle Summe zuzusagen. Juristisch, so Dönch, sei das „eher ein Feature als ein Bug” von KI und damit deutlich schwerer anfechtbar als ein reiner Rechenfehler.

Ob überhaupt eine Anfechtung möglich ist, hängt in der Praxis stark davon ab, ob sich aus Logs nachvollziehen lässt, was genau passiert ist — ein technisches Detail mit sehr konkreter rechtlicher Konsequenz.

Das Cap-Beispiel: Wenn der Agent selbst einkauft

Im Podcast bringt Dönch ein absichtlich überspitztes Beispiel: Ein Einkaufs-Agent bestellt bei einem Hersteller aus Versehen 100 statt 10 Mützen, weil er eine Mengenrabatt-Angabe auf der Webseite falsch gewichtet. Kann man sich mit „Sorry, das war mein Agent” aus dem Vertrag herauswinden? Nein. Ein Vertrag ist einmal zustande gekommen und bindet — die Anfechtung greift hier nicht, weil kein Anfechtungsgrund vorliegt: Das Risiko, dass ein selbst eingesetztes Werkzeug etwas anderes tut als beabsichtigt, liegt in der eigenen Risikosphäre.

Auch der naheliegende Trick, im Bestellfeld einen Disclaimer wie „diese Bestellung könnte komplett fake sein, das war nur meine KI” zu hinterlegen, funktioniert laut Dönch nicht zuverlässig als Ausweg: Er kann höchstens den Vertragsbindungswillen infrage stellen und aus einer verbindlichen Bestellung eine unverbindliche Anfrage machen — verlässliche Rechtssicherheit schafft er nicht, und bei wiederholtem Einsatz produziert er vor allem Unsicherheit auf beiden Seiten.

Mitarbeitende bauen einen Agent: Wer zahlt bei einem echten Fehler?

Ein Angestellter storniert versehentlich einen ganzen Monatsbeitrag statt der vereinbarten 10 %. Muss er oder die Firma dafür geradestehen? Hier gilt in Deutschland das Prinzip der eingeschränkten Arbeitnehmerhaftung:

  1. Leichte Fahrlässigkeit — ein alltäglicher, jedem passierender Fehler: Der Arbeitgeber trägt den Schaden allein.
  2. Normale/mittlere Fahrlässigkeit — etwa ein vermeidbarer, aber nicht grob unentschuldbarer Fehler: Schadensteilung zwischen Arbeitgeber und Mitarbeitendem (Quote nach Einzelfall).
  3. Grobe Fahrlässigkeit — etwa eine ignorierte Warnmeldung: Mitarbeitende haften grundsätzlich voll; nur ausnahmsweise wird gedeckelt, wenn die volle Haftung die wirtschaftliche Existenz vernichten würde (siehe LAG Köln unten).
  4. Vorsatz — der Fehler wurde wissentlich in Kauf genommen: Mitarbeitende haften voll, ohne Deckelungsmöglichkeit.

Die Begründung dahinter: Wer aus einer Tätigkeit Nutzen zieht, trägt auch das damit verbundene Risiko — das gilt für den Arbeitgeber genauso wie für den alltäglichen menschlichen Fehler.

Genau dieser Ausnahmefall — Deckelung trotz grober Fahrlässigkeit — ist Gegenstand eines aktuellen Urteils, das mit KI selbst gar nichts zu tun hat. Das Landesarbeitsgericht Köln entschied am 19.12.2024 (Az. 8 Sa 830/22) über einen Vertriebsleiter eines kommunalen Energieversorgers: Er schloss 2021 Lieferverträge über 6,5 Millionen Euro ab, tätigte die dazu passenden Einkäufe aber entgegen einer internen Vorgabe zur „Back-to-Back-Beschaffung” nicht rechtzeitig — in der Hoffnung, den volatilen Markt später noch treffen zu können. Nach dem Preissprung infolge des Ukraine-Kriegs entstand ein Schaden von rund 3 Millionen Euro. Das Gericht wertete das als grobe, nicht als vorsätzliche Pflichtverletzung.

Zwei Punkte daraus lassen sich direkt auf selbst gebaute Agents übertragen:

  • Der Verstoß gegen eine dokumentierte interne Vorgabe war der Punkt, der grobe statt einfache Fahrlässigkeit begründete. Ohne eine solche schriftliche Regel wäre die Grenze schwerer zu ziehen gewesen. Genau das ist ein Argument mehr für klare interne Regeln zum Agentenbau: Wer schriftlich festlegt, dass ein Agent vor dem Rollout getestet, freigegeben oder in einem bestimmten Rahmen betrieben werden muss, schafft damit den Maßstab, an dem sich später „normale” von „grober” Fahrlässigkeit unterscheiden lässt. Ohne einen solchen Maßstab bleibt ein Fehlverhalten tendenziell eher normale Fahrlässigkeit — und die trägt allein der Arbeitgeber.
  • Selbst grobe Fahrlässigkeit führt nicht automatisch zur vollen Haftung. Das LAG Köln kürzte die Forderung von 2,8 Millionen auf rund 200.000 Euro — zwei Bruttojahresgehälter —, weil die volle Summe die wirtschaftliche Existenz des Mitarbeiters vernichtet hätte und der Arbeitgeber als „Herr des Betriebsrisikos” ein Risiko dieser Größenordnung eher tragen oder versichern kann. Eine feste Formel gibt es dafür laut den Urteilsbesprechungen nicht — die zwei Jahresgehälter sind ein Anhaltspunkt aus diesem konkreten Fall, keine allgemeine Regel.

Für den Agentenbau heißt das in der Praxis: Interne Regeln — wer einen Agent freigeben darf, welche Tests vor dem Rollout Pflicht sind, welche Grenzen für kundenwirksames Handeln gelten — entscheiden mit darüber, ob ein Fehler später als normale oder grobe Fahrlässigkeit eingeordnet wird. Und selbst wenn ein Gericht grobe Fahrlässigkeit bejaht, bleibt ein erheblicher Teil des Risikos beim Unternehmen hängen, weil ein ruinöser Ausgang für eine einzelne Person die Ausnahme bleiben soll.

Und wenn ein Dienstleister den Agent gebaut hat?

Sobald ein externer Dienstleister einen Agent implementiert, landet die Frage im Vertrag zwischen Auftraggeber und Dienstleister — und damit oft in dessen Allgemeinen Geschäftsbedingungen. Zwei Punkte machen das laut Dönch komplizierter, als es zunächst wirkt:

  • Anwendbares Recht. Sitzt der Anbieter im Ausland, kann der Vertrag ein fremdes Rechtssystem festlegen — dann muss zunächst geklärt werden, wie dort mit Haftungsausschlüssen umgegangen wird, bevor überhaupt deutsches Recht ins Spiel kommt.
  • Verschulden bleibt Voraussetzung. Vertragliche Haftung setzt vorsätzliche oder fahrlässige Pflichtverletzung voraus. Ein Anbieter, der offenlegt, dass „100 % Ergebnisqualität” bei KI-Systemen nicht zusagbar ist, haftet für eine Halluzination innerhalb des vereinbarten Rahmens in aller Regel nicht automatisch.

Ab Dezember 2026 zählt Verschulden nicht mehr

Neben der vertraglichen gibt es die außervertragliche, verschuldensunabhängige Haftung — und die verändert sich gerade grundlegend. Die neue EU-Produkthaftungsrichtlinie (EU) 2024/2853 nimmt erstmals ausdrücklich Software und KI-Systeme in den Anwendungsbereich auf, unabhängig davon, ob lokal installiert oder aus der Cloud bereitgestellt. Deutschland setzt das mit einem neuen Produkthaftungsgesetz um, das zum 9. Dezember 2026 in Kraft treten soll — unter anderem fällt die bisherige Haftungshöchstgrenze weg.

Was das praktisch bedeutet, macht Dönch an einem Beispiel fest: Ein Messer ist gefährlich und kann verletzen — trotzdem ist das kein Produktfehler, weil das Messer genau das tut, wofür es gebaut ist. Ausschlaggebend ist immer der bestimmungsgemäße Einsatz. Für KI-Anbieter heißt das: Sie müssen künftig genau festhalten, wofür ihr System geeignet ist und wofür nicht — und dass ein System, das laufend weiterlernt, auch nach der Auslieferung sicherheitsseitig gepflegt werden muss.

Kann ich mich bei Microsoft schadlos halten?

Naheliegend, aber laut Dönch in den meisten Fällen kein tragfähiger Weg: Das Microsoft Customer Copyright Commitment federt Urheberrechtsansprüche bei generierten Inhalten ab — es deckt nicht ab, dass ein selbst gebauter Agent im eigenen Anwendungsfall halluziniert. Hinzu kommt: Microsoft ist bei vielen Modellen selbst „nur” Hosting-Partner für Anthropic, Mistral, DeepSeek oder OpenAI. Und selbst bei einem berechtigten Anspruch bleibt das Kräfteverhältnis zwischen einem einzelnen Unternehmen und einem globalen Anbieter real — ein Rechtsstreit braucht dafür einen langen Atem.

Wenn jemand deinen Agent bewusst manipuliert

Anders liegt der Fall, wenn jemand deinen Agent gezielt über Prompt Injection oder wiederholte, offensichtlich unwahre Angaben zu einer falschen Aussage bewegt. Ein bewusster Manipulationsversuch unterbricht laut Dönch die ursprüngliche Haftungskette — vergleichbar mit einem Kunden, der wissentlich behauptet, ein Paket nie erhalten zu haben, obwohl er es in der Hand hält.

Der entscheidende Haken: Das lässt sich nur nachweisen, wenn tatsächlich geloggt wurde. Genau hier trifft die juristische Frage auf sehr konkrete M365-Praxis — Audit-Logs, Human in the Loop-Freigaben und eine granulare eDiscovery-Auswertung entscheiden am Ende, ob sich „das war ein Manipulationsversuch” tatsächlich belegen lässt oder eine Behauptung bleibt.

Es gibt bereits ein deutsches Urteil

Was im Podcast noch als offene Frage klang, hat inzwischen eine erste, wegweisende — aber noch nicht letztinstanzliche — Antwort bekommen: Das Oberlandesgericht Hamm hat am 12.05.2026 (Az. 4 UKl 3/25) geurteilt, dass ein Unternehmen für irreführende Angaben seines eigenen Chatbots in vollem Umfang haftet — die Aussagen werden ihm als eigene geschäftliche Handlung zugerechnet — und die Revision zum BGH zugelassen; rechtskräftig ist das Urteil damit noch nicht. Geklagt hatte nicht ein geschädigter Kunde, sondern die Verbraucherzentrale NRW wegen irreführender Werbung (UWG): Im entschiedenen Fall hatte ein Chatbot einer Schönheitsklinik nicht existente Facharztbezeichnungen für deren Geschäftsführer behauptet. „Das war der Chatbot” hat als Verteidigung nicht funktioniert.

Was du diese Woche tun kannst

Dönchs wichtigster Praxistipp aus dem Gespräch: Nie grundsätzlich auf Agents verzichten — das Potenzial dafür ist zu groß —, aber jederzeit wissen, welche Agents überhaupt laufen. Mitarbeitende kommen und gehen, von ihnen gebaute Agents bleiben oft aktiv, ohne dass jemand das noch auf dem Schirm hat. Konkret heißt das:

  1. Ein Agentenverzeichnis führen und regelmäßig durchsehen — wer hat welchen Agent wofür gebaut, und läuft er noch?
  2. Logging aktivieren, bevor ein Agent nach außen wirkt oder Kaufkraft bekommt — ohne Audit-Trail lässt sich später weder ein technischer Fehler von einer Halluzination unterscheiden noch ein Manipulationsversuch belegen.
  3. Klar trennen, welche Agents rein intern arbeiten und welche nach außen rechtlich bindend auftreten dürfen.
  4. Verträge mit Dienstleistern auf Haftungsklauseln und das vereinbarte anwendbare Recht prüfen, bevor der erste Agent produktiv geht.
  5. Die eigene Risikoexposition unter der neuen Produkthaftung ab Dezember 2026 einordnen — und wo nötig eine Versicherungslösung prüfen.
  6. Interne Regeln zum Agentenbau schriftlich festhalten — Freigabepflichten, Testschritte, Grenzen für kundenwirksames Handeln. Sie sind, wie das LAG-Köln-Urteil zeigt, der Maßstab, an dem ein Gericht später normale von grober Fahrlässigkeit unterscheidet.

Wenn ihr genau das — Agentenverzeichnis, Logging, klare Freigabegrenzen — für euren eigenen Copilot-Rollout aufbauen wollt, ist das eine Aufgabe für das Coaching für IT und Admins.

Die vollständige Folge mit allen Details, inklusive weiterer Beispiele zu Prompt Injection und dem AGB-Recht, findest du im Podcast-Archiv von 365 Checkpoint, sobald sie veröffentlicht ist. Mehr von Julia Dönch gibt es auf LinkedIn.

Quellen: Gespräch mit RA Julia Dönch, Podcast 365 Checkpoint (Aufnahme 5. September 2026); EU-Produkthaftungsrichtlinie (EU) 2024/2853; deutsches Produkthaftungsgesetz, Inkrafttreten 9. Dezember 2026; OLG Hamm, Urteil vom 12.05.2026, Az. 4 UKl 3/25; LAG Köln, Urteil vom 19.12.2024, Az. 8 Sa 830/22