Zum Inhalt springen
Aktuell

Agenten verdienen sich Autonomie wie neue Mitarbeiter

Volle Autonomie am ersten Tag kostet Vertrauen. Auf Perfektion warten heisst nie ausliefern. Wie wir Agenten in Produktion ihre Autonomie verdienen lassen.

Aman Tiwari
Aman Tiwari
Software-Ingenieur
Veröffentlicht
Aktualisiert
Lesezeit6 min

Der schnellste Weg, das Vertrauen in einen KI-Agenten zu verlieren, ist, ihm am ersten Tag volle Autonomie zu geben. Der schnellste Weg, nie einen auszuliefern, ist zu warten, bis er perfekt ist. Wir haben Agenten über mehr als 100'000 echte Kundenanrufe laufen lassen, und das Modell, das wirklich funktioniert, ist das älteste im Management: Man deployt einen Agenten nicht — man arbeitet ihn ein.

Ein neuer Mitarbeiter bekommt am ersten Morgen nicht die Schlüssel zur Bank. Er schaut zu. Er übernimmt die einfachen Fälle unter Aufsicht. Er verdient sich Spielraum, indem er in einem engeren Spielraum zuverlässig ist. Agenten sind exakt gleich — und sie so zu behandeln ist der Unterschied zwischen einem System, das Ihr Operations-Team verteidigt, und einem, das es still abschaltet.

Auf Probe starten

Jeder Agent, den wir ausliefern, beginnt in einem Modus, in dem er vorschlagen, aber nicht handeln kann. Auf einer Telefonlinie heisst das: Er kann das Gespräch führen, die Absicht verstehen und die Handlung entwerfen — den Termin buchen, die Rückerstattung auslösen, den Datensatz aktualisieren — aber ein Mensch gibt die Handlung frei, bevor sie ausgeführt wird. Die Kundenerfahrung ist voll automatisiert; die Konsequenz bleibt hinter einem Tor.

Das fühlt sich für Leute, die «KI, die es einfach erledigt» wollten, wie eine halbe Sache an. Ist es nicht. Die Probezeit ist, wo Sie die zwanzig Randfälle entdecken, die Ihr Prompt nie erahnt hat — mit einem Sicherheitsnetz unter jedem. Sie bremsen den Agenten nicht — Sie kaufen die Belege, die es später erlauben, ihn sicher zu beschleunigen.

Die teure Abkürzung:

Die Probezeit zu überspringen, um «schnell zu sein», ist die teuerste Einzelentscheidung, die Teams mit Agenten treffen. Die Fehler, die Sie in Woche eins als harmlose Vorschläge gefangen hätten, werden stattdessen ausgeführte Handlungen — ausgelöste Rückerstattungen, doppelt gebuchte Termine, ein Kunde, dem etwas Falsches gesagt wurde — und jetzt bauen Sie Vertrauen im Geschäft wieder auf, statt bloss einen Bug zu fixen.

Das Transkript ist das Produkt

Man denkt, das Modell sei der Vermögenswert. Bei einem betriebenen Agenten ist der Vermögenswert der Transkript-Speicher — jeder Gesprächszug, jeder Werkzeugaufruf, jede Entscheidung, jedes menschliche Übersteuern, erfasst und durchsuchbar. Er ist Ihre Trainingsdaten, Ihr Debugger, Ihre Audit-Spur und Ihr Vertrauensinstrument, alles zugleich.

Wenn bei Anruf 40'312 etwas schiefgeht, ist «die KI hat's vermasselt» nutzlos. «In diesem Zug hat der Agent das Datum falsch aufgelöst, weil der Anrufer an einem Montag ‹nächsten Dienstag› sagte und unser Datums-Resolver die laufende Woche annahm» ist ein Fix. Den zweiten Satz bekommen Sie nur, wenn Sie die ganze Argumentationskette geloggt haben — nicht nur die finale Ausgabe.

call_event · structured turn log

{ call_id: "c_40312", turn: 14, intent: "reschedule_appointment", heard: "can we do next tuesday", resolved: { date: "2026-06-16", confidence: 0.71 }, // low → gate proposed: "move booking to Tue 16 Jun, 10:00", action: "held_for_approval", // not committed human: { decision: "edited", to: "2026-06-23" } // learns from this }

Dieses Datum mit niedriger Konfidenz ist das ganze Spiel. Der Agent hat nicht so getan, als wäre er sicher. Er hat sich selbst markiert, die Handlung wurde angehalten, ein Mensch hat korrigiert — und diese Korrektur wird ein gelabeltes Beispiel für die nächste Iteration. Das Transkript hat einen Beinahe-Fehler in eine Verbesserung verwandelt.

Ein Agent ohne Transkript ist kein Mitarbeiter. Er ist ein Fremder, der Entscheidungen trifft, die Sie nicht prüfen können.

— Über Observability als Vertrauen

Das Freigabetor, das Sie nie entfernen

Hier ist die Regel, die wir nicht beugen: Jede schwer umkehrbare Handlung behält einen Menschen in der Schleife — dauerhaft. Nicht «bis der Agent gut genug ist» — dauerhaft. Geld bewegen, Daten löschen, eine rechtliche Zusage machen, alles, was ein Kunde nicht leicht rückgängig machen kann: Das bleibt hinter dem Tor, egal, wie viele Anrufe der Agent gemeistert hat.

Das Tor ist kein Zeichen eines unreifen Systems. Es ist eine Designentscheidung über Konsequenz. Umkehrbare Handlungen — eine Frage beantworten, eine Nachricht entwerfen, etwas nachschlagen — graduieren schnell zu voller Autonomie. Unumkehrbare graduieren nicht, weil die Kosten des Irrtums asymmetrisch sind und keine Genauigkeitszahl «Rückerstattung ans falsche Konto» akzeptabel macht.

Bearbeitete Live-Anrufe —

Über echte kundenseitige Telefonlinien hinweg.

Autonomie-Stufen —

Schatten, Handlung-mit-Tor, voll — verdient, nicht verliehen.

Protokollierte unumkehrbare Handlungen —

Jede ausgeführte Handlung ist zuordenbar und prüfbar.

Befördern auf Belegen, nicht auf Gefühl

Ein Agent wandert für eine bestimmte Handlungsklasse von der Probe zur Autonomie, wenn die Belege sagen, dass er es sich verdient hat — nicht, wenn sich jemand nach der Demo gut fühlt. Wir definieren Beförderungskriterien vorab, pro Absicht:

  • Volumen. Er hat genug Fälle dieses Typs bearbeitet, dass die Stichprobe etwas bedeutet — nicht drei glückliche Anrufe.
  • Zustimmungsquote. Menschen haben seine vorgeschlagene Handlung ohne Änderungen freigegeben, über einer Schwelle, die wir mit der Risikobereitschaft des Kunden festlegen.
  • Fehlerprofil. Wenn er falsch lag, lag er sicher falsch — er hat niedrige Konfidenz markiert, statt sich selbstbewusst auf einen Fehler festzulegen.

Alle drei für eine Absicht erfüllt — und diese Absicht graduiert: Das Tor fällt für die umkehrbaren, die Konfidenzschwellen lockern sich. Verfehlt — sie bleibt auf Probe, und die Transkripte zeigen exakt, welche Fälle zu fixen sind. Die Beförderung ist eine Datenentscheidung mit Papierspur — und genau das lässt auch einen vorsichtigen Kunden Ja sagen.

Den schlechten Anruf vor dem guten entwerfen

Die Demo ist der Agent mit einem sauberen, kooperativen Anrufer. Die Produktion ist ein Anrufer auf schlechter Verbindung, der dem Agenten ins Wort fällt, drei Dinge zugleich fragt, in einem Akzent, auf den das Sprachmodell nicht getrimmt war. Ihr System wird durch diesen Anruf definiert, nicht durch die Demo.

Also entwerfen wir zuerst den Fehlerpfad. Der Agent muss immer drei Dinge können: erkennen, dass er überfordert ist; sauber und mit vollem Kontext an einen Menschen übergeben; und den Anrufer nie in einer Schleife stranden lassen. Ein würdevolles «Ich hole eine Kollegin, die Ihnen damit helfen kann» ist ein erfolgreiches Ergebnis. Eine selbstbewusst falsche Antwort ist das einzige echte Scheitern.

Die Kennzahl, die zählt:

Wir optimieren nicht auf «voll automatisierte Anrufe». Wir optimieren auf «gut gelöste Anrufe» — inklusive derer, die der Agent korrekt an eine Person übergeben hat. Ein Agent, der seine Grenzen kennt und entsprechend routet, schlägt einen übermütigen auf jeder Messgrösse, die einem Kunden wirklich wichtig ist.

Das Einarbeitungs-Playbook

Wenn Sie einen Agenten vor echte Kunden stellen, ist das die Reihenfolge, in der wir es tun würden:

  1. Ab Anruf eins alles loggen. Strukturierte Transkripte auf Zug-Ebene, bevor Sie einen einzigen Prompt tunen. Was Sie nicht erfasst haben, können Sie nicht verbessern.
  2. Im Schatten- oder Tor-Modus ausliefern. Echter Traffic, echte Absichten, null unumkehrbare Autonomie. Lassen Sie die Realität Ihre Randfall-Liste schreiben.
  3. Beförderungskriterien pro Absicht schriftlich festlegen. Volumen, Zustimmungsquote, Fehlerprofil. Vereinbart mit der Risikobereitschaft des Kunden — nicht mit Ihrem Enthusiasmus.
  4. Das Unumkehrbar-Tor für immer behalten. Geld, Löschung, Zusagen — der Mensch in der Schleife ist eine dauerhafte Designentscheidung, keine Phase.
  5. Übergabe als Erfolg behandeln. Lösung messen, nicht Automatisierungsquote. Belohnen Sie den Agenten dafür, zu wissen, wann er zurücktritt.

So gemacht, hört Autonomie auf, ein Vertrauensvorschuss zu sein, und wird ein Kontobuch. Jeden Spielraum, den der Agent hält, hat er verdient — mit Transkripten als Beleg. Das ist die Version von «KI, die es einfach erledigt», für die man mit seinem Namen einstehen kann — weil man sie eingearbeitet hat wie jeden, dem man Kunden anvertrauen würde.

Genau dieses Onboarding — Berechtigungen, Transkripte, schrittweises Vertrauen — bauen wir in die Agenten, die wir bei CODT ausliefern. Wenn Sie gerade entscheiden, wie viel Leine Ihr erster Agent bekommt, zeigen wir Ihnen unser Vorgehen.

Arbeiten Sie an etwas Ähnlichem?

Antwort innerhalb eines Werktags
Aman Tiwari
Geschrieben von

Aman Tiwari

Software-Ingenieur

Aman entwickelt KI-Agenten für den Produktivbetrieb — Sprache, Chat und Back-Office-Automatisierung, die vor echten Kunden zuverlässig bleiben muss. Er arbeitet an den Leitplanken, Transkripten und Human-in-the-Loop-Systemen, mit denen Automatisierung ihre Autonomie verdient.

LinkedIn ↗

Haben Sie ein Projekt im Sinn?

Erzählen Sie uns davon — wir antworten innerhalb eines Werktags mit einer ehrlichen Einschätzung zu Fit und Umfang.