„Dein KI-Agent ist ja toll, aber kann der auch eine Retoure anlegen?“ Diese Frage kam letzte Woche von einer Kundin, und ich musste erst mal tief durchatmen. Was sie ihren „KI-Agenten“ nannte, war ein FAQ-Chatbot. Acht vordefinierte Antwortblöcke, ein Link zur Versandstatus-Seite, das war’s. Kein Zugriff auf irgendein System, keine Entscheidungsbefugnis, nichts. Und das ist völlig okay! Nur schwirren die Begriffe gerade so durcheinander, dass kaum noch jemand auseinanderhält, was eigentlich was ist.
Also machen wir das hier sauber: KI-Agent vs. Chatbot, der Unterschied, erklärt an echten Projekten aus unserer Arbeit. Mit Tools, mit Zahlen, mit den Dingen, die daneben gegangen sind. Falls du tiefer einsteigen willst, haben wir zusammengestellt, wie KI-Agenten im Arbeitsalltag wirklich funktionieren.
Und ja, das Thema klingt nach der nächsten großen Sache. Ist es auch. Aber nicht für jeden Anwendungsfall, und genau darum geht’s.
Die Unterscheidung in einem Satz
Ein Chatbot redet. Ein Agent handelt.
Mehr braucht es ehrlich gesagt nicht. Ein Chatbot nimmt Text rein und gibt Text raus. Er kann dir sagen, wo dein Paket gerade steckt, aber er kann den Status nicht ändern. Ein Agent bekommt ein Ziel statt einer Frage, plant selbst, welche Schritte dafür nötig sind, und führt sie aus, mit echten Zugriffen auf echte Systeme. Er liest E-Mails, aktualisiert das CRM, bucht Termine, storniert Bestellungen.
Mein Lieblingstest fürs nächste Meeting: Frag, was das Ding tut, wenn gerade niemand antwortet. Ein Chatbot wartet. Ein Agent arbeitet weiter.
Was ein Agent wirklich ist
Unter der Haube ist ein Agent ein Sprachmodell (GPT-4o, Claude, was gerade am besten passt) mit drei Extras:
- Tools: Der Agent kann Funktionen aufrufen. Kalender, CRM, Datenbank, E-Mail, Websuche. Das Modell entscheidet selbst: „Um die Frage zu beantworten, muss ich erst im CRM nachschlagen“, und ruft dann tatsächlich die Schnittstelle auf.
- Gedächtnis: kurzfristig für den laufenden Vorgang, langfristig für Kundenhistorie und frühere Gespräche.
- Eine Schleife: planen, ausführen, Ergebnis prüfen, nachjustieren. Solange, bis das Ziel erreicht ist oder eine Regel abbricht.
Ein Chatbot hat keine Schleife. Frage rein, Antwort raus, fertig. Mein Lieblingsbild: Ein Chatbot ist ein extrem belesener Mitarbeiter, der am Telefon sitzt und nur reden darf. Ein Agent ist derselbe Mitarbeiter, nur mit Schlüssel zum Gebäude, Zugangsdaten für alle Systeme und dem Auftrag, die Sache bis zum Ende zu erledigen.
Der Haken liegt auf der Hand. Jede Fähigkeit ist auch ein Risiko, und ein Agent, der Mails verschicken darf, verschickt irgendwann auch mal eine, die er nicht hätte verschicken sollen. Deshalb dreht sich bei Agenten vieles um Rechte, Guardrails und Idempotenz (dazu später mehr, es wird peinlich). Wie wir Workflows so bauen, dass sie nachts um drei nicht ausrasten, haben wir unter Workflow-Reliability gesammelt. Und warum eine Agenten-Strategie ohne Sicherheitskonzept zum Risiko wird, haben wir separat aufgemacht.
Multi-Agent-Systeme: Wenn ein Agent nicht reicht
Statt einem Alleskönner baust du ein Team. Jeder Agent kriegt ein enges Aufgabengebiet, ein Orchestrator verteilt die Arbeit. Im Support-Szenario sieht das so aus: Ein Triage-Agent sortiert jede Anfrage ein (Rechnung, Versand, technisches Problem), spezialisierte Agenten bearbeiten ihr jeweiliges Thema, und ein Prüf-Agent schaut über die Antwort, bevor sie rausgeht. Wie Abteilungen, nur ohne Meetings und Raucherpausen.
Drei Gründe sprechen für den Team-Ansatz. Erstens greift ein Sprachmodell mit 15 Tools messbar häufiger zum falschen als eines mit vier. In einem Projekt sind wir von etwa 15 Prozent Fehlgriffen auf unter 5 Prozent gekommen, allein weil wir die 15 Tools auf drei Agenten verteilt haben. Zweitens bleibt der Kontext pro Agent klein, das spart Tokens und Geld. Drittens lassen sich Fehler eingrenzen: Wenn der Versand-Agent Unsinn erzählt, weißt du sofort, wo du suchen musst.
Klingt nach Overkill? Ist es oft auch. Bei drei Support-Anfragen pro Woche brauchst du kein Agenten-Team, dann reicht ein guter Chatbot. Wir bauen Multi-Agent-Systeme nur, wenn Volumen und Vielfalt der Anfragen es wirklich rechtfertigen, und ob sich das für jedes kleine Team lohnt, bin ich selbst noch nicht hundertprozentig sicher. Wer es trotzdem nachbauen will: unsere Schritt-für-Schritt-Anleitung für ein Multi-Agent-Support-Team ist ein guter Start.
Echte Projektbeispiele
Theorie war genug. Hier kommen drei Projekte, eins davon ging gehörig schief.
Beispiel 1: Der FAQ-Chatbot für den Fahrradshop
Kunde: ein Onlineshop für Fahrradteile mit etwa 4.000 Bestellungen im Monat und zwei Personen im Support. Die beiden ertranken in Anfragen wie „Wo ist mein Paket?“, „Wie retourniere ich?“, „Passt das Teil an mein Rad?“.
Unsere Lösung: ein FAQ-Chatbot in Tidio, trainiert auf rund 140 Helpdesk-Artikel und die 40 häufigsten Tickets, hinten dran GPT-4o, damit er auch verstümmelte Fragen versteht. Nach vier Wochen beantwortete der Bot etwa 73 Prozent der Anfragen komplett ohne menschliches Eingreifen, und die Ticketzahl sank von rund 60 pro Woche auf 22. Aufbau: zwei Nachmittage, vielleicht 14 Stunden Arbeit insgesamt.
Und jetzt das Wichtigste: Das Ding kann nichts. Keine Retoure anlegen, keinen Gutschein erstellen, nichts. Es kennt die Retouren-Seite und den Status-Link, Punkt. Genau deshalb funktioniert es so gut. Klarer Scope, null Risiko, messbares Ergebnis. Ein Agent wäre hier einfach Geldverschwendung gewesen.
Beispiel 2: Der Lead-Qualifizierer
Ganz anderes Kaliber war der zweite Kunde: ein B2B-SaaS-Anbieter für Maschinenbau mit rund 120 Leads im Monat, verteilt auf Website-Formular, E-Mail und LinkedIn. Der Vertrieb brauchte teils zwei Tage, um zurückzurufen. Zwei Tage! Die Hälfte der Leads hatte da längst woanders angefragt.
Wir haben einen Agenten auf n8n gebaut, hinten dran OpenAI. Der Ablauf: Lead kommt rein, der Agent holt Firmendaten, prüft gegen das Idealprofil, recherchiert bei Bedarf die Website, schreibt eine Zusammenfassung ins HubSpot-CRM und legt einen personalisierten Antwortentwurf an. Der Vertriebsleiter klickt nur noch auf „Senden“. Nachts, am Wochenende, im Urlaub: läuft.
Die Zahlen: Antwortzeit von durchschnittlich elf Stunden auf unter fünfzehn Minuten. Vorher bekamen etwa 80 der 120 Leads überhaupt eine zeitnahe Antwort, jetzt alle 120. Die Demos pro Monat gingen von 9 auf 14. Und die Prüfung der Entwürfe, anfangs 20 Minuten am Tag, lag nach zwei Wochen unter fünf Minuten, weil die Entwürfe einfach gut geworden sind.
Das ist der Unterschied in Reinform. Der Agent entscheidet, handelt und hinterlässt Spuren im CRM. Ein Chatbot hätte dem Lead bestenfalls geschrieben: „Danke für Ihre Anfrage, wir melden uns.“ Und hätte dann gewartet.
Beispiel 3: Der Termin-Agent, der mir eine peinliche Woche beschert hat
Dieser geht auf mein Konto. Für uns selbst hatte ich einen Agenten gebaut, der Termine aus E-Mails ziehen, freie Slots prüfen und Termine buchen sollte. Hat funktioniert. Wunderbar sogar. Bis ein Timeout einen Retry ausgelöst hat, während die Buchung längst durch war. Das Ergebnis: Ein Lead bekam vier fast identische Bestätigungsmails mit vier leicht unterschiedlichen Terminen. Zwei davon existierten tatsächlich im Kalender.
Ich hatte schlicht keine Idempotenz-Schlüssel eingebaut. Das war mein Fehler, und eine ganze Woche lang habe ich mich dabei ziemlich dumm gefühlt. Der Lead hat es zum Glück mit Humor genommen. Trotzdem war das Vertrauen erst mal weg, und das hat mir zu schaffen gemacht.
Heute geht bei uns kein Agent ohne Idempotenz und Dry-Run-Modus in Produktion. Wer das nachbauen will: fail-safe Pipelines mit API-Idempotenz haben wir Schritt für Schritt aufgeschrieben.
Wann du was wählen solltest
Nach gut einem Dutzend Projekten hab ich eine Faustregel:
- Chatbot: wenn sich die Anfragen mit Text beantworten lassen, häufig vorkommen und ein klares Regelwerk haben. Typische Fälle: FAQ, Versandstatus, Öffnungszeiten. Billig im Betrieb, schnell gebaut, risikoarm.
- Klassische Automation (Zapier, Make, n8n): wenn ein klarer, wiederholbarer Prozess dahintersteckt, den man regelbasiert abbilden kann. Nicht alles braucht ein Sprachmodell, die wenigsten Fälle wirklich. Unser Vergleich der Automation-Plattformen hilft bei der Einordnung.
- Agent: wenn der Vorgang mehrere Systeme berührt, Entscheidungen erfordert und sich nicht in ein starres Schema pressen lässt. Lead-Qualifizierung, Rechnungsprüfung, Terminlogik.
Drei Fragen, die dir die Entscheidung leichter machen:
- Muss das Ding in andere Systeme schreiben, oder reicht Lesen und Antworten?
- Was kostet ein Fehler? Beim FAQ-Chatbot fast nichts, beim Agenten mit Kündigungsrechten richtig viel.
- Gibt es einen klaren Prozess? Dann erst regelbasiert versuchen. KI ist oft die teurere Lösung für ein bereits gelöstes Problem.
Beim Thema KI-Agent vs. Chatbot ist die ehrliche Antwort übrigens oft: beides nicht, sondern eine simple Automation. Wenn du gerade erst anfängst, fang klein an, mit einem Chatbot oder einer einzelnen Automation. Dafür haben wir ein komplettes No-Hype-Playbook für KI-Automatisierung im Mittelstand, ohne Buzzword-Bingo.
FAQ
Ist ein KI-Agent nicht einfach ein Chatbot mit GPT?
Nein. GPT macht aus einem dummen Chatbot einen schlauen Chatbot. Er versteht Varianten und formuliert besser. Aber er plant nicht, und er handelt nicht. Der Unterschied liegt in Tools und Schleife, nicht im Sprachmodell.
Reicht für mein Unternehmen nicht ein Chatbot?
Wahrscheinlich, zumindest am Anfang. Die meisten Teams brauchen erst mal ein sortierteres Postfach, automatische Antworten auf Standardfragen und ein CRM, das sich selbst befüllt. Wie ich selbst Leads im Inbox-Chaos verloren habe, ist ein eigenes Thema. Meist läuft das ohne einen einzigen Agenten.
Was kostet der Unterschied?
Ein Chatbot wie im Fahrradshop-Projekt läuft ab etwa 50 bis 100 Euro im Monat plus ein paar Tage Aufbau. Ein Agent mit mehreren Integrationen liegt deutlich darüber, unsere Lead-Qualifizierer-Projekte lagen im mittleren vierstelligen Bereich plus laufende Kosten. Nimm das als Größenordnung, nicht als Angebot.
Sind Agenten nicht gefährlich?
Sie können es werden, ja. Jede Fähigkeit ist ein Risiko. Deshalb: minimal nötige Rechte, Human-in-the-Loop bei kritischen Schritten, sauberes Monitoring. Und manche Fähigkeiten geben wir Agenten bewusst nicht, weil die Fehlerkosten jede Ersparnis auffressen würden.
Kurz zum Schluss
Wenn Text reicht, nimm den Chatbot. Wenn gehandelt werden muss, den Agenten. Und im Zweifel fang klein an, das ist keine Schande, sondern Budgetverstand.
Falls du unsicher bist, was dein Anwendungsfall wirklich braucht: schreib mir. Ich sage dir auch, wenn du keins von beidem brauchst. Wer wissen will, wer hier eigentlich schreibt, kann das gerne nachlesen.
Bis zum nächsten Mal,
Damian
