Anfang 2025 hat mir ein Geschäftsführer aus dem Maschinenbau ernsthaft erklärt, KI sei „etwas für Marketingmenschen und Kalifornier“. Vor drei Wochen rief derselbe Mann an und wollte wissen, ob ein Agent eigenständig Lieferantenangebote vergleichen kann. Zwischen diesen beiden Anrufen liegt ziemlich genau das, was die Bitkom-Studie 2026 zu KI im Mittelstand misst: Die Nutzung ist von 17 auf 41 Prozent gestiegen. Innerhalb von zwölf Monaten. Verdopplung, plus ein bisschen obendrauf.
Und fast jede zweite dieser Firmen sagt gleichzeitig: messbares Ergebnis? Fehlanzeige.
Beides gehört zusammen, und man versteht das eine ehrlich gesagt nicht ohne das andere. Wer die Grundlagen nachlesen will, findet sie in unserem No-Hype-Playbook für KI-Automation im Mittelstand. Hier geht es um die Zahlen, um die Lücke dazwischen und um drei Fragen, die deinen nächsten Piloten entweder retten oder sauber beenden.
Die Bitkom-Zahlen: Verdopplung in zwölf Monaten
17 auf 41 Prozent ist keine Entwicklung mehr, das ist ein Phasenübergang. Zum Vergleich: Cloud brauchte im Mittelstand rund ein Jahrzehnt für ähnliche Quoten. KI hat das in einem Jahr geschafft, ohne dass irgendjemand einen großen Digitalisierungsrat ins Leben gerufen hätte.
Meine unromantische Erklärung: Der Preis fürs Ausprobieren ist gegen null gefallen. Früher brauchte ein KI-Projekt ein Beratungsbudget und ein IT-Gremium. Heute reichen eine 30-Euro-Lizenz und ein motivierter Mensch aus der Buchhaltung. Copilot sitzt längst in Office, ChatGPT auf jedem Handy, und jede Fachabteilung legt los, bevor die IT überhaupt Wind bekommt.
Ein Beispiel aus meinem Alltag: Für eine Kanzlei mit 14 Mitarbeitenden hab ich Anfang 2025 eine Rechnungs-Vorprüfung gebaut. Make plus Claude API, drei Wochen Aufbau, rund 2.000 Euro Gesamtkosten. Vorher hat eine Mitarbeiterin täglich etwa 90 Minuten Belege erfasst, heute sind es 15 Minuten Kontrollzeit. Das Ding läuft seit vierzehn Monaten produktiv, und niemand denkt mehr daran. Solche Geschichten sind der Grund, warum mich die Bitkom-Zahl nicht überrascht.
Nebenbei: Ich vermute, die reale Zahl liegt über 41 Prozent, weil keine Umfrage die Schatten-KI misst, also all die Mitarbeitenden, die abends privat mit ChatGPT Angebote glätten und E-Mails formulieren. Beweisen kann ich das nicht. Frag mal in deinem Umfeld herum.
Was 2026 anders macht: Agenten statt Chatbots
Die Verdopplung hat einen technischen Kern, und der heißt Agenten. 2023 und 2024 war KI im Unternehmen quasi ein besserer Texteditor: Du fragst, die KI antwortet, du kopierst, du fügst ein. Nett, aber kein Geschäftsmodell.
2026 ist die KI nicht mehr der Kollege, der nur redet, sondern der, der Handgriffe macht. Agenten lesen Postfächer, buchen Belege, pflegen CRM-Datensätze und eskalieren Sonderfälle an Menschen. Wer schon mal Agenten im echten Arbeitsalltag gesehen hat, versteht, warum der Mittelstand plötzlich aufspringt: Zum ersten Mal spart KI fertige Arbeitszeit, statt nur Entwürfe zu liefern.
Der Grund, warum das ausgerechnet dem Mittelstand hilft: Agenten integrieren sich in Werkzeuge, die ohnehin vorhanden sind. Outlook, DATEV, die Warenwirtschaft, das CRM. Kein neues System, keine Schulungswelle, kein Reißbrettprojekt. Ein Agent, der Postfach und Buchhaltung verbindet, ist für eine 80-Personen-Firma relevanter als jede Vision aus Palo Alto.
Allerdings halte ich gut ein Drittel von dem, was heute „Agent“ genannt wird, für einen Chatbot mit besserem Marketing. Ein echter Agent führt Aktionen aus, entscheidet innerhalb definierter Grenzen und übergibt sauber, wenn er nicht mehr weiterweiß. Ein Textfeld, das drei Tools aufrufen kann, ist noch keine Belegschaft. Der Unterschied wird wichtig, sobald Geld fließt: Ein falscher Text ist peinlich, eine falsche Buchung ist ein Schaden.
Die ROI-Lücke: Warum Piloten selten Produktion werden
Jetzt der unbequeme Teil der Studie: Laut Bitkom sieht fast jede zweite Firma mit KI-Einsatz noch kein messbares Ergebnis. Nicht „wenig“, sondern keins. Und aus meiner Erfahrung läuft fast immer dasselbe Muster ab.
Erstens: Piloten messen Begeisterung statt Ergebnisse. Kaum jemand definiert vorab, was Erfolg überhaupt bedeuten soll. Stunden gespart? Fehlerquote gesenkt? Durchlaufzeit verkürzt? Vor Kurzem hab ich einen Projektplan gesehen, dessen Erfolgskriterium wörtlich „Nutzung der Mitarbeiter“ lautete. Nutzung von was, gemessen wie? Keine Antwort. Wenn diese Zahl vorher niemand aufschreiben kann, wird sie nachher auch niemand vorweisen.
Zweitens: Piloten werden nach Wow-Effekt ausgewählt, nicht nach Prozess. Die Demo soll den Vorstand beeindrucken, also nimmt man das spektakulärste Szenario statt das langweiligste Volumen. Das Geld liegt aber fast immer in der Langeweile.
Drittens, und das wird am meisten unterschätzt: Produktion ist Betrieb, kein Projekt. Nach der Demo-Person kommt niemand, der das Ding über Monate wartet, Fehler protokolliert und nachjustiert. Zwischen Proof of Concept und Budgetfreigabe stirbt so mancher Pilot einen stillen Tod.
Ich rede hier aus Erfahrung, nicht aus Überheblichkeit. 2024 hab ich für einen Maschinenbauer mit 340 Mitarbeitenden einen Mail-Triage-Piloten gebaut: Make plus GPT-4o, automatisches Sortieren und Priorisieren von Support-Mails und Kundenanfragen. In der Testumgebung 93 Prozent Trefferquote, alle begeistert. Nach sechs Wochen Produktion lagen wir bei knapp über 70 Prozent, weil echte Mails Anhänge hatten, drei Sprachen durcheinanderliefen und Leute auf Deutsch antworteten, obwohl der Kunde Englisch geschrieben hatte. Wir haben abgeschaltet. Rund 6.000 Euro Tiefflug. Und ich war mir monatelang nicht sicher, ob das die richtige Entscheidung war; ehrlich gesagt weiß ich es bis heute nicht hundertprozentig. Der Kunde hat es mir nicht übel genommen. Ich mir schon.
Dazu kommt die Zuverlässigkeitsfalle: 80 Prozent Korrektheit wirken in einer Demo stark. In Produktion bedeutet 80 Prozent, dass jede fünfte Anfrage falsch behandelt wird, und das frisst die komplette Ersparnis wieder auf. Deshalb ist Zuverlässigkeit von Workflows bei uns kein Nebenkapitel, sondern der Kern jeder Automation.
Wo deutsche Firmen zuerst automatisieren (laut Deloitte)
Deloitte zeichnet in den Auswertungen zur generativen KI ein ziemlich einheitliches Bild davon, wo deutsche Firmen tatsächlich zuerst anfangen: im papierlastigen Backoffice und am Kundenkontakt. Rechnungs- und Vertragsverarbeitung, Kundenservice, Angebotserstellung, Lead-Bearbeitung. Überall dort also, wo unstrukturierter Text auf strukturierte Prozesse trifft. Nebenbei bemerkt: Content-Erstellung, 2023 noch als DER Anwendungsfall gefeiert, taucht in echten Produktivsystemen seltener auf, als die Keynotes vermuten ließen.
Auffällig ist, wo Mittelständler nicht starten: in Produktion, Logistik, ERP-Workflows. Aus gutem Grund, finde ich. Diese Bereiche verzeihen keine Fehler und hängen an Altsystemen, über die niemand freiwillig spricht. Wer dort zuerst automatisiert, wählt meist den schwierigsten Fall zum ungünstigsten Zeitpunkt.
Für die typischen Erstprojekte reicht übrigens oft Standardwerkzeug. Welche Plattform für welchen Anwendungsfall taugt, haben wir in unserem Vergleich der Automatisierungsplattformen aufgeschlüsselt, von Zapier über Make bis n8n. Und falls der Vertrieb dein Startpunkt ist: Ich hab meine komplette Lead-Qualifizierung automatisiert und arbeite seitdem deutlich weniger Wochenenden.
Drei Fragen vor dem nächsten Pilot-Budget
Wenn in diesem Jahr Pilotgeld beantragt wird, egal ob 5.000 oder 500.000 Euro, sollten vorher drei Fragen beantwortet sein. Sie retten den Piloten oder beenden ihn. Beides ist ein Gewinn, nur das Weiter-so ist teuer.
1. Welchen Prozess ersetzt das konkret – und wer macht ihn heute, wie lange?
Wenn niemand Name und Wochenstunden nennen kann, gibt es auch nichts zu messen. „Wir modernisieren die Kommunikation“ ist ein Wunsch, kein Ziel. „Frauke braucht für die Angebotserstellung elf Stunden pro Woche, wir wollen daraus drei machen“ ist ein Ziel.
2. Was passiert, wenn die KI falsch liegt?
Jede Automation braucht einen Plan für den Fehlerfall. Wer fängt es ab, wie schnell, mit welchen Folgen? Wenn die Antwort „merkt schon jemand“ lautet, Finger weg. Genau diese Lücke hat meinen Mail-Triage-Piloten beerdigt.
3. Wer betreibt das nach Woche sechs?
KI ist kein Projekt mit Endtermin, sondern ein Produkt mit laufenden Kosten. Ohne Betreiber kein Monitoring, ohne Monitoring keine Fehlerquote, ohne Fehlerquote kein ROI. Der Betreiber darf eine einzelne Person mit vier Stunden pro Woche sein. Aber es muss eine Person mit Namen sein.
Fazit: Der Mittelstand ist weiter als er denkt
41 Prozent KI-Nutzung in zwölf Monaten ist für deutsche Verhältnisse bemerkenswert schnell. Der alte Vorwurf, der Mittelstand verschlafe alles, galt vielleicht 2023. Heute ist er eine billige Ausrede.
Die eigentliche Baustelle liegt zwischen Pilot und Produktion. Nicht das Probieren ist das Problem, sondern das Betreiben. Und das ist weniger eine Technologiefrage als eine Frage von Zieldefinition, Verantwortung und ehrlicher Fehlerrechnung.
Für die nächste Bitkom-Runde wette ich auf folgendes Bild: Die Nutzungsquote steigt weiter, aber die Ergebnisquote entscheidet, wer damit Geld verdient. Wer die drei Fragen oben beantworten kann, gehört vermutlich schon dazu. Wer es nicht kann, hat gerade ein paar tausend Euro Pilotgeld gespart.
Genug Zahlen für heute. Wenn dein Pilot gerade zwischen Demo und Produktion festhängt, schreib mir, ich antworte meist schneller als unsere Automationen. Und falls du wissen willst, warum ich so auf Fehlerquoten herumreite: hier steht, wer ich bin.
Bis zum nächsten Mal,
Damian
