Im vergangenen märz, auf halbem weg durch eine live-demo für das ops-team eines kunden, erreichte der openai-schlüssel eine harte ausgabenobergrenze und der workflow starb vor neun leuten. Finance hatte die Kappe auf $20 pro Monat. Wir hatten verbrannt $18,40 davon während der Testläufe in der Nacht zuvor, und um 2:15 an einem Dienstagnachmittag die Lead-Scoring-Demo 401'd auf dem Projektor, Mitte Satz.
Diese Geschichte ist normalerweise eine Warnung vor der Abrechnung von Governance. Aber als n8n v2.36 mit dem n8n AI Gateway ausgeliefert hat, wurde mir klar, dass es genauso eine Geschichte über Setup-Friktion ist. Der Pitch: Credits innerhalb von n8n kaufen, Modelle aus einem Katalog über eine Abrechnungsbeziehung anrufen, die Anbieterkonten, die Prepaid-Rechnungen und die Demütigung am Dienstag-Nachmittag überspringen.
Wir bauen die meisten Client-Stacks auf n8n und unsere Vergleich von Zapier, Make und n8n wird nach diesem Release ein Update benötigen. Anstatt also zehn Minuten lang an das Feature zu stoßen, haben mein Team und ich es richtig getestet. 2.400 produktionsförmige Aufforderungen. Drei Modellfamilien. Zwei Parallelitätsstufen. Direct API Keys als Kontrollgruppe.
Dies ist die ehrliche Aufschlüsselung, einschließlich der Teile, in denen Credits leise mehr kosten.
Welche n8n AI Gateway Credits erhalten Sie in v2.36
Die Mechanik braucht dreißig Sekunden, um es zu erklären. Fügen Sie die Gateway-Anmeldeinformationen hinzu, kaufen Sie einen Eimer Credits und jeder LLM-Knoten oder AI-Agent-Knoten in Ihren Workflows kann im Gateway-Katalog ausgeführt werden. Kein OpenAI-Konto, kein Anthropic-Konto, kein Mistral-Konto, keine vier separaten Rechnungen, die das Finanzteam eines Kunden in vier separaten Meetings genehmigen muss. Wir stützen uns ständig auf Agenten (mehr dazu) Wie KI-Agenten tatsächlich in der Produktion arbeiten), und eins zu drehen, ohne einen einzigen anbieter anzumelden, ist wirklich attraktiv.
Für kleine und mittlere Unternehmen löst dies ein echtes Problem. Die Hälfte unserer Kunden hat genau eine Person, die das OpenAI-Konto "besitzt", und diese Person macht Urlaub.
Ab dem Build, den wir getestet haben, deckte der Katalog das ab, was Sie erwarten würden: GPT-4o und GPT-4o mini, Claude 3.5 Sonnet und Haiku, Gemini, Llama 3.1 70B und 405B über Hosting-Partner sowie Mistral und DeepSeek. Caveat, bevor ich weiter gehe: n8n Schiffe schnell, und ich wette Geld Teile dieser Liste haben sich bereits geändert. Überprüfen Sie die aktuellen Dokumente, bevor Sie meinen Snapshot planen.
Was Sie immer noch nicht durch das Gateway erreichen können
Kein Azure OpenAI. Keine AWS Bedrock, keine Vertex AI, keine privaten Endpunkte, nichts selbst gehostetes wie Ollama oder vLLM und keine fein abgestimmten Modelle. Wenn Ihre Architektur von einer davon abhängt, ist das Gateway keine Option, Punkt. Erinnern Sie sich an diese Lücke. Es kommt später in diesem Post mit Zähnen zurück.
Unser Test-Setup: 2.400 Aufforderungen, drei Familien, zwei Parallelitätsstufen
Faire Warnung: Dies war kein Labor. Wir haben vier Aufgabentypen aus echten Kundenjobs gezogen und anonymisiert: Support-Ticket-Klassifizierung, Lead-Message-Extraktion, Dokumentenzusammenfassung und Kurzformgenerierung. Die durchschnittliche Eingabeaufforderung lief etwa 750 Eingangstoken und 180 Ausgangstoken. 800 Aufforderungen pro Familie über GPT-4o, Claude 3.5 Sonnet und Llama 3.1 70B, und jede Aufforderung wurde zweimal ausgeführt, einmal durch Gateway-Credits und einmal durch unsere eigenen Schlüssel, im identischen Workflow, in dem nur die Anmeldeinformationen ausgetauscht wurden.
Die Hälfte der Läufe ging seriell aus. Die andere Hälfte lief mit 10 parallelen Hinrichtungen, was ungefähr das ist, was ein beschäftigter SMB-Workflow an einem Montagmorgen macht. Für den kontext sind wir ein zwei-personen-shop und die längere version von. Wer schreibt das und wie wir mit Kunden arbeiten Leben auf der About Page.
Jetzt ein Geständnis, denn sonst bedeuten die Zahlen nichts. Die ersten 400 Hinrichtungen hatten ein promptes Caching auf der direkten Seite, aber nicht auf der Gateway-Seite, da ich die beiden Anmeldeinformationen an verschiedenen Tagen mit unterschiedlichen Mengen Kaffee konfiguriert habe. Direct API kam zurück und sah etwa 30% billiger aus als die Realität. Mein Fehler, ganz und gar. Ich warf den Batch raus und wiederholte ihn, dann saß ich eine Weile da und fragte mich, wie viele Benchmark-Posts im Internet genau diese Art von Drift tragen und es nie bemerken.
Noch eine Beichte. Ich ging in Rooting für das Gateway zum Scheitern. Ich halte einen Anmeldeordner mit 40-ungerade sorgfältig beschrifteten API-Schlüsseln und nehme einen seltsamen Stolz darauf. Eine Sache zu verlieren zu wollen, ist schlechte Wissenschaft, also ließ ich meine Kollegin Miriam die Kostenrechnung überprüfen, ohne ihr zu sagen, welche Kolumne welche war. Sie fand einen arithmetischen Fehler. Auch meine.
Kostenrechnung: Credits vs. direkte API-Abrechnung
Über alle 2.400 Eingabeaufforderungen hinweg hat uns das Gateway aufgeladen $13.87. Die identische Arbeitsbelastung unserer eigenen Schlüssel kostet $11.42. Das ist eine Prämie von 21,4%, die, wie sich herausstellt, niedriger ist, als ich erwartet hatte.
| Modellfamilie | Direkte API (800 Aufforderungen) | Gateway Credits (800 Aufforderungen) | Premium |
|---|---|---|---|
| GPT-4o | $5.90 | $6.95 | +18% |
| Claude 3.5 Sonnet | $4.10 | $5.05 | +23% |
| Llama 3.1 70B | $1.42 | $1.87 | +32% |
Das Muster, das es wert ist, angeschaut zu werden: Je billiger das Modell, desto größer der Prozentsatz. Meine vermutung ist, gibt es eine feste pro-call-routing-overhead in kreditpreise gebacken, die proportional härter auf billige modelle landet. Das kann ich nicht beweisen. n8n veröffentlicht keine Pricing Interna, also bleibt es eine Vermutung.
Wo die Prämie tatsächlich landet, hängt vom Volumen ab. Wenn Sie dies auf die Nutzungsstufen in unser AI Automation Playbook für KMUsDie Klammern sehen so aus:
- Geringes Volumen (etwa 5.000 Aufforderungen pro Monat): interne Tools, Prototypen, Sologründer. Die Prämie funktioniert in etwa $5 pro Monat, etwa $61 pro Jahr. Das ist weniger als die Stunde des Anbieter-Onboardings, die Sie sonst verbringen würden. Credits gewinnen leicht.
- Mittleres Volumen (rund 60.000 pro Monat): Produktions-SMB-Workflows. Die Prämie landet in der Nähe $61 pro Monat, ungefähr $735 pro Jahr. Borderline. Wenn der Client seine eigene Instanz verwaltet und Sie eine Null-Abrechnungsverschränkung wünschen, ist dies vertretbar. Wenn Sie die Kosten in einem festen Retainer essen, sticht es ein wenig.
- Hohes Volumen (400.000 + pro Monat): die Prämienkreuze $400 pro Monat, fast $4.900 pro Jahr. Bringen Sie Ihre eigenen Schlüssel, kein Wettbewerb. Direct APIs entsperren auch Batch-Preise in dieser Größenordnung, 50% Rabatt auf OpenAI und Anthropic Batch-Endpunkte, und soweit wir wissen, gibt das Gateway diese Rabatte nicht durch. Ich würde mich gerne irren, denn billige batch plus null setup wäre schön, aber unsere batch läuft durch das gateway mit vollen raten abgerechnet.
Latenz Realität: die 1,4-Sekunden-Steuer auf jedem Gateway-Anruf
Jeder Gateway-Anruf kam langsamer zurück als sein direkter Zwilling. Median Overhead war 1,4 Sekunden pro Anruf, ziemlich konsistent über Familien hinweg, von 1,1 Sekunden auf GPT-4o bis 1,7 auf Llama. Die Antwortzeit von GPT-4o auf p50 ging von 2,3 Sekunden direkt auf 3,7 durch das Gateway. Bei 10 gleichzeitigen Hinrichtungen ballte der p95-Overhead auf 4,1 Sekunden, was nach Warteschlangen auf der Routing-Schicht riecht.
Die Fehlerraten blieben auf beiden Seiten gering: 11 fehlgeschlagene Anrufe von 2.400 auf dem Gateway im Vergleich zu 5 auf Direktschlüsseln, die alle beim Wiederholen wiederhergestellt wurden. Ärgerlich, nicht alarmierend.
Wo 1,4 Sekunden tatsächlich weh tun
Eine nächtliche Bereicherung Job kaut durch 400 Aufzeichnungen kaum bemerkt. Sie fügen etwa neun Minuten zu einem Job hinzu, den niemand sieht. Interne Werkzeuge, bei denen ein Mensch auf einen Knopf klickt und wartet, auch in Ordnung.
Two places it genuinely bites. First, anything user-facing: a customer-facing chatbot already takes 1.5 to 3 seconds to first token, and another 1.4 on top makes it feel broken. Second, agentic workflows. Multi-step agents make five to eight model calls per run, so a six-call agent picks up 8.4 seconds of routing delay every single run. Slow calls also sit closer to timeout ceilings, and if you’ve ever watched retries cascade on a Monday morning, you know latency is a reliability problem wearing a costume. Our notes on workflow reliability engineering go deep on that failure mode.
The data residency caveat that killed an EU pilot
This one stung.
A German insurance brokerage, about 40 staff, hired us for a pilot: triage and summarize incoming claims emails before they reach the adjusters. Two weeks of build. Everything worked. The adjusters liked the summaries. Then their data protection officer asked one question on the review call: ‘Where exactly are these prompts processed once they leave our n8n instance, and can you put that in writing?’
With direct keys, the answer is easy. Azure OpenAI in Sweden, or Bedrock in Frankfurt, regional processing guarantees written into the contracts. With Gateway credits, at least as of our testing, it wasn’t. The docs couldn’t give a binding EU-processing guarantee for credit-routed calls, and when we asked support directly, the answer amounted to US-managed routing with EU residency not yet contractually promised. The DPO said no. Pilot dead, roughly €6,000 of planned scope parked until we rebuild it on Azure keys.
To be fair, none of this is n8n’s fault in any dramatic sense. Somebody else’s routing means somebody else’s regions; that’s the structural cost of the convenience. But it’s exactly the kind of caveat that never makes the launch announcement, and for any client under GDPR with sensitive data, it’s the whole ballgame. The Gateway is simultaneously the fastest way to start building and the slowest thing in the room during a security review.
Verdict: when credits win, and when bring-your-own-keys is non-negotiable
After three weeks of spreadsheets, here’s my split.
Use Gateway credits for: prototypes, client demos, workshops, internal tools under roughly 10,000 prompts a month, and anything where setup friction is the actual enemy. That Tuesday-afternoon demo failure from the intro? One billing relationship, one low-balance alert, and it doesn’t happen. For a solo founder who’d rather build than do vendor onboarding, credits are kind of great.
Bring your own keys when: the data is regulated or needs contractual EU residency, the workflow is user-facing and latency-sensitive, volume crosses 50,000-ish prompts a month, or you need fine-tuned models and Azure, Bedrock, or private endpoints. In production for paying clients, that’s us most of the time.
I expected to write this as a hit piece, and honestly, I’ll own that. The Gateway beat my expectations on cost for small usage, and the premium is often cheaper than the unbilled setup hours it replaces. The uncomfortable truth for my credential folder: for most of what SMBs actually build, credits are good enough. I’ve already moved two of our internal tools onto them. Client-facing stuff stays on keys.
Oh, and I finally set a proper balance alert on that OpenAI account. Only took a year.
Talk soon,
Damian
