Cloudflare AI Gateway: So cachen, drosseln und kontrollieren Sie die Kosten von LLM-API-Aufrufen (Leitfaden 2026)

Wenn Ihr SaaS in diesem Jahr eine LLM-Funktion ausgeliefert hat, ist Ihre Rechnung von OpenAI oder Anthropic inzwischen ein Posten, nach dem die Finanzabteilung fragt, und sie bewegt sich mit einer Nutzung, die Sie nicht vollständig kontrollieren. Der Reflex ist, einen Caching-Proxy und ein Ausgabenlimit selbst zu bauen. Bevor Sie dafür einen Sprint aufwenden, liefert Cloudflare AI Gateway das meiste davon, indem Sie eine einzige Zeile in Ihrer API-Basis-URL ändern.

Cloudflare AI Gateway ist ein Proxy, der zwischen Ihrer Anwendung und LLM-Anbietern wie OpenAI, Anthropic und Google sitzt. Sie leiten Modellaufrufe darüber, um Caching, Ratenbegrenzung, Wiederholungen, Ausgabenlimits und Protokollierung pro Anfrage zu erhalten, ohne das SDK Ihres Anbieters zu ändern. Die Kernfunktionen sind kostenlos und fügen höchstens einige zehn Millisekunden Latenz hinzu.

Dieser Leitfaden behandelt, was es tut, wie Caching und Ratenbegrenzungen echte Kosten senken, wie Sie es einrichten, wie es sich gegenüber dem Bau eines eigenen Proxys oder der Nutzung von Tools wie LiteLLM und Helicone schlägt und wann es die falsche Wahl ist.

Was ist Cloudflare AI Gateway?

Cloudflare AI Gateway ist ein verwalteter Anfrage-Proxy für den Datenverkehr von KI-Modellen. Anstatt dass Ihre App direkt api.openai.com oder api.anthropic.com aufruft, ruft sie einen Gateway-Endpunkt an Cloudflares Edge auf, der die Anfrage an den Anbieter weiterleitet und die Antwort zurückgibt. Weil jeder Aufruf durch eine einzige Stelle läuft, erhalten Sie einen Kontrollpunkt, den Sie zuvor nicht hatten.

Dieser Kontrollpunkt leistet fünf Dinge, die Beachtung verdienen:

  • Caching, damit identische oder ähnliche Anfragen bedient werden, ohne den Anbieter erneut zu belasten.
  • Ratenbegrenzung, damit eine außer Kontrolle geratene Schleife oder ein missbräuchlicher Client nicht tausende Aufrufe verursachen kann.
  • Wiederholungen und Fallbacks, damit ein Timeout des Anbieters nicht als fehlgeschlagene Funktion auftritt.
  • Ausgaben- und Anfragelimits, damit das Gateway die Auslieferung stoppt, sobald ein von Ihnen festgelegter Schwellenwert überschritten wird.
  • Protokollierung und Analytik, damit Sie Kosten, Latenz und Token-Anzahl pro Anfrage sehen, statt eine monatliche Rechnung zu lesen.

Es unterstützt die großen Anbieter, darunter OpenAI, Anthropic, Google AI Studio, Groq und Mistral, sowie Cloudflares eigenes Workers AI. Sie müssen Ihre App nicht bei Cloudflare hosten, um es zu nutzen. Das Gateway ist anbieterunabhängig und funktioniert mit einem Standard-Backend an beliebiger Stelle.

Wie senkt Caching Ihre LLM-Rechnung?

Beim Caching finden die meisten Teams die schnellsten Einsparungen, denn ein Cache-Treffer kostet null Anbieter-Token und liefert in einigen zehn Millisekunden statt der einen bis mehreren Sekunden, die ein Modellaufruf braucht. Das Gateway speichert eine Antwort mit der Anfrage als Schlüssel, und wenn dieselbe Anfrage erneut eintrifft, spielt es die gespeicherte Antwort ab.

Wie viel das spart, hängt vollständig davon ab, wie repetitiv Ihr Datenverkehr ist. Ein Support-Assistent, der dieselben Produktfragen beantwortet, ein Klassifizierungs-Endpunkt, der ähnliche Eingaben bewertet, oder eine Funktion “dieses Dokument zusammenfassen”, die auf denselben Dokumenten läuft, weisen hohe Wiederholungsraten auf. Bei solchen Arbeitslasten sind 20 bis 40 Prozent der Anfragen oft nahezu Duplikate, und Caching entfernt diesen Anteil der Rechnung vollständig.

Seien Sie ehrlich beim umgekehrten Fall. Wenn jeder Prompt langen, nutzerspezifischen Kontext trägt, etwa ein Chat, der den gesamten Gesprächsverlauf enthält, sind die Cache-Trefferraten niedrig und exaktes Caching hilft kaum. Cloudflare bietet auch ähnlichkeitsbasiertes Caching, das Anfragen abgleicht, die nah, aber nicht identisch sind. Das hebt die Trefferraten bei umformulierten Anfragen, kann aber eine Antwort zurückgeben, die für eine leicht andere Frage korrekt war. Testen Sie daher die Trefferqualität mit echtem Datenverkehr, bevor Sie es für nutzerseitige Antworten aktivieren.

Diagramm, das LLM-Datenverkehr mit hoher und niedriger Wiederholungsrate vergleicht und zeigt, wie jeder auf Caching reagiert

Wie schützen Ratenbegrenzung und Ausgabenlimits Ihr Budget?

Die beängstigendsten LLM-Rechnungen kommen nicht von stetiger Nutzung. Sie kommen von einer Wiederholungsschleife, die über Nacht zehntausend Aufrufe abfeuert, einem geleakten API-Schlüssel oder einem Launch, der weiter reicht als prognostiziert. Ratenbegrenzung und Ausgabenlimits sind die Leitplanken dagegen.

Mit der Ratenbegrenzung können Sie Anfragen pro Zeitfenster und pro Gateway begrenzen. Setzen Sie sie knapp über Ihren realen Spitzenwert, und ein außer Kontrolle geratener Prozess stößt an die Obergrenze statt an den Anbieter. Ausgaben- und Anfragelimits gehen weiter: Sobald ein Gateway die konfigurierte Anzahl an Anfragen oder das Budget überschreitet, leitet es keine Aufrufe mehr weiter, bis das Fenster zurückgesetzt wird. Das verwandelt ein offenes Risiko in ein bekanntes Maximum.

Der Kompromiss ist real, setzen Sie diese Werte daher bewusst. Ein zu eng eingestelltes Limit drosselt legitime Nutzer während einer echten Spitze, was sich für sie wie ein Ausfall anfühlt. Stützen Sie die Zahlen auf Ihren tatsächlichen Spitzenverkehr plus Puffer und warnen Sie bei Annäherung, nicht erst bei Überschreitung, damit ein Mensch reagieren kann, bevor echte Nutzer abgewiesen werden.

Entscheidungsablauf, der zeigt, was mit einer ausufernden LLM-Rechnung mit und ohne Ratenbegrenzung und Ausgabenlimit passiert

Wie richten Sie Cloudflare AI Gateway ein?

Die Einrichtung ist bewusst gering gehalten. Sie erstellen ein Gateway im Cloudflare-Dashboard und richten dann Ihr vorhandenes Anbieter-SDK auf die Gateway-URL aus. Kein SDK-Wechsel, kein Umschreiben Ihrer Aufrufstellen.

Die Schritte:

  1. Öffnen Sie im Cloudflare-Dashboard AI, dann AI Gateway, und erstellen Sie ein Gateway. Notieren Sie sich dessen Konto-ID und Gateway-ID.
  2. Ändern Sie die Basis-URL, die Ihr SDK verwendet, auf den Gateway-Endpunkt für diesen Anbieter.
  3. Aktivieren Sie optional Caching, legen Sie eine Standard-TTL fest und konfigurieren Sie Raten- oder Ausgabenlimits in den Gateway-Einstellungen.
  4. Stellen Sie bereit und beobachten Sie im Analytik-Tab die Cache-Trefferrate, die Kosten und die Latenz.

Hier ist die eine Änderung, die das Routing bewirkt, am Beispiel des OpenAI-Node-SDK:

import OpenAI from "openai";

// Point the existing SDK at the gateway. Nothing else changes.
const client = new OpenAI({
  apiKey: process.env.OPENAI_API_KEY,
  baseURL:
    "https://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_id}/openai",
});

const completion = await client.chat.completions.create({
  model: "gpt-4o-mini",
  messages: [{ role: "user", content: "Summarize this ticket." }],
});

Caching kann für das gesamte Gateway aktiviert oder pro Anfrage über einen Header gesteuert werden, was nützlich ist, wenn einige Antworten sicher zwischengespeichert werden können und andere aktuell bleiben müssen. Die Lebensdauer legen Sie in Sekunden fest:

const completion = await client.chat.completions.create(
  {
    model: "gpt-4o-mini",
    messages: [{ role: "user", content: "Summarize this ticket." }],
  },
  {
    headers: {
      "cf-aig-cache-ttl": "3600",
    },
  }
);

Das ist die gesamte Integration für einen Anbieter. Anthropic, Google und die übrigen folgen demselben Muster mit ihrem eigenen Pfadsegment in der Gateway-URL. Wenn Ihre App bereits eine Inline-baseURL-Überschreibung für Staging verwendet, passt dies an dieselbe Stelle in Ihrer Konfiguration.

Cloudflare AI Gateway vs. eigener Proxy

Streng genommen brauchen Sie Cloudflare für nichts davon. Ein Caching-Proxy ist ein bekanntes Muster, und Tools wie LiteLLM und Helicone decken überlappenden Boden ab. Die richtige Wahl hängt davon ab, wie viel Routing-Logik Sie benötigen und ob Sie die Infrastruktur selbst betreiben wollen. So schneiden die wichtigsten Optionen im Vergleich ab.

Option
Am besten geeignet für
Caching
Raten- und Ausgabenlimits
Selbst gehostet
Option

Cloudflare AI Gateway

Am besten geeignet für

Schnelle Kontrolle, ohne Infrastruktur zu betreiben

Caching

Exakt und ähnlichkeitsbasiert

Raten- und Ausgabenlimits

Ja

Selbst gehostet

Nein, verwaltete Edge

Option

LiteLLM

Am besten geeignet für

Multi-Anbieter-Routing und Fallback-Logik

Caching

Ja, mit Redis

Raten- und Ausgabenlimits

Ja

Selbst gehostet

Ja

Option

Helicone

Am besten geeignet für

Observability und Analytik zuerst

Caching

Ja

Raten- und Ausgabenlimits

Begrenzt

Selbst gehostet

Cloud oder Selbst-Hosting

Option

Eigener Proxy

Am besten geeignet für

Eine Regel, die kein Produkt abdeckt

Caching

Selbst bauen

Raten- und Ausgabenlimits

Selbst bauen

Selbst gehostet

Ja

Für die meisten mittelständischen Teams lautet die ehrliche Antwort, dass Cloudflare AI Gateway den 80-Prozent-Fall mit dem geringsten Aufwand abdeckt: Caching, Leitplanken und Sichtbarkeit pro Anfrage mit einer einzeiligen Änderung und ohne Server, die betrieben werden müssen. Greifen Sie zu LiteLLM, wenn Sie echtes Multi-Anbieter-Routing, Modell-Fallback-Ketten oder eine einheitliche Schnittstelle über viele Anbieter hinweg benötigen. Greifen Sie nur dann zu einem eigenen Proxy, wenn Sie eine Regel haben, die kein Produkt abdeckt, und die Entwicklungszeit, um ihn zu betreuen. Einen eigenen zu bauen, um eine Gebühr für einen verwalteten Dienst zu sparen, kostet in der Wartung meist mehr, als es einspart.

Wann Cloudflare AI Gateway die falsche Wahl ist

Kein Tool ist frei von Kompromissen, und ein Gateway ist eine weitere Abhängigkeit in Ihrem Anfragepfad. Verzichten Sie darauf oder überlegen Sie es sich zweimal in diesen Fällen.

  • Ihre Prompts sind fast alle einzigartig. Wenn Caching nicht helfen kann und Sie bereits Observability haben, fügt das Gateway einen Zwischenschritt für wenig Nutzen hinzu.
  • Sie haben strenge Regeln zur Datenlokalisierung oder zum Datenschutz. Die Protokollierung von Anfragen und Antworten kann Prompts erfassen, die personenbezogene Daten enthalten. Prüfen Sie, was wo protokolliert wird, bevor Sie die vollständige Protokollierung aktivieren, und halten Sie sensible Felder aus den Prompts heraus.
  • Sie benötigen heute komplexes Routing. Das Gateway ist kein vollwertiger Router. Wenn Ihr Kernbedarf gewichtetes Load-Balancing oder Fallback über fünf Anbieter ist, passt ein speziell dafür gebauter Router besser.
  • Sie können keine weitere externe Abhängigkeit akzeptieren. Cloudflares Edge ist zuverlässig, aber sie bleibt ein Zwischenschritt zwischen Ihnen und dem Anbieter. Für ein System mit strengen Einzelanbieter-Vorgaben besteht es die Prüfung womöglich nicht.

Keiner dieser Punkte ist ein Grund, es grundsätzlich zu meiden. Es sind Gründe, sich bewusst zu entscheiden, statt es hinzuzufügen, weil es einfach ist.

Wie Redwerk LLM-Kosten in der Produktion kontrolliert

Die meisten LLM-Kostenprobleme sind keine Modellprobleme. Es sind Architekturentscheidungen, die getroffen wurden, bevor jemand die Rechnung im Blick hatte: keine Caching-Schicht, keine Ausgabenobergrenze, Prompts, die mehr Kontext tragen als die Aufgabe braucht, und keine Sichtbarkeit pro Funktion darüber, was jeder Aufruf tatsächlich kostet.

Redwerk stellt Ingenieure, die bereits auf Cloudflares Edge und mit den großen LLM-SDKs ausgeliefert haben, sodass das Gateway, eine sinnvolle Cache-Key-Strategie und Ausgaben-Leitplanken während des Onboardings eingebaut werden statt nach einer überraschenden Rechnung. Das ist der Tech-Match-Vorteil: Sie zahlen kein Team dafür, den Stack auf Ihre Kosten zu lernen. Wir halten außerdem die prognostizierte Kostenkurve von Anfang an sichtbar, sodass ein Product Owner sieht, wohin die Ausgaben fließen, bevor sie festgelegt sind, nicht danach.

Wenn Sie KI-Funktionen hinzufügen und wollen, dass sie nicht nur gut, sondern auch günstig im Betrieb sind, baut sie unser KI- und ML-Entwicklungsteam mit eingebauter Kostenkontrolle, und unsere Ingenieure für individuelle Webentwicklung verdrahten das Gateway und die Leitplanken in Ihre bestehende App. Für einen tieferen Blick auf das Ausliefern von Produktions-KI lesen Sie unsere Leitfäden zum Aufbau einer LLM-semantischen Suche in Ihrem SaaS-Produkt und zum Senken der Modellkosten durch Distillation.

Häufig gestellte Fragen

Funktioniert Cloudflare AI Gateway mit Modellen von OpenAI, Anthropic und Google?

Ja. Es unterstützt die großen Anbieter, darunter OpenAI, Anthropic, Google AI Studio, Mistral und Groq, sowie Cloudflare Workers AI. Sie behalten Ihr vorhandenes Anbieter-SDK und ändern nur die Basis-URL auf den Gateway-Endpunkt für jeden Anbieter, den Sie routen.

Wie viel kostet Cloudflare AI Gateway?

Die Kernfunktionen des Gateways, also Caching, Ratenbegrenzung, Wiederholungen und Analytik, sind zu Beginn kostenlos. Sie zahlen nur für längere Protokollaufbewahrung und höheres Speichervolumen in kostenpflichtigen Tarifen. Bei jedem Cache-Fehltreffer fallen weiterhin Anbieter-Token-Kosten an, da diese Aufrufe wie gewohnt das Modell erreichen.

Beeinträchtigt das Caching von LLM-Antworten die Antwortqualität?

Exaktes Caching gibt bei einer identischen Anfrage die identische Antwort zurück, was bei deterministischen Prompts sicher ist. Ähnlichkeitsbasiertes Caching kann eine Antwort zurückgeben, die für eine nahe, aber andere Anfrage erzeugt wurde. Testen Sie daher die Trefferqualität mit echtem Datenverkehr, bevor Sie es für nutzerseitige Antworten aktivieren.

Ist Cloudflare AI Gateway ein Ersatz für LiteLLM oder Helicone?

Es überschneidet sich bei Caching und Observability, ist aber kein vollwertiger Multi-Anbieter-Router. Teams, die gewichtetes Routing oder Fallback-Ketten über mehrere Anbieter benötigen, wählen oft LiteLLM, während Teams, die schnelle Leitplanken und Sichtbarkeit pro Anfrage ohne Infrastruktur wollen, das Gateway wählen.

Kann Cloudflare AI Gateway eine ausufernde LLM-Rechnung stoppen?

Ja. Ratenbegrenzung sowie Ausgaben- oder Anfragelimits pro Gateway stoppen eine Schleife oder einen missbräuchlichen Client, bevor die Aufrufe den Anbieter erreichen. Legen Sie die Schwellenwerte anhand Ihres realen Spitzenverkehrs plus Puffer fest, denn ein zu niedrig gesetztes Limit drosselt legitime Nutzer während einer echten Spitze.

Erfahren Sie, wie wir ein neuronales Netz mit 1,5 Mio.+ Texten trainiert haben, um relevanzbasierte Suche in einem Recruitment-SaaS zu ermöglichen

Bitte geben Sie Ihre Geschäfts-E-Mail-Adresse ein ist keine Geschäfts-E-Mail