In vielen Unternehmen hat sich eine einfache Faustregel etabliert: Für KI-gestützte Aufgaben wird das jeweils leistungsfähigste verfügbare Modell eingesetzt. Die Logik dahinter klingt plausibel – wer das beste Werkzeug nimmt, bekommt das beste Ergebnis. In der Praxis führt diese Haltung aber regelmäßig dazu, dass Budget für Rechenleistung ausgegeben wird, die für die konkrete Aufgabe gar nicht nötig gewesen wäre.

Ein aktueller Fachbeitrag bringt den Punkt auf eine griffige Formel: Token zu zählen reicht nicht. Entscheidend ist die Frage, was eine erledigte Aufgabe kostet – nicht, wie viele Ressourcen dabei verbraucht wurden.

Was Token-Effizienz tatsächlich misst

Token sind die kleinsten Verarbeitungseinheiten eines Sprachmodells – vereinfacht gesagt Wortbestandteile, nach denen Ein- und Ausgaben abgerechnet werden. Weil sich daraus eine saubere Zahl ableiten lässt, wird der Token-Verbrauch gern als Steuerungsgröße verwendet.

Das Problem: Diese Zahl sagt nichts darüber aus, ob das Ergebnis brauchbar war. Ein günstiges Modell, das dreimal nachgebessert werden muss und am Ende doch manuelle Korrektur erfordert, ist teurer als ein stärkeres Modell, das im ersten Durchlauf ein verwendbares Resultat liefert. Umgekehrt ist ein Premium-Modell für eine simple Klassifikationsaufgabe schlicht überdimensioniert.

Die sinnvollere Kennzahl ist deshalb Kosten pro erledigter Aufgabe. Darin stecken neben den reinen Modellkosten auch:

  • Wiederholungsläufe, weil das erste Ergebnis nicht ausreichte
  • Aufwand für die menschliche Prüfung und Nachbearbeitung
  • Zeitverlust durch langsamere Antworten bei interaktiven Workflows
  • Folgekosten, wenn fehlerhafte Ausgaben erst spät auffallen

Modell-Routing als Architekturentscheidung

Aus dieser Perspektive wird die Modellauswahl zu einer Architekturfrage. Statt eine einzige Standardkonfiguration für alles zu verwenden, wird jede Aufgabenklasse dem Modell zugewiesen, das sie zuverlässig und zu vertretbaren Kosten löst. Dieses Vorgehen wird als Modell-Routing bezeichnet: Eine vorgelagerte Logik entscheidet, welche Anfrage an welches Modell geht.

In der Praxis lassen sich typische Stufen unterscheiden:

  1. Strukturierte Routineaufgaben wie Kategorisierung, Extraktion von Feldern aus Dokumenten oder einfache Umformulierungen. Hier reichen kleinere, schnelle Modelle in der Regel aus.
  2. Aufgaben mit mittlerer Komplexität wie Zusammenfassungen, Entwürfe für Texte oder Codefragmente in überschaubarem Kontext.
  3. Aufgaben mit hoher Anforderung an Nachvollziehbarkeit, etwa Refactorings über mehrere Dateien, Architekturentscheidungen oder die Analyse widersprüchlicher Vorgaben. Hier zahlt sich ein starkes Modell aus.

Der wirtschaftliche Effekt entsteht dadurch, dass die große Masse an Anfragen typischerweise in die ersten beiden Kategorien fällt – während die Kosten pro Anfrage in der dritten Kategorie am höchsten sind.

Was das für Coding-Workflows heißt

Besonders deutlich wird der Unterschied in KI-gestützter Softwareentwicklung. Ein Assistent, der im Editor Vervollständigungen vorschlägt, wird extrem häufig aufgerufen. Hier zählen niedrige Latenz und geringe Kosten pro Aufruf mehr als maximale Modellstärke. Ein Agent, der dagegen eine größere Änderung über mehrere Module hinweg vorbereitet, profitiert von einem Modell mit besserer Planungsfähigkeit – weil ein misslungener Durchlauf hier teuer ist, sowohl in Rechenzeit als auch in Entwicklerzeit.

Wer beide Fälle mit derselben Konfiguration abdeckt, zahlt entweder zu viel oder bekommt zu schwache Ergebnisse. Eine bewusste Trennung ist deshalb kein Optimierungsdetail, sondern eine Grundsatzentscheidung im Setup.

Kontext ist ein Kostenfaktor

Ein zweiter Hebel liegt darin, wie viel Information einem Modell mitgegeben wird. Jeder zusätzliche Kontext – ganze Dateien, lange Chatverläufe, komplette Dokumentationen – erhöht den Token-Verbrauch bei jedem einzelnen Aufruf. Häufig verbessert er das Ergebnis nicht proportional, sondern verwässert es sogar, weil relevante Stellen in der Masse untergehen.

Praktische Ansatzpunkte sind daher:

  • gezielte Auswahl der tatsächlich benötigten Kontextausschnitte statt pauschaler Übergabe
  • klar formulierte Aufgabenstellungen, die Rückfragen und Wiederholungen reduzieren
  • Zwischenspeichern wiederkehrender Bestandteile, soweit die eingesetzte Plattform das unterstützt
  • Begrenzung der Ausgabelänge dort, wo kompakte Antworten genügen

Messbar machen statt schätzen

Eine Routing-Strategie lässt sich nur bewerten, wenn Ergebnisse messbar sind. Dafür braucht es pro Anwendungsfall eine Vorstellung davon, was ein akzeptables Resultat ist – etwa eine Testsuite bei Code, eine Stichprobenprüfung bei Textgenerierung oder definierte Pflichtfelder bei der Datenextraktion.

Erst auf dieser Basis lässt sich ein kleineres Modell testweise gegen das bisherige antreten lassen. Bleibt die Trefferquote stabil, ist der Wechsel ein reiner Kostenvorteil. Sinkt sie, zeigt sich, an welcher Stelle die zusätzliche Modellstärke tatsächlich gebraucht wird. Diese Prüfung ist kein einmaliger Vorgang: Da sich das Modellangebot laufend verändert, lohnt sich eine regelmäßige Neubewertung.

Organisatorische Voraussetzung

Technisch ist Modell-Routing überschaubar. Schwieriger ist meist die organisatorische Seite. Wenn in einem Unternehmen mehrere Teams eigenständig KI-Dienste anbinden, entstehen schnell parallele Konfigurationen ohne gemeinsame Kostenlogik. Eine zentrale Abstraktionsschicht, über die Anfragen laufen, schafft hier Transparenz – und erlaubt es, Modelle auszutauschen, ohne jede Anwendung einzeln anzufassen.

Ebenso wichtig ist eine Zuordnung der Kosten zu konkreten Anwendungsfällen. Eine Gesamtrechnung ohne Aufschlüsselung lässt keine Entscheidung darüber zu, wo sich Optimierung lohnt.

Einordnung für Web- und Softwareprojekte

Für Projekte, in denen KI-Funktionen dauerhaft im Betrieb laufen, wird die Modellauswahl zu einem festen Bestandteil der technischen Konzeption – vergleichbar mit Caching-Strategien oder der Wahl der Datenbank. Wer von Beginn an eine austauschbare Schnittstelle vorsieht und pro Anwendungsfall definiert, was ein gutes Ergebnis ausmacht, behält sowohl die Kosten als auch die Qualität unter Kontrolle. Der entscheidende Perspektivwechsel liegt darin, nicht die stärkste verfügbare Technik zur Norm zu erklären, sondern die jeweils ausreichende.

Quellen