KI-Agenten: Kosten skalieren mit Aufgaben, nicht Nutzern

Auf den Punkt
KI-Agenten skalieren nicht pro Nutzer, sondern pro erledigter Aufgabe. Inference-Kosten wachsen mit jedem Agenten-Task; Wartung, Monitoring und Compliance machen über 24 Monate oft das Zwei- bis Vierfache der Baukosten aus. Die Betriebskurve ist der entscheidende Hebel – und sie lässt sich planbar machen.
Die neue Kostenlogik: Agenten rechnen pro Aufgabe ab
Bei klassischer Software wachsen Lizenzkosten mit der Zahl der Nutzer. Bei KI-Agenten ist das anders: Sobald ein Agent eigenständig Recherchen ausführt, Dokumente prüft oder Prozesse übernimmt, entsteht Rechenlast für jede einzelne Ausführung. Altimeter Capital projiziert einen Anstieg der installierten KI-Rechenleistung von rund 18 Gigawatt 2025 auf rund 115 Gigawatt 2028 – mit dem grössten Sprung von etwa 43 Gigawatt allein im Jahr 2027. Für dein Budget heisst das: Die laufende Kostenkurve folgt den erledigten Aufgaben, nicht der Zahl der eingeloggten Mitarbeitenden.
Inference ist der Motor – und der Kostentreiber
Inference – also die eigentliche Ausführung eines Modells – macht nach Bloomberg Intelligence (via ClearML) bereits rund zwei Drittel des gesamten AI-Compute aus und wächst weiter. Gleichzeitig ist der Stückpreis pro Inference-Einheit in den letzten zweieinhalb Jahren um 99 Prozent gefallen. Das klingt nach Entlastung, ist aber eine Falle: Durch inference-time reasoning steigt der Token-Verbrauch parabolisch. Du kaufst die Einheit günstiger, aber deine Agenten verbrauchen sehr viel mehr davon. Die Gesamtkosten werden damit zu einer Frage des Arbeitsvolumens.
≈ 2/3
des AI-Compute entfällt bereits auf Inference (Bloomberg Intelligence via ClearML, 2026)
Volumen explodiert, aber der Stückpreis sinkt parallel: Gerstner korrigierte die realistische 2027-Zubau-Prognose auf rund 25 Gigawatt statt 43 Gigawatt, weil Netz-, Interconnection- und Stromengpässe das Wachstum bremsen. Für dich heisst das: Die entscheidende Stellschraube ist nicht der Tagespreis, sondern das kumulierte Task-Volumen über Monate.
Die versteckten Betriebskosten über 24 Monate
Token-Kosten sind nur ein kleiner Teil der Wahrheit. Unsere eigenen RAG-Analysen zeigen: Je nach Setup machen Tokens nur 10 bis 30 Prozent der echten Kosten aus. Monitoring, Mensch-im-Loop-Eskalationen, Wartung, Modell-Drift und Compliance dominieren die Rechnung – und können über 24 Monate das Zwei- bis Vierfache der Baukosten erreichen. Dazu kommt ein stiller Anteil von 15 bis 30 Prozent Ingenieurszeit pro Monat. Genau hier liegt der Unterschied zwischen Demo-Budget und Betriebsbudget. Wer nur die API-Preise vergleicht, plant an der Realität vorbei – warum jedes dritte Unternehmen die Rechnung unterschätzt, liest du in unserem Kosten-Ratgeber.
Für Schweizer KMU zählt Diskretion als Betriebskosten
revDSG-Compliance, Datenhaltung und Vertraulichkeit sind keine Einmalkosten. Sie laufen in jedem Agenten-Task mit – und müssen in der Betriebskurve eingeplant werden.
Warum Eigenbau bei Agenten besonders teuer wird
Der Bau eines Agenten ist nur der Anfang. MIT NANDA zeigt: Der Kauf von spezialisierten Anbietern gelingt in etwa 67 Prozent der Fälle, reiner Eigenbau nur in rund 33 Prozent. Bei Agenten verschärft sich das, weil die laufenden Kosten mit jeder übernommenen Aufgabe skalieren. Wer intern baut, trägt nicht nur die Entwicklung, sondern auch den Betrieb, die Eskalation und die Modellpflege selbst. KI-Agenten vs. menschliche Arbeit: Der Kostenwendepunkt ist erreicht zeigt, ab wann sich das rechnet.
Planbare Betriebskosten durch KI-Outsourcing
Outsourcing ändert die Kostenlogik: Du beziehst einen Agenten als externe Division, mit vereinbarter Leistung, Eskalationsweg und definierten Betriebskosten – statt die Eigendynamik wachsender Agenten-Tasks selbst zu finanzieren. Dadurch wird die Inference- und Wartungskurve kalkulierbar. Der Schweizer KI-Podcast erklärt, warum KI-Pilotprojekte 2026 sterben und was anstelle des internen Bastelns tritt.
Der entscheidende Hebel: Task-Volumen steuern
Nicht jeder Prozess ist reif für autonome Agenten. Entscheidend ist, wie oft ein Agent wirklich läuft, wie viele Eskalationen er auslöst und wie stabil die Datenlage ist. Welche Prozesse sich wirklich lohnen, zeigt die Machbarkeitsmatrix – sie hilft dir, das Task-Volumen und damit die laufenden Kosten realistisch zu bewerten.
Häufige Fragen
- Warum skalieren KI-Agenten mit Aufgaben statt mit Nutzern?
- Weil jede ausgeführte Aufgabe eigene Rechenleistung verbraucht. Bei klassischer Software zählt die Anzahl Lizenzen, bei Agenten das Volumen der tatsächlich erledigten Tasks. Dadurch folgt die laufende Kostenkurve dem Arbeitsvolumen.
- Was sind die grössten laufenden Kosten nach dem Go-Live?
- Neben den Token-Kosten sind Monitoring, Mensch-im-Loop-Eskalationen, Wartung, Modell-Drift und Compliance die grössten Posten. Zusammen können sie über 24 Monate das Zwei- bis Vierfache der Baukosten ausmachen.
- Lohnt sich Eigenbau bei KI-Agenten?
- Selten. MIT NANDA zeigt, dass der Kauf von spezialisierten Anbietern in etwa 67 Prozent der Fälle gelingt, reiner Eigenbau nur in rund 33 Prozent. Zudem trägt man beim Eigenbau den gesamten Betrieb selbst.
- Warum ist das Thema für Schweizer KMU relevant?
- Weil Agenten bei steigender Autonomie schnell zu einer ungeplanten Betriebskostenposition werden. revDSG-Compliance und Diskretion kommen als laufende Anforderungen hinzu, die das Budget zusätzlich belasten.
- Wie kann KI-Outsourcing die Kosten planbar machen?
- Outsourcing definiert Leistung, Eskalationswege und Betriebskosten vertraglich. Statt die Eigendynamik wachsender Agenten-Tasks selbst zu finanzieren, wird die Kostenkurve kalkulierbar und an Aufgaben statt an unklare Nutzerzahlen gebunden.
Quellen
Möchten Sie dieses Thema für Ihr Unternehmen vertiefen?
Kapazität prüfen