Helpcenter

Tokenkostencontent/help/token.md

Zahlen erscheinen nur, wenn ein Pfeil ein LLM berührt. Andere Nachrichten haben keine Rechnung.

Siehe auch: Sequenz bauen · Lasttest · Echte Daten

Drei Karten, eine Formel

  • Unten in der Sequenzliste: Summe des teuersten Pfads. Hier sitzt Last ×1 / ×10 / ×100.
  • Am LLM-Teilnehmer: dieselbe Summe, nur für dieses Modell — ohne Last-Schalter.
  • An der LLM-Nachricht: nur dieser Call.

Die fünf Spalten

WasWann
InputPfeil zur LLM
Cache 5 MinPrefix schreiben, erster Call
Cache 1 Stdlanger Prefix; Katalog 0 = kein Tarif
Trefferab Call 2: Prefix, den das Modell schon kennt
OutputPfeil von der LLM zurück

Cache-Treffer ist kein zweites Input. Freier Text am Pfeil braucht {n} Token.

Grok Cached prompt ist der Prefix (oft System+Schema). Die Fläche setzt Cache 5 Min am ersten Call auf das ganze Input — deshalb kann der Dollar über der Rechnung liegen. Zuordnung der Grok-Zeilen: Echte Daten.

Wann wird es rot?

Wenn eine Nachricht über 128 000 Token liegt (Kontextfenster, Lastfaktor zählt mit):

  • Input rot auf dem Pfeil zur LLM
  • Output rot auf der Rückgabe
  • dieselbe Zeile am Pfeil auf der Fläche

Die Summenkarten (Liste, LLM-Kopf) bleiben ohne Rot. Rot heißt: der Ablauf passt so nicht. Vorfilter zeichnen ([k] plus of= am Folgelauf), nicht die Zahl schönen. Wie: Echte Daten.

Datensätze kommen aus dem Lasttest, außer die .puml setzt n=.