content/help/token.mdZahlen erscheinen nur, wenn ein Pfeil ein LLM berührt. Andere Nachrichten haben keine Rechnung.
Siehe auch: Sequenz bauen · Lasttest · Echte Daten
| Was | Wann |
|---|---|
| Input | Pfeil zur LLM |
| Cache 5 Min | Prefix schreiben, erster Call |
| Cache 1 Std | langer Prefix; Katalog 0 = kein Tarif |
| Treffer | ab Call 2: Prefix, den das Modell schon kennt |
| Output | Pfeil von der LLM zurück |
Cache-Treffer ist kein zweites Input. Freier Text am Pfeil braucht {n} Token.
Grok Cached prompt ist der Prefix (oft System+Schema). Die Fläche setzt Cache 5 Min am ersten Call auf das ganze Input — deshalb kann der Dollar über der Rechnung liegen. Zuordnung der Grok-Zeilen: Echte Daten.
Wenn eine Nachricht über 128 000 Token liegt (Kontextfenster, Lastfaktor zählt mit):
Die Summenkarten (Liste, LLM-Kopf) bleiben ohne Rot. Rot heißt: der Ablauf passt so nicht. Vorfilter zeichnen ([k] plus of= am Folgelauf), nicht die Zahl schönen. Wie: Echte Daten.
Datensätze kommen aus dem Lasttest, außer die .puml setzt n=.