Ein Token ist die kleinste Einheit, in der ein Sprachmodell Text verarbeitet: ein Wort, ein Wortteil oder ein einzelnes Zeichen. Vor der Verarbeitung zerlegt ein Tokenizer jeden Text in diese Stücke; häufige Wörter ergeben ein einzelnes Token, seltene oder zusammengesetzte zerfallen in mehrere, ein deutsches Kompositum wie „Datenschutzgrundverordnung" etwa in eine ganze Kette.
Als Faustregel entspricht ein Token im Englischen rund vier Zeichen oder drei Vierteln eines Wortes; deutsche Texte benötigen wegen der langen Wörter meist etwas mehr Token für denselben Inhalt.
Relevant ist die Einheit, weil Modelle in Token rechnen: Das Kontextfenster wird in Token gemessen, und wer KI über eine Schnittstelle (API) einbindet, zahlt pro Token, getrennt nach Ein- und Ausgabe. Textlänge wird damit unmittelbar zum Kostenfaktor, von der Länge des Prompts bis zur Menge mitgeschickter Dokumente.