AngelStone
KI & Daten

Token

Auch bekannt als: Tokenisierung

Kleinste Verarbeitungseinheit, in die ein Sprachmodell Text zerlegt – Grundlage für Abrechnung und Kontextfenster.

Ein Token ist die kleinste Einheit, in der ein Sprachmodell Text verarbeitet: ein Wort, ein Wortteil oder ein einzelnes Zeichen. Vor der Verarbeitung zerlegt ein Tokenizer jeden Text in diese Stücke; häufige Wörter ergeben ein einzelnes Token, seltene oder zusammengesetzte zerfallen in mehrere, ein deutsches Kompositum wie „Datenschutzgrundverordnung" etwa in eine ganze Kette.

Als Faustregel entspricht ein Token im Englischen rund vier Zeichen oder drei Vierteln eines Wortes; deutsche Texte benötigen wegen der langen Wörter meist etwas mehr Token für denselben Inhalt.

Relevant ist die Einheit, weil Modelle in Token rechnen: Das Kontextfenster wird in Token gemessen, und wer KI über eine Schnittstelle (API) einbindet, zahlt pro Token, getrennt nach Ein- und Ausgabe. Textlänge wird damit unmittelbar zum Kostenfaktor, von der Länge des Prompts bis zur Menge mitgeschickter Dokumente.

Aus der Praxis

Begriffe sind das eine. Umsetzung das andere.

Wir übersetzen Technologie in Lösungen, die zu deinem Geschäft passen — aus Wien für den DACH-Raum.

Projekt besprechen