Das Context Window (Kontextfenster) ist die maximale Textmenge, die ein Sprachmodell bei einer Anfrage gleichzeitig berücksichtigen kann, gemessen in Token. Hinein zählt alles: die Systemanweisungen, der bisherige Gesprächsverlauf, hochgeladene Dokumente und die entstehende Antwort. Was nicht mehr ins Fenster passt, existiert für das Modell nicht; deshalb „vergessen" lange Chats irgendwann ihren Anfang.
Die Fenster sind rasant gewachsen: von wenigen tausend Token in frühen Modellen auf Hunderttausende bis über eine Million bei aktuellen Systemen, genug für ganze Bücher oder Vertragsordner in einer Anfrage (Stand 07/2026). Ein großes Fenster garantiert allerdings keine gleichmäßige Aufmerksamkeit: Inhalte in der Mitte sehr langer Eingaben werden mitunter schwächer genutzt, Wichtiges gehört daher an Anfang oder Ende.
Und weil Firmenwissen selten komplett in ein Fenster passt, bleibt RAG das Mittel der Wahl, um gezielt nur die relevanten Ausschnitte hineinzureichen.