Das Kontextfenster ist die Textmenge, die ein Sprachmodell gleichzeitig überblicken kann – gemessen in Token. Alles, was darin steht, kann das Modell beim Antworten berücksichtigen: die Frage, mitgeschickte Dokumente, der bisherige Gesprächsverlauf und die entstehende Antwort selbst.
Was darüber hinausgeht, sieht das Modell nicht. Daraus stammen viele scheinbar unerklärliche Aussetzer: Ein Modell fasst ein langes Dokument zusammen und lässt ausgerechnet den entscheidenden Abschnitt weg; in einem langen Gespräch vergisst es eine Vorgabe vom Anfang. Kein Fehler im engeren Sinne – der Text war schlicht nicht mehr im Blickfeld.
Die Fenster sind in den vergangenen Jahren stark gewachsen, was das Problem verschoben, aber nicht abgeschafft hat. Denn auch innerhalb des Fensters ist die Aufmerksamkeit ungleich verteilt: Was am Anfang und am Ende steht, wirkt zuverlässiger als das, was in der Mitte einer sehr langen Eingabe steht.
Praktisch folgen daraus drei Dinge. Erstens gehören die wichtigsten Vorgaben an den Anfang oder ans Ende, nicht in die Mitte. Zweitens ist bei langen Dokumenten die gezielte Auswahl relevanter Abschnitte besser als das vollständige Mitschicken – genau das leistet Grounding. Drittens hat jedes Mitschicken einen Preis, siehe Token: Ein größeres Fenster verführt dazu, alles hineinzukippen, und macht die Antworten dadurch teurer und nicht unbedingt besser.
Im Ticker dazu