Контекстное окно — это максимальный объём текста, который нейросеть может держать «в голове» одновременно: ваш вопрос, вся история переписки и её собственный ответ. Измеряется в токенах.
Хорошая аналогия — рабочий стол: на него помещается ограниченное количество бумаг. Когда кладёте новую, старая падает со стола. Модель не «забывает» в человеческом смысле — просто самая ранняя часть разговора перестаёт ей быть видна.
Почему это важно на практике
Три ситуации, где вы сталкиваетесь с этим напрямую:
- Длинный разговор начинает сбоить: модель забывает договорённости из начала переписки, повторяется, теряет ваши правила.
- Большой документ не помещается целиком: приходится дробить его на части.
- ИИ-агент «тупеет» на длинной задаче — у него в контексте копится история действий, и место заканчивается. У OpenClaw для этого есть отдельное решение проблемы переполнения.
Насколько большими бывают окна
Разброс огромный: от нескольких тысяч токенов у небольших локальных моделей до сотен тысяч и больше у современных флагманов. Большое окно — важное преимущество при работе с документами и кодом.
Но есть нюанс, о котором редко пишут: чем длиннее контекст, тем дороже каждый запрос — вся история отправляется модели заново при каждом сообщении. И качество внимания к середине очень длинного текста у моделей падает: важное лучше держать ближе к концу запроса.
Что делать, когда контекст кончается
- Начните новый чат и в первом сообщении кратко перескажите договорённости.
- Попросите резюме: «подведи итог нашего обсуждения в 10 пунктах» — и перенесите его в новый разговор.
- Отправляйте только нужный фрагмент документа, а не весь файл.
- Используйте память агента: у современных агентов важные факты выносятся в постоянные файлы и не занимают контекст — например, так устроена память Hermes.
Другие термины — в глоссарии.