DeepSeek 8B: 128K в config — ещё не запас VRAM
DeepSeek 8B: 128K в config — ещё не запас VRAM
DeepSeek-R1-0528-Qwen3-8B — текстовая reasoning-модель DeepSeek с открытыми весами под MIT, полученная дообучением Qwen3-8B-Base на рассуждениях R1-0528. Это практика локального inference, не новость о релизе.
Факт. В её официальном config указаны max_position_embeddings=131072 и YaRN с factor=4.0, original_max_position_embeddings=32768. Разработчик отдельно требует брать ВСЕ configuration files из репозитория DeepSeek, а не исходного Qwen3: одинаковая архитектура не означает одинаковые настройки.
Почему важно: допустимая длина context не гарантирует, что GPU выдержит её с нужным числом запросов. Для длинной последовательности нужен дополнительный KV cache; одна лишь настройка YaRN память не добавляет.
Три шага: 1. Загружайте weights, tokenizer и config из deepseek-ai/DeepSeek-R1-0528-Qwen3-8B. Не подмешивайте файлы Qwen3-8B из старой локальной папки. 2. В загруженном config проверьте поля выше, а в логах runtime — поддержку YaRN и фактический лимит context. Не увеличивайте только число токенов, игнорируя RoPE-настройки. 3. Начните с реальной длины ваших документов и одного запроса. Измерьте пиковую VRAM, latency и качество, затем увеличивайте длину и concurrency по одному параметру. Оставляйте место в context и для ответа.
Ловушка: 128K в config — не обещание точного извлечения фактов из любой части документа и не универсальное требование к GPU. Этот тест относится к inference, не к fine-tuning.
Каталог GPU Verum: https://verum-ai.uz — наличие нужной конфигурации уточняйте отдельно.

