DeepSeek 8B: config’dagi 128K — VRAM zaxirasi emas
DeepSeek 8B: config’dagi 128K — VRAM zaxirasi emas
DeepSeek-R1-0528-Qwen3-8B — DeepSeek’ning MIT ostida ochiq vaznli, matn bilan ishlaydigan reasoning modeli. U Qwen3-8B-Base’ni R1-0528 mulohazalari asosida qo‘shimcha o‘qitish orqali olingan. Bu yangi reliz xabari emas, lokal inference amaliyoti.
Fakt. Rasmiy config’da max_position_embeddings=131072 va YaRN uchun factor=4.0, original_max_position_embeddings=32768 berilgan. Ishlab chiquvchi BARCHA configuration files’ni asl Qwen3’dan emas, DeepSeek repozitoriysidan olishni talab qiladi: bir xil arxitektura bir xil sozlamalar degani emas.
Nega muhim: ruxsat etilgan context uzunligi GPU kerakli so‘rovlar sonini ko‘tara olishini kafolatlamaydi. Uzun ketma-ketlikka qo‘shimcha KV cache kerak; YaRN sozlamasining o‘zi xotira qo‘shmaydi.
Uch qadam: 1. Weights, tokenizer va config’ni deepseek-ai/DeepSeek-R1-0528-Qwen3-8B dan yuklang. Eski lokal papkadagi Qwen3-8B fayllarini aralashtirmang. 2. Yuklangan config’da yuqoridagi maydonlarni, runtime loglarida esa YaRN qo‘llab-quvvatlanishi va amaldagi context limitini tekshiring. RoPE sozlamalarini e’tiborsiz qoldirib, faqat token sonini oshirmang. 3. Hujjatlaringizning haqiqiy uzunligi va bitta so‘rovdan boshlang. Eng yuqori VRAM sarfi, latency va sifatni o‘lchang; keyin uzunlik va concurrency’ni bittadan oshiring. Context’da javob uchun ham joy qoldiring.
Xato: config’dagi 128K hujjatning istalgan qismidan faktlarni aniq topish va’dasi ham, GPU uchun universal talab ham emas. Bu sinov fine-tuning emas, inference uchun.
Verum GPU katalogi: https://verum-ai.uz — kerakli konfiguratsiya mavjudligini alohida aniqlashtiring.
Источники / Manbalar: https://huggingface.co/deepseek-ai/DeepSeek-R1-0528-Qwen3-8B https://huggingface.co/deepseek-ai/DeepSeek-R1-0528-Qwen3-8B/blob/main/config.json

