Barcha yangiliklar
Kunlik sharh

Kunning AI va GPU yangiliklari

2026-09-26 kuni Telegram kanalimizda e’lon qilingan 7 ta amaliy AI va GPU materiali.

27-sentabr 2026

Kunning AI va GPU yangiliklari
Sun’iy intellekt1/7

PyTorch: model.eval() autograd’ni hali o‘chirmaydi

PyTorch: model.eval() autograd’ni hali o‘chirmaydi

O‘z inference kodingizda faqat model.eval() yetmaydi: u Dropout va BatchNorm kabi qatlamlar xatti-harakatini o‘zgartiradi, ammo gradientlar uchun graf yozilishini o‘chirmaydi. Sof inference uchun torch.inference_mode() bor; uning o‘zi eval rejimini yoqmaydi.

Nega muhim: training bo‘lmasa ham, keraksiz autograd har so‘rovda VRAM va vaqt sarflashi mumkin. Kattaroq GPU tanlashdan oldin kodning bajarilish yo‘lini tekshiring.

Qanday qo‘llash: 1. Bu faqat bashorat ekaniga ishonch hosil qiling: backward ham, bu tensors bilan keyinchalik autograd ostida hisoblash ham bo‘lmaydi. 2. Yuklangan model va tayyor kirish uchun: model.eval() with torch.inference_mode(): output = model(**inputs) 3. Eski kod bilan bir xil inputs, batch size va precision’da solishtiring. Warmup’dan keyin torch.cuda.max_memory_allocated() cho‘qqisini o‘lchang; har sinov oldidan torch.cuda.reset_peak_memory_stats() bilan statistikani tozalang. Oldingi sinov natijalarini o‘chiring; javob sifatini tekshiring.

Xato: inference mode’da yaratilgan tensors’ni autograd yozib boradigan hisoblashlarda ishlatib bo‘lmaydi. Bunday holatda torch.no_grad()ni ko‘rib chiqing. Tayyor runtime gradientlarni allaqachon o‘chirgan bo‘lishi mumkin — unda qo‘shimcha tejam va’da qilinmaydi. Bu quantization emas: weights kichraymaydi.

GPU katalogi: https://verum-ai.uz — konfiguratsiya mavjudligini alohida aniqlashtiring.

Источник / Manba · PyTorch: https://docs.pytorch.org/docs/2.14/notes/autograd.html

Sun’iy intellekt2/7

Bot ikkinchi xabarda qoidalarni «unutdimi»?

Bot ikkinchi xabarda qoidalarni «unutdimi»?

Fakt: OpenAI Responses API’da previous_response_id javoblarni dialogga bog‘laydi, ammo oldingi so‘rovning instructions maydonidagi matn keyingisiga ko‘chmaydi. Suhbat tarixi va joriy yo‘riqnoma bir narsa emas.

Nega muhim: til, format va taxmin qilmaslik qoidasini faqat boshida bersangiz, keyingi so‘rov bu aniq ko‘rsatmalarsiz qoladi. Modelni almashtirishdan oldin so‘rov qanday tuzilayotganini tekshiring.

Qanday qo‘llash: 1. Doimiy qoidalarni ilovada foydalanuvchi matnidan alohida RULES o‘zgaruvchisiga joylang. 2. Har chaqiruvda instructions=RULES yuboring. Davom ettirishda previous_response_id=last.id qo‘shing; bu maydonni ko‘chirish uchun IDning o‘zi yetmaydi. 3. Ketma-ket ikki bosqichni sinang: avval matndan faktlarni ajratish, keyin «yana bitta band qo‘sh». Ikkala so‘rovda qoidalar borligini va ikkinchi javob yetishmagan ma’lumotni taxmin bilan to‘ldirmasligini tekshiring.

instructions uchun shablon: O‘zbekcha javob ber. Format: fakt | kirish matnidan iqtibos. Faqat berilgan ma’lumotdan foydalan. Tasdiq bo‘lmasa, «ma’lumot yo‘q» deb yoz; javobni taxmin bilan to‘ldirma.

Cheklov: bu API’ning aniq bir maydoniga tegishli; butun tarix yo‘qoladi yoki oddiy ChatGPT ham shunday ishlaydi degani emas. Yo‘riqnomani takrorlash faktlar to‘g‘riligini kafolatlamaydi — iqtiboslarni baribir tekshiring.

Verum GPU katalogi: https://verum-ai.uz

Источник / Manba · OpenAI: https://platform.openai.com/docs/api-reference/responses/create

Sun’iy intellekt3/7

gpt-oss-20b: avval chat template, keyin modelni baholash

gpt-oss-20b: avval chat template, keyin modelni baholash

OpenAI gpt-oss-20b’ni 2025-yil 5-avgustda chiqargan: matnli MoE-model, taxminan 21B parametr, 3.6B faol, context 131 072 tokens, Apache 2.0 ostidagi ochiq weights. Oilada 120b ham bor. Bu bugungi yangi reliz emas, lokal inference bo‘yicha amaliy tahlil.

Fakt: model Harmony formatida o‘qitilgan. OpenAI ogohlantiradi: usiz to‘g‘ri ishlash kafolatlanmaydi. Savol yozilgan oddiy satr chat template o‘rnini bosmaydi.

Nega muhim: g‘alati javobni model zaifligiga yo‘yish yoki kuchliroq GPU olishdan oldin kirish formati qanday tuzilganini tekshiring.

Uch qadam: 1. Tokenizer’ni boshqa modeldan emas, aynan openai/gpt-oss-20b dan yuklang. 2. Transformers chat pipeline’iga xabarlar ro‘yxatini bering — u shablonni qo‘llaydi. model.generate ni bevosita chaqirsangiz, avval tokenizer bilan input tayyorlang: ids = tokenizer.apply_chat_template( messages, tokenize=True, add_generation_prompt=True, return_tensors="pt" ) Bu yerda messages — role va content maydonli obyektlar ro‘yxati; tayyor ids’ni kerakli device’da modelga bering. 3. Ikki bosqichli qisqa dialogni tekshiring. Javobni Harmony kanallari bo‘yicha ajrating: foydalanuvchiga xizmat tokens va analysis aralash xom oqim emas, final kerak.

GPU va cheklov: OpenAI MoE weights uchun MXFP4 bilan 20b’ni 16 GB xotira doirasida ishga tushirishni ko‘rsatadi. Bu istalgan context/batch yoki fine-tuning ham shu hajmga sig‘adi degani emas. O‘z so‘rovlaringizda VRAM’ni o‘lchang. To‘g‘ri format fakt xatolarini yo‘qotmaydi va tools’ni o‘zi bajarmaydi.

Verum GPU katalogi: https://verum-ai.uz — konfiguratsiya mavjudligini alohida aniqlashtiring.

Источники / Manbalar · OpenAI: https://huggingface.co/openai/gpt-oss-20b https://openai.com/index/introducing-gpt-oss/

GPU va infratuzilma4/7

CUDA .cpu() da xato berdimi? Sabab oldinroq bo‘lishi mumkin

CUDA .cpu() da xato berdimi? Sabab oldinroq bo‘lishi mumkin

Fakt. PyTorch odatda GPU operatsiyalarini asinxron ishga tushiradi. Xato keyingi chaqiruvda ko‘rinishi mumkin, shuning uchun stack trace’dagi satr har doim ham uni keltirib chiqargan operatsiyani ko‘rsatmaydi. Debugging uchun CUDA_LAUNCH_BLOCKING=1 CUDA chaqiruvlarini sinxron qiladi.

Nega: GPU yoki driver’ni almashtirishdan oldin traceback’dagi tasodifiy satrni emas, minimal misoldagi muammoli operatsiyani toping.

Uch qadam: 1. Xatoni qayta yuzaga keltiradigan input’ni saqlang. Minimal misolni repro.py ga ajrating; boshqa so‘rovlar va yuklamani olib tashlang. 2. Flag’ni Python boshlanishidan oldin belgilab, yangi process’da ishga tushiring. Linux/Bash: CUDA_LAUNCH_BLOCKING=1 python repro.py 3. Yangi traceback bo‘yicha muammoli operatsiyaning shapes, dtype va indekslarining ruxsat etilgan qiymatlarini tekshiring. Sababni tuzating, so‘ng ayni testni flagsiz — odatiy asinxron rejimda qaytaring.

Cheklov: flag xatoni tuzatmaydi va GPU nosozligini isbotlamaydi. U operatsiyalarni kutish tartibini o‘zgartiradi va bajarilishni sekinlashtirishi mumkin; uni production’da qoldirmang va u bilan ishchi unumdorlikni o‘lchamang.

https://verum-ai.uz da GPU katalogi bor; kerakli konfiguratsiya mavjudligini alohida aniqlashtiring.

PyTorch manbasi: https://docs.pytorch.org/docs/2.14/notes/cuda.html#asynchronous-execution

Sun’iy intellekt5/7

Qwen3.5-9B: Base — tayyor chat-bot emas

Qwen3.5-9B: Base — tayyor chat-bot emas

Qwen jamoasining Qwen3.5 oilasida nomi o‘xshash, vazifasi boshqa ikki model bor. Qwen/Qwen3.5-9B — post-trained model. Qwen/Qwen3.5-9B-Base esa faqat pre-training’dan o‘tgan: mualliflar uni bevosita suhbat uchun emas, fine-tuning va tadqiqotlar uchun tavsiya qiladi.

Nega muhim: Base ko‘rsatmalarni yomon bajarsa, kuchliroq GPU uni tayyor assistentga aylantirmaydi. Prompt yoki serverni o‘zgartirishdan oldin checkpoint’ni tekshiring.

Qanday qo‘llash kerak: 1. Yuklash konfiguratsiyasidagi to‘liq model ID’ni tekshiring. Tayyor suhbat uchun -Base qo‘shimchasisiz Qwen/Qwen3.5-9B va uning rasmiy chat template’idan boshlang. 2. Yuklama sinovidan oldin ko‘rsatmalaringiz bajarilishini tekshiring: kerakli til, javob formati, tasvirlar bilan ishlash. Faqat chiroyli formatni emas, mazmunni ham tekshiring. 3. Base’ni o‘ylangan o‘qitish tajribasi uchun tanlang. Uning model card’iga ko‘ra, control tokens rasmiy template bilan LoRA-style PEFT uchun avvaldan o‘qitilgan — shu tokenlar uchun embeddings’ni qayta o‘qitish shart emas.

Cheklov: chat template borligi instruction tuning bo‘lganini anglatmaydi. LoRA inference uchun yetarli GPU’da o‘qitish ham sig‘ishini kafolatlamaydi: o‘z sequence length va batch size’ingizda VRAM cho‘qqisini o‘lchang. Bu yerda GPU uchun universal talab bermaymiz.

Verum GPU katalogi: https://verum-ai.uz — konfiguratsiya mavjudligini alohida aniqlashtiring.

Источники Qwen / Qwen manbalari: https://huggingface.co/Qwen/Qwen3.5-9B https://huggingface.co/Qwen/Qwen3.5-9B-Base

GPU va infratuzilma6/7

Yuklashda CUDA OOM? GPU’da vaznlarning ortiqcha nusxasini yaratmang

Yuklashda CUDA OOM? GPU’da vaznlarning ortiqcha nusxasini yaratmang

Fakt. Checkpoint ichida GPU tensorlari bo‘lsa, torch.load() odatda ularni GPU’ga qaytaradi. PyTorch yuklash paytida VRAM sarfi keskin oshmasligi uchun map_location="cpu", keyin load_state_dict() ishlatishni tavsiya qiladi.

Nega muhim: birinchi so‘rovdan oldingi xato har doim kattaroq GPU kerakligini anglatmaydi. Xotirada model parametrlari va alohida yuklangan state_dict bir vaqtda turishi mumkin.

Oddiy PyTorch state_dict uchun uch qadam: 1. Kerakli arxitekturadagi modelni CPU’da yarating; konstruktorda .cuda() chaqirmang. 2. Ishonchli faylni CPU’ga yuklab, vaznlarni modelga ko‘chiring: state = torch.load("weights.pt", map_location="cpu", weights_only=True) model.load_state_dict(state) 3. Vaqtinchalik lug‘atni o‘chirib, modelni GPU’ga o‘tkazing: del state model = model.to("cuda")

Cheklov: CPU RAM model va checkpoint’ni sig‘dirishi kerak. Usul yuklashdagi ortiqcha GPU nusxasini yo‘qotadi, lekin vaznlar, KV cache yoki activations hajmini kamaytirmaydi. Bu sharded/quantized loaders uchun universal yo‘riqnoma emas. Hatto weights_only=True bilan ham kelib chiqishi noma’lum fayllarni yuklamang.

https://verum-ai.uz saytida VRAM hajmlari ko‘rsatilgan GPU katalogi bor — faqat fayl hajmiga emas, xotiraning eng yuqori sarfini tekshirgandan keyin taqqoslang.

Manba: https://docs.pytorch.org/docs/stable/generated/torch.load.html

Sun’iy intellekt7/7

Agent shoshilyaptimi: bitta o‘rniga ikkita tool call?

Agent shoshilyaptimi: bitta o‘rniga ikkita tool call?

Fakt. OpenAI API’da parallel_tool_calls: false parametri model javobini nol yoki bitta function call bilan cheklaydi. Bu keyingi qadam oldingi natijaga bog‘liq bo‘lganda foydali: avval murojaat yaratish, so‘ng olingan ID orqali fayl biriktirish.

Qanday qo‘llash kerak 1. O‘zingizning function tools bilan Responses API so‘roviga "parallel_tool_calls": false qo‘shing. Bu promptdagi jumla emas, API sozlamasi. 2. Ilova argumentlar va ruxsatlarni tekshiradi, ruxsat etilgan chaqiruvni bajaradi va modelga tegishli call_id bilan function_call_output qaytaradi. 3. Faqat natija kelgach keyingi qadamni so‘rang. Murojaat yaratishda xato yuz bersa, ilova kodi fayl biriktirishni bloklashi kerak — modelga ko‘rsatma berishning o‘zi yetmaydi.

Ko‘rsatma shabloni: Avval murojaat yarat. Faylni faqat muvaffaqiyatli natijadan keyin biriktir va undagi ID’dan foydalan. Yaratish amalga oshmasa, to‘xta va xatoni bildir.

Cheklov. Parametr bitta javobdagi chaqiruvlar sonini cheklaydi, ammo to‘g‘ri tartibni kafolatlamaydi va keyingi qadamda amal takrorlanishidan himoya qilmaydi. Takrorlarni aniqlash va holat nazorati ilova zimmasida qoladi. Mustaqil o‘qish amallarini ketma-ket bajarish shart emas.

Verum GPU konfiguratsiyalari katalogi: https://verum-ai.uz Manba: https://developers.openai.com/api/docs/guides/function-calling