Barcha yangiliklar
Kunlik sharh

Kunning AI va GPU yangiliklari

2026-09-29 kuni Telegram kanalimizda e’lon qilingan 20 ta amaliy AI va GPU materiali.

30-sentabr 2026

Kunning AI va GPU yangiliklari
GPU va infratuzilma1/20

NCCL: algbw va busbw — GPU’ning ikki xil tezligi emas

NCCL: algbw va busbw — GPU’ning ikki xil tezligi emas

Fakt. nccl-tests’da algbw — ma’lumot hajmining operatsiya vaqtiga nisbati. busbw esa collective turi va ranks soniga tuzatish kiritilgan hisobiy metrika, fizik portning alohida o‘lchovi emas.

AllReduce uchun: busbw = algbw × 2 × (n−1) / n, n — ranks soni. To‘rtta rank bo‘lsa, shartli 100 GB/s algbw qiymati 150 GB/s busbw beradi. Bu arifmetik misol, server testi natijasi emas.

Nega muhim: ustunlarni adashtirib, interconnect’ni xato ravishda yaroqsiz deb topish yoki benchmark o‘lchamagan LLM tezligini va’da qilish mumkin.

Qanday qo‘llash kerak 1. Test buyrug‘i, NCCL/nccl-tests versiyalari, ranks soni va GPU topology’ni saqlang. Bir xil collective, xabar hajmlari, dtype va in-place/out-of-place rejimini solishtiring. 2. Hisobotda size | time | algbw | busbw ustunlarini sarlavhadagi birliklari bilan qoldiring. busbw uchun belgilangan me’yorga algbw’ni qo‘ymang. 3. Kichik xabarlarda avvalo latency, kattalarida bandwidth’ga qarang. Almashinuvni tekshirgach, o‘z LLM workload’ingizni o‘lchang: aloqa benchmark’i modelning tokens/s ko‘rsatkichini bermaydi.

Xato: busbw barcha NVLink uchun reklamadagi tezliklar yig‘indisi emas. Boshqa collective uchun tuzatish boshqacha; hisob topology va haqiqiy tor joy tahlilining o‘rnini bosmaydi.

Verum GPU katalogi: https://verum-ai.uz — kerakli konfiguratsiya mavjudligini alohida aniqlashtiring.

Источник / Manba · NVIDIA: https://github.com/NVIDIA/nccl-tests/blob/master/doc/PERFORMANCE.md

Sun’iy intellekt2/20

Qwen3.5-4B: matnli chat uchun vision’ni o‘chiring

Qwen3.5-4B: matnli chat uchun vision’ni o‘chiring

Qwen Team Qwen3.5-4B’ni 2026-yil 2-martda chiqargan: Apache 2.0 litsenziyali ochiq weights, kirishda matn, tasvir va video. Bu bugungi reliz emas, mavjud model uchun foydali sozlama.

Fakt: rasmiy vLLM misolida --language-model-only flag’i vision encoder va multimodal profiling’ni o‘tkazib yuborib, qo‘shimcha KV cache uchun xotira bo‘shatadi. Faqat matn yuborish bu rejimni yoqish bilan bir xil emas.

Qanday qo‘llash kerak: 1. Endpoint faqat matn bilan ishlashini tekshiring: unga skrinshot, skan va video kerak bo‘lmasin. 2. Mos vLLM versiyasida ishlayotgan vllm serve Qwen/Qwen3.5-4B buyrug‘iga --language-model-only qo‘shing, qolgan parametrlarni saqlang. Flag qo‘llanishini help orqali tekshiring; test serverini qayta ishga tushiring. 3. Bir xil so‘rovlarda ishga tushish loglaridagi KV cache sig‘imi, kechikish va OOM’siz parallel so‘rovlar sonini solishtiring. Context, precision va xotira limitini bir paytda o‘zgartirmang.

Nega muhim: ko‘proq VRAM’li GPU olishdan oldin keraksiz modality’ni olib tashlang. Umumiy band VRAM deyarli kamaymasligi mumkin: vLLM bo‘shagan joyni cache uchun ishlatadi.

Cheklov: bu rejimda tasvir va video qabul qilinmaydi. Tejaladigan xotira miqdori va’da qilinmagan; standart 262 144 tokens context hammasi GPU’ingizga sig‘ishini kafolatlamaydi. Bu inference sozlamasi, fine-tuning retsepti emas.

GPU katalogi: https://verum-ai.uz — kerakli konfiguratsiya mavjudligini alohida aniqlashtiring.

Источники / Manbalar: https://huggingface.co/Qwen/Qwen3.5-4B https://docs.vllm.ai/en/latest/configuration/engine_args/#multimodalconfig

Sun’iy intellekt3/20

AI JSON tayyorladi, lekin API rad etdimi? NaN’ni tekshiring

AI JSON tayyorladi, lekin API rad etdimi? NaN’ni tekshiring

Python json.dumps() odatda NaN, Infinity va -Infinity qiymatlarini chiqaradi, ammo JSON standarti ularga ruxsat bermaydi. Demak, «kod bajarildi» hali «payload API uchun yaroqli» degani emas: hisoblashdagi son bo‘lmagan natija eksportni buzishi mumkin.

Qanday qo‘llash kerak 1. AI’dan qat’iy serializatsiyani yoqishni so‘rang: body = json.dumps(payload, allow_nan=False). Bunday qiymatlar bo‘lsa, jo‘natishdan oldin ValueError chiqadi. 2. Xatoda muammoli maydon va sababni toping. NaN’ni avtomatik ravishda nolga almashtirmang. None JSON’da null bo‘ladi — bundan faqat API qiymat yo‘qligiga ruxsat bersa foydalaning. 3. Test qo‘shing: NaN va ikkala cheksizlik rad etilsin, oddiy son qabul qilinsin. Avval JSON satrini to‘liq tayyorlang, keyin jo‘nating yoki faylga yozing.

Tayyor prompt Python’da payload’ni JSON’ga eksport qilishni tekshir. allow_nan=False bilan NaN/Infinity’ni taqiqlagin. API qoidasi bo‘lmasa, xato sonlarni nol yoki null bilan almashtirma. nan, inf, -inf va oddiy son uchun testlar qo‘sh. Testlarning haqiqiy natijalarini ko‘rsat.

Cheklov: bu parametr API sxemasi, majburiy maydonlar va ruxsat etilgan oraliqlarni tekshirmaydi. Bu bitta to‘siq, to‘liq validatsiya emas.

Manba: https://docs.python.org/3/library/json.html#infinite-and-nan-number-values Verum AI: https://verum-ai.uz

GPU va infratuzilma4/20

Model yuklandi — CUDA’ga hali xotira kerak

Model yuklandi — CUDA’ga hali xotira kerak

Fakt: CUDA lazy loading’da ayrim modullar faqat kerak bo‘lganda yuklanadi. NVIDIA ogohlantiradi: ilova ishga tushishda barcha VRAM’ni egallasa, keyin modullar uchun xotira yetmasligi mumkin. Weights muvaffaqiyatli yuklangani birinchi ishchi so‘rov OOM’siz bajarilishini isbotlamaydi.

Nima qilish kerak: 1. Ishga tushirgach, haqiqiy ishlov berish yo‘llari bo‘yicha warmup bajaring: kerakli batch sizes, kirish uzunliklari va modalities. Bitta qisqa matnli so‘rov tasvirga ishlov berish yo‘lini tekshirmaydi. 2. GPU ishi tugashini kuting va warmup’dan oldin hamda keyin bo‘sh VRAM’ni solishtiring. Qurilmaning umumiy holati uchun: nvidia-smi --query-gpu=uuid,memory.used,memory.free --format=csv. Bu modullarning aniq hajmi emas: xotira boshqa sabablarga ko‘ra ham o‘zgaradi. 3. Ilova deyarli barcha VRAM’ni oldindan band qilsa, uning memory budget’ini kamaytiring va yuklamani takrorlang. Universal foizga emas, o‘lchovlarga asoslanib zaxira qoldiring; servisni muvaffaqiyatli warmup’dan keyin so‘rovlar uchun oching.

Cheklov: warmup faqat bajarilgan yo‘llarni qamrab oladi. Yangi kirish shakli boshqa kernels’ni talab qilishi mumkin. CUDA_MODULE_LOADING=EAGER yuklash vaqtini o‘zgartiradi, lekin VRAM qo‘shmaydi va har qanday OOM’ni tuzatmaydi.

GPU konfiguratsiyalari katalogi: https://verum-ai.uz — kerakli node mavjudligini alohida aniqlashtiring.

Источник / Manba · NVIDIA: https://docs.nvidia.com/cuda/cuda-programming-guide/04-special-topics/lazy-loading.html

Sun’iy intellekt5/20

Nemotron 3 Nano: 1M context o‘z-o‘zidan yoqilmaydi

Nemotron 3 Nano: 1M context o‘z-o‘zidan yoqilmaydi

NVIDIA Nemotron 3 Nano 30B-A3B’ni 2025-yil 15-dekabrda chiqargan: NVIDIA Nemotron Open Model License ostidagi ochiq weights’li matnli MoE model. Gap BF16 checkpoint haqida, bugungi yangi reliz haqida emas.

Fakt: model 1M tokens gacha context’ni qo‘llaydi, ammo Hugging Face config’da default qiymat 262144. NVIDIA kichikroq default’ni uzun context uchun yuqoriroq VRAM talabi bilan izohlaydi. Model sig‘imi va ishga tushirilgan server limiti — boshqa-boshqa narsalar.

Qanday qo‘llash kerak: 1. vLLM ishga tushirishidagi haqiqiy --max-model-len va chat template’dan keyingi kirish hajmini tekshiring; javob uchun joy qoldiring. 2. Uzunroq context haqiqatan zarur bo‘lsa, bu model uchun rasmiy misolda VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 va --max-model-len 1M berilgan. Bular mavjud ishga tushirish buyrug‘ining sozlamalari, to‘liq buyruq emas. 3. Ishchi trafikdan oldin uzun so‘rovni, keyin rejalashtirilgan concurrency’ni sinang. VRAM, birinchi token’gacha vaqtni o‘lchang va hujjat boshi, o‘rtasi hamda oxiridan faktlarni topishni tekshiring.

Xato: flag uzun context’ga ruxsat beradi, lekin GPU xotirasini qo‘shmaydi. GPU’ni «1M» raqamiga qarab sotib olmang: avval o‘z workload’ingizni tekshiring. Katta oyna ham aniq javobni kafolatlamaydi.

GPU konfiguratsiyalari katalogi: https://verum-ai.uz — tanlangan node mavjudligini alohida aniqlashtiring.

Источник / Manba · NVIDIA model card: https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16

Sun’iy intellekt6/20

AI eng yaxshi javobni tanladimi? Javoblar o‘rnini almashtiring

AI eng yaxshi javobni tanladimi? Javoblar o‘rnini almashtiring

Fakt: OpenAI LLM-as-judge’da position bias borligini qayd etadi: javoblar tartibi bahoga ta’sir qilishi mumkin. AI’ga ikki matnni solishtirishni topshirsangiz, sifat emas, ro‘yxatdagi o‘rin yutishi mumkin.

Qanday tekshirish kerak 1. Model va muallif nomlarini olib tashlang. Asl vazifa, zarur manbalar va yagona rubric bering: aniqlik, talablarga rioya qilish, tasdiqlanmagan faktlarning yo‘qligi. Durang va «ma’lumot yetarli emas» javoblariga ruxsat bering. 2. Yangi suhbatda javoblarni A va B deb ko‘rsating. Keyin boshqa yangi suhbatda matnlar o‘rnini almashtirib, ayni tekshiruvni takrorlang. Rubric va hakam modelni o‘zgartirmang; birinchi hukmni ko‘rsatmang. 3. G‘olibni harfga emas, asl matnga bog‘lang. Avval A, almashtirgandan keyin B yutsa, bu bir xil javob bo‘lishi mumkin. Tanlangan matnning o‘zi o‘zgarsa, juftlikni beqaror deb belgilang va qo‘lda tekshiring; ishonchli g‘alaba deb hisoblamang.

Tayyor prompt [Vazifa] uchun A va B javoblarini solishtir. Mezonlar: [rubric]. Manbalar: [materiallar]. Har bir mezon uchun javoblardan qisqa dalil keltir. Natija: A / B / durang / ma’lumot yetarli emas. Faqat uzunligi yoki o‘rni uchun javobni afzal ko‘rma. A: […] B: […]

Cheklov: o‘rin almashtirish beqarorlikni ko‘rsatadi, ammo sababini isbotlamaydi: hakamning javoblari ham o‘zgaradi. Bir xil hukmlar haqiqatni kafolatlamaydi; muhim faktlarni manbalar bilan tekshiring.

Verum AI: https://verum-ai.uz

Источник / Manba · OpenAI: https://developers.openai.com/api/docs/guides/evaluation-best-practices

Sun’iy intellekt7/20

PyTorch: record_stream() ma’lumot tayyor bo‘lishini kutmaydi

PyTorch: record_stream() ma’lumot tayyor bo‘lishini kutmaydi

Fakt: CUDA streams’da ikki xil vazifa bor: hisoblash tartibini belgilash va allocator xotirani juda erta qayta ishlatishiga yo‘l qo‘ymaslik. wait_stream() streams orasida bog‘liqlik o‘rnatadi; tensor.record_stream(s) allocator’ga tensor s stream’da ishlatilayotganini bildiradi. Ikkinchisi birinchisining o‘rnini bosmaydi.

Nega muhim: bu shartlarsiz operatsiyani qo‘shimcha stream’ga ko‘chirish tezlashish o‘rniga data race keltirishi mumkin — hatto bitta GPU’da ham.

O‘z PyTorch kodingizda qo‘llash: 1. Kirish tensor’ini tayyorlagan stream va uni o‘qiydigan s stream’ni aniqlang. Tayyorlash navbatga qo‘yilgach, lekin o‘qishni navbatga qo‘yishdan oldin s.wait_stream(producer) chaqiring; producer — boshlang‘ich stream. 2. with torch.cuda.stream(s): orqali hisoblashni s navbatiga qo‘ying. Boshqa stream’da yaratilgan kirish tensor’i uchun ish navbatga qo‘yilgach va x’ga oxirgi havola o‘chirilishidan oldin x.record_stream(s) chaqiring. Bu xotirani muddatidan oldin qayta ishlatishdan himoya qiladi. 3. Natijani boshqa GPU stream’da ishlatishdan oldin o‘sha stream’da s’ni kutishni belgilang. Bir xil kirishlarda natijani faqat bitta stream ishlatadigan variant bilan solishtiring; keyin tezlikni o‘lchang.

Xato: record_stream kodingizning tensor ustiga yozishini taqiqlamaydi. O‘qish tugamaguncha uning mazmunini o‘zgartirmang. Qo‘shimcha stream tezlashishni kafolatlamaydi; juda erta kutish overlap’ni yo‘qotadi.

Verum AI: https://verum-ai.uz

Источник / Manba · PyTorch: https://docs.pytorch.org/docs/stable/notes/cuda.html#cuda-streams

Sun’iy intellekt8/20

AI hisobot tuzdi — bo‘limsiz yozuvlar qayerga ketdi?

AI hisobot tuzdi — bo‘limsiz yozuvlar qayerga ketdi?

Fakt: pandas’da groupby() odatda dropna=True bilan ishlaydi: guruhlash kalitida NA bo‘lgan qatorlar guruhlarga kirmaydi. AI texnik jihatdan to‘g‘ri kod yozsa ham, hisobotdan ayrim yozuvlar — masalan, bo‘limi ko‘rsatilmagan xarajatlar — tushib qolishi mumkin.

Qo‘llash tartibi: 1. Guruhlashdan oldin qatorlar va kalitdagi yetishmayotgan qiymatlarni sanating: df["department"].isna().sum(). 2. Hisobot barcha yozuvlarni qamrashi kerak bo‘lsa, alohida NA guruhini saqlang: g = df.groupby("department", dropna=False). Qatorlar soni uchun g.size() ishlating. 3. Guruhlarni filtrlashdan oldin g.size().sum() == len(df) ni tekshiring. Tekshiruv o‘tmasa, natijani moslashtirmang — hisobot chiqarishni to‘xtating.

Tayyor prompt: pandas orqali department bo‘yicha hisobot tuz. Kalitida NA bo‘lgan qatorlarni dropna=False bilan saqla. Dastlabki qatorlar soni, NA soni va har bir guruh hajmini ko‘rsat. Qatorlar soni saqlanganini amalda tekshir. Asl faylni o‘zgartirma.

Xato xavfi: count() barcha qatorlarni emas, tanlangan ustundagi bo‘sh bo‘lmagan qiymatlarni sanaydi. Bo‘sh satr va probellar har doim NA emas: ularni qayta ishlash qoidasini alohida belgilang. Qatorlar sonini solishtirish pul summalari to‘g‘riligini isbotlamaydi.

Verum GPU konfiguratsiyalari katalogi: https://verum-ai.uz

Источник / Manba · pandas: https://pandas.pydata.org/docs/reference/api/pandas.DataFrame.groupby.html

Sun’iy intellekt9/20

cuDNN: turli o‘lchamlarda autotune sekinlashtirishi mumkin

cuDNN: turli o‘lchamlarda autotune sekinlashtirishi mumkin

Fakt: torch.backends.cudnn.benchmark = True bo‘lsa, cuDNN yangi o‘lchamlar to‘plami uchun bir nechta convolution algoritmini sinashi, so‘ng shu o‘lchamlarda tanlanganini ishlatishi mumkin. Shapes tez-tez o‘zgarsa, qayta tanlash xarajati tezlik yutug‘ini yo‘qqa chiqarishi mumkin.

Nega muhim: tasvirlar bilan ishlaydigan CNN’da kechikish kuchsiz GPU emas, autotune sababli oshishi mumkin. Bu flag LLM uchun universal tezlatgich emas.

Uch qadam: 1. Kirishning haqiqiy shapes’ini, jumladan batch size’ni yozib oling. Testda tasvirlar ketma-ketligi, model va precision bir xil bo‘lsin. 2. Alohida ishga tushirishlarda torch.backends.cudnn.benchmark = False va True ni solishtiring; flag’ni hisoblashdan oldin o‘rnating. Boshlanish va warmup’dan keyingi ishni alohida o‘lchang; vaqtni o‘lchashda CUDA tugashini kuting. 3. O‘lchamlar keskin farqlansa, False variantini tekshiring. Takrorlanuvchi shapes uchun True ni faqat o‘lchangan foyda bo‘lsa qoldiring. GPU’ni almashtirishdan oldin kechikish va sifatni solishtiring.

Tuzoq: benchmark=False deterministik natijani kafolatlamaydi: tanlangan algoritmning o‘zi nodeterministik bo‘lishi mumkin. Takrorlanuvchanlik alohida sozlanadi.

Verum AI GPU katalogi: https://verum-ai.uz — konfiguratsiya mavjudligini alohida aniqlashtiring.

Источники / Manbalar · PyTorch: https://docs.pytorch.org/tutorials/recipes/recipes/tuning_guide.html https://docs.pytorch.org/docs/2.14/notes/randomness.html

Sun’iy intellekt10/20

Olmo 3: qisqa vazifa uchun Think emas, Instruct’ni sinang

Olmo 3: qisqa vazifa uchun Think emas, Instruct’ni sinang

Ai2 Olmo 3’ni 2025-yil 20-noyabrda chiqargan. Bu bugungi yangilik emas. allenai/Olmo-3-7B-Instruct — ochiq weights va Apache 2.0 litsenziyali matn modeli; config’da context — 65 536 tokens. Oilada alohida 7B va 32B Think modellari ham bor.

Fakt: Ai2 Instruct’ni chat, tool use va tez javoblar uchun variant deb ta’riflaydi: u mos Think modeliga qaraganda qisqaroq ketma-ketliklar yaratadi. Maydonlarni ajratish yoki qisqa tasniflashda uzoq reasoning ortiqcha vaqt sarfi bo‘lishi mumkin.

Uch qadam: 1. Olmo-3-7B-Instruct va Olmo-3-7B-Think ni oldindan to‘g‘ri javoblari belgilangan bir xil haqiqiy vazifalarda solishtiring. Har checkpoint’ning o‘z chat template’ini ishlating. 2. GPU, precision va concurrency bir xil bo‘lsin. Reasoning bilan birga barcha chiqish tokens’ni hisoblang; faqat tokens/s emas, to‘liq javob vaqti va to‘g‘ri natijalar ulushini o‘lchang. 3. Sifat siz belgilagan chegaradan o‘tgan vazifalarda Instruct’ni qoldiring. Murakkab vazifalarni Think’da alohida tekshiring. Tanlovdan so‘ng ishchi context va batch bilan eng yuqori VRAM sarfini o‘lchang.

Cheklov: qisqaroq javob weights xotirasini avtomatik kamaytirmaydi va sizning yuklamangizda tezlashishni kafolatlamaydi. Model card’da English ko‘rsatilgan: RU/UZ alohida test talab qiladi. E’lon qilingan benchmarks bu test o‘rnini bosmaydi; GPU’ingiz uchun aniq tezlik yutug‘i va’da qilinmaydi.

Verum GPU katalogi: https://verum-ai.uz — konfiguratsiya mavjudligini alohida aniqlashtiring.

Источники / Manbalar · Ai2: https://allenai.org/blog/olmo3 https://huggingface.co/allenai/Olmo-3-7B-Instruct

Sun’iy intellekt11/20

AI kodni tekshirdimi yoki faqat boshini?

AI kodni tekshirdimi yoki faqat boshini?

Fakt: Python’da re.match() satr boshidan moslikni, re.fullmatch() esa butun satr mosligini tekshiradi. AI olti xonali kod uchun re.match(r'[0-9]{6}', value) yozgan bo‘lsa, 123456XYZ ham tekshiruvdan o‘tadi. Hujjatlardan olingan ID uchun bu API’ga yaroqsiz qiymat yuborish xavfini tug‘diradi.

Qanday qo‘llash kerak: 1. Avval qoidani belgilang: misolimizda kod aynan oltita ASCII raqamidan iborat, probel va qo‘shimcha belgilar yo‘q. Bu misol, barcha ID’lar uchun yagona format emas. 2. import re dan keyin asl satrni tekshiring: re.fullmatch(r'[0-9]{6}', value) is not None. Noto‘g‘ri kodni bildirmasdan qisqartirmang yoki «tuzatmang». 3. AI’dan testlarni amalda bajarishni so‘rang: 123456 o‘tadi; 123456XYZ, beshta raqam va oxirida yangi satr belgisi bo‘lgan oltita raqam — o‘tmaydi. Faqat format tekshirilgach, tizimdan yozuvni qidiring.

Tayyor prompt: Python’da ajratib olingan ID validatorini tekshir. Qoida: aynan 6 ta ASCII raqami. fullmatch ishlat, asl satrni o‘zgartirma. Ijobiy test va salbiy testlar qo‘sh: qo‘shimcha belgilar, qisqa kod, yangi satr belgisi. Testlarni bajar va natijani ko‘rsat; o‘tmagan satrlarni tekshirish uchun ajrat, o‘rniga qiymat taxmin qilma.

Cheklov: to‘g‘ri format ID mavjudligini yoki kerakli mijozga tegishliligini isbotlamaydi. Boshqa format uchun boshqa pattern kerak.

Verum AI: https://verum-ai.uz

Источник / Manba · Python: https://docs.python.org/3/library/re.html#re.fullmatch

GPU va infratuzilma12/20

Memory utilization — band VRAM foizi emas

Memory utilization — band VRAM foizi emas

NVIDIA monitoring’da utilization.memory — o‘lchov oralig‘ida GPU xotirasi o‘qilgan yoki yozilgan vaqt ulushi. Bu VRAM to‘lganlik darajasi ham, erishilgan peak bandwidth ulushi ham emas. Band xotira hajmi alohida ko‘riladi: memory.used.

Nega farqlash kerak: model VRAM’ning deyarli hammasini egallab, so‘rovlar orasida xotiraga kam murojaat qilishi mumkin. Past memory utilization yoniga yana bir model sig‘ishini anglatmaydi.

Ikkinchi yuklamani boshlashdan oldin 3 qadam: 1. Ikkala metrikani bir buyruq bilan oling: nvidia-smi --query-gpu=timestamp,uuid,memory.used,memory.total,utilization.memory --format=csv -l 1 2. Bir xil UUID satrlarini bo‘sh turish va odatiy inference paytida solishtiring. Bu yerda memory.used/total — MiB’dagi hajm, utilization.memory — % dagi faollik. Kuzatishni tugatish: Ctrl+C. 3. Ikkinchi model bo‘yicha qarorni past faollik foiziga emas, ishchi context/batch uchun uning weights, KV cache va vaqtinchalik buferlarini hisobga olgan VRAM zaxirasiga qarab qiling. Birgalikdagi yuklamani test muhitida tekshiring.

Tuzoq: N/A metrika mavjud emasligini bildiradi, nolni emas. Qo‘llab-quvvatlash GPU va rejimga, jumladan MIG’ga bog‘liq. Har soniyada o‘lchash qisqa cho‘qqilarni o‘tkazib yuborishi mumkin — bu OOM bo‘lmasligiga kafolat emas.

Verum AI: https://verum-ai.uz

Источник / Manba · NVIDIA: https://docs.nvidia.com/deploy/nvidia-smi/index.html

Sun’iy intellekt13/20

MiniCPM4.1: nomning o‘zi sparse attention’ni yoqmaydi

MiniCPM4.1: nomning o‘zi sparse attention’ni yoqmaydi

OpenBMB MiniCPM4.1-8B’ni 05.09.2025 kuni chiqargan. Bu mavjud model tahlili, yangi e’lon emas: matn → matn, 8B, Apache 2.0, reasoning va non-reasoning. Asosiy context javob bilan birga 65 536 tokens; 131 072 standart sozlamalarda emas, o‘zgartirilgan LongRoPE bilan tekshirilgan.

Fakt: Transformers uchun rasmiy InfLLM v2 yo‘riqnomasida alohida kernels va sparse_config kerak. dense_len=8192 bo‘lsa, qisqa ketma-ketliklar dense attention bilan ishlanadi. Demak, qisqa test sparse acceleration ishlayotganini ham, buzilganini ham isbotlamaydi.

GPU tanlashdan oldin tekshiring: 1. openbmb/MiniCPM4.1-8B checkpoint’i va runtime versiyalarini belgilang. Model card’dagi Sparse Attention bo‘limiga amal qiling: kernels’ni o‘rnating va bitta parametr emas, to‘liq sparse_config qo‘shing. 2. Dense va sparse’ni bir xil hujjatlarda solishtiring: chegaradan qisqa va uzun matnlarni alohida sinang. Batch, precision va javob limitini bir xil saqlang; birinchi token’gacha vaqt, generatsiya tezligi va peak VRAM’ni o‘lchang. 3. Hujjat boshi, o‘rtasi va oxiridagi ma’lumotlar bo‘yicha javoblarni tekshiring. GPU’ni o‘lchangan xotira sarfiga qarab, KV cache va buffers uchun zaxira bilan tanlang. GPTQ/AWQ/GGUF — alohida variantlar; BF16 natijalarini ularga avtomatik ko‘chirmang.

Cheklov: ishlab chiquvchining RTX 4090’dagi 3× natijasi sparse attention va speculative decoding ishlatilgan o‘z testiga tegishli, har qanday ishga tushirishga emas. Weights yuklangach tezlik uch baravar oshadi, degan va’da yo‘q.

Verum sayti: https://verum-ai.uz

Manba / Источник: https://huggingface.co/openbmb/MiniCPM4.1-8B

Sun’iy intellekt14/20

AI «faqat raqamlar» deb yozdimi? Qaysilarini aniqlashtiring

AI «faqat raqamlar» deb yozdimi? Qaysilarini aniqlashtiring

Python’da satrlar uchun regex \d standart holatda faqat 0–9 emas, boshqa Unicode decimal digits’ni ham qabul qiladi. Shu sababli re.fullmatch(r'\d{6}', s) ham 123456, ham 123456 ni o‘tkazadi. API ASCII kod talab qilsa, bunday validator ortiqcha qiymatlarni qabul qiladi.

Uch qadam: 1. AI uchun aniq shart bering: aynan oltita 0–9 belgisi, bo‘shliqlarsiz; kod satr bo‘lib qoladi, boshidagi nollar saqlanadi. 2. Butun satrni tekshirishni so‘rang: re.fullmatch(r'[0-9]{6}', s) is not None Bu Python ifodasi import re dan keyin ishlatiladi; s — satr. 3. Testlarni bajaring: 001234 qabul qilinsin; 123456, 12345, 123456x va oxirida bo‘shliq bor satr rad etilsin. Taxminni emas, haqiqiy natijani so‘rang.

Tayyor prompt: «Shart bo‘yicha Python validator yoz: oltita ASCII digits’dan iborat satr, normalizatsiyasiz va bo‘shliqlarni kesmasdan. Unicode digits bilan birga ijobiy va salbiy testlar qo‘sh. Testlarni bajarib, natijani ko‘rsat; ishga tushirish imkoni bo‘lmasa, ochiq ayt».

Cheklov: barcha maydonlarga ASCII shart emas. Xalqaro kiritish qoidalari boshqacha bo‘lishi mumkin. Regex’dan o‘tish kodning bazada borligini emas, formatini tekshiradi; identifikatorni bildirmasdan “tuzatmang”.

Verum AI: https://verum-ai.uz

Источник / Manba · Python: https://docs.python.org/3/library/re.html

Sun’iy intellekt15/20

PyTorch: umumiy tensorni butun batch uchun nusxalamang

PyTorch: umumiy tensorni butun batch uchun nusxalamang

Fakt: repeat() ma’lumotni nusxalaydi, expand() esa o‘lchami 1 bo‘lgan o‘qni kengaytirib, yangi ma’lumot xotirasini ajratmasdan view yaratadi. CUDA tensor uchun bu bir xil nusxalarga VRAM sarflamaslikka yordam beradi — masalan, batch uchun umumiy maskada.

Qanday qo‘llanadi 1. Batchdagi barcha B elementga kerak bo‘lgan, shakli [1, D] bo‘lgan umumiy x tensorni toping. Undan foydalanadigan amallar faqat o‘qishini tekshiring. 2. x.repeat(B, 1) o‘rniga y = x.expand(B, -1) ni sinang: shakl [B, D] bo‘ladi, -1 esa D ni saqlaydi. 3. Natija va eng yuqori VRAM sarfini faqat y yaratilganda emas, butun inference/training qadamida solishtiring: keyingi amal ma’lumotni xotirada to‘liq yaratishi mumkin.

Cheklov: bu repeat o‘rniga universal yechim emas — kengaytiriladigan o‘q o‘lchami 1 bo‘lishi kerak. Expanded view’ni in-place amallar bilan o‘zgartirmang: bir nechta element bitta xotira joyiga murojaat qiladi. Mustaqil yozish kerak bo‘lsa, avval clone() qiling, lekin nusxa yana xotira talab qiladi. Expand’dan keyin dtype o‘zgarishi ham butun kengaytirilgan tensor uchun xotira ajratishi mumkin.

Verum AI: https://verum-ai.uz

Источники / Manbalar — PyTorch: https://docs.pytorch.org/docs/stable/generated/torch.Tensor.expand.html https://docs.pytorch.org/docs/stable/generated/torch.Tensor.repeat.html

GPU va infratuzilma16/20

LFM2-24B-A2B: GPU tanlashdan oldin tilni tekshiring

LFM2-24B-A2B: GPU tanlashdan oldin tilni tekshiring

Liquid AI dastlabki checkpoint’ni 24.02.2026 kuni chiqargan. Bu reasoning traces’siz matnli Instruct MoE: jami 24B, faol 2,3B parametr; context — 32 768 tokens. Weights LFM Open License v1.0 ostida ochiq, Apache 2.0 emas.

Fakt: modelning rasmiy qo‘llab-quvvatlanadigan tillari ro‘yxatida rus va o‘zbek tillari yo‘q. Bu ushbu tillarda javob bera olmaydi degani emas, ammo inglizcha demo sifatini mahalliy support uchun kafolat deb bo‘lmaydi.

Ishga tushirishdan oldin uch qadam: 1. Shaxsiy ma’lumotlari olib tashlangan haqiqiy savollarni ruscha va o‘zbekcha alohida yig‘ing, aralash nutqni ham qo‘shing. To‘g‘ri javoblar va aniqlashtirish kerak bo‘lgan holatlarni oldindan belgilang. 2. Bitta checkpoint’ni rasmiy chat template bilan sinang: temperature=0.1, top_k=50, repetition_penalty=1.05. Faktlar, til va tool calls to‘g‘riligini alohida baholang — chiroyli javob hali to‘g‘ri javob emas. 3. Sifat tekshiruvidan keyingina maqsadli context va concurrency’da latency hamda peak memory’ni o‘lchang. Quantization va runtime bir xil bo‘lsin.

GPU tanlovi: A2B xotira sarfi dense 2B’nikidek degani emas. Barcha 24B weights uchun BF16’da qo‘pol hisob — taxminan 48 GB; cache va runtime qo‘shimcha joy talab qiladi. Bu hisob, rasmiy minimal VRAM talabi emas. Quantization/offload xotira va tezlikni o‘zgartiradi; fine-tuning uchun alohida hisob kerak.

Cheklov: ishlab chiquvchi bu modelni coding uchun tavsiya etmaydi. Faqat generatsiya tezligiga qarab tanlamang.

Verum sayti: https://verum-ai.uz

Manbalar / Источники: https://huggingface.co/LiquidAI/LFM2-24B-A2B https://www.liquid.ai/blog/lfm2-24b-a2b

Sun’iy intellekt17/20

AI SQL yozdi: bitta NULL — va ro‘yxat bo‘sh?

AI SQL yozdi: bitta NULL — va ro‘yxat bo‘sh?

Fakt: PostgreSQL’da NOT IN (subquery) mos qiymat topilmasa, lekin solishtirilayotgan qiymatlar orasida NULL bo‘lsa, true emas, NULL beradi.[1] Hisobi yo‘q mijozlarni qidirishda bunday filtr aynan kerakli mijozlarni natijadan chiqarib yuborishi mumkin.

Qanday qo‘llanadi 1. AI’ga faqat jadval nomlarini emas, sxemani bering: customers.id — PRIMARY KEY, invoices.customer_id esa NULL bo‘lishi mumkin. Maqsad — birorta ham hisob mos kelmaydigan mijozlar. 2. Mos yozuv yo‘qligini NOT EXISTS orqali tekshirishni so‘rang:[1] SELECT c.id FROM customers c WHERE NOT EXISTS ( SELECT 1 FROM invoices i WHERE i.customer_id = c.id ); 3. Test bazasida tekshiring: mijozlar 1, 2, 3; hisoblardagi customer_id qiymatlari 1 va NULL. Kutilgan to‘plam — 2 va 3. Keyin bo‘sh hisoblar jadvali va bitta mijozning takroriy hisoblarini alohida sinang.

Tayyor prompt: Hisobi yo‘q mijozlarni top. Nullable customer_id ni hisobga ol. NOT EXISTS bilan SELECT va NULL, bo‘sh jadval, dublikatlar uchun testlar ber. Kutilgan id to‘plamlarini ko‘rsat; ma’lumotni o‘zgartirma.

Cheklov: barcha NOT IN’larni ko‘r-ko‘rona almashtirmang. Bu yerda mijoz kaliti NULL bo‘la olmaydi; nullable kalit uchun avval yetishmayotgan qiymatning biznes ma’nosini belgilang. To‘g‘ri query tezlikni kafolatlamaydi — execution plan’ni alohida tekshiring.

Verum AI: https://verum-ai.uz

Sources: [1] https://www.postgresql.org/docs/current/functions-subquery.html — PostgreSQL: Subquery Expressions

GPU va infratuzilma18/20

Konteynerda nvidia-smi ishlayapti — CUDA-chi?

Konteynerda nvidia-smi ishlayapti — CUDA-chi?

Fakt: NVIDIA Container Runtime’dagi NVIDIA_DRIVER_CAPABILITIES konteynerga qaysi driver kutubxonalari va utilitalari kiritilishini belgilaydi. utility nvidia-smi va NVML uchun, compute esa CUDA/OpenCL uchun kerak. nvidia-smi ishlashi CUDA ilovasi ham ishga tushishini isbotlamaydi.

Nega muhim: konfiguratsiyada faqat utility qolsa, monitoring GPU’ni ko‘radi, ammo hisoblash uchun zarur komponentlar bo‘lmasligi mumkin. GPU’ni almashtirishga yoki modelni qayta o‘rnatishga shoshilmang.

Uch qadam: 1. Dockerfile, Docker/Compose va konteyner ichida NVIDIA_DRIVER_CAPABILITIES qiymatini tekshiring: printenv NVIDIA_DRIVER_CAPABILITIES. Aniq berilgan ro‘yxat standart ro‘yxatni to‘ldirmaydi, almashtiradi. 2. CUDA va monitoring uchun compute,utility belgilang. Docker run’da: -e NVIDIA_DRIVER_CAPABILITIES=compute,utility. Avval ruxsat berilgan GPU’lar to‘plamini saqlab, konteynerni qayta yarating; ishlayotgan konteynerdagi export yetishmayotgan kutubxonalarni qo‘shmaydi. 3. nvidia-smi bilan cheklanmay, kichik CUDA amalini bajaring. CUDA’li PyTorch o‘rnatilgan image uchun: python -c "import torch; x=torch.ones(1,device='cuda'); print((x+1).item())" Kutiladigan natija — 2.0; bu tezlik benchmark’i emas.

Cheklov: qiymat o‘zgartirilmasa, standart to‘plam allaqachon utility,compute. U mavjud bo‘lsa, boshqa sababni tekshiring: GPU’ga kirish, driver mosligi yoki framework build’i. all ni ko‘r-ko‘rona yoqmang.

NVIDIA manbasi: https://docs.nvidia.com/datacenter/cloud-native/container-toolkit/latest/docker-specialized.html Verum-AI sayti: https://verum-ai.uz

Sun’iy intellekt19/20

Granite 4.0 Micro: model 3B, KV cache esa 10 GiB

Granite 4.0 Micro: model 3B, KV cache esa 10 GiB

IBM Granite-4.0-Micro’ni 02.10.2025 da chiqargan: bu mavjud model tahlili, bugungi yangilik emas. Ochiq weights, Apache 2.0, matn → matn, 3B parametr, 128K context; vazifalar — RAG, ma’lumot ajratish va tool calling.

Fakt: H harfisiz ibm-granite/granite-4.0-micro — 40 ta attention layer’li oddiy dense Transformer. Mamba2 ishlatadigan gibrid H-variantlarning xotira hisobini unga ko‘chirmang.

Bitta 131 072 tokenli sequence va BF16/FP16 KV cache uchun faqat K va V hisob bo‘yicha 10 GiB egallaydi: 2 × 40 layers × 8 KV heads × 64 × 2 bayt × 131 072. Bu config asosidagi bizning hisobimiz, GPU uchun rasmiy talab emas. Weights, ishchi buffers va qo‘shimcha xarajatlar kiritilmagan. Kichik model ham uzun hujjatda VRAM chegarasiga yetishi mumkin.

Qanday qo‘llash kerak: 1. Faqat «Granite 3B» emas, aniq model ID va cache dtype’ni belgilang. 2. Kirish + javob uchun 8192 token limiti va bitta faol sequence’dan boshlang: shu sharoitda uning to‘liq KV cache’i — 0,625 GiB. 3. Haqiqiy vazifada eng yuqori VRAM sarfini o‘lchang, so‘ng context va concurrency’ni alohida oshiring.

Cheklov: bu fine-tuning emas, inference hisobi. Weights quantization’i o‘z-o‘zidan BF16 cache’ni kamaytirmaydi. Runtime xotirani oldindan band qilishi mumkin, shuning uchun nvidia-smi aynan shu farqni ko‘rsatishi shart emas.

Verum-AI sayti: https://verum-ai.uz

IBM manbalari / Источники IBM: https://huggingface.co/ibm-granite/granite-4.0-micro https://huggingface.co/ibm-granite/granite-4.0-micro/blob/main/config.json

Sun’iy intellekt20/20

AI bool("false") yozdi — sozlama yoqilib qoldimi?

AI bool("false") yozdi — sozlama yoqilib qoldimi?

Fakt: Python’da bo‘sh bo‘lmagan satr rost hisoblanadi: bool("false") va bool("0") natijasi True. Bu so‘z ma’nosini tahlil qilish emas. AI yozgan kod CSV yoki muhit o‘zgaruvchisidagi matnli flag’ni shunday o‘qisa, o‘chirilgandek ko‘ringan sozlama yoqilishi mumkin.

Tekshirishning uch qadami 1. Kirish turini aniqlang: "false" satri va False Boolean’i — turli qiymatlar. Amal bajarilishidan oldin tur o‘zgartiriladigan joyni tekshiring. 2. Aniq qoida belgilang: masalan, haqiqiy Boolean hamda faqat aynan "true"/"false" satrlari qabul qilinsin. Qolganlari yashirincha True yoki False’ga aylantirilmasin, xato bilan rad etilsin. 3. Test so‘rang: ruxsat etilgan ikkala satr va ikkala Boolean; alohida bo‘sh satr, "0", "False", None. Bu qoidada ikkinchi guruh rad etilishi kerak. Testlarni haqiqiy jo‘natish va o‘chirishlarsiz bajaring.

Tayyor prompt Python’da flag turini o‘zgartirishni tekshir. bool va aynan "true"/"false" satrlari mumkin; qolganlari — ValueError. bool(satr) ishlatma. Ijobiy va salbiy testlar qo‘sh, bajarilishning haqiqiy natijalarini ko‘rsat.

Tuzoq: katta-kichik harflar va bo‘shliqlar qoidasi ma’lumot formatiga mos bo‘lsin. lower()/strip() ni avtomatik qo‘shmang. To‘g‘ri talqin qilingan flag ham amal uchun huquqlarni tekshirish o‘rnini bosmaydi.

Verum AI: https://verum-ai.uz

Источник / Manba · Python: https://docs.python.org/3/library/stdtypes.html#truth-value-testing