Barcha yangiliklar
Kunlik sharh

Kunning AI va GPU yangiliklari

2026-09-28 kuni Telegram kanalimizda e’lon qilingan 18 ta amaliy AI va GPU materiali.

29-sentabr 2026

Kunning AI va GPU yangiliklari
GPU va infratuzilma1/18

PCIe «sekinlashdimi»? Bekor turgan GPU’ni darrov nosoz demang

PCIe «sekinlashdimi»? Bekor turgan GPU’ni darrov nosoz demang

Fakt: NVIDIA ogohlantiradi: GPU ishlatilmayotganda nvidia-smi’dagi joriy PCIe link avlodi va kengligi pasayishi mumkin. Bekor holatdagi past Current slot yoki karta nosozligini o‘zi isbotlamaydi.

Nega muhim: serverni qabul qilishda energiya tejashni nosozlik deb baholash oson. Faqat GPU pasportiga qarab esa haqiqiy cheklovni o‘tkazib yuborish mumkin.

3 qadamli tekshiruv 1. nvidia-smi -L orqali kerakli kartani toping. GPU’larni adashtirmaslik uchun uning UUID qiymatini nusxalang. 2. nvidia-smi -q -i GPU_UUID -l 1 buyrug‘ida GPU_UUID o‘rniga olingan qiymatni qo‘ying. PCI → GPU Link Info bo‘limida avlod va link kengligi uchun Current hamda Max qiymatlarini alohida yozib oling. Ko‘rishni to‘xtatish — Ctrl+C. 3. Kuzatuvni faqat GPU ichidagi hisoblash paytida emas, kelishilgan CPU↔GPU ma’lumot uzatish testi davomida takrorlang. Link kutilganidan past qolsa, slot, riser va platforma konfiguratsiyasini tekshirish uchun ikkala holat natijasini hamda test tavsifini muhandisga bering.

Ehtiyot bo‘ling: Max faqat karta pasportidagi emas, GPU + tizimning joriy konfiguratsiyasi uchun maksimumdir. Uni ham platforma cheklashi mumkin. Bu maydonlar haqiqiy throughput’ni o‘lchamaydi; asosiy ulanishi C2C bo‘lgan tizimlarda PCIe bosh ma’lumot yo‘lini umuman ifodalamasligi mumkin. N/A — ma’lumot qo‘llab-quvvatlanmaydi degani, nol tezlik emas.

https://verum-ai.uz saytida GPU bo‘limi bor; aniq konfiguratsiya mosligini alohida tekshiring.

Источник / Manba · NVIDIA: https://docs.nvidia.com/deploy/nvidia-smi/index.html

Sun’iy intellekt2/18

Nemotron Nano 9B v2: SSM cache aniqligini tejab qolmang

Nemotron Nano 9B v2: SSM cache aniqligini tejab qolmang

NVIDIA-Nemotron-Nano-9B-v2 18.08.2025 kuni chiqqan — bu mavjud model tahlili, yangi reliz xabari emas. Weights NVIDIA Open Model License asosida ochiq; matn → matn, context 128K gacha. Arxitektura Mamba-2, MLP va to‘rtta Attention layer’ni birlashtiradi.

Fakt: rasmiy vLLM misolida NVIDIA --mamba_ssm_cache_dtype float32 ni belgilashni so‘raydi va usiz sifat pasayishi mumkinligini aytadi. Bu Mamba holatining aniqligi; barcha weights’ni FP32 ga o‘tkazish emas.

Nega muhim: model yuklangani inference to‘g‘ri sozlanganini anglatmaydi. Javoblar kutilganidan yomon bo‘lsa, checkpoint almashtirishga yoki GPU sotib olishga shoshilmang.

Uch qadam 1. Base qo‘shimchasisiz aniq model ID va vLLM versiyasini qayd eting. Flag sintaksisini vllm serve --help bilan solishtiring: yuqorida model card’dagi yozilish berilgan. 2. Ishga tushirish konfiguratsiyasida SSM cache uchun float32 ni tekshiring. O‘zgarishdan oldin va keyin sifatni bir xil prompts hamda decoding settings bilan tekshiring. 3. CUDA OOM bo‘lsa, --max-num-seqs ni kamaytiring: NVIDIA misolida 64, ammo bu sizning GPU’ingiz uchun kafolat emas. Server tanlashdan oldin o‘z yuklamangizda peak VRAM va latency’ni o‘lchang.

Cheklov: maslahat aynan shu hybrid model inference’i uchun; barcha LLM’lar uchun qoida ham, fine-tuning xotirasi hisobi ham emas. 128K — context chegarasi, istalgan concurrency’da shuncha tokens’ga xizmat ko‘rsatish va’dasi emas. Misoldagi --trust-remote-code repository kodini bajarishga ruxsat beradi: kodni tekshiring va revision’ni mahkamlang.

https://verum-ai.uz saytida GPU bo‘limi bor; kerakli konfiguratsiya mavjudligini alohida aniqlashtiring.

Источник / Manba · NVIDIA: https://huggingface.co/nvidia/NVIDIA-Nemotron-Nano-9B-v2

Sun’iy intellekt3/18

AI nol chiqardimi — yoki umuman ma’lumot yo‘qmidi?

AI nol chiqardimi — yoki umuman ma’lumot yo‘qmidi?

Fakt: pandas odatda bo‘sh Series yoki barcha qiymatlari yetishmayotgan ustun yig‘indisini 0 deb qaytaradi. Shuning uchun Python’ni rostdan ishga tushirgan AI ham «xarajatlar noma’lum» o‘rniga «xarajat yo‘q» deb yozishi mumkin.

Uch qadam 1. Hisoblashdan oldin belgilang: bo‘sh katak — noma’lum qiymat, nol emas. Alohida qoidasiz bo‘sh qiymatlarni fillna(0) bilan almashtirmang. 2. Sonli ustun uchun s.sum(min_count=1) ishlating. Bitta ham ma’lum qiymat bo‘lmasa, sun’iy nol emas, yetishmayotgan qiymat qaytadi. 3. Yig‘indi yonida s.count() — ma’lum qiymatlar sonini va s.size — jami qatorlar sonini chiqaring. Ma’lumot to‘liq emasligini aniq belgilang.

Tayyor prompt: amount ustuni yig‘indisini Python orqali hisobla. Bo‘sh qiymat «noma’lum» degani. sum(min_count=1) ishlat, ma’lum qiymatlar va jami qatorlar sonini ko‘rsat. Ma’lum qiymat bo‘lmasa, 0 emas, «ma’lumot yo‘q» deb yoz. Bo‘sh qiymatlar bo‘lsa, natijani qisman yig‘indi deb atagin.

Xato: min_count=1 to‘liqlikni tekshirmaydi! [10, bo‘sh qiymat] uchun 10 chiqadi — bu faqat ma’lum qiymatlar yig‘indisi. Misol pandas 3.0.6’da tekshirildi; asl faylni o‘zgartirmang.

GPU konfiguratsiyalari katalogi: https://verum-ai.uz

Источник / Manba · pandas: https://pandas.pydata.org/docs/reference/api/pandas.Series.sum.html

Sun’iy intellekt4/18

non_blocking=True: yuborildi — hali nusxalanmadi

non_blocking=True: yuborildi — hali nusxalanmadi

Fakt: PyTorch ogohlantiradi: pinned CPU memory’dan asinxron yuborishdan keyin manba tensor o‘zgartirilsa, GPU’ga buzilgan ma’lumot tushishi mumkin. .to(..., non_blocking=True) qaytishi nusxalash tugaganini bildirmaydi.

Nega muhim: o‘z pipeline’ingizda GPU oldingi batch’ni hali o‘qiyotganida ayni CPU buffer’ni keyingi batch bilan to‘ldirish oson. Ma’lumotdagi xato model beqarorligiga o‘xshab ko‘rinishi mumkin.

Uch qadam 1. Qayta ishlatiladigan pinned buffers’ni toping: pin_memory=True yoki .pin_memory(). Yuborishdan keyin ularni kim o‘zgartirishini tekshiring. 2. Qayta yozishdan oldin transfer tugashini kuting. Bitta GPU uchun oddiy variant: gpu = cpu.to("cuda:0", non_blocking=True) torch.cuda.synchronize("cuda:0") cpu.zero_() Bu yerda cpu — oldindan yaratilgan pinned tensor, torch import qilingan. Faqat kutishdan keyin tozalash mumkin. 3. Buffer ko‘p marta qayta ishlatilganda GPU tensor tarkibini kutilgan qiymat bilan solishtiring — faqat tezlikni o‘lchamang.

Xato: synchronize tanlangan GPU’dagi barcha ishni kutadi va overlap foydasini yo‘qotishi mumkin. Optimallashtirish uchun nusxalashdan keyin o‘sha stream’da CUDA event qo‘ying va qayta yozishdan oldin uni kuting. To‘g‘rilik tezlikdan muhimroq.

GPU konfiguratsiyalari katalogi: https://verum-ai.uz — mavjudligini alohida aniqlashtiring.

Источник / Manba · PyTorch: https://docs.pytorch.org/tutorials/intermediate/pinmem_nonblock.html

Sun’iy intellekt5/18

Granite 4.0 H Tiny: bo‘sh system — yo‘riqnoma yo‘q degani emas

Granite 4.0 H Tiny: bo‘sh system — yo‘riqnoma yo‘q degani emas

IBM Granite-4.0-H-Tiny’ni 02.10.2025 kuni chiqargan: bu mavjud model tahlili, yangi e’lon emas. Matnli instruct-model, 7B parametr, hybrid Mamba-2 + Attention/MoE, context 128K, Apache 2.0 asosida ochiq weights. Matndan ma’lumot ajratish, RAG va tool calling uchun mos — sifatni o‘z vazifalaringizda tekshiring.

Fakt: joriy rasmiy chat template system yo‘q yoki bo‘sh bo‘lsa va tools/documents berilmasa, default system prompt qo‘shadi. Bo‘sh satr bu yo‘riqnomani o‘chirmaydi. Demak, «system’siz» test aslida yashirin qo‘shilgan qoidalar bilan o‘tishi mumkin.

Uch qadam 1. Inference’dan oldin yakuniy prompt’ni ko‘ring: tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True) Bu yerda tokenizer ayni model repository’dan yuklangan. 2. O‘z qoidalaringiz kerak bo‘lsa, birinchi system xabarini bo‘sh qoldirmang. Masalan: «Shartnoma raqamini ajrat. Topilmasa — null qaytar». Faqat messages ro‘yxatini emas, template natijasini tekshiring. 3. Ishga tushirishlarni taqqoslash uchun weights va tokenizer’ga bir xil revision, Transformers versiyasi va generation settings’ni mahkamlang. Template o‘zgarishini model sifati o‘zgarishi deb qabul qilmang.

Tekshiruv va GPU: joriy Jinja-template mahalliy testida: system yo‘q → default; bo‘sh system → default; to‘ldirilgan system → o‘z yo‘riqnomasi. Weights yuklanmadi: bu tekshiruvga GPU kerak emas. Bu model benchmark’i ham, inference/fine-tuning uchun VRAM hisobi ham emas.

Xato: tools/documents bilan template qo‘shimcha maxsus yo‘riqnomalar tuzadi; maslahatni boshqa modellarga ko‘r-ko‘rona ko‘chirmang. System’ni olib tashlashning o‘zi xavfsizlik yoki aniqlikni kafolatlamaydi.

Verum saytidagi GPU bo‘limi: https://verum-ai.uz

Источник / Manba · IBM: https://huggingface.co/ibm-granite/granite-4.0-h-tiny

Sun’iy intellekt6/18

AI zip() yozdi: oxirgi yozuv qayerga yo‘qoldi?

AI zip() yozdi: oxirgi yozuv qayerga yo‘qoldi?

Fakt: Python odatda zip()ni eng qisqa kirish tugaganda to‘xtatadi. AI yozgan kod uchta ID’ni ikkita natija bilan juftlasa, uchinchi yozuv juftliklardan ogohlantirishsiz tushib qoladi. Python 3.10+ da strict=True bunday uzunlik farqini iteratsiya paytida ValueErrorga aylantiradi.

Qanday qo‘llash kerak 1. Ro‘yxatlar pozitsiya bo‘yicha mos kelishi kerakligiga ishonch hosil qiling. Tartib turlicha bo‘lsa, zip orqali emas, ID bo‘yicha moslang. 2. Kichik ro‘yxatlar uchun fayl yoki tizimga yozishdan oldin barcha juftliklarni tuzing: pairs = list(zip(ids, results, strict=True)) Xato chiqsa, to‘xtang; bo‘sh joylarni o‘ylab topilgan qiymatlar bilan to‘ldirmang. 3. AI’dan oxirgi natija yo‘q holatni tekshirishni so‘rang. Kod qisqargan hisobotni saqlash o‘rniga xato berishi kerak.

Tayyor prompt Bu ro‘yxatlarni element yo‘qotmasdan mosla. Pozitsion moslik uchun zip(..., strict=True) ishlat. Teng uzunliklarni va bitta natija yetishmagan holatni tekshir. Mos kelmasa to‘xta; ma’lumotlarni avtomatik kesma yoki to‘ldirma.

Ehtiyot bo‘ling: zip — lazy iterator: xato yaratishda emas, iteratsiyada chiqadi. Yozish bajariladigan siklda ayrim amallar allaqachon bajarilgan bo‘lishi mumkin. list chekli, kichik kirishlarni oldindan tekshiradi, ammo RAM talab qiladi; teng uzunlik juftliklar to‘g‘riligini isbotlamaydi.

Verum saytida GPU katalogi va ochiq modellar: https://verum-ai.uz

Источник / Manba · Python: https://peps.python.org/pep-0618/

GPU va infratuzilma7/18

Treningda VRAM yetmayaptimi? Activation’larni qayta hisoblang

Treningda VRAM yetmayaptimi? Activation’larni qayta hisoblang

Fakt. PyTorch’dagi activation checkpointing forward paytidagi ayrim oraliq tensorlarni backward’gacha saqlamaydi: gradientlar uchun kerak bo‘lganda ularni qayta hisoblaydi. Bu vaznlarni siqish emas, qo‘shimcha hisoblash evaziga xotirani tejashdir.

Nega muhim: trening yoki fine-tuning activation xotirasiga borib taqalsa, kattaroq VRAM’li GPU’ga o‘tishdan oldin shu usulni sinash mumkin. Buning narxi — qo‘shimcha hisoblash; haqiqiy foydani o‘lchash kerak.

Uch qadam 1. Batch, ketma-ketlik uzunligi va dtype’ni o‘zgartirmang. Warm-up’dan keyin dastlabki VRAM cho‘qqisi va to‘liq trening qadami vaqtini o‘lchang. 2. Forward’da bitta og‘ir blokning oddiy y = block(x) chaqiruvini almashtiring: from torch.utils.checkpoint import checkpoint y = checkpoint(block, x, use_reentrant=False) Bu yerda block — modulingiz, x — uning kirishi. PyTorch use_reentrant=False ni aniq ko‘rsatishni tavsiya qiladi. 3. Xuddi shu o‘lchovni takrorlang. Bir xil vaznlar, ma’lumotlar va seed bilan loss hamda gradientlarni dastlabki variantga solishtiring. Xotira, vaqt va sonli farqlar maqbul bo‘lsagina o‘zgarishni qoldiring.

Cheklov: bu backward uchun usul; inference’da vaznlar yoki KV cache’ni kichraytirmaydi. O‘zgaruvchan global holat tufayli blok qayta chaqirilganda boshqacha ishlasa, gradientlar ochiq xato chiqmasdan ham noto‘g‘ri bo‘lishi mumkin.

Verum GPU katalogi: https://verum-ai.uz — kerakli konfiguratsiya mavjudligini alohida aniqlashtiring. Manba: https://docs.pytorch.org/docs/2.14/checkpoint.html

Sun’iy intellekt8/18

Qwen3-30B: million token — shunchaki yangi limit emas

Qwen3-30B: million token — shunchaki yangi limit emas

Qwen/Alibaba Qwen3-30B-A3B-Instruct-2507’ni 30.07.2025 kuni chiqargan. Bu mavjud model tahlili, bugungi yangilik emas: matn → matn, MoE 30.5B/3.3B faol parametr, ochiq weights, Apache 2.0. Faqat non-thinking; Thinking — alohida versiya.

Fakt: native context — 262 144 token. Rasmiy 1M usuli alohida config_1m.json, Dual Chunk Attention va maxsus attention backend ishlatadi. Faqat --max-model-len ni oshirish yetmaydi.

Nega muhim: uzun arxivda xotira faqat weights uchun ketmaydi. Model card 1M uchun taxminan 240 GB jami GPU memory ko‘rsatadi: weights, KV cache va eng yuqori activation sarfi. Bu ishlab chiquvchining tavsiflangan inference usuli uchun ko‘rsatkichi; bizning hisobimiz yoki har bir ishga tushirish talabi emas.

Uch qadam 1. Haqiqiy so‘rov tokenlarini javob uchun zaxira bilan hisoblang. Native context yetsa, 1M’ni «ehtiyot uchun» yoqmang. 2. 1M kerak bo‘lsa, modelning alohida nusxasida ishlang: asl config’ni saqlang, config_1m va model card’dagi to‘liq backend yo‘riqnomasini qo‘llang. Versiyalarni belgilang; eski flags joriy vLLM’ga mos kelmasligi mumkin. 3. Yuklama shartlarini takrorlang: rasmiy vLLM misolida --max-num-seqs 1. O‘z hujjatlaringizda VRAM cho‘qqisi, kechikish va bosh, o‘rta hamda oxirdagi faktlarni topish aniqligini o‘lchang.

Cheklov: config_1m BF16 belgilaydi; 240 GB’ni quantization, concurrency yoki fine-tuning’ga avtomatik tatbiq etmang. 1M qo‘llovi aniqlik kafolati emas: e’lon qilingan RULER’da DCA + sparse attention bilan 1000k natijasi 72.2, 100 emas. Biz bu benchmark’ni takrorlamadik.

GPU katalogi: https://verum-ai.uz — mavjudligini alohida aniqlashtiring.

Источники / Manbalar · Qwen https://huggingface.co/Qwen/Qwen3-30B-A3B-Instruct-2507 https://github.com/QwenLM/Qwen3

Sun’iy intellekt9/18

AI buyruqni ishga tushirdi — bu hali «tayyor» emas

AI buyruqni ishga tushirdi — bu hali «tayyor» emas

Fakt: Python’da subprocess.run() odatda nol bo‘lmagan exit code sababli exception chiqarmaydi. AI tekshiruvsiz wrapper yozgan bo‘lsa, yiqilgan konvertatsiya yoki test ham «muvaffaqiyatli» xabari bilan tugashi mumkin.

Uch qadam 1. Tashqi buyruqlarning barcha chaqiruvlarini tekshirtiring. Nol bo‘lmagan kod xato bo‘lsa, check=True ishlating: result = subprocess.run(args, check=True, capture_output=True, text=True) Bu yerda subprocess import qilingan, args esa dastur va argumentlar ro‘yxati. 2. CalledProcessError bo‘lsa, unga bog‘liq amallarni to‘xtating. Maxfiy ma’lumotlarni olib tashlab, exit code va stderr’ning foydali qismini ko‘rsating. Exception’ni except: pass bilan yashirmang. 3. Wrapper’ni ataylab 7 kodi bilan tugaydigan buyruq orqali tekshiring. U xatoni bildirishi va «tayyor» bosqichiga o‘tmasligi kerak. Keyin muvaffaqiyatli holatni hamda chiqish faylining o‘zini tekshiring.

Tayyor prompt Bu koddagi buyruqlar ishga tushirilishini tekshir. Nol bo‘lmagan exit code xato bo‘lgan joylarga check=True qo‘sh. Xatoni yashirma va unga bog‘liq qadamlarni bajarma. Exit code 7 va 0 holatlarini tekshir. Muvaffaqiyatni faqat qaytish kodi bilan emas, natija mazmuni bilan ham tasdiqla.

Cheklov: ayrim utilitalarda nol bo‘lmagan kod odatiy natijani bildiradi — avval hujjatini o‘qing. Kod 0 fayl to‘g‘riligini isbotlamaydi va bajarilgan o‘zgarishlarni bekor qilmaydi. run xatti-harakati Python 3.11.16’da tekshirildi: kod 7 → CalledProcessError; kod 0 → natija mavjud.

Verum saytidagi GPU bo‘limi: https://verum-ai.uz

Источник / Manba · Python: https://docs.python.org/3/library/subprocess.html#subprocess.run

GPU va infratuzilma10/18

NCCL: bo‘sh VRAM to‘lgan /dev/shm muammosini hal qilmaydi

NCCL: bo‘sh VRAM to‘lgan /dev/shm muammosini hal qilmaydi

Docker ichidagi multi-GPU vazifa GPU xotirasi deyarli bo‘sh bo‘lsa ham ishga tushmayaptimi? NVIDIA alohida sababni ko‘rsatadi: /dev/shm ichidagi shared memory yetishmasa, NCCL ishga tusha olmasligi mumkin. Bu VRAM emas, host xotirasi. Xotirasi kattaroq GPU sotib olish bu limitni tuzatmaydi.

Nima qilish kerak 1. Vazifani NCCL_DEBUG=WARN bilan ishga tushiring. failed to extend /dev/shm/nccl-... xabarini qidiring. Aynan shu konteyner ichida df -h /dev/shm ni tekshiring: hostdagi natija boshqa limitni ko‘rsatishi mumkin. 2. Xato /dev/shm ni ko‘rsatsa, kelishilgan limit bilan konteynerni qayta yarating. NVIDIA misolidagi docker run argumentlari, image nomidan oldin: --shm-size=1g --ulimit memlock=-1 Birinchisi shared memory hajmini o‘zgartiradi, ikkinchisi locked memory limitini olib tashlaydi. Bular ikki xil cheklov; 1g — misol, har qanday yuklama uchun hisoblangan hajm emas. 3. Xuddi shu testni bir xil jarayonlar/GPU soni bilan takrorlang. Faqat bitta xato satri yo‘qolganini emas, test yakunini va NCCL logini tekshiring.

Cheklov: NCCL /dev/shm o‘rniga cuMem host allocations dan ham foydalana oladi. /dev/shm ni kattalashtirish — logga asoslangan aniq chora, barcha NCCL xatolariga yechim emas. Boshqa mexanizmlarni taxmin bilan o‘chirmang; host RAM hajmi va siyosatini hisobga oling.

NVIDIA manbasi: https://docs.nvidia.com/deeplearning/nccl/user-guide/docs/troubleshooting/runtime_and_mpi_issues.html Verum AI sayti: https://verum-ai.uz

Sun’iy intellekt11/18

LFM2.5: tool call — ishga tushirish uchun tayyor Python emas

LFM2.5: tool call — ishga tushirish uchun tayyor Python emas

Liquid AI LFM2.5-1.2B-Instruct’ni 05.01.2026 kuni chiqargan. Bu mavjud text-only model: 1,17B parametr, context 32 768 token, tijoriy foydalanish cheklovlari bo‘lgan LFM Open License v1.0 ostidagi ochiq weights. Base, Thinking, VL va Audio — alohida variantlar.

Fakt: model odatda JSON emas, Pythonic function calls chiqaradi. Funksiya chaqiruvi yozilgan ro‘yxat — harakat taklifi, ishonchli kod emas. Uni eval() yoki exec() ga uzatmang: lokal model bunday bajarishni xavfsiz qilmaydi.

Uch qadam 1. System prompt’ga faqat kerakli tools va ularning JSON schemas’ini kiriting. Parser JSON kutsa, ishlab chiquvchi tavsiya qilgan ko‘rsatmani qo‘shing: Output function calls as JSON 2. Javobni ma’lumot sifatida tahlil qiling. Bajarishdan oldin nomni allowlist, turlar va majburiy arguments hamda foydalanuvchi huquqlarini tekshiring. Noma’lum funksiya yoki ortiqcha arguments’ni rad eting; ma’lumotni o‘zgartirish alohida ruxsat talab qiladi. 3. Ruxsat etilgan funksiyani o‘z kodingiz bilan bajaring, haqiqiy natijani tool rolli xabarda qaytaring va modelni yana chaqiring. To‘g‘ri chaqiruv, noma’lum nom, noto‘g‘ri tur va kirish rad etilishi testlarini tekshiring.

GPU tanlovi: llama.cpp orqali CPU uchun GGUF va vLLM orqali GPU serving bor. BF16’da faqat weights taxminan 2,34 GB (tahririy hisob: 1,17B × 2 bytes), cache va runtime’siz. Bu to‘liq VRAM budjeti ham, fine-tuning talabi ham emas. Avval o‘z yuklamangizning latency va xotirasini o‘lchang.

Cheklov: prompt to‘g‘ri JSON’ni kafolatlamaydi. Liquid o‘z handler’i bilan BFCLv3 49,12 natijasini e’lon qilgan — bu agentingiz ishonchliligi kafolati emas; benchmark’ni takrorlamadik. Rus va o‘zbek tillari model tillari ro‘yxatida yo‘q: alohida tekshiring.

Verum GPU katalogi: https://verum-ai.uz — mavjudligini alohida aniqlashtiring.

Источники / Manbalar https://huggingface.co/LiquidAI/LFM2.5-1.2B-Instruct https://docs.liquid.ai/lfm/key-concepts/tool-use

Sun’iy intellekt12/18

AI research: qidiruvni va’da bilan emas, sozlama bilan cheklang

AI research: qidiruvni va’da bilan emas, sozlama bilan cheklang

Mahsulot haqida bloglardagi qayta bayonlarsiz ma’lumot kerakmi? OpenAI Responses API’dagi web_search natijalarni filters.allowed_domains orqali cheklay oladi. Prompt’dagi «faqat rasmiy saytlardan izla» talabi bu filtrning o‘rnini bosmaydi.

Uch qadam 1. Savolga mos rasmiy domenlarni tanlang. Masalan, NVIDIA hujjatlari uchun tools ro‘yxatiga shu obyektni qo‘shing: {"type":"web_search","filters":{"allowed_domains":["docs.nvidia.com"]}} Domenni https:// va yo‘lsiz yozing. Filtr uning subdomenlarini ham qamrab oladi; keng domen manbalar doirasini kengaytiradi. 2. Qidiruv haqiqatan chaqirilganini tekshiring: output’da web_search_call bo‘lishi kerak. tool_choice="auto" bo‘lsa, model qidirmasligi mumkin. Yagona tool web_search bo‘lsa va qidiruv majburiy bo‘lsa, tool_choice="required" qo‘ying. 3. Javobdagi havolalarni oching: mahsulot, versiya va da’vo mazmuni mosmi? Audit uchun so‘rovga include=["web_search_call.action.sources"] qo‘shing: ko‘rilgan URL ro‘yxati matndagi citations’dan kengroq.

Tayyor prompt NVIDIA hujjatlaridan [savol]ga javob top. Har bir xulosa uchun URL va, ko‘rsatilgan bo‘lsa, mahsulot versiyasini ber. Tasdiqlangan va noma’lum ma’lumotni ajrat. Tasdiq topilmasa, buni ochiq yoz.

Cheklov: bu Responses API va web_search sozlamasi; oddiy chat tugmasi yoki web_search_preview funksiyasi emas. Filtr yangilik, to‘liqlik yoki to‘g‘ri xulosani kafolatlamaydi va boshqa tools’ni cheklamaydi. Tor ro‘yxat kerakli manbani chiqarib tashlashi mumkin. Bu hujjatdagi sozlama, biz o‘tkazgan API-test natijasi emas.

Verum AI sayti: https://verum-ai.uz

Источник / Manba · OpenAI https://developers.openai.com/api/docs/guides/tools-web-search

Sun’iy intellekt13/18

NCCL: eth1 — aniq nom emas, prefiks

NCCL: eth1 — aniq nom emas, prefiks

Multi-node GPU vazifasi noto‘g‘ri tarmoqni tanlayaptimi? NVIDIA hujjatiga ko‘ra, NCCL_SOCKET_IFNAME=eth1 interfeyslarni prefiks bo‘yicha tanlaydi: eth1 ham, eth10 ham mos kelishi mumkin. Aniq nom uchun qiymat ichida = belgisi kerak. Bu ortiqcha interfeyslarni chiqarib tashlashga yordam beradi, o‘z-o‘zidan «GPU’ni tezlashtirmaydi».

Qanday qo‘llash kerak 1. Har bir Linux tugunida ip -br addr buyrug‘ini bajaring. Boshqa tugunlardan IP manziliga ulanish mumkin bo‘lgan interfeysni tanlang. Vazifa konteynerda ishlasa, nomlarni uning ichida tekshiring. 2. Worker jarayonlarini ishga tushirishdan oldin ularning muhitida belgilang: export NCCL_SOCKET_IFNAME='=eth1' Har bir tugunda eth1 o‘rniga haqiqiy nomni yozing: nomlar farq qilishi mumkin. Qo‘shtirnoqlar tenglik belgisini qiymat tarkibida saqlaydi. 3. Vaqtinchalik NCCL_DEBUG=INFO bilan qisqa multi-node test bajaring. Loglarda tanlangan interfeysni va collective operatsiyalar tugaganini tekshiring; keyin debug sozlamasini olib tashlang.

Cheklov: qo‘lda tanlash NCCL interfeyslarining avtomatik tanlovini o‘chiradi. U routing/firewall muammosini tuzatmaydi va distributed job’ning to‘liq sozlamasi o‘rnini bosmaydi. eth1’ni tekshirmay ko‘chirmang, debug loglarini doimiy qoldirmang.

Verum katalogidagi GPU konfiguratsiyalari: https://verum-ai.uz NVIDIA manbasi: https://docs.nvidia.com/deeplearning/nccl/user-guide/docs/env.html#nccl-socket-ifname

Sun’iy intellekt14/18

GLM-4.7-Flash: token budget’ni benchmark’dan ko‘chirmang

GLM-4.7-Flash: token budget’ni benchmark’dan ko‘chirmang

Z.ai GLM-4.7-Flash’ni 19.01.2026 kuni chiqargan. Bu mavjud model tahlili, bugungi reliz emas: text → text, MoE 30B-A3B, model card’da MIT ko‘rsatilgan ochiq weights. API’da context 200K; GLM-4.7 va FlashX — boshqa variantlar.

Fakt: model card’da ko‘pchilik testlar uchun 131 072 yangi token chegarasi, SWE-bench Verified uchun esa 16 384, temperature 0.7 va top_p 1.0 berilgan. Bu baholash shartlari, har bir javobning majburiy hajmi emas. Katta limit uzoq generatsiya va GPU band bo‘lishiga yo‘l beradi.

Uch qadam 1. Qisqa coding vazifalari uchun serving’ingizdagi OpenAI-compatible endpoint’da max_tokens=4096 bilan alohida test boshlang. Bu bizning sinov budjetimiz, Z.ai tavsiyasi emas. Prompt, thinking mode va sampling’ni o‘zgartirmang. 2. Bir xil vazifalar to‘plamida bu limitni 16 384 bilan solishtiring. Faqat tokens/s emas, o‘tgan testlar, haqiqiy output tokens va to‘liq javobgacha vaqtni o‘lchang. 3. finish_reason’ni tekshiring: length muvaffaqiyatli yakun emas, limitga yetilganini bildiradi. Qirqilish vazifaga xalaqit bergan joyda budjetni oshiring; tayyor javob bir xil bo‘lsa, pastroq chegara o‘z-o‘zidan modelni tezlashtirmaydi.

GPU tanlovi: 3B active barcha weights hajmi emas. Nominal 30B uchun BF16’da qo‘pol tahririy hisob: faqat weights taxminan 60 GB, KV cache va runtime’siz. Bu minimal VRAM ham, fine-tuning budjeti ham emas. Kerakli context va concurrency bilan xotira cho‘qqisini o‘lchang.

Cheklov: reasoning ham generatsiya budjetini sarflaydi. Juda tor limit natijagacha javobni uzishi mumkin. Z.ai SWE-bench Verified 59.2 e’lon qilgan; biz benchmark’ni takrorlamadik va 4096 token bilan shu natijani va’da qilmaymiz.

Verum GPU katalogi: https://verum-ai.uz — mavjudligini alohida aniqlashtiring.

Источники / Manbalar https://huggingface.co/zai-org/GLM-4.7-Flash https://docs.z.ai/release-notes/new-released

Sun’iy intellekt15/18

Claude PDF’ni o‘qiydi, lekin grafikni ko‘rmayaptimi? Citations’ni tekshiring

Claude PDF’ni o‘qiydi, lekin grafikni ko‘rmayaptimi? Citations’ni tekshiring

Fakt: Claude uchun Amazon Bedrock Converse API hujjatida PDF’ning ikki rejimi ko‘rsatilgan. Citations yoqilmasa, faqat matn olinadi; rasm va grafiklarni tahlil qilish uchun citations’ni yoqish kerak. Vizual kirish uzatilmagan bo‘lsa, «diqqat bilan qara» deb takrorlash yordam bermaydi.

Uch qadam 1. So‘rov yo‘lini tekshiring: qoida aynan Converse API’ga tegishli. Joriy hujjat bu bo‘limni Opus 4.6 va undan oldingi modellar uchun Bedrock integratsiyasiga bog‘laydi; sozlamani barcha Claude endpoint’lariga tatbiq etmang. 2. document obyektiga "citations":{"enabled":true} JSON maydonini qo‘shing, hujjatning format, name va source maydonlarini saqlang. Bu prompt’dagi ibora emas, so‘rov sozlamasi. 3. Avval tafsilotlari matnda takrorlanmagan grafik bor bitta sahifani yuboring. Javobni rasm bilan qo‘lda solishtiring; shundan keyingina butun hisobotni qayta ishlang. Haqiqiy token sarfini taqqoslang.

Tayyor prompt 1-sahifadagi grafikni tavsifla: o‘q yozuvlari, birliklar va o‘zgarish yo‘nalishi. Ko‘rinadigan qiymatlarni taxminiy baholardan ajrat. O‘qilmaydigan elementlarni taxmin bilan to‘ldirma; aynan nimani o‘qib bo‘lmaganini ko‘rsat.

Cheklov: vizual rejim qo‘shimcha token sarflaydi va mayda yozuvlarni aniq o‘qishni kafolatlamaydi. InvokeModel API mexanizmi boshqa — citations majburiyligi unga tegishli emas. Bu yerda hujjat tekshirildi, Bedrock API-testi bajarilmadi.

Verum AI sayti: https://verum-ai.uz

Источники / Manbalar https://platform.claude.com/docs/en/build-with-claude/pdf-support https://docs.aws.amazon.com/bedrock/latest/APIReference/API_runtime_DocumentBlock.html

Sun’iy intellekt16/18

PyTorch: nol gradient va gradient yo‘qligi bir xil emas

PyTorch: nol gradient va gradient yo‘qligi bir xil emas

Fakt: optimizer.zero_grad(set_to_none=True) gradient tensorlarini nol bilan to‘ldirmaydi, balki gradients’ni None qiladi. PyTorch hujjatiga ko‘ra, bu odatda xotira sarfini kamaytiradi va training’ni biroz tezlashtirishi mumkin. Ammo optimizer xatti-harakati ham o‘zgaradi: grad=None bo‘lgan parametr uchun step o‘tkazib yuboriladi; nol gradient bilan esa bajariladi.

Nega muhim: VRAM’i kattaroq GPU sotib olishdan oldin eski training loop’ni tekshiring. Unda set_to_none=False aniq berilgan bo‘lishi mumkin. Joriy hujjatda default allaqachon True: shu qiymatni qo‘shishning o‘zi tezlikni oshirmaydi.

Uch qadam 1. Alohida testda yangi gradient accumulation sikli oldidagi tozalashni quyidagiga almashtiring: optimizer.zero_grad(set_to_none=True) Gradient accumulation paytida bitta optimizer step’ga tegishli microbatches orasida gradients’ni tozalamang. 2. p.grad bilan ishlaydigan kodni tekshiring: tensor amallaridan oldin p.grad is not None sharti kerak. Backward’dan keyin gradient olmagan parametrda None qolishi mumkin. 3. Bir xil ma’lumotlar, batch size va precision bilan warmup’dan keyin loss, tensorlarning peak memory hajmi va training step vaqtini solishtiring. nvidia-smi ko‘rsatkichi pasayishi shart emas: allocator bo‘shagan xotirani cache’da saqlashi mumkin.

Cheklov: None shunchaki «arzonroq nol» emas. Shartli tarmoqlari bor modellarni ayniqsa sinchiklab tekshiring; weights bir xil yangilanishi kafolatlanmaydi. Bu usul weights hajmini kamaytirmaydi.

Manba: https://docs.pytorch.org/docs/stable/generated/torch.optim.Optimizer.zero_grad.html GPU katalogi: https://verum-ai.uz

Sun’iy intellekt17/18

Devstral Small 2: quantization’ni ayblashdan oldin runtime’ni tekshiring

Devstral Small 2: quantization’ni ayblashdan oldin runtime’ni tekshiring

Mistral AI Devstral Small 2’ni 09.12.2025 kuni chiqargan: 24B, text + images → text, context 256K, Apache 2.0 ostidagi ochiq weights. Bu mavjud coding model tahlili, yangi reliz emas. Uni Devstral 2 123B bilan adashtirmang.

Fakt: community GGUF uchun model card llama.cpp PR #17945 o‘zgarishlarini bevosita talab qiladi. U mistral3 uchun attention factor’ni tuzatadi va allaqachon merged. Eski runtime modelni noto‘g‘ri hisoblasa, kuchliroq GPU sotib olish hisoblashni tuzatmaydi.

Uch qadam 1. Haqiqatan ishlatilayotgan binary uchun llama-server --version bajaring. Build/commit’da #17945 tuzatishi borligini tekshiring. GUI’da faqat ilova emas, ichki backend versiyasini ham tekshiring. 2. Tuzatish bo‘lmasa, runtime’ni alohida muhitda yangilang. GGUF, chat template, prompt, context va sampling’ni o‘zgartirmang: aks holda taqqoslash yangilanish ta’sirini ko‘rsatmaydi. 3. Testlari bor bir nechta coding vazifani takrorlang. Bir xil concurrency’da o‘tgan testlar, to‘liq javob vaqti va peak VRAM’ni solishtiring. Ishlaydigan runtime va weights versiyalarini saqlang.

GPU tanlovi: avval to‘g‘ri inference, keyin server hajmi. Weights yuklangani to‘liq 256K context KV cache bilan birga sig‘ishini isbotlamaydi. Bu fix weights’ni kamaytirmaydi va fine-tuning budjetini belgilamaydi.

Cheklov: bu muayyan moslik tekshiruvi, har qanday GGUF’ni tuzatish va’dasi emas. Mistral SWE-bench Verified’da 68.0% e’lon qilgan; biz benchmark’ni takrorlamadik, sizning quantized build’ingizda natija kafolatlanmaydi.

Verum GPU katalogi: https://verum-ai.uz — mavjudligini alohida aniqlashtiring.

Источники / Manbalar https://huggingface.co/mistralai/Devstral-Small-2-24B-Instruct-2512 https://github.com/ggml-org/llama.cpp/pull/17945 https://mistral.ai/news/devstral-2-vibe-cli

Sun’iy intellekt18/18

AI requests.get() yozdi: kutish chegarasi qayerda?

AI requests.get() yozdi: kutish chegarasi qayerda?

Fakt: Python Requests odatiy holatda timeout belgilamaydi. Javob bermayotgan bitta sayt AI yozgan ma’lumot yig‘uvchi kodni uzoq vaqt to‘xtatib qo‘yishi mumkin — yangi natijasiz va aniq xatosiz.

Qanday qo‘llash kerak 1. AI’dan timeout yo‘q HTTP chaqiruvlarini, jumladan Session orqali chaqiruvlarni topishni so‘rang. 2. Ulanish va o‘qish uchun kutish vaqtini alohida belgilang. Bu misol, universal me’yor emas: r = requests.get(url, timeout=(3.05, 20)) r.raise_for_status() Birinchi son — connect timeout; ikkinchisi — read timeout: ma’lumot kelishlari orasidagi ruxsat etilgan kutish vaqti, butun yuklab olish muddati emas. 3. Lokal test serverida kechikkan javob va HTTP 500 ni tekshiring. Timeout va HTTPError’ni aniq qayta ishlang: manbani vaqtincha mavjud emas deb belgilang, xatoni «ma’lumot yo‘q» natijasiga aylantirmang.

Tayyor prompt «Ushbu Python-koddagi HTTP chaqiruvlarini tekshir. Connect/read timeouts va xatolarni aniq qayta ishlashni qo‘sh. Sekin javob hamda HTTP 500 testlarini ko‘rsat. Avtomatik qayta urinish qo‘shma, boshqa hisob-kitoblarni o‘zgartirma».

Xato xavfi: timeout=20 «butun vazifani 20 soniyada tugat» degani emas. Umumiy muddat uchun alohida deadline kerak; ma’lumotni onda-sonda yuboradigan oqim read timeout’dan uzoqroq davom etishi mumkin.

https://verum-ai.uz saytida GPU katalogi berilgan; kerakli konfiguratsiya mavjudligini alohida aniqlashtiring. Manba: https://requests.readthedocs.io/en/latest/user/advanced/#timeouts