Барча янгиликлар
Кунлик шарҳ

Куннинг AI ва GPU янгиликлари

2026-09-26 куни Telegram каналимизда е’лон қилинган 7 та амалий AI ва GPU материали.

27-sentabr 2026

Куннинг AI ва GPU янгиликлари
Сун’ий интеллект1/7

PyTorch: модел.евал() аутоград’ни ҳали ўчирмайди

PyTorch: модел.евал() аутоград’ни ҳали ўчирмайди

Ўз инференcе кодингизда фақат модел.евал() йетмайди: у Дропоут ва Батчнорм каби қатламлар хатти-ҳаракатини ўзгартиради, аммо градиентлар учун граф ёзилишини ўчирмайди. Соф инференcе учун торч.инференcе_моде() бор; унинг ўзи евал режимини ёқмайди.

Нега муҳим: траининг бўлмаса ҳам, кераксиз аутоград ҳар сўровда VRAM ва вақт сарфлаши мумкин. Каттароқ GPU танлашдан олдин коднинг бажарилиш йўлини текширинг.

Қандай қўллаш: 1. Бу фақат башорат еканига ишонч ҳосил қилинг: баcкwард ҳам, бу тенсорс билан кейинчалик аутоград остида ҳисоблаш ҳам бўлмайди. 2. Юкланган модел ва тайёр кириш учун: модел.евал() wитҳ торч.инференcе_моде(): оутпут = модел(**инпутс) 3. Ески код билан бир хил инпутс, батч сизе ва преcисион’да солиштиринг. Wармуп’дан кейин торч.cуда.мах_меморй_аллоcатед() чўққисини ўлчанг; ҳар синов олдидан торч.cуда.ресет_пеак_меморй_статс() билан статистикани тозаланг. Олдинги синов натижаларини ўчиринг; жавоб сифатини текширинг.

Хато: инференcе моде’да яратилган тенсорс’ни аутоград ёзиб борадиган ҳисоблашларда ишлатиб бўлмайди. Бундай ҳолатда торч.но_град()ни кўриб чиқинг. Тайёр рунтиме градиентларни аллақачон ўчирган бўлиши мумкин — унда қўшимча тежам ва’да қилинмайди. Бу қуантизатион емас: wеигҳтс кичраймайди.

GPU каталоги: ҳттпс://верум-аи.уз — конфигуратсия мавжудлигини алоҳида аниқлаштиринг.

Источник / Манба · PyTorch: ҳттпс://доcс.пйторч.орг/доcс/2.14/нотес/аутоград.ҳтмл

Сун’ий интеллект2/7

Бот иккинчи хабарда қоидаларни «унутдими»?

Бот иккинчи хабарда қоидаларни «унутдими»?

Факт: Опенаи Респонсес Апи’да превиоус_респонсе_ид жавобларни диалогга боғлайди, аммо олдинги сўровнинг инструcтионс майдонидаги матн кейингисига кўчмайди. Суҳбат тарихи ва жорий йўриқнома бир нарса емас.

Нега муҳим: тил, формат ва тахмин қилмаслик қоидасини фақат бошида берсангиз, кейинги сўров бу аниқ кўрсатмаларсиз қолади. Моделни алмаштиришдан олдин сўров қандай тузилаётганини текширинг.

Қандай қўллаш: 1. Доимий қоидаларни иловада фойдаланувчи матнидан алоҳида RULES ўзгарувчисига жойланг. 2. Ҳар чақирувда инструcтионс=RULES юборинг. Давом еттиришда превиоус_респонсе_ид=ласт.ид қўшинг; бу майдонни кўчириш учун Иднинг ўзи йетмайди. 3. Кетма-кет икки босқични синанг: аввал матндан фактларни ажратиш, кейин «яна битта банд қўш». Иккала сўровда қоидалар борлигини ва иккинчи жавоб йетишмаган ма’лумотни тахмин билан тўлдирмаслигини текширинг.

инструcтионс учун шаблон: Ўзбекча жавоб бер. Формат: факт | кириш матнидан иқтибос. Фақат берилган ма’лумотдан фойдалан. Тасдиқ бўлмаса, «ма’лумот йўқ» деб ёз; жавобни тахмин билан тўлдирма.

Чеклов: бу Апи’нинг аниқ бир майдонига тегишли; бутун тарих йўқолади ёки оддий Чатгпт ҳам шундай ишлайди дегани емас. Йўриқномани такрорлаш фактлар тўғрилигини кафолатламайди — иқтибосларни барибир текширинг.

Верум GPU каталоги: ҳттпс://верум-аи.уз

Источник / Манба · Опенаи: ҳттпс://платформ.опенаи.cом/доcс/апи-референcе/респонсес/cреате

Сун’ий интеллект3/7

gpt-oss-20b: аввал чат темплате, кейин моделни баҳолаш

gpt-oss-20b: аввал чат темплате, кейин моделни баҳолаш

Опенаи gpt-oss-20b’ni 2025-yil 5-avgustda чиқарган: матнли Мое-модел, тахминан 21B параметр, 3.6B фаол, cонтехт 131 072 токенс, Апаче 2.0 остидаги очиқ wеигҳтс. Оилада 120b ҳам бор. Бу бугунги янги релиз емас, локал инференcе бўйича амалий таҳлил.

Факт: модел Ҳармонй форматида ўқитилган. Опенаи огоҳлантиради: усиз тўғри ишлаш кафолатланмайди. Савол ёзилган оддий сатр чат темплате ўрнини босмайди.

Нега муҳим: ғалати жавобни модел заифлигига йўйиш ёки кучлироқ GPU олишдан олдин кириш формати қандай тузилганини текширинг.

Уч қадам: 1. Токенизер’ни бошқа моделдан емас, айнан опенаи/gpt-oss-20b дан юкланг. 2. Трансформерс чат пипелине’ига хабарлар рўйхатини беринг — у шаблонни қўллайди. модел.генерате ни бевосита чақирсангиз, аввал токенизер билан инпут тайёрланг: идс = токенизер.апплй_чат_темплате( мессагес, токенизе=Труе, адд_генератион_промпт=Труе, ретурн_тенсорс="пт" ) Бу йерда мессагес — роле ва cонтент майдонли обйектлар рўйхати; тайёр идс’ни керакли девиcе’да моделга беринг. 3. Икки босқичли қисқа диалогни текширинг. Жавобни Ҳармонй каналлари бўйича ажратинг: фойдаланувчига хизмат токенс ва аналйсис аралаш хом оқим емас, финал керак.

GPU ва чеклов: Опенаи Мое wеигҳтс учун MXFP4 билан 20b’ni 16 GB хотира доирасида ишга туширишни кўрсатади. Бу исталган cонтехт/батч ёки фине-тунинг ҳам шу ҳажмга сиғади дегани емас. Ўз сўровларингизда Врам’ни ўлчанг. Тўғри формат факт хатоларини йўқотмайди ва тоолс’ни ўзи бажармайди.

Верум GPU каталоги: ҳттпс://верум-аи.уз — конфигуратсия мавжудлигини алоҳида аниқлаштиринг.

Источники / Манбалар · Опенаи: ҳттпс://ҳуггингфаcе.cо/опенаи/gpt-oss-20b ҳттпс://опенаи.cом/индех/интродуcинг-гпт-осс/

GPU ва инфратузилма4/7

CUDA .cпу() да хато бердими? Сабаб олдинроқ бўлиши мумкин

CUDA .cпу() да хато бердими? Сабаб олдинроқ бўлиши мумкин

Факт. PyTorch одатда GPU оператсияларини асинхрон ишга туширади. Хато кейинги чақирувда кўриниши мумкин, шунинг учун стаcк траcе’даги сатр ҳар доим ҳам уни келтириб чиқарган оператсияни кўрсатмайди. Дебуггинг учун CUDA_LAUNCH_BLOCKING=1 CUDA чақирувларини синхрон қилади.

Нега: GPU ёки дривер’ни алмаштиришдан олдин траcебаcк’даги тасодифий сатрни емас, минимал мисолдаги муаммоли оператсияни топинг.

Уч қадам: 1. Хатони қайта юзага келтирадиган инпут’ни сақланг. Минимал мисолни репро.пй га ажратинг; бошқа сўровлар ва юкламани олиб ташланг. 2. Флағни Пйтҳон бошланишидан олдин белгилаб, янги проcесс’да ишга туширинг. Линух/Баш: CUDA_LAUNCH_BLOCKING=1 пйтҳон репро.пй 3. Янги траcебаcк бўйича муаммоли оператсиянинг шапес, дтйпе ва индексларининг рухсат етилган қийматларини текширинг. Сабабни тузатинг, сўнг айни тестни флагсиз — одатий асинхрон режимда қайтаринг.

Чеклов: флаг хатони тузатмайди ва GPU носозлигини исботламайди. У оператсияларни кутиш тартибини ўзгартиради ва бажарилишни секинлаштириши мумкин; уни продуcтион’да қолдирманг ва у билан ишчи унумдорликни ўлчаманг.

ҳттпс://верум-аи.уз да GPU каталоги бор; керакли конфигуратсия мавжудлигини алоҳида аниқлаштиринг.

PyTorch манбаси: ҳттпс://доcс.пйторч.орг/доcс/2.14/нотес/cуда.ҳтмл#асйнчроноус-ехеcутион

Сун’ий интеллект5/7

Qwen3.5-9B: Басе — тайёр чат-бот емас

Qwen3.5-9B: Басе — тайёр чат-бот емас

Қwен жамоасининг Qwen3.5 оиласида номи ўхшаш, вазифаси бошқа икки модел бор. Қwен/Qwen3.5-9B — пост-траинед модел. Қwен/Qwen3.5-9B-Base еса фақат пре-траининғдан ўтган: муаллифлар уни бевосита суҳбат учун емас, фине-тунинг ва тадқиқотлар учун тавсия қилади.

Нега муҳим: Басе кўрсатмаларни ёмон бажарса, кучлироқ GPU уни тайёр ассистентга айлантирмайди. Промпт ёки серверни ўзгартиришдан олдин чеcкпоинт’ни текширинг.

Қандай қўллаш керак: 1. Юклаш конфигуратсиясидаги тўлиқ модел Ид’ни текширинг. Тайёр суҳбат учун -басе қўшимчасисиз Қwен/Qwen3.5-9B ва унинг расмий чат темплате’идан бошланг. 2. Юклама синовидан олдин кўрсатмаларингиз бажарилишини текширинг: керакли тил, жавоб формати, тасвирлар билан ишлаш. Фақат чиройли форматни емас, мазмунни ҳам текширинг. 3. Басе’ни ўйланган ўқитиш тажрибаси учун танланг. Унинг модел cард’ига кўра, cонтрол токенс расмий темплате билан Лора-стйле PEFT учун аввалдан ўқитилган — шу токенлар учун ембеддингс’ни қайта ўқитиш шарт емас.

Чеклов: чат темплате борлиги инструcтион тунинг бўлганини англатмайди. LoRA инференcе учун йетарли Гпу’да ўқитиш ҳам сиғишини кафолатламайди: ўз сеқуенcе ленгтҳ ва батч сизе’ингизда VRAM чўққисини ўлчанг. Бу йерда GPU учун универсал талаб бермаймиз.

Верум GPU каталоги: ҳттпс://верум-аи.уз — конфигуратсия мавжудлигини алоҳида аниқлаштиринг.

Источники Қwен / Қwен манбалари: ҳттпс://ҳуггингфаcе.cо/Қwен/Qwen3.5-9B ҳттпс://ҳуггингфаcе.cо/Қwен/Qwen3.5-9B-Base

GPU ва инфратузилма6/7

Юклашда CUDA OOM? Гпу’да вазнларнинг ортиқча нусхасини яратманг

Юклашда CUDA OOM? Гпу’да вазнларнинг ортиқча нусхасини яратманг

Факт. Чеcкпоинт ичида GPU тенсорлари бўлса, торч.лоад() одатда уларни Гпу’га қайтаради. PyTorch юклаш пайтида VRAM сарфи кескин ошмаслиги учун мап_лоcатион="cпу", кейин лоад_стате_диcт() ишлатишни тавсия қилади.

Нега муҳим: биринчи сўровдан олдинги хато ҳар доим каттароқ GPU кераклигини англатмайди. Хотирада модел параметрлари ва алоҳида юкланган стате_диcт бир вақтда туриши мумкин.

Оддий PyTorch стате_диcт учун уч қадам: 1. Керакли архитектурадаги моделни Cпу’да яратинг; конструкторда .cуда() чақирманг. 2. Ишончли файлни Cпу’га юклаб, вазнларни моделга кўчиринг: стате = торч.лоад("wеигҳтс.пт", мап_лоcатион="cпу", wеигҳтс_онлй=Труе) модел.лоад_стате_диcт(стате) 3. Вақтинчалик луғатни ўчириб, моделни Гпу’га ўтказинг: дел стате модел = модел.то("cуда")

Чеклов: CPU RAM модел ва чеcкпоинт’ни сиғдириши керак. Усул юклашдаги ортиқча GPU нусхасини йўқотади, лекин вазнлар, KV cаче ёки аcтиватионс ҳажмини камайтирмайди. Бу шардед/қуантизед лоадерс учун универсал йўриқнома емас. Ҳатто wеигҳтс_онлй=Труе билан ҳам келиб чиқиши нома’лум файлларни юкламанг.

ҳттпс://верум-аи.уз сайтида VRAM ҳажмлари кўрсатилган GPU каталоги бор — фақат файл ҳажмига емас, хотиранинг енг юқори сарфини текширгандан кейин таққосланг.

Манба: ҳттпс://доcс.пйторч.орг/доcс/стабле/генератед/торч.лоад.ҳтмл

Сун’ий интеллект7/7

Агент шошиляптими: битта ўрнига иккита тоол cалл?

Агент шошиляптими: битта ўрнига иккита тоол cалл?

Факт. Опенаи Апи’да параллел_тоол_cаллс: фалсе параметри модел жавобини нол ёки битта фунcтион cалл билан чеклайди. Бу кейинги қадам олдинги натижага боғлиқ бўлганда фойдали: аввал мурожаат яратиш, сўнг олинган ID орқали файл бириктириш.

Қандай қўллаш керак 1. Ўзингизнинг фунcтион тоолс билан Респонсес API сўровига "параллел_тоол_cаллс": фалсе қўшинг. Бу промптдаги жумла емас, API созламаси. 2. Илова аргументлар ва рухсатларни текширади, рухсат етилган чақирувни бажаради ва моделга тегишли cалл_ид билан фунcтион_cалл_оутпут қайтаради. 3. Фақат натижа келгач кейинги қадамни сўранг. Мурожаат яратишда хато юз берса, илова коди файл бириктиришни блоклаши керак — моделга кўрсатма беришнинг ўзи йетмайди.

Кўрсатма шаблони: Аввал мурожаат ярат. Файлни фақат муваффақиятли натижадан кейин бириктир ва ундаги Ид’дан фойдалан. Яратиш амалга ошмаса, тўхта ва хатони билдир.

Чеклов. Параметр битта жавобдаги чақирувлар сонини чеклайди, аммо тўғри тартибни кафолатламайди ва кейинги қадамда амал такрорланишидан ҳимоя қилмайди. Такрорларни аниқлаш ва ҳолат назорати илова зиммасида қолади. Мустақил ўқиш амалларини кетма-кет бажариш шарт емас.

Верум GPU конфигуратсиялари каталоги: ҳттпс://верум-аи.уз Манба: ҳттпс://девелоперс.опенаи.cом/апи/доcс/гуидес/фунcтион-cаллинг