AI-layfxak: prompt’ni faqat mini-eval orqali o‘zgartiring
AI-layfxak: prompt’ni faqat mini-eval orqali o‘zgartiring
Fakt. Generative AI o‘zgaruvchan: bir xil input turli outputs berishi mumkin. OpenAI o‘zgarishlarni bitta omadli javob bilan emas, balki odatiy, chegaraviy va adversarial cases’dan iborat task-specific to‘plamda tekshiradigan eval-driven development usulini tavsiya qiladi.
Nega muhim. Yangi prompt, model yoki reasoning effort demo’da yaxshiroq ko‘rinib, real vazifalar, latency yoki tokens sarfini yomonlashtirishi mumkin.
Qanday qo‘llanadi: 1. 12–20 ta anonimlashtirilgan real vazifani yig‘ing: odatiy, murakkab va muammoli. Har biri uchun kutilgan natija hamda pass/fail criterion yozing. 2. Joriy versiyani ishga tushirib baseline saqlang: muvaffaqiyat ulushi, jiddiy xatolar, latency va tokens. 3. Faqat bitta parametrni — prompt, model yoki effort’ni — o‘zgartiring va ayni to‘plamni qayta ishlating. O‘zgaruvchanlik sabab muhim cases’ni 2–3 marta sinang. 4. Faqat belgilangan chegara bajarilib, jiddiy regression bo‘lmasa joriy qiling. Har yangi xatoni eval set’ga qo‘shing.
Shablon: Maqsad: [o‘lchanadigan natija] Testlar: [odatiy + edge cases] Mezon: [pass/fail] A va B’ni bir xil to‘plamda solishtir; jadval: case | A | B | g‘olib | sabab.
⚠️ LLM-as-a-judge’da bias bo‘lishi mumkin; muhim qarorlarni inson tekshirsin.
Self-hosted testlar uchun https://verum-ai.uz katalogi hozir H200, H100, A100, L40S va RTX 4090 konfiguratsiyalarini ko‘rsatmoqda. Manba: https://developers.openai.com/api/docs/guides/evaluation-best-practices

