QO‘LLANMA · 10 DAQIQA O‘QISH
Ideal promptning formulasi
Formula bor, va u qisqa: maqsad, joy, chegaralar, tayyorlik mezoni, javob formati. Prompt-injiniring niqobi ostida sotiladigan qolgan hamma narsa yo tadqiqotlar bilan tasdiqlanmaydi, yo allaqachon eskirgan.
Promptlash bo'yicha eng katta sistematik sharh — The Prompt Report — tanlangan 1565 ta ishni tahlil qilib, ularni 58 ta matn texnikasiga jamladi. Shu sharhning amaliy qismi hushyor qiladi: mualliflar promptni qo'lda sozlashga 20 soat sarflab F1 0,53 oldi, avtomatik tanlov esa 0,548 berib, odamni ortda qoldirdi.
Skelet: besh qism
1. MAQSAD — nima og'riyapti va bu qanday ko'rinadi. 2. JOY — fayllar, papkalar, funksiyalar. 3. CHEGARALAR — nima tegilmay qoladi. 4. TAYYOR — natijani nima bilan tekshirish. 5. FORMAT — javobda nimani ko'rsatish.
1. Maqsad: soha emas, simptom
Edi: «Login bilan bog'liq bagni tuzat». Soha aytilgan. Simptom va takrorlash sharti yo'q. Model qidirishdan boshlaydi — nima haqida ketayotganini tushunish uchun o'nlab faylni o'qiydi — va kontekstni to'ldiradi. Anthropic buni alohida nosozlik deb ataydi: chegarasiz tadqiqot.
Ikkinchi balo tinchroq va qimmatroq: «login bilan bag» ostida model eng ehtimolli gipotezani tanlaydi va boshqa joyni tuzatadi.
Bo'ldi: «Foydalanuvchilar shikoyat qilishmoqda: sessiya muddati tugagach kirish ishlamay qoladi. Avtorizatsiya oqimiga qara, src/auth/ ichida, ayniqsa tokenni yangilash joyiga. Avval muammoni takrorlaydigan yiqiladigan test yoz, keyin tuzat».
2. Joy: repozitoriy emas, bitta papka
Joyni ko'rsatish qidiruvni o'nlab fayldan bitta katalogga qisqartiradi. Undan ham ishonchliroq ishlaydigan narsa — namuna faylga havola: konvensiyalarni so'z bilan qayta aytib berish o'rniga, modelga allaqachon qanday qilinganini o'qishga ber.
Namuna tavsifdan ishonchliroq, chunki u prompt bilan birga eskirmaydi. Koddagi konvensiyani qayta yozsang, model yangisini o'qiydi.
3. Chegaralar: nima butun qolishini sanab o't
Vazifani chegarasiz qo'ysang, model bo'shliqni o'zi to'ldiradi. Anthropic yangi modellarda ortiqcha injiniring moyilligini ochiq hujjatlashtiradi: keraksiz fayllar, bitta chaqiruv uchun abstraksiyalar, hech kim so'ramagan kelajak uchun moslashuvchanlik.
Buning xavfi shundaki, sanab o'tilganlarning hammasi kompilyatsiya bo'ladi va testlardan o'tadi. U diffni ko'rib chiqishda, tuzatish allaqachon o'sib ketganda chiqadi.
Chegara ustiga klapan qo'y: «Agar shu ramkalardan chiqish kerak deb hisoblasang — avval ayt, tahrirlama». Usiz model yo chegaradan jimgina hatlab o'tadi, yo tupikka kiradi.
4. Tayyor: modelning o'zi sensiz tekshiradigan narsa
Anthropic formulirovkasi so'zma-so'z: model ish bajarilganday ko'ringanda to'xtaydi, va tekshiruvsiz «tayyorga o'xshaydi» yagona mavjud signal bo'ladi. Unda tekshirish aylanasi sen bo'lasan, va har bir xato sen payqaguningcha kutadi.
Mezon shunday bo'lishi kerakki, model uni o'zi o'qiy olsin: testlarni yurgizish, yig'ish, tiplarni tekshirish, skrinshot va maketga solishtirish.
Model tekshira olmaydigan talabni u bajarilgan deb e'lon qiladi. «Chiroyliroq qil» ni u ko'rmaydi — chizilgan sahifaga ko'zi yo'q, shuning uchun muvaffaqiyat kiritilgan tuzatishlar fakti bo'yicha e'lon qilinadi. Skrinshot bilan davolanadi: natijaning rasmini ol, maket bilan solishtir, farqlarni sanab o't va tuzat.
5. Format: dalilni ko'rsat
Buyruq chiqishini ko'rsatishni so'ra. Muvaffaqiyatni so'z bilan qayta aytib berishni tekshirib bo'lmaydi. Begona chiqishni o'qish hammasini qaytadan yurgizishdan tezroq.
Va hujjatlar sog'lom fikrga zid beradigan bir detal: promptning o'zining bezagi javobga oqib o'tadi. Oddiy matn xohlasang — o'z promptingdan razmetkani olib tashla, javobdagi razmetka hajmi tushadi.
«Qadamba-qadam o'yla» endi ishlamaydi
2022 yilda bu ibora mo''jiza qilardi: o'sha davr modelida MultiArith'dagi aniqlik 17,7 foizdan 78,7 foizga sakrardi. Xalq odati o'shandan boshlangan. Bugun u boshqa natija keltiradi.
ICLR 2025 da chop etilgan yuzdan ortiq ishning meta-tahlili yutuqni vazifa turlari bo'yicha ajratdi: ramziy mulohaza +14,2 punkt, matematika +12,3, mantiq +6,9. Qolgan hamma narsada — zanjirsiz 56,1 ga qarshi 56,8, ya'ni shovqin doirasida.
Ichkarida mulohaza yurituvchi modellarda manzara bundan ham yomon. Wharton'ning PhD darajasidagi 198 ta savoldagi o'lchovi: o3-mini +2,9 foiz, o4-mini +3,1 foiz, Gemini Flash 2.5 minus 3,3 foiz — javob vaqti 20-80 foizga oshgan holda.
OpenAI bu haqda hujjatlarida to'g'ridan-to'g'ri yozadi: bunday modellardan qadamba-qadam o'ylashni so'rashning hojati yo'q, ular buni ichkarida qiladi. Anthropic qo'lda zanjirni faqat o'chirilgan mulohaza o'rniga taklif qiladi.
Ekspert roli: bahs uning foydasiga emas
Eng yirik tekshiruv — 162 ta rol, 2410 ta faktologik savol, to'rtta model oilasi. Tizim promptidagi persona rolsiz promptga nisbatan natijani yaxshilamadi.
O'sha ishning alohida topilmasi usul nega ishlaydiganday tuyulishini tushuntiradi: agar har bir savolga eng yaxshi rolni keyin tanlasang, o'sish katta. Kerakli rolni oldindan bashorat qilib bo'lmaydi — bashoratlar ko'pincha tasodifiy tanlovdan yaxshi emas.
Qarama-qarshi natijalar va zarar ham bor: modellardan birida rol promptlari o'n ikkita datasetning yettitasida mulohazani yomonlashtirdi. 2026 yildagi 1140 ta savoldagi tahlil almashuvni ko'rsatdi — ekspertiza chuqurligi oshadi, ravshanlik tushadi, umumiy ball deyarli qimirlamaydi.
Choychaqa, tahdid va KATTA HARFLAR
Pul to'lash va'dasi hamda tahdid ikkita jiddiy benchmarkda alohida tadqiqotda tekshirildi. Xulosa so'zma-so'z: natijaga sezilarli ta'siri yo'q. Ayrim formulirovkalar aniq savollarda javobni siljitadi, lekin qayerga siljitishini oldindan bashorat qilib bo'lmaydi.
Muloyimlik haqida uchta ish uchta xil javob beradi: biri qo'pol promptlarda yutuq topadi, ikkinchisi muloyimlarida, uchinchisi hech qaysi tomonga barqaror ta'sir topmaydi. Bu yerda barqaror qoida yo'q.
Katta harflar haqida esa Anthropic'ning to'g'ridan-to'g'ri tavsiyasi bor, va u qarshi. Yangi modellar tizim promptiga kuchliroq javob beradi, va bosh harflar bilan yozilgan «JUDA MUHIM, SEN MAJBURSAN» endi kerak bo'lmagan joyda ishga tushadi. Hujjatlardagi maslahat: agressiv formulirovkalarni olib tashlash va oddiy til bilan yozish.
Misollar shaklni belgilaydi
2022 yildagi ish buni qattiq tekshirdi: misollarda to'g'ri javoblar tasodifiy aralashtirildi, sifat esa deyarli tushmadi. Boshqa uchta narsa ishlaydi: umuman qanday javoblar bo'lishi, tipik kirish qanday ko'rinishi va javob qanday tuzilishi.
To'rt yil o'tib zamonaviy modellardagi o'lchov xuddi shunga keldi: misollar chiqish formatini tekislaydi, shu bilan birga modellar ko'rsatmalarga tayanadi va demonstratsiyalarni e'tiborsiz qoldirishga moyil. Agar format so'z bilan aniq berilgan bo'lsa, misollar o'zini oqlamay qo'yadi.
Anthropic 3-5 ta misolni va ularni teglarga o'rashni tavsiya qiladi, toki model ularni ko'rsatmalardan ajratsin. E'lon qilingan ta'sir u yerda halol aytilgan: format, ton va tuzilma.
Bezak o'ylagandan ko'ra ko'proq vazn qiladi
ICLR 2024 dagi ish bitta promptning semantik jihatdan bir xil bezaklarini — ajratgichlar, bo'shliqlar, registr — saralab chiqdi. Modellardan birida aniqlik tarqalishi 76 punktga yetdi. Sezgirlik na model o'sishi bilan, na misollar qo'shilishi bilan yo'qolmaydi.
Amaliyot oddiy: bitta shablonni ushlab tur va unda mazmunni o'zgartir. Har xil bezatilgan ikki promptni solishtirish ma'nosiz — unda sen bezakni o'lchayotgan bo'lasan.
Qattiq JSON mulohazani buzadi
Dekodlash darajasida qat'iy format talabi qimmatga tushadi. Maktab matematikasidagi o'lchov: modellardan biri 86,5 foizdan 23,4 foizga tushdi, ikkinchisi 76,6 dan 49,3 ga. Format cheklovi qanchalik qattiq bo'lsa, tushish shunchalik kuchli.
Teskari tomoni ham o'lchangan: klassifikatsiyada format yordam beradi — javoblar maydonini toraytirish tanlov xatolarini kamaytiradi. Bu ikki chekka orasidagi ishchi usul: avval model erkin mulohaza yuritsin, qat'iy formatga o'tkazish esa alohida qadam bilan qilinsin.
Uzun promptning o'rtasi yiqiladi
Modellarga hujjatlar to'plami beriladi, ulardan roppa-rosa bittasida javob bor, va uning o'rni siljitiladi. Aniqlik: kerakli hujjat birinchi bo'lganda 75,8 foiz, o'rtada bo'lganda 53,8 foiz, oxirida bo'lganda 63,2 foiz. Umuman hujjatsiz — 56,1 foiz.
Bu to'rt raqamni yana bir bor o'qi. Kerakli hujjat o'rtada bo'lsa, natija hujjat umuman berilmagandagidan YOMONROQ.
Anthropic uzun ma'lumotlarni yuqoriga, savol va ko'rsatmalarni ularning ostiga qo'yishni maslahat beradi. Ularning o'lchovlariga ko'ra, bu murakkab ko'p hujjatli kirishlarda sifatga 30 foizgacha qo'shadi.
Tashqi signalsiz «o'zingni tekshir» zarar qiladi
Modelning o'zini sverka qiladigan narsasi yo'q bo'lganda o'z javobini qayta tekshirishni so'rash sifatni tushiradi. Maktab matematikasidagi o'lchov: boshida 95,5 foiz, birinchi o'z-o'zini tekshirish aylanasidan keyin 91,5 foiz, ikkinchisidan keyin 89,0 foiz.
Sababi shundaki, model xato qilgan-qilmaganini tushunolmaydi, so'rov bilan ekilgan shubha esa uni to'g'ri javobdan uzoqlashtiradi. Boshqa narsa ishlaydi: tashqi signal. Test, kompilyator, tiplar, buyruq chiqishi. Formulaning to'rtinchi bandi shunga tayanadi.
Chek-list: yuborishdan oldin promptni tekshir
Simptom aytilgan: tashqaridan nima ko'rinadi va qanday sharoitda. Joy ko'rsatilgan — qaysi papka, fayl yoki funksiyadan boshlash kerak. Nima tegilmay qolishi sanab o'tilgan: fayllar, bog'liqliklar, qo'shni modullar.
Klapan bor: chegaradan chiqishga faqat savoldan keyin ruxsat. Tayyorlik mezoni shundayki, model uni o'zi tekshiradi. Vazifa bitta, qolganlari alohida sessiyalarga chiqarilgan.
Promptda rol, choychaqa, tahdid va katta harflar yo'q: tadqiqotlar ularning ta'sirini topmagan. Uzun ma'lumotlar yuqorida, savol ularning ostida. Dalil sifatida buyruq chiqishini ko'rsatish talab qilingan.