सारांश

विज़न मॉडल आपकी फोटो को इंसान की तरह «समझ» नहीं पाता — वह उसे विज़ुअल सबूतों के ग्रिड के रूप में पढ़ता है, इसलिए आपके प्रॉम्प्ट में विषय, क्रिया और कोई भी दिखने वाला टेक्स्ट नाम देना ज़रूरी है ताकि उसका ध्यान निशाना ले सके। और क्योंकि इमेज डिकोड करना शब्दों को डिकोड करने से कई गुना ज़्यादा कंप्यूट जलाता है, हर अटैचमेंट एक असली लागत लेकर आता है जो आपको तभी खर्च करनी चाहिए जब इमेज खुद डेटा हो।

उपमा

एक प्रतिभाशाली विद्वान की कल्पना कीजिए जिसने पूरी ज़िंदगी आँख बंद करके बिताई है।

उसने कभी लिखी गई हर किताब पढ़ी है — चिकित्सा, क़ानून, कला-इतिहास, रसायन — पूरी तरह स्पर्श और टेक्स्ट के ज़रिए। फिर एक दिन पट्टी खुल जाती है। आँखें काम करती हैं। मगर जो नहीं हुआ वह यह: किसी ने उसे ज़िंदगी भर का विज़ुअल अनुभव नहीं थमाया। उसमें यह अंतर्ज्ञान नहीं कि दृश्य में क्या मायने रखता है, कोई प्रतिवर्त नहीं जो कहे «सबसे पहले हर कोई चेहरे को देखता है।» आँखें खुली हैं, मगर वह एक प्रतिभाशाली इंसान है जिसे पता ही नहीं कहाँ देखना है।

तो जब आप उसे अपनी रसोई की फोटो दिखाते हैं और कहते हैं «कुछ विचार?» — तो वह घबराकर सब कुछ पढ़ने लगता है। नल। खिड़की। तीसरी टाइल पर दाग़। विद्वान के पास किसी भी चीज़ की व्याख्या करने का ज्ञान है, मगर इंसानी महत्व-बोध के बिना वह अपनी प्रतिभा पूरे दृश्य पर समान रूप से बाँट देता है। जो जवाब वापस मिलता है वह पूरी तरह देखने वाला और पूरी तरह बिखरा हुआ है।

आपके शब्द वह उंगली हैं जो मायने की चीज़ की ओर इशारा करती है। «तवे के सबसे नीचे लगा स्टिकर — वह कोटिंग के बारे में क्या कहता है?» — और अचानक दुनिया के सबसे पढ़े-लिखे आँखें ठीक उसी चीज़ पर टिक जाती हैं जो आपको चाहिए थी।

एक और बात, जो क़ीमत का राज़ समझाती है: वह पट्टी खुली रखना महँगा है। इमेज पढ़ने में विद्वान को एक वाक्य पढ़ने से सौ गुना मेहनत लगती है। इसलिए आँख खोलकर घूरने का हर मिनट प्रीमियम दर पर बिल बनता है — और आप वह भुगतान करते हैं, चाहे फोटो सबूत हो या सिर्फ़ सजावट।

कैसे काम करता है और लागत (Uzu)

जब आप इमेज अटैच करते हैं, मॉडल उसे पैचों के ग्रिड में काटता है और हर पैच को उसी मुद्रा में बदल देता है जो वह शब्दों के लिए इस्तेमाल करता है: टोकन। एक फोटो आसानी से सैकड़ों टोकन खर्च कर सकती है — इससे पहले कि आपका सवाल पढ़ा भी जाए — और बातचीत की हर चीज़ की तरह, वह कॉन्टेक्स्ट विंडो पर बनी रहती है, उस मेज़ पर जिसे मॉडल हर जवाब से पहले दोबारा पढ़ता है। एक तस्वीर हज़ार शब्दों की क़ीमत की नहीं होती; उस मेज़ पर वह हज़ार शब्दों की जगह घेरती है।

इसीलिए विज़ुअल प्रॉम्प्टिंग की अपनी बनावट है — तीन स्लॉट जो मॉडल के ध्यान को निशाना दिखाते हैं:

स्लॉटवह सवाल जिसका जवाब देता हैउदाहरण
विषयइमेज की कौन-सी चीज़ की बात है?«चार्जर पर लगी चेतावनी लेबल»
क्रियाक्या हो रहा है, या इसके साथ क्या करना है?«अनुवाद करो» / «क्या यह टूटा है?»
टेक्स्टकौन-से दिखने वाले शब्द मायने रखते हैं?«SN से शुरू होता सीरियल नंबर पढ़ो»

विषय नाम दीजिए और मॉडल पूरे ग्रिड पर अपना ध्यान औसत करना बंद कर देता है। क्रिया बताइए — अनुवाद करो, पहचानो, तुलना करो, अनुमान लगाओ — और यह आँखों वाला वन-शॉट प्रॉम्प्ट बन जाता है। दिखने वाले टेक्स्ट की ओर इशारा कीजिए और आप विज़न मॉडल के सबसे तेज़ हुनर का फ़ायदा उठाते हैं: आधुनिक मॉडल इमेज के अंदर का टेक्स्ट लगभग हर और काम से बेहतर पढ़ते हैं।

फिर आता है बिल। उन सैकड़ों इमेज-टोकनों को पढ़ने में असली GPU समय लगता है, इसीलिए Uzu हर अटैच की गई फ़ाइल पर फ़्लैट 10 G-Credits लेता है, क़ीमत उसी क्षण तय होती है जब आप send दबाते हैं। यह स्टोरेज का शुल्क नहीं है — यह बिजली और कंप्यूट की लागत है जो मॉडल घूरने में खर्च करता है। उस क़ीमत में बसा डिज़ाइन-पाठ: इमेज तभी अटैच करें जब इमेज ही डेटा हो। एरर डायलॉग की फोटो डेटा है। किसी पैराग्राफ का स्क्रीनशॉट जिसे आप टेक्स्ट के रूप में पेस्ट कर सकते थे, वह टैक्स वाली सजावट है — वही जवाब, सादे शब्दों की क़ीमत पर। और स्कोप सीमित करने के अनुसार, हर अटैचमेंट पर एक कसा हुआ विज़ुअल सवाल पाँच धुंधलों से बेहतर है: भेजने से पहले विषय, क्रिया और आउटपुट प्रारूप तय करें।

काम का नियम:

एक तस्वीर हज़ार टोकन की क़ीमत की है। सुनिश्चित करें कि मॉडल उन्हें वहीं खर्च करे जहाँ आप अपना ध्यान खर्च करते — और सिर्फ़ उन पिक्सेलों के पैसे दें जो जानकारी ले कर आएं।

पहले और बाद में (प्रॉम्प्ट्स)

उदाहरण 1 — रहस्यमयी वस्तु

[अव्यवस्थित दराज़ की फोटो] यह क्या है?

मॉडल ईमानदारी से दराज़ की सूची बना देता है: केबल, सिक्के, बैटरी, «शायद एक छोटा रिमोट।» उस सूची में कहीं वह चीज़ है जिसका आप मतलब था। शायद।

[वही फोटो] बाएँ ऊपर, बैटरियों के पास वाला छोटा काला डिवाइस पहचानो। बताओ इसका संभावित ब्रांड क्या है और यह किस काम का है, 2 वाक्यों में।

विषय (काला डिवाइस, बाएँ ऊपर), क्रिया (ब्रांड और उद्देश्य पहचानो), प्रारूप (2 वाक्य)। वही फोटो, सर्जिकल जवाब।

उदाहरण 2 — दस्तावेज़

[फ़ॉर्म की फोटो] क्या आप इसे देख सकते हैं?

«देखना» कोई काम नहीं है। मॉडल काग़ज़ का सामान्य सारांश बना देता है — जो ठीक है, सिवाय इसके कि आपको वह एक फ़ील्ड चाहिए थी जो सब कुछ तय करती है।

[वही फोटो] इस कॉन्ट्रैक्ट पेज के ऊपर-दाएँ बॉक्स का सिर्फ़ «Effective Date» फ़ील्ड पढ़ो और बिल्कुल वैसा ही लिखो। अगर पढ़ा न जा सके तो «अपठनीय» कहो — तारीख़ का अंदाज़ा मत लगाओ।

टेक्स्ट-स्लॉट प्रॉम्प्टिंग अपने तीखे रूप में: एक फ़ील्ड, सटीक ट्रांसक्रिप्शन, और एक स्पष्ट no-guessing गार्ड — क्योंकि जो मॉडल अंतराल को बिना झिझक भर देता है, वह बिना-अंदाज़े-वाली क़ानूनी तारीख़ों के लिए ठीक उल्टा औज़ार है।

उदाहरण 3 — सजावट का जाल

[लेख का स्क्रीनशॉट, अटैच किया हुआ] इसका सारांश दो।

आपने अभी-अभी टेक्स्ट के लिए इमेज क़ीमत चुकाई। मॉडल पिक्सेल पढ़ रहा है जो शब्द बनाते हैं — इससे धीमा, महँगा और ग़लती-प्रोन, बजाय इसके कि आप शब्द खुद पेस्ट करते।

[कोई इमेज नहीं] इस लेख का सारांश 3 बुलेट में दो: [पेस्ट किया हुआ टेक्स्ट]

वही जवाब, कंप्यूट का एक छोटा हिस्सा, अटैचमेंट चार्ज ज़ीरो। स्क्रीनशॉट कभी डेटा नहीं था — वह डेटा का कंटेनर था। यह एक आदत — जब टेक्स्ट हो तो पेस्ट करो, जब पिक्सेल हों तो अटैच करो — विज़ुअल प्रॉम्प्टिंग की सबसे बड़ी बचत है।

आम गलतियाँ

  1. AI से इमेज «महसूस» करने की उम्मीद, पढ़ने की नहीं। विज़न मॉडल आपकी सूरज-डूबने की फोटो का अनुभव नहीं करता; वह ग्रिड से सबूतों की सूची बनाता है। «इससे क्या भावनाएँ जागती हैं?» पूछिए तो आपको परंपराओं का आत्मविश्वासी वर्णन मिलेगा — गर्म रंग, मुस्कुराते चेहरे — कोई महसूस किया हुआ जवाब नहीं। पूछिए इमेज में क्या है, न कि उसे देखना कैसा है
  2. सजावट अटैच करना। टेक्स्ट के स्क्रीनशॉट, «संदर्भ के लिए» लोगो, वे फोटो जो आपने पहले ही टाइप कर दिए हैं। हर अटैचमेंट प्रीमियम कंप्यूट है — दो बार खर्चा, अगर जानकारी पहले से शब्दों में थी। सिर्फ़ वही अटैच करें जो सिर्फ़ इमेज ही ले कर आ सकती है।
  3. धुंधला संकेत — «यह», «वो», «वह हिस्सा»। टेक्स्ट चैट में «वो» आखिरी संदेश की ओर इशारा करता है। इमेज में «वो» सब कुछ की ओर इशारा करता है। संज्ञा और स्थान इस्तेमाल कीजिए: बाईं ओर का डायल, रसीद की दूसरी पंक्ति, सबसे नीचे की लाल तार
  4. ज़रूरी पढ़ाई पर no-guessing गार्ड छोड़ना। सीरियल नंबर, तारीख़ें, खुराकें, दाम: अनिश्चितता में विज़न मॉडल अंतराल उसी आसानी से भरता है जैसे कोई और मॉडल। जोड़ दीजिए «बिल्कुल वैसा लिखो; अगर अस्पष्ट हो तो 'अपठनीय' कहो»हैलुसिनेशन पाठ का वही ईमानदारी-किराए पर लेने वाला चालाकी, अब आँखों के साथ।
  5. एक इमेज, पाँच सवाल, एक संदेश। «यह क्या है, इसकी क़ीमत क्या है, यह कहाँ का है, असली है क्या, लिस्टिंग लिख दो» — यह ध्यान को पूरे ग्रिड पर पाँच बार पतला कर देता है। एक अटैचमेंट, एक तेज़ सवाल — फिर फ़ॉलो-अप करें; इमेज मेज़ पर बनी रहती है, और फ़ॉलो-अप उन टोकनों पर सवारी करते हैं जिनके पैसे आप दे चुके हैं।

अक्सर पूछे जाने वाले प्रश्न

मैं AI को इमेज के साथ कैसे प्रॉम्प्ट करूँ?

विषय, क्रिया और कोई दिखने वाला टेक्स्ट नाम दीजिए, फिर आउटपुट सीमित कीजिए: «[इमेज में विशिष्ट चीज़] को पहचानो, [इमेज में स्थान] में, [इसके साथ यह करो], जवाब [प्रारूप] में दो।» मॉडल के ध्यान को वैसे निशाना दिखाइए जैसे आप सहकर्मी की आँखें दिखाते — स्टिकर पर, रसोई पर नहीं।

AI को इमेज भेजना ज़्यादा महँगा क्यों पड़ता है?

क्योंकि मॉडल को आपका सवाल प्रोसेस करने से पहले इमेज को विज़ुअल सबूतों के सैकड़ों टोकनों में बदलना पड़ता है — समकक्ष वाक्य से कई गुना ज़्यादा कंप्यूट। Uzu में वह प्रीमियम फ़्लैट 10 G-Credits प्रति फ़ाइल है: घूरने में बीते GPU समय की ईमानदार क़ीमत। टेक्स्ट सस्ता है; पिक्सेल प्रोसेस होते हैं।

क्या AI इमेज के अंदर का टेक्स्ट पढ़ सकता है?

हाँ — और यह विज़न मॉडलों के सबसे मज़बूत हुनरों में से एक है, हस्तलेखन से लेकर सड़क के चिह्नों और फ़ॉर्मों के स्क्रीनशॉट तक। पकड़ यह है: अनिश्चितता में सटीकता। किसी भी ज़रूरी चीज़ (तारीख़ें, सीरियल, खुराकें) के लिए सटीक ट्रांसक्रिप्शन माँगिए और स्पष्ट «अस्पष्ट हो तो अपठनीय कहो» — मॉडल को अंतराल भरने के लिए छोड़ने के बजाय।

अगला पाठ

ध्यान दीजिए इस पूरे पाठ में किसने इशारा किया: आपने। आपने विषय चुना, आपने ध्यान को निशाना दिखाया, आपने सीमाएँ दीं। मगर एक चाल पूरी बातचीत पलट देती है — क्या हो अगर, सवालों के जवाब देने की जगह, AI आपसे पहले सवाल पूछे? मशीन द्वारा आपका इंटरव्यू लेने का एक सस्ता राउंड, आपके दोबारा समझाने के तीन महँगे राउंडों की जगह ले सकता है।

अगला पाठ: «Ask Me First» तकनीक

जाने से पहले का अभ्यास: वह आखिरी फोटो ढूँढिए जो आपने AI को भेजी थी और सवाल तीन तरीकों से दोबारा पूछिए — धुंधला, मध्यम, और सर्जिकल (विषय + क्रिया + टेक्स्ट + प्रारूप)। देखिए जवाब हर एक के साथ तीखा होता है, फिर जाँचिए कि धुंधले संस्करण ने असल में कितना खर्च किया।