सारांश
विज़न मॉडल आपकी फोटो को इंसान की तरह «समझ» नहीं पाता — वह उसे विज़ुअल सबूतों के ग्रिड के रूप में पढ़ता है, इसलिए आपके प्रॉम्प्ट में विषय, क्रिया और कोई भी दिखने वाला टेक्स्ट नाम देना ज़रूरी है ताकि उसका ध्यान निशाना ले सके। और क्योंकि इमेज डिकोड करना शब्दों को डिकोड करने से कई गुना ज़्यादा कंप्यूट जलाता है, हर अटैचमेंट एक असली लागत लेकर आता है जो आपको तभी खर्च करनी चाहिए जब इमेज खुद डेटा हो।
उपमा
एक प्रतिभाशाली विद्वान की कल्पना कीजिए जिसने पूरी ज़िंदगी आँख बंद करके बिताई है।
उसने कभी लिखी गई हर किताब पढ़ी है — चिकित्सा, क़ानून, कला-इतिहास, रसायन — पूरी तरह स्पर्श और टेक्स्ट के ज़रिए। फिर एक दिन पट्टी खुल जाती है। आँखें काम करती हैं। मगर जो नहीं हुआ वह यह: किसी ने उसे ज़िंदगी भर का विज़ुअल अनुभव नहीं थमाया। उसमें यह अंतर्ज्ञान नहीं कि दृश्य में क्या मायने रखता है, कोई प्रतिवर्त नहीं जो कहे «सबसे पहले हर कोई चेहरे को देखता है।» आँखें खुली हैं, मगर वह एक प्रतिभाशाली इंसान है जिसे पता ही नहीं कहाँ देखना है।
तो जब आप उसे अपनी रसोई की फोटो दिखाते हैं और कहते हैं «कुछ विचार?» — तो वह घबराकर सब कुछ पढ़ने लगता है। नल। खिड़की। तीसरी टाइल पर दाग़। विद्वान के पास किसी भी चीज़ की व्याख्या करने का ज्ञान है, मगर इंसानी महत्व-बोध के बिना वह अपनी प्रतिभा पूरे दृश्य पर समान रूप से बाँट देता है। जो जवाब वापस मिलता है वह पूरी तरह देखने वाला और पूरी तरह बिखरा हुआ है।
आपके शब्द वह उंगली हैं जो मायने की चीज़ की ओर इशारा करती है। «तवे के सबसे नीचे लगा स्टिकर — वह कोटिंग के बारे में क्या कहता है?» — और अचानक दुनिया के सबसे पढ़े-लिखे आँखें ठीक उसी चीज़ पर टिक जाती हैं जो आपको चाहिए थी।
एक और बात, जो क़ीमत का राज़ समझाती है: वह पट्टी खुली रखना महँगा है। इमेज पढ़ने में विद्वान को एक वाक्य पढ़ने से सौ गुना मेहनत लगती है। इसलिए आँख खोलकर घूरने का हर मिनट प्रीमियम दर पर बिल बनता है — और आप वह भुगतान करते हैं, चाहे फोटो सबूत हो या सिर्फ़ सजावट।
कैसे काम करता है और लागत (Uzu)
जब आप इमेज अटैच करते हैं, मॉडल उसे पैचों के ग्रिड में काटता है और हर पैच को उसी मुद्रा में बदल देता है जो वह शब्दों के लिए इस्तेमाल करता है: टोकन। एक फोटो आसानी से सैकड़ों टोकन खर्च कर सकती है — इससे पहले कि आपका सवाल पढ़ा भी जाए — और बातचीत की हर चीज़ की तरह, वह कॉन्टेक्स्ट विंडो पर बनी रहती है, उस मेज़ पर जिसे मॉडल हर जवाब से पहले दोबारा पढ़ता है। एक तस्वीर हज़ार शब्दों की क़ीमत की नहीं होती; उस मेज़ पर वह हज़ार शब्दों की जगह घेरती है।
इसीलिए विज़ुअल प्रॉम्प्टिंग की अपनी बनावट है — तीन स्लॉट जो मॉडल के ध्यान को निशाना दिखाते हैं:
| स्लॉट | वह सवाल जिसका जवाब देता है | उदाहरण |
|---|---|---|
| विषय | इमेज की कौन-सी चीज़ की बात है? | «चार्जर पर लगी चेतावनी लेबल» |
| क्रिया | क्या हो रहा है, या इसके साथ क्या करना है? | «अनुवाद करो» / «क्या यह टूटा है?» |
| टेक्स्ट | कौन-से दिखने वाले शब्द मायने रखते हैं? | «SN से शुरू होता सीरियल नंबर पढ़ो» |
विषय नाम दीजिए और मॉडल पूरे ग्रिड पर अपना ध्यान औसत करना बंद कर देता है। क्रिया बताइए — अनुवाद करो, पहचानो, तुलना करो, अनुमान लगाओ — और यह आँखों वाला वन-शॉट प्रॉम्प्ट बन जाता है। दिखने वाले टेक्स्ट की ओर इशारा कीजिए और आप विज़न मॉडल के सबसे तेज़ हुनर का फ़ायदा उठाते हैं: आधुनिक मॉडल इमेज के अंदर का टेक्स्ट लगभग हर और काम से बेहतर पढ़ते हैं।
फिर आता है बिल। उन सैकड़ों इमेज-टोकनों को पढ़ने में असली GPU समय लगता है, इसीलिए Uzu हर अटैच की गई फ़ाइल पर फ़्लैट 10 G-Credits लेता है, क़ीमत उसी क्षण तय होती है जब आप send दबाते हैं। यह स्टोरेज का शुल्क नहीं है — यह बिजली और कंप्यूट की लागत है जो मॉडल घूरने में खर्च करता है। उस क़ीमत में बसा डिज़ाइन-पाठ: इमेज तभी अटैच करें जब इमेज ही डेटा हो। एरर डायलॉग की फोटो डेटा है। किसी पैराग्राफ का स्क्रीनशॉट जिसे आप टेक्स्ट के रूप में पेस्ट कर सकते थे, वह टैक्स वाली सजावट है — वही जवाब, सादे शब्दों की क़ीमत पर। और स्कोप सीमित करने के अनुसार, हर अटैचमेंट पर एक कसा हुआ विज़ुअल सवाल पाँच धुंधलों से बेहतर है: भेजने से पहले विषय, क्रिया और आउटपुट प्रारूप तय करें।
काम का नियम:
एक तस्वीर हज़ार टोकन की क़ीमत की है। सुनिश्चित करें कि मॉडल उन्हें वहीं खर्च करे जहाँ आप अपना ध्यान खर्च करते — और सिर्फ़ उन पिक्सेलों के पैसे दें जो जानकारी ले कर आएं।
पहले और बाद में (प्रॉम्प्ट्स)
उदाहरण 1 — रहस्यमयी वस्तु
[अव्यवस्थित दराज़ की फोटो] यह क्या है?
मॉडल ईमानदारी से दराज़ की सूची बना देता है: केबल, सिक्के, बैटरी, «शायद एक छोटा रिमोट।» उस सूची में कहीं वह चीज़ है जिसका आप मतलब था। शायद।
[वही फोटो] बाएँ ऊपर, बैटरियों के पास वाला छोटा काला डिवाइस पहचानो। बताओ इसका संभावित ब्रांड क्या है और यह किस काम का है, 2 वाक्यों में।
विषय (काला डिवाइस, बाएँ ऊपर), क्रिया (ब्रांड और उद्देश्य पहचानो), प्रारूप (2 वाक्य)। वही फोटो, सर्जिकल जवाब।
उदाहरण 2 — दस्तावेज़
[फ़ॉर्म की फोटो] क्या आप इसे देख सकते हैं?
«देखना» कोई काम नहीं है। मॉडल काग़ज़ का सामान्य सारांश बना देता है — जो ठीक है, सिवाय इसके कि आपको वह एक फ़ील्ड चाहिए थी जो सब कुछ तय करती है।
[वही फोटो] इस कॉन्ट्रैक्ट पेज के ऊपर-दाएँ बॉक्स का सिर्फ़ «Effective Date» फ़ील्ड पढ़ो और बिल्कुल वैसा ही लिखो। अगर पढ़ा न जा सके तो «अपठनीय» कहो — तारीख़ का अंदाज़ा मत लगाओ।
टेक्स्ट-स्लॉट प्रॉम्प्टिंग अपने तीखे रूप में: एक फ़ील्ड, सटीक ट्रांसक्रिप्शन, और एक स्पष्ट no-guessing गार्ड — क्योंकि जो मॉडल अंतराल को बिना झिझक भर देता है, वह बिना-अंदाज़े-वाली क़ानूनी तारीख़ों के लिए ठीक उल्टा औज़ार है।
उदाहरण 3 — सजावट का जाल
[लेख का स्क्रीनशॉट, अटैच किया हुआ] इसका सारांश दो।
आपने अभी-अभी टेक्स्ट के लिए इमेज क़ीमत चुकाई। मॉडल पिक्सेल पढ़ रहा है जो शब्द बनाते हैं — इससे धीमा, महँगा और ग़लती-प्रोन, बजाय इसके कि आप शब्द खुद पेस्ट करते।
[कोई इमेज नहीं] इस लेख का सारांश 3 बुलेट में दो: [पेस्ट किया हुआ टेक्स्ट]
वही जवाब, कंप्यूट का एक छोटा हिस्सा, अटैचमेंट चार्ज ज़ीरो। स्क्रीनशॉट कभी डेटा नहीं था — वह डेटा का कंटेनर था। यह एक आदत — जब टेक्स्ट हो तो पेस्ट करो, जब पिक्सेल हों तो अटैच करो — विज़ुअल प्रॉम्प्टिंग की सबसे बड़ी बचत है।
आम गलतियाँ
- AI से इमेज «महसूस» करने की उम्मीद, पढ़ने की नहीं। विज़न मॉडल आपकी सूरज-डूबने की फोटो का अनुभव नहीं करता; वह ग्रिड से सबूतों की सूची बनाता है। «इससे क्या भावनाएँ जागती हैं?» पूछिए तो आपको परंपराओं का आत्मविश्वासी वर्णन मिलेगा — गर्म रंग, मुस्कुराते चेहरे — कोई महसूस किया हुआ जवाब नहीं। पूछिए इमेज में क्या है, न कि उसे देखना कैसा है।
- सजावट अटैच करना। टेक्स्ट के स्क्रीनशॉट, «संदर्भ के लिए» लोगो, वे फोटो जो आपने पहले ही टाइप कर दिए हैं। हर अटैचमेंट प्रीमियम कंप्यूट है — दो बार खर्चा, अगर जानकारी पहले से शब्दों में थी। सिर्फ़ वही अटैच करें जो सिर्फ़ इमेज ही ले कर आ सकती है।
- धुंधला संकेत — «यह», «वो», «वह हिस्सा»। टेक्स्ट चैट में «वो» आखिरी संदेश की ओर इशारा करता है। इमेज में «वो» सब कुछ की ओर इशारा करता है। संज्ञा और स्थान इस्तेमाल कीजिए: बाईं ओर का डायल, रसीद की दूसरी पंक्ति, सबसे नीचे की लाल तार।
- ज़रूरी पढ़ाई पर no-guessing गार्ड छोड़ना। सीरियल नंबर, तारीख़ें, खुराकें, दाम: अनिश्चितता में विज़न मॉडल अंतराल उसी आसानी से भरता है जैसे कोई और मॉडल। जोड़ दीजिए «बिल्कुल वैसा लिखो; अगर अस्पष्ट हो तो 'अपठनीय' कहो» — हैलुसिनेशन पाठ का वही ईमानदारी-किराए पर लेने वाला चालाकी, अब आँखों के साथ।
- एक इमेज, पाँच सवाल, एक संदेश। «यह क्या है, इसकी क़ीमत क्या है, यह कहाँ का है, असली है क्या, लिस्टिंग लिख दो» — यह ध्यान को पूरे ग्रिड पर पाँच बार पतला कर देता है। एक अटैचमेंट, एक तेज़ सवाल — फिर फ़ॉलो-अप करें; इमेज मेज़ पर बनी रहती है, और फ़ॉलो-अप उन टोकनों पर सवारी करते हैं जिनके पैसे आप दे चुके हैं।
अक्सर पूछे जाने वाले प्रश्न
मैं AI को इमेज के साथ कैसे प्रॉम्प्ट करूँ?
विषय, क्रिया और कोई दिखने वाला टेक्स्ट नाम दीजिए, फिर आउटपुट सीमित कीजिए: «[इमेज में विशिष्ट चीज़] को पहचानो, [इमेज में स्थान] में, [इसके साथ यह करो], जवाब [प्रारूप] में दो।» मॉडल के ध्यान को वैसे निशाना दिखाइए जैसे आप सहकर्मी की आँखें दिखाते — स्टिकर पर, रसोई पर नहीं।
AI को इमेज भेजना ज़्यादा महँगा क्यों पड़ता है?
क्योंकि मॉडल को आपका सवाल प्रोसेस करने से पहले इमेज को विज़ुअल सबूतों के सैकड़ों टोकनों में बदलना पड़ता है — समकक्ष वाक्य से कई गुना ज़्यादा कंप्यूट। Uzu में वह प्रीमियम फ़्लैट 10 G-Credits प्रति फ़ाइल है: घूरने में बीते GPU समय की ईमानदार क़ीमत। टेक्स्ट सस्ता है; पिक्सेल प्रोसेस होते हैं।
क्या AI इमेज के अंदर का टेक्स्ट पढ़ सकता है?
हाँ — और यह विज़न मॉडलों के सबसे मज़बूत हुनरों में से एक है, हस्तलेखन से लेकर सड़क के चिह्नों और फ़ॉर्मों के स्क्रीनशॉट तक। पकड़ यह है: अनिश्चितता में सटीकता। किसी भी ज़रूरी चीज़ (तारीख़ें, सीरियल, खुराकें) के लिए सटीक ट्रांसक्रिप्शन माँगिए और स्पष्ट «अस्पष्ट हो तो अपठनीय कहो» — मॉडल को अंतराल भरने के लिए छोड़ने के बजाय।
अगला पाठ
ध्यान दीजिए इस पूरे पाठ में किसने इशारा किया: आपने। आपने विषय चुना, आपने ध्यान को निशाना दिखाया, आपने सीमाएँ दीं। मगर एक चाल पूरी बातचीत पलट देती है — क्या हो अगर, सवालों के जवाब देने की जगह, AI आपसे पहले सवाल पूछे? मशीन द्वारा आपका इंटरव्यू लेने का एक सस्ता राउंड, आपके दोबारा समझाने के तीन महँगे राउंडों की जगह ले सकता है।
अगला पाठ: «Ask Me First» तकनीक
जाने से पहले का अभ्यास: वह आखिरी फोटो ढूँढिए जो आपने AI को भेजी थी और सवाल तीन तरीकों से दोबारा पूछिए — धुंधला, मध्यम, और सर्जिकल (विषय + क्रिया + टेक्स्ट + प्रारूप)। देखिए जवाब हर एक के साथ तीखा होता है, फिर जाँचिए कि धुंधले संस्करण ने असल में कितना खर्च किया।