TL;DR
비전 모델은 사람처럼 사진을 '이해'하지 않습니다 —— 시각적 증거의 격자로 읽습니다.그래서 프롬프트는 주의를 조준하기 위해 주제, 행동, 보이는 텍스트를 이름 붙여야 합니다.그리고 이미지 디코딩은 단어 디코딩보다 훨씬 많은 연산을 태우므로, 모든 첨부에는 실제 비용이 따르고, 이미지 자체가 데이터일 때만 지불해야 합니다.
비유
평생 눈을 가리고 살아온 총명한 학자를 상상하세요.
그는 나온 책을 거의 다 읽었습니다 —— 의학, 법률, 미술사, 화학 —— 완전히 촉각과 텍스트를 통해.그러던 어느 날, 가리개가 벗겨집니다.눈은 작동합니다.하지만 일어나지 않은 것이 하나 있습니다:아무도 그에게 평생의 시각 경험을 주지 않았다는 것.장면에서 무엇이 중요한지에 대한 직감도, '모두가 먼저 얼굴을 본다'는 반사신경도 없습니다.눈을 뜬 그는, 어디를 봐야 할지 모르는 천재입니다.
그래서 부엌 사진을 보여주며 *"느낌이 어때?"*라고 하면 —— 그는 당황하며 모든 것을 연구합니다.수도꼭지.창문.세 번째 타일의 얼룩.학자는 무엇이든 해석할 지식이 있지만, 인간의 두드러짐 감각이 없어 천재성을 장면 전체에 균등하게 배분합니다.돌아오는 답은 망라적으로 관찰적이고, 완전히 초점이 흐립니다.
당신의 말은 중요한 것을 가리키는 손가락입니다. "프라이팬 바닥의 스티커 —— 코팅에 대해 뭐라고 적혀 있지?"—— 그러면 갑자기, 세계에서 가장 교육받은 눈이 필요했던 바로 그것에 고정됩니다.
가격표를 설명하는 세부 하나:**그 가리개를 계속 들어올리는 건 비쌉니다.**이미지를 읽는 것은 문장을 읽는 백 배의 노력을 학자에게 요구합니다.그래서 눈 뜨고 응시하는 매 분마다 프리미엄이 청구되고 —— 사진이 증거든 장식이든 당신이 지불합니다.
작동 원리와 비용(Uzu)
이미지를 첨부하면 모델은 그것을 패치 격자로 자르고, 각 패치를 단어와 같은 통화로 변환합니다:토큰입니다.사진 한 장은 질문이 읽히기도 전에 가볍게 수백 토큰이며 —— 대화의 다른 모든 것처럼 컨텍스트 윈도우, 모델이 매 답변 전 다시 읽는 책상에 머뭅니다.이미지는 천 마디의 가치가 있을 뿐 아니라, 그 책상 위에서 천 마디를 점유합니다.
그래서 비주얼 프롬프트에는 자체 해부학이 있습니다 —— 모델의 주의를 조준하는 세 개의 슬롯:
| 슬롯 | 대답하는 질문 | 예시 |
|---|---|---|
| 주제 | 이미지 속 어떤 것에 관한 것인가? | "충전기의 경고 라벨" |
| 행동 | 무엇이 일어나고 있거나 해야 하는가? | "번역해줘" / "손상되었나?" |
| 텍스트 | 어떤 보이는 글자가 중요한가? | "SN으로 시작하는 일련번호를 읽어줘" |
주제를 이름 붙이면 모델이 격자 전체에 주의를 평균화하는 것을 멈춥니다.행동을 주면 —— 번역, 식별, 비교, 추정 —— 눈 달린 원샷 프롬프트가 됩니다.보이는 텍스트를 가리키면 비전 모델의 가장 날카로운 기술을 활용합니다:현대 모델은 이미지 속 텍스트를 다른 거의 모든 것보다 잘 읽습니다.
그리고 청구서.수백 개의 이미지 토큰을 읽는 데는 실제 GPU 시간이 듭니다.그래서 Uzu는 전송 버튼을 누르는 순간 첨부 파일당 10 G-Credits의 정액을 부과합니다.보관 요금이 아니라 —— 모델이 응시하는 데 쓰는 전력과 연산의 비용입니다.이 가격에 구워진 설계 교훈:**이미지가 데이터일 때만 이미지를 첨부하라.**에러 창의 사진은 데이터입니다.텍스트로 붙여넣을 수 있었던 문단의 스크린샷은 세금 붙은 장식입니다 —— 같은 답이 평범한 단어의 가격으로 도착합니다.그리고 범위 제한처럼, 첨부당 날카로운 시각 질문 하나가 모호한 다섯 개를 이깁니다:보내기 전에 주제, 행동, 출력 형식을 제약하세요.
작업 규칙:
**이미지는 천 토큰의 가치.**당신이 자신의 주의를 쓸 곳에 모델이 토큰을 쓰게 하라 —— 정보를 실은 픽셀에만 돈을 지불하라.
변경 전후(프롬프트)
예시 1 —— 정체불명의 물체
[어수선한 서랍 사진] 이게 뭐야?
모델은 성실하게 서랍 목록을 만듭니다:케이블, 동전, 배터리, "작은 리모컨 비슷한 것".그 목록 어딘가에 당신이 의도한 것이 있습니다.아마도.
[같은 사진] 왼쪽 상단, 배터리 옆의 작은 검은 기기를 식별해줘. 유력한 브랜드와 용도를 2문장으로.
주제(검은 기기, 왼쪽 상단), 행동(브랜드와 용도 식별), 형식(2문장).같은 사진, 외과적 답변.
예시 2 —— 문서
[서류 사진] 이거 봐줄래?
"보다"는 작업이 아닙니다.모든 것을 결정하는 그 하나의 필드가 필요했던 게 아니라면 괜찮지만, 모델은 서류를 일반적으로 요약합니다.
[같은 사진] 이 계약서 페이지의 오른쪽 상단 박스에 있는 "발효일" 필드만 읽고 정확히 옮겨 적어줘. 판독 불가능하면 "판독 불가"라고 해 —— 날짜를 지어내지 말고.
텍스트 슬롯 프로프팅의 정점:하나의 필드, 정확한 전사, 그리고 명시적 지어내기 방지 가드 —— 틈을 매끄럽게 메우는 모델은 지어내면 안 되는 법적 날짜에 정확히 잘못된 도구이기 때문입니다.
예시 3 —— 장식의 함정
[기사 스크린샷, 첨부] 이걸 요약해줘.
당신은 방금 텍스트에 이미지 가격을 지불했습니다.모델은 단어를 쓰는 픽셀을 읽습니다 —— 단어 자체를 붙여넣었을 때보다 느리고, 비싸고, 오류가 잦습니다.
[이미지 없이] 이 기사를 3불릿으로 요약해줘:[붙여넣은 텍스트]
동일한 답, 계산량은 극히 일부, 첨부 요금 제로.스크린샷은 결코 데이터가 아니었습니다 —— 데이터의 용기였습니다.이 하나의 습관 —— 텍스트면 붙여넣고, 픽셀이면 첨부하기 —— 가 비주얼 프롬프팅의 최대 절약입니다.
흔한 함정
- **AI가 이미지를 '읽는' 게 아니라 '느끼길' 기대하기.**비전 모델은 당신의 노을 사진을 경험하지 않습니다 —— 격자에서 증거를 목록화합니다. *"어떤 감정을 불러일으키나요?"*라고 물으면 확신에 찬 관습의 묘사가 돌아옵니다 —— 따뜻한 색조, 웃는 얼굴 —— 느낀 반응이 아니라.보는 감각이 아니라 이미지 속에 무엇이 있는지 물으세요.
- **장식 첨부하기.**텍스트 스크린샷, "맥락용" 로고, 이미 입력한 내용을 반복하는 사진.정보가 이미 단어였다면 모든 첨부는 이중으로 지불되는 프리미엄 연산입니다.이미지만 실을 수 있는 것만 첨부하세요.
- **모호한 지시 —— "이거", "그거", "저 부분".**텍스트 채팅에서 "그거"는 마지막 메시지를 가리킵니다.이미지에서 "그거"는 모든 것을 가리킵니다.명사와 위치를 사용하세요:왼쪽 다이얼, 영수증 두 번째 줄, 아래쪽 빨간 케이블.
- **중요한 읽기에서 지어내기 방지 가드 생략하기.**일련번호, 날짜, 용량, 가격:불확실성 아래의 비전 모델은 다른 모델만큼이나 매끄럽게 틈을 메웁니다. *"정확히 옮겨 적어; 불분명하면 '판독 불가'라고 해"*를 추가하세요 —— 환각 레슨의 정직함 대여 트릭, 이번엔 눈을 달고서.
- 이미지 한 장, 질문 다섯 개, 메시지 한 통."이게 뭐고, 얼마고, 어디산이고, 진품이고, 판매 문구 써줘"를 묶으면 주의가 격자 전체에서 다섯 배로 희석됩니다.첨부 하나, 날카로운 질문 하나 —— 그다음 후속 질문을.이미지는 책상에 남고, 후속 질문은 이미 지불한 토큰에 얹힙니다.
FAQ
이미지로 AI에 프롬프트하는 방법은?
주제, 행동, 보이는 텍스트를 이름 붙이고 출력을 제약하세요:"[이미지 속 위치]의 [구체적 것]을 식별하고, [이걸 하고], [형식]으로 답해줘".동료의 눈을 인도하듯 모델의 주의를 인도하세요 —— 부엌이 아니라 스티커로.
AI에 이미지를 보내는 게 더 비싼 이유는?
모델이 질문을 처리하기 전에 이미지를 수백 토큰의 시각적 증거로 변환해야 하기 때문입니다 —— 동등한 문장보다 몇 배의 연산.Uzu에서 이 프리미엄은 파일당 10 G-Credits의 정액입니다:응시에 쓴 GPU 시간의 정직한 가격.텍스트는 싸고, 픽셀은 처리됩니다.
AI는 이미지 속 텍스트를 읽을 수 있나요?
가능합니다 —— 그리고 비전 모델의 최강 기술 중 하나입니다.손글씨부터 표지판, 서류 스크린샷까지.문제는 불확실성 아래의 정확도입니다:중요한 것(날짜, 일련번호, 용량)에 대해서는 모델이 틈을 메우게 두지 말고 정확한 전사와 명시적 "불명확하면 판독 불가라고 말해"를 요구하세요.
다음 레슨
이 레슨 전체를 관통한 것에 주목하세요:당신이 가리켰다는 것.주제를 고르고, 주의를 조준하고, 제약을 공급한 것도 당신입니다.하지만 대화 전체를 뒤집는 한 수가 있습니다 —— AI가 질문에 답하는 대신, 먼저 당신에게 질문하게 하면 어떨까요?기계가 당신을 인터뷰하는 값싼 한 라운드가, 당신이 재설명하는 비싼 세 라운드를 대체할 수 있습니다.
다음 레슨으로: "먼저 물어봐" 기법
떠나기 전 연습:AI에 보낸 마지막 사진을 찾아, 질문을 세 가지 방식으로 다시 해보세요 —— 모호하게, 중간으로, 외과적으로(주제+행동+텍스트+형식).답이 날카로워지는 걸 지켜보고, 모호한 버전이 실제로 얼마나 들었는지 확인하세요.