미디어 입력
멀티모달 프롬프트
Multimodal prompt
뜻
텍스트와 이미지, 문서, 음성, 동영상 같은 하나 이상의 미디어 유형을 결합한 요청입니다.
언제 쓰나
여러 데이터 형식에 표현된 정보를 함께 사용해야 하는 작업에 적용합니다.
활용 예시
차트 이미지와 작성된 예측을 비교하고, 뒷받침되는 주장과 상충되는 주장을 식별합니다.Generative AI Engineering
텍스트와 이미지, 문서, 음성, 동영상을 결합하는 AI 요청의 구조화, 근거 연결, 비교, 검증 용어를 설명합니다.
17 개 용어
미디어 입력
Multimodal prompt
텍스트와 이미지, 문서, 음성, 동영상 같은 하나 이상의 미디어 유형을 결합한 요청입니다.
여러 데이터 형식에 표현된 정보를 함께 사용해야 하는 작업에 적용합니다.
차트 이미지와 작성된 예측을 비교하고, 뒷받침되는 주장과 상충되는 주장을 식별합니다.미디어 입력
Image input
모델 분석을 위해 제공하는 사진, 스크린샷, 스캔, 도표 등의 이미지입니다.
모델이 확인할 구체적인 시각 요소나 영역을 지정합니다.
첨부된 스크린샷에서 오류 배너만 읽고, 해당 코드와 메시지를 나열합니다.미디어 입력
Document input
텍스트와 시각적 구조를 함께 가진 PDF, 프레젠테이션, 보고서 등의 파일 입력입니다.
페이지, 절, 표, 각주 위치를 보존해야 하는지 명시합니다.
계약에서 결제 조건을 추출하고, 각 항목에 대해 페이지와 섹션을 명시합니다.미디어 입력
Audio input
전사나 분석을 위해 제공하는 음성, 음악, 환경음 등의 녹음 입력입니다.
전사 전에 언어, 화자 구분, 타임스탬프, 불확실성 표시 조건을 정합니다.
한국어 회의 내용을 받아 적고, 화자를 구별할 수 있는 경우 화자를 표시하며, 각 결정 사항에 타임스탬프를 추가합니다.미디어 입력
Video input
음성, 텍스트, 움직임, 장면 변화를 함께 포함할 수 있는 시간 기반 시각 입력입니다.
시간 근거를 요청하고 보이는 내용, 들리는 내용, 추론한 내용을 구분합니다.
각 장면 전환 시, 타임스탬프, 보이는 동작 및 발언된 주장을 제공합니다.프롬프트 구조
Interleaved input
지시나 표지가 관련 항목 가까이에 있도록 텍스트와 미디어를 번갈아 배치한 입력입니다.
여러 미디어 비교, 단계별 예시, 복수 자료 요청에 사용합니다.
Image A -> its question -> Image B -> its question -> final comparison criteria프롬프트 구조
Modality ordering
텍스트, 이미지, 문서, 음성, 동영상 요소를 제시하는 순서입니다.
관련 지시를 미디어 가까이에 두고 중요한 작업은 다른 순서도 시험합니다.
이미지를 먼저 제공하고, 추출 지침을 제공한 다음, 출력 스키마를 제공합니다.프롬프트 구조
Image detail and resolution
작은 글자, 물체, 공간 관계를 읽을 수 있도록 제공되는 시각 정보의 세부 수준입니다.
미세한 정보가 중요하면 충분한 해상도를 사용하고 관련 영역을 잘라 제공합니다.
높은 해상도는 처리 비용을 늘릴 수 있으며 원본에 없는 세부 정보를 복원하지는 못합니다.
전체 장치의 원거리 사진 대신, 시리얼 라벨의 확대 사진을 첨부합니다.근거 연결
Visual grounding
설명이나 추출 결과를 이미지 또는 동영상에서 관찰 가능한 내용과 연결하는 방식입니다.
사용자가 결론의 근거 위치를 확인해야 할 때 요구합니다.
각 결함에 대해, 보이는 증거를 설명하고 대략적인 위치를 식별합니다.근거 연결
Region reference and bounding box
이미지의 특정 영역을 텍스트, 좌표, 사각형으로 가리키는 참조 방식입니다.
반복되는 물체를 구분하고 후속 검토나 주석을 지원할 때 사용합니다.
좌표 형식과 정확도는 모델과 API마다 다르므로 자동화 전에 검증해야 합니다.
감지된 각 레이블에 대해 정규화된 [x_min, y_min, x_max, y_max] 박스를 반환합니다.근거 연결
Temporal reference and timestamp
음성이나 동영상에서 사건이 발생하는 시점 또는 구간을 나타내는 참조입니다.
장면 분석, 근거 검토, 편집, 전사 정렬에 사용합니다.
안전 사고를 시작 시간, 종료 시간, 관찰된 동작 및 신뢰도와 함께 기록합니다.분석 작업
OCR instruction
이미지나 스캔 문서에 보이는 글자를 탐지하고 옮겨 적도록 하는 요청입니다.
언어, 레이아웃 유지, 판독 불가 처리, 정규화 허용 여부를 지정합니다.
영수증 내용을 한 줄씩 받아 적고, 누락된 문자를 추측하는 대신 "[illegible]"을 사용합니다.분석 작업
Chart and table interpretation
시각화되거나 표 형태인 데이터에서 값, 표지, 추세, 관계를 읽는 작업입니다.
직접 읽은 값과 계산하거나 추론한 결론을 구분하도록 요청합니다.
먼저 범례와 축 단위를 추출한 다음, 가장 큰 전년 대비 변화를 보고합니다.분석 작업
Multi-image comparison
둘 이상의 이미지에서 유사점, 차이점, 변화를 분석하는 작업입니다.
각 이미지에 표지를 붙이고 결론을 요청하기 전에 비교 기준을 정합니다.
레이아웃, 보이는 텍스트, 누락된 컨트롤 및 색상 변경 사항만 비교하기 위해 이미지 A와 이미지 B를 비교합니다.분석 작업
Cross-modal reasoning
서로 다른 데이터 형식의 근거를 결합해 질문에 답하거나 결론을 내리는 과정입니다.
어느 한 형식만으로는 완전한 답을 얻을 수 없을 때 사용합니다.
음성 금액, 송장 이미지 및 정책 텍스트를 사용하여 불일치를 식별합니다.근거 연결
Multimodal evidence reference
답변을 뒷받침하는 페이지, 영역, 프레임, 타임스탬프를 가리키는 인용형 참조입니다.
검토 가능한 출력에 근거 참조를 요구하고 이후 워크플로에서도 보존합니다.
주장: 총액은 48.20입니다. 증거: 1페이지, 하단 오른쪽 총액 행; 신뢰도: 높음.신뢰성
Unsupported visual inference
제공된 미디어에서 보이거나 들리는 근거의 범위를 넘어선 결론입니다.
불확실성을 표시하고 확인할 수 없는 속성은 판단할 수 없다고 말하도록 지시합니다.
외관만으로 민감한 특성, 신원, 의도, 의학적 상태를 추론하지 마세요.
눈에 보이는 손상만 보고하고, 미디어가 직접적으로 보여주는 경우에만 원인을 추론하지 않습니다.| 멀티모달 프롬프트 설계 | AI 미디어 생성 프롬프트 |
|---|---|
| 이미지, 문서, 음성, 동영상을 이해·분석 입력으로 제공 | 생성할 이미지, 동영상, 음성, 음악, 효과를 설명 |
| 근거, 영역, 시간, 추출, 비교, 불확실성에 집중 | 피사체, 구도, 카메라, 움직임, 스타일, 사운드, 제외 조건에 집중 |
텍스트만으로 이미지를 생성하는 요청은 보통 미디어 생성 프롬프트입니다. 이미지나 다른 미디어를 분석·비교·편집·가이드 입력으로 함께 제공하면 멀티모달 프롬프트가 됩니다.
직접 관찰한 근거와 계산·추론을 구분하고 페이지, 영역, 프레임, 타임스탬프를 표시하며 미디어가 결론을 뒷받침하지 않으면 그렇게 밝히도록 요청합니다.
위험이 낮은 보조 업무에는 자동 검사를 적용할 수 있지만 중요한 결정에는 원본 품질, 추출 정확도, 근거 없는 추론, 민감 특성 처리, 모델별 한계를 검증해야 합니다.
텍스트와 이미지·동영상 입력 결합, 요소 순서, 문제 해결, 출력 제어를 설명하는 공식 문서입니다.
프롬프트 내용, 구조, 예시, 출력 형식, 반복 개선, 평가를 설명하는 공식 개요입니다.
미디어 입력을 추가하기 전에 역할, 지시문, 예시, 제약, 출력 스키마를 확인합니다.
대규모 문서, 음성, 동영상, 기록, 보조 근거를 배분하고 조립합니다.
이미지를 분석하는 것이 아니라 생성하는 목적이라면 이 별도 가이드를 확인합니다.
카메라, 움직임, 시간, 연속성, 동영상 생성 제약은 이 별도 가이드를 확인합니다.