오늘도 공부
PixelRAG: PDF와 이미지를 화면 그대로 검색하는 시각 자료용 RAG 본문
1. 개요
PixelRAG는 PDF, 이미지, 웹페이지를 텍스트로 변환하지 않고 화면 이미지 자체를 검색 대상으로 사용하는 시각 자료용 RAG(Retrieval-Augmented Generation) 프로젝트입니다.
일반적인 문서 RAG는 PDF에서 텍스트를 추출한 뒤 문단 단위로 나누어 검색합니다. 반면 PixelRAG는 문서 페이지를 이미지로 저장하고, 비전·언어 임베딩 모델을 이용해 질문과 관련된 페이지를 찾습니다.
이 방식은 다음과 같이 시각적 구조가 중요한 문서에 적합합니다.
- 표와 차트가 많은 보고서
- 그림과 설명이 결합된 교재
- PPT를 변환한 PDF
- 인포그래픽
- 제품 매뉴얼
- 스캔 문서
- 시스템 구성도와 설계 도면
- 웹페이지 UI
PixelRAG는 완성된 문서 채팅 서비스라기보다, 이러한 자료를 검색하기 위한 픽셀 기반 RAG 파이프라인에 가깝습니다.
2. 핵심 처리 구조
PixelRAG의 기본 처리 흐름은 다음과 같습니다.
PDF·이미지·웹페이지 입력
↓
페이지를 스크린샷 또는 이미지 타일로 변환
↓
Qwen3-VL-Embedding-2B로 이미지 임베딩 생성
↓
FAISS 또는 Qdrant에 벡터 저장
↓
사용자 질문을 벡터로 변환
↓
질문과 관련된 페이지 이미지 검색
↓
검색된 이미지를 비전 언어 모델이 분석
↓
답변과 출처 페이지 제공
핵심은 문서를 OCR 텍스트로 변환한 뒤 검색하는 것이 아니라, 문서의 시각적 표현을 유지한 상태에서 검색한다는 점입니다.
3. 일반 문서 RAG와의 차이
구분일반 문서 RAGPixelRAG
| 문서 처리 | PDF에서 텍스트 추출 | PDF를 페이지 이미지로 변환 |
| 검색 단위 | 문장 또는 문단 | 페이지 또는 이미지 타일 |
| 임베딩 대상 | 텍스트 | 이미지와 텍스트의 시각적 의미 |
| 표·차트 처리 | 추출 과정에서 구조가 깨질 수 있음 | 원래 배치와 형태 유지 |
| OCR 의존성 | 높음 | 상대적으로 낮음 |
| 주요 대상 | 텍스트 중심 문서 | 교재·보고서·도면·인포그래픽 |
| 검색 결과 | 관련 텍스트 조각 | 관련 페이지 또는 이미지 영역 |
일반 RAG에서는 표의 행과 열, 이미지와 설명의 위치 관계, 페이지 레이아웃 등이 텍스트 추출 과정에서 사라질 수 있습니다.
PixelRAG는 페이지를 이미지로 다루기 때문에 이러한 시각적 관계를 유지할 수 있습니다.
4. 검색 예시
다음과 같은 PDF가 있다고 가정하겠습니다.
페이지내용
| 1페이지 | 회사 소개 |
| 2페이지 | PixelRAG 시스템 구성도 |
| 3페이지 | 매출 현황 표 |
| 4페이지 | 제품 이미지 |
사용자가 다음과 같이 질문합니다.
PixelRAG 시스템 구조도를 보여줘.
PixelRAG는 OCR로 추출한 문장을 찾는 대신, 질문과 시각적으로 관련된 2페이지 이미지를 검색 결과로 반환할 수 있습니다.
공식 예제에서도 PDF를 인덱싱한 후 다음과 같은 질문으로 구성도가 포함된 페이지를 검색합니다.
Overview of PixelRAG and the diagram
따라서 PixelRAG가 담당하는 핵심 역할은 다음과 같이 정리할 수 있습니다.
사용자의 질문과 가장 관련된 PDF 페이지 또는 이미지 영역을 시각적으로 검색한다.
5. PDF를 업로드하면 바로 질문할 수 있는가
기술적으로 구현할 수 있지만, 질문하기 전에 문서 인덱싱 과정이 필요합니다.
PixelRAG는 사용자가 질문할 때마다 PDF 전체를 처음부터 분석하지 않습니다. 문서를 최초로 등록할 때 페이지별 임베딩을 생성하고, 이후에는 만들어진 벡터 인덱스를 이용해 관련 페이지를 검색합니다.
기본 작업 순서는 다음과 같습니다.
5.1 입력 문서 지정
source:
type: local
path: ./paper.pdf
5.2 이미지 임베딩 모델 지정
embed:
model: Qwen/Qwen3-VL-Embedding-2B
5.3 인덱스 생성
pixelrag index build
5.4 검색 API 실행
pixelrag serve \
--index-dir ./paper_index \
--port 30001
인덱스 생성이 완료되면 애플리케이션은 사용자의 질문을 검색 API로 전달하고, 관련성이 높은 페이지 이미지를 받을 수 있습니다.
공식 README에 기재된 예시 기준으로 샘플 PDF 인덱싱 시간은 다음과 같습니다.
- Apple M 시리즈: 약 3분
- GPU 환경: 약 1분
문서 크기, 페이지 수, 이미지 해상도, 하드웨어 사양에 따라 실제 처리 시간은 달라질 수 있습니다.
6. PixelRAG가 담당하는 범위
PixelRAG의 주요 역할은 관련 이미지 검색입니다.
검색된 페이지를 읽고 자연어 답변을 생성하려면 별도의 비전 언어 모델(VLM)을 연결해야 합니다.
예를 들어 다음 모델을 답변 생성 단계에 사용할 수 있습니다.
- Qwen3-VL
- GPT 비전 지원 모델
- Claude 비전 지원 모델
- 기타 이미지 입력을 지원하는 멀티모달 모델
전체 문서 채팅 시스템에서는 PixelRAG와 답변 생성 모델의 역할이 구분됩니다.
구성 요소담당 역할
| PixelRAG | 질문과 관련된 페이지 또는 이미지 영역 검색 |
| 벡터 데이터베이스 | 이미지 임베딩 저장 및 유사도 검색 |
| 비전 언어 모델 | 검색된 이미지의 내용 분석 |
| LLM | 최종 답변 구성 |
| 프런트엔드 | 파일 업로드, 질문 입력, 답변 및 출처 표시 |
7. 문서 채팅 서비스 구성 예시
ChatPDF와 같은 서비스를 만들려면 PixelRAG 외에 업로드, 작업 관리, 답변 생성, 출처 표시 기능을 추가해야 합니다.
Next.js 파일 업로드 화면
↓
PDF 원본 저장
↓
인덱싱 작업 등록
↓
페이지 이미지 생성
↓
PixelRAG 임베딩 및 인덱스 생성
↓
사용자 질문 입력
↓
관련 페이지 이미지 검색
↓
비전 언어 모델이 페이지 분석
↓
답변과 PDF 페이지 출처 표시
필요한 주요 구성 요소
- 파일 업로드 기능
- 사용자가 PDF나 이미지를 업로드할 수 있어야 합니다.
- 원본 파일 저장소
- 업로드된 문서를 로컬 디스크나 객체 스토리지에 보관합니다.
- 비동기 인덱싱 작업
- 파일 업로드 후 백그라운드 작업으로 페이지 변환과 임베딩 생성을 처리합니다.
- 벡터 데이터베이스
- 소규모 서비스는 FAISS, 다중 사용자 서비스는 Qdrant와 같은 벡터 데이터베이스를 검토할 수 있습니다.
- 검색 API
- 사용자 질문을 받아 관련 페이지와 이미지 영역을 반환합니다.
- 답변 생성 모델
- 검색된 페이지 이미지를 읽고 질문에 맞는 답변을 생성합니다.
- 출처 표시 기능
- 답변과 함께 문서명, 페이지 번호, 원본 페이지 이미지를 표시합니다.
8. 적합한 활용 사례
PixelRAG는 다음과 같은 서비스에 활용할 수 있습니다.
교육 자료 검색
교재의 그림, 문법표, 수학 도형, 과학 실험 이미지가 포함된 페이지를 검색할 수 있습니다.
보고서 분석
매출 그래프, 통계표, 조직도, 비교 차트가 포함된 페이지를 찾아 분석할 수 있습니다.
기술 문서 검색
시스템 구성도, 네트워크 다이어그램, UI 화면, 설치 절차가 포함된 페이지를 검색할 수 있습니다.
스캔 문서 검색
텍스트 추출 품질이 낮은 스캔 문서를 페이지 이미지 상태로 검색할 수 있습니다.
웹페이지 UI 검색
웹페이지를 화면 이미지로 수집한 뒤 특정 메뉴, 버튼, 카드 또는 화면 구성을 검색하는 데 사용할 수 있습니다.
9. 고려해야 할 사항
PixelRAG를 실제 서비스에 적용할 때는 다음 항목을 함께 검토해야 합니다.
- 문서별 인덱싱 시간
- 페이지 이미지 저장 공간
- GPU 또는 Apple Silicon 사용 여부
- 임베딩 모델의 메모리 요구량
- 여러 사용자의 인덱스 분리 방식
- 질문별 검색 결과 수
- 비전 언어 모델 호출 비용
- 답변에 표시할 페이지 출처
- 문서 삭제 시 이미지와 인덱스를 함께 제거하는 절차
- 표와 차트의 수치 정확성 검증
특히 이미지 기반 답변은 검색된 페이지의 내용을 비전 모델이 다시 해석하는 구조이므로, 중요한 수치나 표 데이터는 원본 페이지와 함께 제공하는 것이 좋습니다.
10. 결론
PixelRAG는 PDF나 이미지를 OCR 텍스트로 변환해 검색하는 프로젝트가 아닙니다. 문서의 페이지와 화면 영역을 이미지 상태로 임베딩하고, 사용자 질문과 관련된 시각 자료를 검색하는 프로젝트입니다.
따라서 다음과 같이 이해할 수 있습니다.
PixelRAG는 PDF·이미지·웹페이지의 시각적 구조를 유지하면서, 질문과 관련된 페이지나 이미지 영역을 찾아주는 픽셀 기반 검색 시스템이다.
표, 차트, 교재, 인포그래픽, 시스템 구성도처럼 텍스트만 추출하면 정보 구조가 손실되는 문서에서 특히 활용 가치가 있습니다.
다만 완성형 문서 채팅 서비스를 구축하려면 PixelRAG에 파일 업로드 UI, 문서 저장소, 인덱싱 작업 관리, 비전 언어 모델, 답변 생성 및 출처 표시 기능을 추가해야 합니다.
참고 자료
'AI > 추천 오픈소스' 카테고리의 다른 글
| LLM 추론 엔지니어링 튜토리얼 (0) | 2026.07.29 |
|---|---|
| Unity CLI 에 대해 알아보자 (0) | 2026.07.29 |
| ChatGPT Sites 내부에선 어떻게 돌아갈까? (0) | 2026.07.24 |
| AI가 ‘도구’가 아니라 ‘팀원’이 되는 회사 (Buzz) (0) | 2026.07.22 |
| 파라미터 대신 ‘작업의 지평선’을 확장한 AI 모델 Agents-A1 (0) | 2026.07.21 |
