도구별 실전 가이드 · 공식 정보 확인 2026-08-20
pdfstract Apache-2.0 오픈소스 조건과 시작 절차
작성: gentive · 편집·검수 책임: 신유빈 · 지원 환경: CLI, Web, Self-hosted · 페이지 갱신: · 운영·편집 기준
PDF를 OCR로 추출하고 의미 단위로 나눠 임베딩해 CLI·WebUI·API로 제공하는 RAG용 PDF 추출·청킹·임베딩 계층입니다.
PDF를 OCR로 추출하고 의미 단위로 나눠 임베딩해 CLI·WebUI·API로 제공하는 RAG용 PDF 추출·청킹·임베딩 계층입니다. pdfstract의 첫 실전 과제는 “사내 매뉴얼 한 권을 장·절 경계를 보존한 RAG 청크로 만들기”이며, 이 흐름을 직접 통제할 사람에게 맞습니다.
이럴 때 맞습니다
- “목차·표·머리글이 반복되는 80쪽 비식별 제품 매뉴얼” 같은 입력으로 pdfstract의 핵심 기능을 시험하려는 사람
- 청크마다 원 페이지·절 제목이 있고 문장이 중간에서 잘리지 않으며 검색 질문이 해당 절을 찾는지 기준으로 pdfstract 결과를 직접 검수할 수 있는 경우
- CLI·Web·Self-hosted 환경에서 Apache-2.0 코드를 직접 설치·관리하려는 작업
이럴 때는 멈추세요
- RAG용 PDF 추출·청킹·임베딩 계층 설치·모델 준비·업데이트를 관리하지 않고 즉시 완성된 서비스를 원하는 경우
- 다음 위험을 사람이 확인할 수 없는 작업: 잘못된 청크 경계와 OCR 오자가 임베딩에 고정되고 API를 공개해 원문·벡터 데이터가 노출되는 위험.
참고 시작점
팩트시트 · 작업 근거 확인 필요: 아래 문구는 공식 제품 사실을 정리한 참고 시작점이며, 성공 결과를 보장하는 검증 절차가 아닙니다.
80쪽 매뉴얼의 구조를 먼저 추출한다
목차·장·절·페이지와 반복 머리글이 구분된다.
참고 시작점: 이 매뉴얼의 목차와 장·절 제목을 페이지와 연결하고 반복 머리글은 제거해 줘.
- PDFStract CLI 또는 WebUI에 비식별 manual PDF를 넣는다.
- OCR·data extraction 결과에서 table of contents와 section heading을 찾는다.
- 반복 header·footer와 page number를 본문과 분리한다.
의미 단위로 청크하고 임베딩한다
장·절 경계를 보존한 page-aware RAG chunk가 생긴다.
참고 시작점: 문장을 중간에서 자르지 말고 절 제목과 원 페이지를 metadata로 붙여 chunk해 줘.
- semantic chunking에서 section boundary를 우선 분할 기준으로 둔다.
- 각 chunk에 source page·section title·document ID를 metadata로 붙인다.
- embedding 전에 OCR 오자와 깨진 table text를 대표 구간에서 교정한다.
검색 적중과 API 노출을 시험한다
근거 절을 찾는 검색과 보호된 RAG API가 남는다.
참고 시작점: 대표 질문이 해당 절 chunk를 찾는지와 반환 metadata·API 공개 범위를 확인해 줘.
- manual의 서로 다른 세 절에 대한 retrieval question을 실행한다.
- 검색 결과가 올바른 section·page를 반환하고 문장이 잘리지 않았는지 본다.
- WebUI·API를 localhost에 제한하고 원문·vector endpoint에 인증을 적용한다.
무료 조건과 주의점
Apache-2.0 오픈소스 소프트웨어는 횟수 제한 없이 실행 가능. 연결한 모델 API·서버·GPU 비용은 별도
Apache-2.0 오픈소스 소프트웨어는 횟수 제한 없이 실행 가능. 연결한 모델 API·서버·GPU 비용은 별도
Apache-2.0 저장소 코드는 상업적으로 사용할 수 있지만, 모델 가중치·입력 자료·생성물·번들 자산의 권리는 각각 따로 확인해야 합니다.
잘못된 청크 경계와 OCR 오자가 임베딩에 고정되고 API를 공개해 원문·벡터 데이터가 노출되는 위험.
공식 근거와 확인일
| 확인 항목 | 확인한 내용 | 공식 출처·확인일 |
|---|---|---|
| 제품 정보 | PDF를 OCR로 추출하고 의미 단위로 나눠 임베딩해 CLI·WebUI·API로 제공하는 RAG용 PDF 추출·청킹·임베딩 계층입니다. | pdfstract 공식 사이트 |
| 무료 조건 | Apache-2.0 오픈소스 소프트웨어는 횟수 제한 없이 실행 가능. 연결한 모델 API·서버·GPU 비용은 별도 | 공식 무료 정책·요금 안내 |
| 공식 코드 라이선스 | 오픈소스 코드의 사용·수정·재배포 조건 | 공식 코드 라이선스 |
| 공식 제품 페이지 | PDF를 OCR로 추출하고 의미 단위로 나눠 임베딩해 CLI·WebUI·API로 제공하는 RAG용 PDF 추출·청킹·임베딩 계층입니다. | 공식 제품 페이지 |