도구별 실전 가이드 · 공식 정보 확인 2026-08-20

pdfstract Apache-2.0 오픈소스 조건과 시작 절차

작성: gentive · 편집·검수 책임: 신유빈 · 지원 환경: CLI, Web, Self-hosted · 페이지 갱신: · 운영·편집 기준

PDF를 OCR로 추출하고 의미 단위로 나눠 임베딩해 CLI·WebUI·API로 제공하는 RAG용 PDF 추출·청킹·임베딩 계층입니다.

PDF를 OCR로 추출하고 의미 단위로 나눠 임베딩해 CLI·WebUI·API로 제공하는 RAG용 PDF 추출·청킹·임베딩 계층입니다. pdfstract의 첫 실전 과제는 “사내 매뉴얼 한 권을 장·절 경계를 보존한 RAG 청크로 만들기”이며, 이 흐름을 직접 통제할 사람에게 맞습니다.

이럴 때 맞습니다

  • “목차·표·머리글이 반복되는 80쪽 비식별 제품 매뉴얼” 같은 입력으로 pdfstract의 핵심 기능을 시험하려는 사람
  • 청크마다 원 페이지·절 제목이 있고 문장이 중간에서 잘리지 않으며 검색 질문이 해당 절을 찾는지 기준으로 pdfstract 결과를 직접 검수할 수 있는 경우
  • CLI·Web·Self-hosted 환경에서 Apache-2.0 코드를 직접 설치·관리하려는 작업

이럴 때는 멈추세요

  • RAG용 PDF 추출·청킹·임베딩 계층 설치·모델 준비·업데이트를 관리하지 않고 즉시 완성된 서비스를 원하는 경우
  • 다음 위험을 사람이 확인할 수 없는 작업: 잘못된 청크 경계와 OCR 오자가 임베딩에 고정되고 API를 공개해 원문·벡터 데이터가 노출되는 위험.

참고 시작점

팩트시트 · 작업 근거 확인 필요: 아래 문구는 공식 제품 사실을 정리한 참고 시작점이며, 성공 결과를 보장하는 검증 절차가 아닙니다.

80쪽 매뉴얼의 구조를 먼저 추출한다

목차·장·절·페이지와 반복 머리글이 구분된다.

참고 시작점: 이 매뉴얼의 목차와 장·절 제목을 페이지와 연결하고 반복 머리글은 제거해 줘.

  1. PDFStract CLI 또는 WebUI에 비식별 manual PDF를 넣는다.
  2. OCR·data extraction 결과에서 table of contents와 section heading을 찾는다.
  3. 반복 header·footer와 page number를 본문과 분리한다.

의미 단위로 청크하고 임베딩한다

장·절 경계를 보존한 page-aware RAG chunk가 생긴다.

참고 시작점: 문장을 중간에서 자르지 말고 절 제목과 원 페이지를 metadata로 붙여 chunk해 줘.

  1. semantic chunking에서 section boundary를 우선 분할 기준으로 둔다.
  2. 각 chunk에 source page·section title·document ID를 metadata로 붙인다.
  3. embedding 전에 OCR 오자와 깨진 table text를 대표 구간에서 교정한다.

검색 적중과 API 노출을 시험한다

근거 절을 찾는 검색과 보호된 RAG API가 남는다.

참고 시작점: 대표 질문이 해당 절 chunk를 찾는지와 반환 metadata·API 공개 범위를 확인해 줘.

  1. manual의 서로 다른 세 절에 대한 retrieval question을 실행한다.
  2. 검색 결과가 올바른 section·page를 반환하고 문장이 잘리지 않았는지 본다.
  3. WebUI·API를 localhost에 제한하고 원문·vector endpoint에 인증을 적용한다.

무료 조건과 주의점

Apache-2.0 오픈소스 소프트웨어는 횟수 제한 없이 실행 가능. 연결한 모델 API·서버·GPU 비용은 별도

Apache-2.0 오픈소스 소프트웨어는 횟수 제한 없이 실행 가능. 연결한 모델 API·서버·GPU 비용은 별도

Apache-2.0 저장소 코드는 상업적으로 사용할 수 있지만, 모델 가중치·입력 자료·생성물·번들 자산의 권리는 각각 따로 확인해야 합니다.

잘못된 청크 경계와 OCR 오자가 임베딩에 고정되고 API를 공개해 원문·벡터 데이터가 노출되는 위험.

공식 근거와 확인일

pdfstract 가이드의 주장별 공식 출처
확인 항목확인한 내용공식 출처·확인일
제품 정보PDF를 OCR로 추출하고 의미 단위로 나눠 임베딩해 CLI·WebUI·API로 제공하는 RAG용 PDF 추출·청킹·임베딩 계층입니다.pdfstract 공식 사이트
무료 조건Apache-2.0 오픈소스 소프트웨어는 횟수 제한 없이 실행 가능. 연결한 모델 API·서버·GPU 비용은 별도공식 무료 정책·요금 안내
공식 코드 라이선스오픈소스 코드의 사용·수정·재배포 조건공식 코드 라이선스
공식 제품 페이지PDF를 OCR로 추출하고 의미 단위로 나눠 임베딩해 CLI·WebUI·API로 제공하는 RAG용 PDF 추출·청킹·임베딩 계층입니다.공식 제품 페이지