문서전처리
비정형 문서를
AI가 활용 가능한
데이터 자산으로
OCR과 DLA(문서 레이아웃 분석)를 결합해 문서 속 텍스트·표·수식·구조를 인식하고, 학습·평가·RAG에 바로 쓰이는 구조화 데이터로 전환합니다.
문서 구조까지 이해하는 데이터 전처리
문서를 단순 OCR로 처리하지 않고, 문서 구조와 활용 목적까지 반영해 학습·평가·RAG에 적합한 데이터로 가공합니다.
문서를 목적에 맞는 구조화 데이터로
문서 구조와 활용 목적까지 반영해 학습·평가·RAG에 적합한 형태로 단계별로 가공합니다.
Document Layout Analysis
01 문서 구조 인식
제목·본문·표·그림·페이지 번호 등 문서의 구조 요소를 영역 단위로 인식합니다.
- 문서 레이아웃 보존
OCR & Element Extraction
02 요소 추출
텍스트·표·수식 정보를 추출해 기계가 읽을 수 있는 형태로 변환합니다.
- 비정형 문서의 기계가독성 확보
Purpose-driven Structuring
03 목적별 구조화
JSON·말뭉치·학습·평가·RAG용으로 활용 목적에 맞게 구조화합니다.
- 후속 활용 비용 최소화
문서 수집부터 구조화 · 검수 · 납품까지
수집 → 정제 → 구조화 → 품질관리까지, 하나의 전처리 파이프라인으로 수행합니다.
OCR + DLA 결합 파이프라인
레이아웃 분석으로 제목·본문·표·그림·페이지번호 영역 식별
OCR 기반 텍스트·표·수식 추출
단일 OCR보다 문서 구조 보존에 유리한 통합 전처리
목적별 데이터 구조화
JSON·말뭉치·학습·평가·RAG 데이터로 가공
원문 외 요소·중복·부적합 자료 제거
메타데이터·개체명·빈도·출현 위치 목록화
품질 · 권리 관리 체계
자동 검수와 휴먼 검수를 결합한 다단계 품질관리
샘플링·교차·전수 검수 적용
출처·처리 이력 관리, 계약 기반 원천 확보
서비스 제공방식
고객사의 보안 정책과 문서 반출 가능 여부에 따라 Cloud와 On-Prem 환경을 모두 지원합니다.
두 방식 모두 자체 전처리 도구를 활용해 OCR·DLA·파싱부터 품질 검수까지 동일한 전처리 서비스를 제공합니다.
구축 가능한 데이터 유형
입력 문서 → 문서 요소 → 출력 포맷까지, 목적에 맞는 데이터로 구축합니다.
INPUT
입력 문서
PDF · 스캔 문서
- OCR · 문서 구조화
기사 원문
- 중복·부적합 제거, JSON 말뭉치
전자책 · 도서
- 본문·표·수식 구조화
내부 업무 문서
- RAG · 평가 데이터 변환
ELEMENT
문서 요소
텍스트
- 본문 추출 · 정제
표
- 행·열 구조 유지
수식
- LaTeX 등 표준화
그림 · 캡션
- 원문 외 요소 정제
OUTPUT
출력 포맷
JSON
- 구조화 납품
말뭉치
- 언어자원화
학습 데이터셋
- 모델 학습 활용
평가 데이터셋
- 벤치마크 · 평가
RAG 데이터
- 검색 · 응답 활용
다양한 산업에서 검증된 구축 사례
대규모 문서 수집 · 전처리
- JSON 말뭉치 + 메타 · 개체명 구축
학습자 쓰기 자료 전처리
- 평가 · 분석용 JSON 산출물
GenAI 서비스 평가 데이터
- Query–Context 구조 확보
금융 특화 LLM 벤치마크
- 내부 문서 기반 평가 · 학습
고난도 수식 문서 전처리
- LaTeX 표준화 구조화 데이터셋
Visual Parser 레이아웃 학습
- bbox 기반 구조화 데이터
요소별 분리 · 재연결 전처리
- 학습 · 평가용 JSON 구조
도메인별 맞춤 구축
- 요구사항에 맞춘 전처리 설계
Data-Centric AI AI 성능 개선, 데이터로부터 시작됩니다.
AI 평가 솔루션 기업
AI 성능부터 안전성까지
셀렉트스타는 AI 성능을 좌우하는 고품질 학습 데이터는 물론,
모델 안전성을 검증하기 위한 전문 컨설팅과 자체 개발 자동화 플랫폼을 제공합니다.
국내 최초 AI 신뢰성 검증 자동화 솔루션, 다투모 이밸
누적 2.5억 건 이상 데이터 구축
글로벌 서비스
기업 고객 330+
NeurIPS EMNLP CVPR 등 글로벌 탑 티어 학회 등재