문서전처리
대규모 영문 기술문서 RAG 데이터 구축 사례
고객
분야
대상 문서
고객
분야
대상 문서
약 250종 · 4만 페이지 영문 기술문서를 RAG용 구조화 데이터로 전환
약 250종 · 4만 페이지 영문 기술문서를 RAG용 구조화 데이터로 전환
RAG
문서전처리
문서구조화
LaTeX
HTML
JSON
수식전처리
표구조화
프로젝트 개요
대규모 기술문서의 RAG 데이터화
약 250종·4만 페이지의 영문 기술문서를 정제해 RAG용 구조화 데이터로 전환
복합 문서 구조를 반영한 전처리
텍스트·이미지·수식·표 등 요소별 특성에 맞게 가공해 원문의 정보 구조를 보존
수식·표까지 포함한 JSON 구조화
수식·표를 LaTeX·HTML로 변환하고 위치 태그를 부여해 본문과 부가정보가 분리된 JSON으로 구조화
대규모 기술문서의 RAG 데이터화
약 250종·4만 페이지의 영문 기술문서를 정제해 RAG용 구조화 데이터로 전환
복합 문서 구조를 반영한 전처리
텍스트·이미지·수식·표 등 요소별 특성에 맞게 가공해 원문의 정보 구조를 보존
수식·표까지 포함한 JSON 구조화
수식·표를 LaTeX·HTML로 변환하고 위치 태그를 부여해 본문과 부가정보가 분리된 JSON으로 구조화
문제점
1. 복합 기술문서의 구조·맥락 손실
1. 복합 기술문서의 구조·맥락 손실
텍스트·이미지·수식·표·각주가 혼재되어 있어, 단순 텍스트 추출만으로는 원문의 구조와 맥락이 손실됨
텍스트·이미지·수식·표·각주가 혼재되어 있어, 단순 텍스트 추출만으로는 원문의 구조와 맥락이 손실됨
2. 수식·표의 의미 정보 손실
2. 수식·표의 의미 정보 손실
일반 텍스트로 변환할 경우 기호와 행·열 관계가 깨져 RAG 검색과 답변 생성에 필요한 의미 정보가 손실될 수 있음
일반 텍스트로 변환할 경우 기호와 행·열 관계가 깨져 RAG 검색과 답변 생성에 필요한 의미 정보가 손실될 수 있음
3. 대규모 문서의 일관된 처리 어려움
3. 대규모 문서의 일관된 처리 어려움
기술문서를 동일한 기준으로 가공하면서 본문과 부가정보의 연결 관계까지 유지해야 해 처리 기준 수립이 복잡함
기술문서를 동일한 기준으로 가공하면서 본문과 부가정보의 연결 관계까지 유지해야 해 처리 기준 수립이 복잡함
솔루션
1. 문서 요소별 특성에 맞춘 전처리
1. 문서 요소별 특성에 맞춘 전처리
2. 수식·표의 구조를 보존한 변환
2.수식·표의 구조를 보존한 변환
3. RAG 활용을 위한 JSON 구조화
3. RAG 활용을 위한 JSON 구조화
데이터 예시
RAW DATA
문제 :
양의 정수 𝑎,𝑏,𝑐가 𝑎𝑏+𝑏𝑐+𝑐𝑎=1+𝑎+𝑏+𝑐를 만족한다고 하자. 이때 모든 순서쌍 (𝑎,𝑏,𝑐) 를 구하여라.
정답 : (1, 2, 3), (1, 3, 2), (2, 1, 3), (2, 3, 1), (3, 1, 2), (3, 2, 1)
풀이 :
주어진 식 𝑎𝑏+𝑏𝑐+𝑐𝑎=1+𝑎+𝑏+𝑐을 정리하면 𝑎𝑏+𝑏𝑐+𝑐𝑎−𝑎−𝑏−𝑐=1 이다. 양변에 1을 더하면 𝑎𝑏+𝑏𝑐+𝑐𝑎−𝑎−𝑏−𝑐+1=2 를 얻는다. 이때 좌변은 (𝑎−1)(𝑏−1)+(𝑏−1)(𝑐−1)+(𝑐−1)(𝑎−1)=2와 같으므로, x = a-1, y = b-1, z = c-1 라고 두면 x, y, z는 0 이상의 정수이고 𝑥𝑦+𝑦𝑧+𝑧𝑥=2를 만족해야 한다.
이제 0 이상의 정수해를 구하자. 만약 셋 중 두 개 이상이 1 이상이면, 경우를 나눠볼 수 있다. x,y,z≥0에서 세 항의 합이 2가 되려면 가능한 경우는 매우 제한적이다. 우선 하나가 0인 경우를 보자. 예를 들어 z=0이면 xy=2이므로 (x,y)=(1,2) 또는 (2,1)이다.
따라서 (x,y,z)의 가능한 순서 있는 해는(1,2,0), (2,1,0), (1,0,2), (2,0,1), (0,1,2), (0,2,1) 뿐이다.
이제 다시 a=x+1, b=y+1, c=z+1로 돌리면(a,b,c)는 다음 6개이다.
(2,3,1), (3,2,1), (2,1,3), (3,1,2), (1,2,3), (1,3,2)
즉, 정답은 1,2,3의 모든 순열이다.
JSON
{
"tag": "q_0323_0001",
"type": "question",
"description": {
"question": "양의 정수 a, b, c가 {f_0323_0001} 를 만족한다고 하자.",
"options": [],
"answer": [
"(a, b, c)는 (1, 2, 3)의 모든 순열이다.,
(1, 2, 3), (1, 3, 2), (2, 1, 3),
(2, 3, 1), (3, 1, 2), (3, 2, 1)"
],
"explanations": [
"주어진 식 {f_0323_0001} 을 정리하면 {f_0323_0002} 이다.,
양변에 1을 더하면 {f_0323_0003} 를 얻는다.,
좌변은 {f_0323_0004} 와 같으므로,
x = a-1, y = b-1, z = c-1 로 두면,
x, y, z는 0 이상의 정수이고 {f_0323_0005} 를 만족해야 한다.,
세 항의 합이 2이므로 셋 중 하나는 반드시 0이어야 한다.,
z = 0이면 {f_0323_0006} 이므로 (x, y) = (1, 2) 또는 (2, 1)이다.,
(x, y, z)의 해:,
(1,2,0), (2,1,0), (1,0,2), (2,0,1), (0,1,2), (0,2,1),
a = x+1, b = y+1, c = z+1 로 돌아가면,
(a, b, c)는 (1,2,3)의 모든 순열이다."
]
},
"caption": null,
"file_path": null,
"bbox": null
} RAW DATA
AUTOMATED INSPECTION SYSTEM PERFORMANCE REPORT
4. PERFORMANCE EVALUATION
4.2 Optical Alignment Verification
The optical inspection module was evaluated under three conveyor-speed conditions to verify alignment stability during continuous operation. Each test was conducted under the same illumination conditions while the conveyor speed and sample throughput were gradually increased.
The lateral alignment error, e = xref − xmeasured, remained below 0.8 mm during steady-state operation. A temporary deviation was observed immediately after the conveyor speed changed, but the measured position returned to the reference range within approximately 40 seconds.
The overall deviation was evaluated using the following root mean square error (RMSE):
The measured RMSE remained below the predefined acceptance threshold for all three test conditions.¹
Figure 7. Alignment error during continuous operation
[그래프 이미지]Table 4. Operating Conditions and Test Results
| Parameter | Condition A | Condition B | Condition C |
|---|---|---|---|
| Conveyor speed (m/s) | 0.6 | 1.0 | 1.4 |
| Sample throughput (items/min) | 45 | 72 | 96 |
| Maximum deviation (mm) | 0.4 | 0.6 | 0.8 |
| Stabilization time (s) | 22 | 31 | 39 |
| RMSE (mm) | 0.18 | 0.26 | 0.35 |
| Result | PASS | PASS | PASS |
JSON
{
"tag": "q_0323_0001",
"type": "question",
"description": {
"question": "양의 정수 a, b, c가 {f_0323_0001} 를 만족한다고 하자.",
"options": [],
"answer": [
"(a, b, c)는 (1, 2, 3)의 모든 순열이다.,
(1, 2, 3), (1, 3, 2), (2, 1, 3),
(2, 3, 1), (3, 1, 2), (3, 2, 1)"
],
"explanations": [
"주어진 식 {f_0323_0001} 을 정리하면 {f_0323_0002} 이다.,
양변에 1을 더하면 {f_0323_0003} 를 얻는다.,
좌변은 {f_0323_0004} 와 같으므로,
x = a-1, y = b-1, z = c-1 로 두면,
x, y, z는 0 이상의 정수이고 {f_0323_0005} 를 만족해야 한다.,
세 항의 합이 2이므로 셋 중 하나는 반드시 0이어야 한다.,
z = 0이면 {f_0323_0006} 이므로 (x, y) = (1, 2) 또는 (2, 1)이다.,
(x, y, z)의 해:,
(1,2,0), (2,1,0), (1,0,2), (2,0,1), (0,1,2), (0,2,1),
a = x+1, b = y+1, c = z+1 로 돌아가면,
(a, b, c)는 (1,2,3)의 모든 순열이다."
]
},
"caption": null,
"file_path": null,
"bbox": null
} 활용분야
RAG 검색·질의응답 시스템 구축
복합 기술문서를 구조화해 검색 정확도와 답변 생성 품질을 높이는 RAG 데이터셋 구축
기술문서 기반 AI 학습 데이터 구축
텍스트·수식·표·이미지 등 다양한 요소를 정제해 모델 학습과 튜닝에 활용 가능한 데이터로 가공
문서 디지털화·지식베이스 구축
대규모 기술문서의 정보 구조와 연결 관계를 보존해 검색·관리 가능한 JSON 데이터로 구조화
RAG 검색·질의응답 시스템 구축
복합 기술문서를 구조화해 검색 정확도와 답변 생성 품질을 높이는 RAG 데이터셋 구축
기술문서 기반 AI 학습 데이터 구축
텍스트·수식·표·이미지 등 다양한 요소를 정제해 모델 학습과 튜닝에 활용 가능한 데이터로 가공
문서 디지털화·지식베이스 구축
대규모 기술문서의 정보 구조와 연결 관계를 보존해 검색·관리 가능한 JSON 데이터로 구조화
외 다양한 사례에 적용 가능합니다.


