한컴 에이전틱 OS 데모 공개

HANCOM

모든 문서를 AI가 이해하는 데이터로.한컴 데이터 로더.

오픈소스 문서 파서 1위 기술 기반의 문서 데이터 추출 솔루션으로서, 복잡한 문서를 RAG 구축과 AI 학습에 바로 활용할 수 있는 데이터로 만듭니다.

데이터 로더는

복잡한 문서에서
정보를 인식하고 추출하여,
AI의 데이터 자산으로 만듭니다.

STEP 1

문서 넣기

STEP 2

구조 읽기

STEP 3

핵심 요소 추출

STEP 4

데이터 구조화

STEP 5

AI 활용

다양한 포맷의 문서를 데이터로 바꾸는 상용 엔진과 PDF 특화 오픈소스 엔진까지 아우르며, AX 시대의 AI 생태계 확산을 뒷받침합니다.

한컴 데이터 로더

DOCX·XLSX·PPTX·PDF·HWP(X) 등 폭넓은 포맷을 아우르는 상용 파싱 엔진으로, 추출한 데이터의 순서/구조를 정밀하게 검토하고 조정할 수 있는 도구를 제공합니다.

상용형데이터 파싱

오픈 데이터 로더

PDF에 특화된 Local-first 오픈소스 파싱 엔진으로, 레이아웃·표·이미지가 뒤섞인 문서도 정확히 읽어 AI가 바로 쓰는 데이터로 만듭니다. (Apache 2.0, 무료 이용 가능)

오픈소스데이터 파싱

접근성 솔루션

PDF 자동 태깅 · PDF/UA 내보내기 · 감사 대응 워크플로우를 제공합니다.

솔루션

데이터 로더의 PDF 엔진은

깃허브 전체 오픈소스 트렌딩 1위로 전 세계 개발자들에게 검증된 오픈소스입니다.

#1 Repository Of The Day

비용 부담 없이, 도입 장벽 없이, 공급자 종속 없이 Apache 2.0 라이선스 하에 지금 바로 시작하고, 직접 성능을 검증해 보세요. 로컬 환경에서도 간편하게 확인할 수 있습니다.

GITHUB 트렌딩

#1

오늘의 저장소

#1 오픈소스 파싱

0.907

opendataloader-bench 종합 점수

GITHUB STARS

27,000+

개발자 주도의 실질 성장 곡선

더 알아보기

텍스트부터 표, 이미지 속 정보까지

손실을 최소화하며 문서 데이터를 추출합니다.

어떤 문서를 넣든, AI가 바로 쓰는 데이터로 변환

01

DOCX·XLSX·PPTX·PDF·HWP(X) 등 다양한 포맷의 문서를, AI 시스템에 즉시 연계 가능한 구조화 데이터로 변환합니다.

사람이 읽는 순서대로, 문단 구조까지 정확하게 분석

02

AI 딥러닝과 문서 구조 분석(DLA, Document Layout Analysis) 기술이 문단의 순서를 읽고 좌표·레이아웃을 정밀하게 분석합니다. 다단 레이아웃도 사람이 읽는 순서 그대로 흐릅니다. (XY-Cut++ 읽기 순서)

문서 속 요소를 세부 카테고리로 똑똑하게 분류

03

텍스트·표·이미지 등 다양한 요소를 자동 인식하고, 세부 객체 카테고리로 분류합니다.

까다로운 표도 원본 구조 그대로 데이터화

04

테두리가 없거나 셀이 병합된 복잡한 표도 손실을 최소화하며 데이터화합니다.

국제 표준을 기반으로

검증된 파트너와 함께 만들었습니다.

PDF Association
SPECIFICATION AUTHORS

PDF Association

Well-Tagged PDF 사양 및 베스트 프랙티스 가이드 저자

Dual Lab
veraPDF DEVELOPERS

Dual Lab

업계 표준 PDF/A · PDF/UA 검증기 veraPDF 개발사

이미 다양한 산업군에서 데이터 로더를 활용하고 있습니다.

자주 묻는 질문