kordoc은 HWP/HWPX·PDF·XLS/XLSX·DOCX·이미지를 Markdown으로 파싱하고, 서식 보존 패치·양식 채우기·HWPX 생성·MCP 연동까지 제공하는 Node.js 기반 한국 문서 처리 CLI다.
- HWP 3.x/5.x·HWPX·HWPML·PDF·XLS/XLSX·DOCX·PNG/JPG/WebP를 Markdown과 구조화된 block으로 변환하는 Node.js C...
- OCR·표 복원·RAG용 breadcrumb chunk·문서 비교·양식 채우기·서식 보존 patch·HWPX 생성과 렌더링을 한 도구 표면에 둔다.
- `npx -y kordoc setup`으로 Claude Desktop·Cursor·Claude Code·Codex 등 설치된 AI 클라이언트의 MCP 설정을 감지·등...
- npm과 GitHub의 최신 배포는 v4.2.7이며, Node.js 18 이상에서 macOS·Linux·Windows 공용으로 실행한다.
- MCP 서버에는 기본 directory restriction이 없으므로, 민감 문서가 있는 환경에서는 agent 권한과 MCP 연결 범위를 먼저 점검해야 한다.
Open source beta
Apache-2.0run-llama/liteparse는 PDF·Office·이미지를 로컬에서 파싱해 텍스트, JSON bounding box, 페이지 스크린샷을 내보내는 Rust 기반 문서 파서/CLI입니다.
- PDFium 기반 Rust core로 PDF 텍스트를 빠르게 뽑고, 선택적으로 Tesseract 또는 HTTP OCR 서버 결과를 병합합니다.
- npm, pip, cargo 설치 경로가 모두 같은 `lit` CLI를 제공하며, Node.js/TypeScript·Python·Rust·Browser WASM 바인...
- 텍스트뿐 아니라 JSON bounding box와 페이지 스크린샷을 내보내므로 RAG 근거 표시, visual citation, 에이전트 문서 읽기에 맞습니다.
- Office 문서와 이미지는 LibreOffice/ImageMagick 변환 의존성이 필요하고, WASM 빌드는 브라우저 제약 때문에 기능 범위가 다릅니다.
- 로컬 우선 도구지만 untrusted upload 서비스로 감싸면 파일 검증, sandbox, timeout, resource limit을 별도로 설계해야 합니다.
Open source notebook
LGPL-3.0Unsloth의 DeepSeek-OCR 3B Colab은 Google Colab GPU에서 DeepSeek-OCR을 불러와 Persian OCR 데이터로 baseline inference, LoRA fine-tuning,...
- `unslothai/notebooks`의 `Deepseek_OCR_(3B).ipynb`는 README의 OCR Notebooks 표에서 Deepseek OCR 3B...
- 노트북은 `unsloth/DeepSeek-OCR`을 `snapshot_download`로 내려받고 `FastVisionModel.from_pretrained(...,...
- 예제 데이터는 Persian OCR용 `hezarai/parsynth-ocr-200k`이며, notebook code는 baseline에는 `train[:2000]`...
- sample 하나에서는 baseline CER 23%에서 60-step LoRA 후 6%로 좋아지는 예시를 보여주고, Unsloth 문서는 200-sample Per...
- 저장 경로는 LoRA adapter local/Hub 저장과 merged 16bit export 중심이며, DeepSeek-OCR 자체 inference는 Trans...
- OCR 문서는 개인정보·계약서·스캔 원본이 섞이기 쉬우므로 Colab/Hugging Face Hub 업로드, `trust_remote_code`, dataset li...
Open source Python library
AGPL-3.0 / commercialPyMuPDF4LLM은 PyMuPDF 위에서 PDF와 문서를 Markdown, JSON, plain text로 변환해 RAG·임베딩·LLM ingest 파이프라인의 첫 단계를 빠르게 만드는 Python 라이브러리다.
- 한 줄의 `pymupdf4llm.to_markdown()` 호출로 PDF를 LLM prompt, vector store, chunker에 넣기 쉬운 Markdown으...
- Markdown뿐 아니라 JSON과 plain text를 지원하고, `page_chunks=True`로 페이지별 metadata가 붙은 chunk를 바로 만들 수 있...
- multi-column layout, table, image reference, header/footer 처리, 선택적 OCR, LlamaIndex·LangChain...
- Python 3.10 이상에서 `pip install pymupdf4llm`로 설치하며 PyMuPDF와 pymupdf-layout을 함께 맞춰 설치한다.
- 라이선스는 AGPL-3.0 또는 Artifex commercial license 구조라 proprietary RAG 제품에 넣기 전 라이선스 검토가 필요하다.