thiagotigaz/ocr-it은 Chrome과 Firefox에서 한 번 지정한 화면 영역을 페이지마다 캡처해 로컬 Tesseract OCR로 텍스트화하고, 반복 페이지 넘김과 .txt 내보내기까지 지원하는 Manifes...
- 한 번 정한 사각형을 `Alt+Shift+S`로 페이지마다 캡처하거나 `Alt+Shift+A` 자동 실행으로 반복해, 선택 불가한 스캔 문서·슬라이드 뷰어의 텍스트를...
- OCR은 번들 Tesseract와 WebAssembly로 기기 안에서 수행된다. 프로젝트의 공개 개인정보 정책은 네트워크 요청·분석·계정·원격 코드를 쓰지 않는다고...
- v0.3.0은 Chrome 116+와 Firefox 140+를 대상으로 하며, GitHub Release에 브라우저별 ZIP이 있다. 현재 스토어 심사 중이므로 Ch...
- 기본 언어는 영어·포르투갈어·스페인어이고, 다른 Tesseract 언어는 source build 때 별도 vendoring해야 한다. 한국어 문서에는 `kor` 모델...
- 자동 페이지 넘김은 사이트별 권한을 명시적으로 허용한 뒤 동작하며, Chrome 내장 PDF viewer·브라우저 내부 페이지·보이지 않는 영역에는 적용되지 않는다.
kordoc은 HWP/HWPX·PDF·XLS/XLSX·DOCX·이미지를 Markdown으로 파싱하고, 서식 보존 패치·양식 채우기·HWPX 생성·MCP 연동까지 제공하는 Node.js 기반 한국 문서 처리 CLI다.
- HWP 3.x/5.x·HWPX·HWPML·PDF·XLS/XLSX·DOCX·PNG/JPG/WebP를 Markdown과 구조화된 block으로 변환하는 Node.js C...
- OCR·표 복원·RAG용 breadcrumb chunk·문서 비교·양식 채우기·서식 보존 patch·HWPX 생성과 렌더링을 한 도구 표면에 둔다.
- `npx -y kordoc setup`으로 Claude Desktop·Cursor·Claude Code·Codex 등 설치된 AI 클라이언트의 MCP 설정을 감지·등...
- npm과 GitHub의 최신 배포는 v4.2.7이며, Node.js 18 이상에서 macOS·Linux·Windows 공용으로 실행한다.
- MCP 서버에는 기본 directory restriction이 없으므로, 민감 문서가 있는 환경에서는 agent 권한과 MCP 연결 범위를 먼저 점검해야 한다.
Open source beta
Apache-2.0run-llama/liteparse는 PDF·Office·이미지를 로컬에서 파싱해 텍스트, JSON bounding box, 페이지 스크린샷을 내보내는 Rust 기반 문서 파서/CLI입니다.
- PDFium 기반 Rust core로 PDF 텍스트를 빠르게 뽑고, 선택적으로 Tesseract 또는 HTTP OCR 서버 결과를 병합합니다.
- npm, pip, cargo 설치 경로가 모두 같은 `lit` CLI를 제공하며, Node.js/TypeScript·Python·Rust·Browser WASM 바인...
- 텍스트뿐 아니라 JSON bounding box와 페이지 스크린샷을 내보내므로 RAG 근거 표시, visual citation, 에이전트 문서 읽기에 맞습니다.
- Office 문서와 이미지는 LibreOffice/ImageMagick 변환 의존성이 필요하고, WASM 빌드는 브라우저 제약 때문에 기능 범위가 다릅니다.
- 로컬 우선 도구지만 untrusted upload 서비스로 감싸면 파일 검증, sandbox, timeout, resource limit을 별도로 설계해야 합니다.
Open source notebook
LGPL-3.0Unsloth의 DeepSeek-OCR 3B Colab은 Google Colab GPU에서 DeepSeek-OCR을 불러와 Persian OCR 데이터로 baseline inference, LoRA fine-tuning,...
- `unslothai/notebooks`의 `Deepseek_OCR_(3B).ipynb`는 README의 OCR Notebooks 표에서 Deepseek OCR 3B...
- 노트북은 `unsloth/DeepSeek-OCR`을 `snapshot_download`로 내려받고 `FastVisionModel.from_pretrained(...,...
- 예제 데이터는 Persian OCR용 `hezarai/parsynth-ocr-200k`이며, notebook code는 baseline에는 `train[:2000]`...
- sample 하나에서는 baseline CER 23%에서 60-step LoRA 후 6%로 좋아지는 예시를 보여주고, Unsloth 문서는 200-sample Per...
- 저장 경로는 LoRA adapter local/Hub 저장과 merged 16bit export 중심이며, DeepSeek-OCR 자체 inference는 Trans...
- OCR 문서는 개인정보·계약서·스캔 원본이 섞이기 쉬우므로 Colab/Hugging Face Hub 업로드, `trust_remote_code`, dataset li...