
Baidu가 GitHub 저장소와 arXiv 논문을 통해 장문 문서 인식 모델 Unlimited-OCR을 공개했다. arXiv에 2026년 6월 22일 제출된 기술 보고서에 따르면 이 모델은 긴 출력 시퀀스에서 KV 캐시가 커지며 메모리 사용량과 생성 속도에 부담을 주는 문제를 줄이는 데 초점을 맞췄다.
Unlimited-OCR은 DeepSeek OCR을 기준선으로 삼고, 디코더의 attention 계층을 연구진이 제안한 Reference Sliding Window Attention, R-SWA로 바꾼 구조다. 논문은 이 방식이 전체 디코딩 과정에서 일정한 KV 캐시를 유지하면서 attention 계산 비용을 낮추도록 설계됐다고 설명한다.
연구진은 DeepSeek OCR 인코더의 높은 압축률과 일정한 KV 캐시 설계를 결합하면 표준 32K 최대 길이 안에서 수십 쪽 문서를 한 번의 forward pass로 전사할 수 있다고 밝혔다. 다만 이 설명은 연구진의 기술 보고서와 공개 저장소 기준이다. 실제 문서 품질, 언어, 스캔 상태, 표와 수식 포함 여부에 따라 결과는 달라질 수 있다.
공개 저장소는 6월 22일 Unlimited-OCR을 공개했다고 안내하고, 6월 23일 논문이 arXiv에 올라왔으며 ModelScope에서도 모델을 제공한다고 밝혔다. 저장소에는 Transformers, SGLang, PDF를 이미지로 변환한 뒤 다중 페이지를 처리하는 예시 코드가 포함돼 있다.
Hugging Face 모델 카드 기준 Unlimited-OCR은 Image-Text-to-Text 계열 모델로 등록돼 있으며 MIT 라이선스를 표시하고 있다. 모델 카드에는 Transformers, vLLM, SGLang, Docker Model Runner 등으로 실행하는 예시가 함께 제공된다. 다만 trust_remote_code 또는 custom_code 방식으로 모델을 불러오는 경우가 있어, 기업 환경에서는 코드 검토와 실행 격리 정책이 필요하다.
이번 공개는 OCR 기술의 관심사가 단일 이미지 인식 정확도에서 긴 문서 흐름을 한 번에 처리하는 구조로 이동하고 있음을 보여준다. 계약서, 연구 보고서, 공문서, 다국어 자료처럼 긴 문서를 다루는 업무에서는 페이지 단위 인식보다 문맥 유지와 장시간 생성 효율이 중요해진다.
R-SWA가 OCR 밖에서도 의미를 가질 수 있다는 점도 연구진이 강조한 대목이다. 논문은 해당 attention 구조가 음성 인식, 번역 등 긴 출력이 필요한 parsing 작업에도 적용될 수 있다고 설명한다. 이는 장문 입력뿐 아니라 장문 출력의 비용과 안정성을 줄이는 모델 구조 연구가 더 넓은 멀티모달·언어 처리 영역으로 확장될 수 있음을 시사한다.
다만 기사화 시점에서 Unlimited-OCR은 공개 직후의 연구·오픈소스 모델이다. 저장소에 공개된 코드와 모델 가중치는 개발자와 연구자가 실험해 볼 수 있는 기반을 제공하지만, 산업 현장에서 요구되는 재현성, 오류율, 개인정보 처리, 보안 검토, 운영 비용은 별도 검증이 필요하다.
출처: Baidu Unlimited-OCR GitHub https://github.com/baidu/Unlimited-OCR
출처: arXiv, “Unlimited OCR Works” https://arxiv.org/abs/2606.23050
출처: Hugging Face baidu/Unlimited-OCR https://huggingface.co/baidu/Unlimited-OCR









