
로컬 음성인식 앱 Handy의 개발자 CJ Pais가 프로젝트 페이지와 공식 저장소를 통해 오픈소스 음성인식 라이브러리 transcribe.cpp를 공개했다. 이 라이브러리는 ggml 런타임과 GGUF 형식을 바탕으로 여러 음성인식 모델을 하나의 C/C++ 추론 엔진에서 구동하도록 설계됐다.
프로젝트가 제시한 지원 범위는 16개 모델 계열과 60여 개 변형이다. Whisper를 비롯해 NVIDIA Parakeet·Canary·Nemotron, Qwen3-ASR, Cohere Transcribe, Moonshine, Voxtral, IBM Granite Speech, MOSS Transcribe-Diarize 등이 공식 저장소의 지원 목록에 포함돼 있다. 사전 변환된 GGUF 모델은 Handy의 Hugging Face 조직에서 배포한다.
가속 경로는 Apple 기기의 Metal, 리눅스와 윈도우의 Vulkan, NVIDIA GPU용 CUDA를 아우른다. CPU에서는 tinyBLAS를 기본으로 사용하고 OpenBLAS를 선택적으로 붙일 수 있다. 프로젝트 문서는 OpenBLAS가 호스트 측 디코더를 약 10~15배 가속할 수 있다고 설명하지만, 실제 성능은 모델과 하드웨어 구성에 따라 달라질 수 있다.
실시간 스트리밍과 일괄 전사를 모두 지원하며, C API 위에 Python, 자바스크립트·타입스크립트, Rust, Swift·Objective-C 바인딩을 제공한다. 기본 명령행 도구는 16kHz 모노 WAV 입력을 요구한다. 다른 오디오 형식은 ffmpeg나 sox로 변환해 사용할 수 있다.
정확도 검증도 프로젝트가 강조하는 부분이다. 개발자는 Handy 공식 Hugging Face 조직에 올린 모델을 원본 구현과 수치로 대조하고, 단어 오류율인 WER 시험을 거쳤다고 밝혔다. 수천 개 발화를 사용한 결과를 저장소와 모델 카드에 공개한다고 설명했다. 다만 이는 프로젝트 측 검증 결과이며, 독립된 제3자 벤치마크로 확인된 수치는 아니다.
transcribe.cpp는 whisper.cpp와의 호환성도 일부 고려했다. 기존 Whisper용 .bin 모델 파일을 실행할 수 있고 주요 사용 방식은 비슷하게 구성했다. 개발자는 대부분의 용도에서 대체할 수 있다고 설명하면서도 whisper.cpp의 모든 플래그와 기능을 아직 지원하는 것은 아니라고 선을 그었다.
공식 저장소의 최신 릴리스는 7월 12일 공개된 v0.1.3이다. 개발자는 프로젝트를 아직 v0.1 단계의 초기 라이브러리로 규정하고 있다. 운영 환경 도입 전에는 대상 모델의 정확도와 지연시간, 메모리 사용량, 각 가속 백엔드의 안정성을 실제 하드웨어에서 별도로 확인할 필요가 있다.
여러 음성인식 모델을 플랫폼별로 따로 포팅해야 했던 부담을 하나의 경량 런타임으로 줄이려는 시도라는 점은 주목할 만하다. 음성 데이터를 클라우드로 보내지 않고 기기 안에서 처리하려는 데스크톱·모바일 애플리케이션 개발자에게 선택지를 넓힐 수 있다.
출처: transcribe.cpp 개발자 프로젝트 페이지 https://workshop.cjpais.com/projects/transcribe-cpp · 공식 GitHub 저장소 https://github.com/handy-computer/transcribe.cpp · v0.1.3 릴리스 https://github.com/handy-computer/transcribe.cpp/releases/tag/v0.1.3 · Handy 공식 Hugging Face 모델 저장소 https://huggingface.co/handy-computer