
Cohere 공식 블로그에 따르면 회사는 2026년 7월 7일 아랍어 음성인식 모델 'Cohere Transcribe Arabic'을 오픈소스로 공개했다. Cohere는 이 모델이 아랍어 방언, Arabic-English 코드스위칭, 업무 현장의 전문 용어를 처리하도록 설계됐으며, 개발자가 모델 가중치를 내려받아 사용할 수 있다고 밝혔다.
이번 발표는 음성 AI 경쟁이 영어 중심의 범용 인식 성능을 넘어 지역 언어와 주권형 AI 인프라로 확장되고 있음을 보여준다. 아랍어는 현대 표준 아랍어와 지역 방언 간 차이가 크고, 실제 대화에서는 영어 단어와 전문 용어가 섞이는 경우가 많다. Cohere는 이런 특성이 기업용 음성 인식 모델 개발을 어렵게 만든다고 설명했다.
Cohere에 따르면 Transcribe Arabic은 올해 초 공개한 20억 파라미터급 자동 음성인식 모델을 기반으로 훈련됐다. 회사는 사우디아라비아와 중동 지역을 포함한 다양한 방언, 전문 업무 환경, 코드스위칭, 음향 조건을 반영했다고 설명했다. 모델은 Apache 2.0 라이선스로 제공되며, Hugging Face에서 가중치와 빠른 시작 예제를 확인할 수 있다.
성능 비교는 회사 발표와 공개 리더보드 기준으로 볼 필요가 있다. Cohere는 Hugging Face의 Arabic ASR Leaderboard에서 Transcribe Arabic이 평균 단어 오류율 25.87을 기록했다고 밝혔다. 이는 이전 선두 모델로 제시된 Meta OmniASR-LLM-7B보다 2.45포인트 낮고, OpenAI Whisper Large V3보다 11포인트 낮은 수치다.
Cohere는 인간 평가 결과도 함께 제시했다. 회사 발표에 따르면 아랍어 원어민 평가자들은 전체 정확도, 방언 충실도, 코드스위칭 처리 능력을 기준으로 비교했으며, Transcribe Arabic은 Whisper와의 직접 비교에서 95.8%의 선호를 받았다. 다만 이 평가는 Cohere가 공개한 방식과 범위 안에서 해석해야 하며, 실제 산업 현장의 녹음 품질과 도메인별 어휘에 따라 결과는 달라질 수 있다.
기업 환경에서 중요한 처리 속도도 강조됐다. Cohere는 vLLM을 중심으로 서빙 시스템을 최적화했고, Transcribe Arabic이 실시간 처리 배수 지표에서 Whisper Large V3와 omniASR 7B-LLM보다 높은 값을 보였다고 설명했다. 대량 콜센터 녹취, 고객 상담 분석, 회의 기록, 내부 지식 검색과 같은 업무에서는 정확도와 처리량이 함께 요구된다.
제공 방식은 오픈소스와 관리형 서비스를 함께 두는 구조다. Cohere는 모델 가중치를 Hugging Face에서 제공하고, Cohere API와 Model Vault를 통한 호스팅 접근도 지원한다고 밝혔다. API는 일정 한도 안에서 무료 접근이 가능하며, 전용 Model Vault는 별도 프로비저닝 방식으로 제공된다.
아랍어 음성인식 모델 공개는 비영어권 AI 인프라 경쟁의 한 단면이다. 기업과 공공기관이 음성 데이터를 다루는 과정에서 언어별 정확도, 데이터 통제, 배포 위치, 비용 구조를 함께 검토해야 하기 때문이다. Cohere의 이번 모델은 중동 지역의 주권형 AI 수요와 오픈소스 생태계를 동시에 겨냥한 발표로 볼 수 있다.
출처: Cohere https://cohere.com/blog/transcribe-arabic
출처: Hugging Face Open ASR Leaderboard https://huggingface.co/spaces/hf-audio/open_asr_leaderboard









