
PrismML 공식 발표에 따르면 회사는 14일(현지시간) Qwen3.6 27B를 기반으로 한 저비트 멀티모달 모델 ‘Bonsai 27B’를 공개했다. 언어 모델 전체에 1비트 또는 3진 가중치를 적용해, 기존 27B급 모델을 스마트폰과 일반 노트북의 메모리 범위로 옮기는 데 초점을 맞췄다.
모델은 두 가지 형태로 제공된다. 1비트 모델은 {-1, +1} 이진 가중치와 그룹별 FP16 스케일을 사용하며 유효 가중치당 비트 수는 1.125, 모델 용량은 3.9GB다. PrismML은 이 모델이 아이폰 17 프로의 앱 메모리 한도 안에서 실행된다고 설명했다. 품질 중심의 Ternary 모델은 {-1, 0, +1} 가중치를 사용하며 유효 1.71비트, 용량 5.9GB로 제시됐다.
두 모델은 텍스트뿐 아니라 이미지 입력을 처리하고, 구조화된 도구 호출과 장기 추론 작업을 지원한다. 회사가 공개한 자료에는 26만2144토큰 문맥 길이와 MLX 기반 애플 기기, CUDA 기반 엔비디아 GPU 지원이 명시됐다. 모델 가중치와 실행 도구는 Apache 2.0 라이선스로 공개됐다.
성능 수치는 PrismML이 자체 실시한 평가 결과다. 회사는 지식·추론·수학·코딩·도구 호출·비전 등 15개 벤치마크에서 Ternary 모델이 원본 정밀도 모델 성능의 95%, 1비트 모델이 90%를 유지했다고 밝혔다. 다만 이 수치는 독립 기관의 재현 검증을 거치지 않았고, 실제 스마트폰 성능은 문맥 길이와 KV 캐시, 비전 모듈 사용 여부에 따라 달라질 수 있다.
대형 모델을 단말에서 직접 실행하면 민감한 데이터를 외부 서버로 보내지 않고 오프라인에서도 작업할 수 있다. 도구 호출을 여러 차례 반복하는 에이전트형 서비스에서는 API 비용과 네트워크 지연도 줄일 여지가 있다. 반면 압축에 따른 정확도 저하와 기기별 메모리 제약, 저비트 연산 커널의 호환성은 실제 도입 과정에서 확인해야 할 변수다.
출처: PrismML 공식 발표 https://prismml.com/news/bonsai-27b
PrismML 공식 GitHub 저장소 https://github.com/PrismML-Eng/Bonsai-demo/
Bonsai 27B 기술 문서 https://github.com/PrismML-Eng/Bonsai-demo/blob/main/bonsai-27b-whitepaper.pdf
Bonsai 27B 모델 컬렉션 https://huggingface.co/collections/prism-ml/bonsai-27b