
Xiaomi MiMo API Open Platform 공식 문서에 따르면 Xiaomi MiMo는 ‘MiMo-V2.5-Pro-UltraSpeed’를 공개하고, 1조 매개변수 규모의 모델에서 초당 최대 1000토큰 수준의 추론 속도를 제공한다고 밝혔다.
MiMo-V2.5-Pro-UltraSpeed는 기존 MiMo-V2.5-Pro의 고속 체험 모드로 소개됐다. Xiaomi는 이 모델이 텍스트 입력과 텍스트 출력을 지원하며, 초고속 추론, 심층 사고, 도구 호출, 스트리밍 출력을 주요 기능으로 제공한다고 설명했다.
공식 문서에 제시된 가격표 기준으로 UltraSpeed 모드는 MiMo-V2.5-Pro보다 입력과 출력 단가가 3배 높다. 대신 출력 TPS는 기존 모델의 약 50~100 수준에서 약 500~1000 수준으로 올라간다고 회사는 밝혔다. 달러 기준 출력 단가는 100만 토큰당 2.61달러로 표시됐다.
Xiaomi는 고속화의 배경으로 FP4 혼합 정밀도 양자화, DFlash 투기적 디코딩, TileRT 시스템 최적화를 들었다. 문서에 따르면 FP4 양자화는 MoE Expert에 적용되고, DFlash는 블록 단위 병렬 예측 방식으로 추론 처리량을 높이는 데 초점을 둔다. TileRT는 GPU 상에서 계산 파이프라인을 지속적으로 운용해 데이터 이동과 연산의 겹침을 극대화하는 방식으로 설명됐다.
이번 공개는 대규모 AI 모델 경쟁이 단순한 성능 지표에서 서비스 지연 시간과 운영 효율로 확장되고 있음을 보여준다. 다만 초당 1000토큰 수준의 속도는 Xiaomi가 공식 문서에서 제시한 수치이며, 구체적인 벤치마크 조건과 외부 재현 검증은 추가 확인이 필요하다.
출처: Xiaomi MiMo API Open Platform
https://platform.xiaomimimo.com/docs/en-US/model-intro/mimo-v2.5-pro-ultraspeed