
OpenAI 공식 API 문서에 따르면 회사는 기존 ‘Priority processing’의 이름을 지난 7월 30일 ‘Fast mode’로 바꾸고, GPT-5.6 Sol에서 최대 2.5배 빠른 처리 속도를 제공하기 시작했다. 회사는 이 옵션이 지연 시간이 중요한 정기 트래픽 기반의 사용자 대면 서비스에 적합하다고 설명했다.
개발자는 Responses API나 Chat Completions API 요청에 service_tier 값을 fast로 지정해 기능을 선택할 수 있다. 기존 priority 값도 지원 모델에서는 같은 방식으로 동작한다. 프로젝트 설정에서 기본 서비스 티어를 Fast로 정하면 요청별 지정 없이 적용할 수도 있다.
다만 Fast mode는 표준 처리보다 토큰당 비용이 높다. OpenAI 가격표에서 GPT-5.6 Sol의 Fast mode 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 45달러로 제시됐다. 표준 처리 가격은 각각 5달러와 30달러다. 캐시된 입력에는 별도 할인 가격이 적용된다.
OpenAI는 Fast mode와 표준 처리의 속도 제한은 모델별로 공유하며, 트래픽 증가 속도가 빠르면 일부 요청을 표준 처리로 낮추고 표준 요금을 적용할 수 있다고 밝혔다. 긴 문맥 처리, 파인튜닝 모델, 임베딩은 지원 대상에서 제외된다.
이번 변경은 모델 성능 경쟁과 별개로 API 응답 지연을 비용 옵션으로 세분화한 조치다. 실시간 상호작용이 중요한 서비스는 속도 향상을 선택할 수 있지만, 대규모 배치 작업에는 표준 처리와 비용을 비교해 적용 범위를 정할 필요가 있다.
출처: OpenAI API Fast mode 공식 문서 https://platform.openai.com/docs/guides/fast-mode / OpenAI API 가격표 https://platform.openai.com/docs/pricing / OpenAI GPT-5.6 Sol 모델 문서 https://platform.openai.com/docs/models/gpt-5.6-sol









