
풀스택 데이터 랩(Full Stack Data Lab) 연구진이 24일 공개한 원문에 따르면, 오픈소스 엔진 'Quail'은 데이터베이스의 SQL 쿼리 계획과 대규모언어모델(LLM) 추론을 함께 최적화한다. SQL에서 AI 함수를 호출해 문서를 분류하거나 두 데이터 집합의 관계를 판별할 때, 쿼리 전체를 살펴 모델 호출 순서와 연산 방식을 정하는 것이 핵심이다.
연구진은 일반 추론 엔진에 개별 요청을 잇달아 보내는 방식이 CPU의 요청 처리 부담을 키우고, 같은 문서를 반복 처리할 때 이미 계산한 키·값(KV) 상태를 버릴 수 있다고 설명했다. Quail은 필터와 조인의 실행 순서를 계획하고 재사용 가능한 KV 상태를 보존해 이런 낭비를 줄이도록 설계됐다. 공개된 버전은 AI 필터와 조인, 열 선택, LIMIT 연산을 지원하며 코드는 MIT 라이선스로 제공된다.
연구팀이 만든 QUAIL-B 벤치마크의 29개 쿼리를 축소된 데이터 규모로 실행한 결과, Quail은 일반 vLLM 구성보다 27개 쿼리에서 빨랐다. 쿼리별 속도 향상의 기하평균은 1.84배였다. 실험은 Qwen3 4B FP8 모델과 엔비디아 H100 GPU 한 대를 사용했고, 두 시스템에 동일한 모델과 프롬프트, 논리적 쿼리 계획을 적용했다.
다만 결과가 모든 작업에서 우위를 뜻하지는 않는다. 서로 다른 행에 공통 접두부가 많은 소프트웨어 에이전트 기록 분석에서는 vLLM의 자동 접두부 캐시가 유리했다. 연구진에 따르면 AGENT-1 쿼리에서 Quail은 vLLM보다 2.32배 오래 걸렸다. Quail은 현재 같은 문서의 재사용에는 강하지만, 서로 다른 문서 사이의 공통 접두부는 자동으로 재사용하지 못한다.
연구진은 향후 지원 연산과 모델·하드웨어를 넓히고, 행 사이의 자동 접두부 캐시를 추가할 계획이라고 밝혔다. 이번 성능 수치는 연구팀이 설계하고 수행한 자체 실험 결과로, 다른 데이터와 장비에서의 성능을 보장하는 독립 검증 결과는 아니다.
출처: 풀스택 데이터 랩 연구진 원문 https://fsdatalab.github.io/blog/introducing-quail/ ; Quail 공식 저장소 https://github.com/fsdatalab/quail ; QUAIL-B 공식 벤치마크 저장소 https://github.com/fsdatalab/quail-bench