
생명과학 AI 기업 Phylo가 연구용 에이전트 서비스 Biomni Lab에 오픈 웨이트 모델을 도입해 추론 비용을 60% 줄였다고 밝혔다. AI 추론 플랫폼 Fireworks가 17일 공개한 공식 고객 사례에 따르면, Phylo는 현재 트래픽의 대부분을 오픈 모델로 처리하면서 난도가 가장 높은 일부 작업에는 독점 모델을 유지하고 있다.
Biomni Lab은 문헌 검토와 가설 수립, 실험 설계, 데이터 분석을 지원하는 연구용 에이전트 환경이다. 한 작업이 수시간에서 수일 동안 이어지고 수백 차례 도구를 호출할 수 있어, 모델 사용 비용과 응답 지연이 서비스 운영에 큰 영향을 미친다. Phylo는 자체 추론 서버를 운영하는 대신 Fireworks의 서버리스 엔드포인트를 활용했다.
모델 선택 기준은 단순한 가격 비교가 아니다. Phylo는 자체 평가 체계인 BiomniBench로 모델의 품질과 지연시간, 비용을 점검한 뒤 작업 유형별 기본 모델을 정한다. 새 모델이 자동 평가를 통과하면 실제 트래픽 일부로 시험하고, 문제가 없을 때 기본 설정을 바꾼다. Fireworks는 이 과정을 통해 새 오픈 모델을 24시간 안에 운영 환경에 반영할 수 있었다고 설명했다.
응답 속도 개선도 보고됐다. Phylo와 Fireworks가 고속 서버리스 엔드포인트를 비교 평가한 결과, 첫 토큰이 출력되기까지 걸리는 시간이 대략 절반으로 줄었다는 설명이다. 여러 차례 모델을 호출하는 에이전트에서는 호출마다 쌓이는 대기시간을 줄이는 것이 중요하다. 다만 이 수치가 전체 연구 과제의 완료 시간이 절반으로 줄었다는 뜻은 아니다.
비용 60% 절감과 지연시간 개선은 서비스 공급사가 공개한 고객 사례에 담긴 결과다. 독립적인 공통 벤치마크 결과는 아니며, 모델 구성과 작업 종류가 다른 서비스에 같은 효과가 나타난다고 일반화할 수는 없다. Phylo 역시 모든 작업을 오픈 모델로 대체하지 않고 어려운 문제에 독점 모델을 병행하고 있다.
Phylo는 앞으로 실제 연구 작업에서 축적한 데이터를 활용해 오픈 모델을 미세조정하고 강화학습을 적용하는 방안을 추진할 계획이라고 밝혔다. 현재의 모델 활용에서 생명과학 과제에 특화된 모델 훈련으로 범위를 넓히겠다는 구상이다.
출처: Fireworks 공식 블로그 https://fireworks.ai/blog/phylo-brings-frontier-ai-to-more-scientists-with-open-models-on-fireworks · Phylo 공식 홈페이지 https://phylo.bio/









