
Perplexity 공식 연구 페이지에 따르면 회사는 대규모 정보 수집 업무를 겨냥한 조사 에이전트 벤치마크 ‘WANDR(Wide ANd Deep Research)’와 평가 도구를 공개했다. 경쟁사 지도 작성, 실사, 문헌 검토, 시장 분석, 제품 비교처럼 많은 대상을 찾은 뒤 각 항목을 근거 자료로 검증해야 하는 업무를 평가한다.
WANDR는 실제 서비스 요청에서 식별 정보를 제거해 얻은 패턴을 바탕으로 만든 500개 과제로 구성됐다. 각 과제는 단순한 정답 하나가 아니라 회사, 인물, 속성, 근거 URL이 이어지는 계층 구조를 요구한다. 500개 과제를 합치면 제출해야 하는 출처 기반 기록은 17만495개다. 과제 중앙값은 대상 50개, 대상당 기록 4개, 전체 기록 245개다.
평가 방식도 고정된 정답 목록과 다르다. 에이전트가 제출한 항목과 URL, 인용 구간, 답변을 대상으로 페이지를 다시 불러온 뒤 자료가 실제로 사용 가능한지, 주장이 과제 범위에 맞는지, 제출한 인용이 원문에 존재하는지, 페이지와 인용이 모든 요구사항을 뒷받침하는지를 판정한다. 일부 가지를 맞히면 부분 점수를 주는 소프트 지표와, 대상 하나에 필요한 전체 하위 구조가 맞아야 점수를 주는 하드 지표를 함께 사용한다.
Perplexity는 고정된 설정으로 여섯 개 상용 조사 시스템을 500개 과제에 각각 투입했다고 밝혔다. 회사 자체 결과에서 Perplexity의 Search as Code는 소프트 F1 0.363, 하드 F1 0.133으로 가장 높았다. Anthropic 시스템은 각각 0.249와 0.072였고, 나머지 시스템의 최고치는 소프트 F1 0.121, 하드 F1 0.035였다. 최고 점수도 완전한 근거 구조를 충족한 비율이 낮았다는 뜻이다.
오류는 검색 결과 페이지에 도달하는 단계보다 빠짐없이 대상을 찾고 충분한 근거를 구성하는 단계에서 커졌다. 회사 분석에서는 최상위 대상 발견의 평균 완성도가 시스템별 0.611~0.951이었고, 대상과 속성 경로가 확보된 뒤 마지막 근거 칸을 채우는 비율은 0.979~0.994였다. 제출 페이지가 과제의 실질 요건 하나 이상을 충족하지 못한 비율은 33.6~68.3%, 인용 구간이 해당 기록의 모든 주장을 지지하지 못한 비율은 57.5~86.6%로 집계됐다.
대상 수가 많아지고 조사 구조가 깊어질수록 성능 저하도 뚜렷했다. Perplexity 시스템의 하드 재현율은 요구 규모가 가장 작은 구간에서 0.219였지만 가장 큰 구간에서는 0.079로 낮아졌다. 중간 계층이 없는 과제와 세 개 이상인 과제를 비교하면 하드 재현율은 0.378에서 0.017로 떨어졌다. 일부 사례를 정확히 찾는 능력과 전체 목록을 빠짐없이 완성하는 능력 사이에 큰 간격이 있다는 설명이다.
Perplexity는 과제 설정과 스키마, 평가기, 실행 구성을 Apache 2.0 라이선스로 GitHub에 공개했다. 외부 연구자가 같은 과제를 실행하고 세부 실패 지점을 확인할 수 있도록 한 점은 벤치마크 검증에 도움이 된다. 다만 전체 평가는 여섯 공급자의 유료 API와 페이지 수집·판정용 API를 사용하며, 저장소도 전체 실행 비용이 매우 클 수 있고 자체 지출 상한이 없다고 안내한다.
결과 해석에는 이해관계도 고려해야 한다. 벤치마크 설계와 비교 실험을 Perplexity가 수행했고 자사 시스템이 선두로 나타났다. 공개 코드와 과제는 독립 재현의 기반이지만, 다른 연구진이 동일한 설정과 비용 조건에서 결과를 재현했다는 자료는 아직 확인되지 않았다. WANDR가 보여주는 핵심 신호는 특정 서비스의 순위보다, 현재 조사 에이전트가 대규모 목록의 완전성과 항목별 증거 품질을 동시에 유지하는 데 여전히 어려움을 겪는다는 점이다.
출처: Perplexity 공식 연구 페이지 https://research.perplexity.ai/articles/wandr-benchmark-evaluating-research-agents-that-must-search-wide-and-deep
출처: WANDR 공식 GitHub 저장소 https://github.com/perplexityai/wandr
출처: WANDR 공식 README https://raw.githubusercontent.com/perplexityai/wandr/main/README.md