
eunomia-bpf 연구진이 공개한 기술 설명과 코드 저장소에 따르면, 실험용 프로젝트 'qwen3-ebpf'는 Qwen3-0.6B의 28개 디코더 계층을 리눅스 eBPF에서 계산하고 다음 토큰을 고른다. eBPF는 보통 시스템 호출 관찰이나 패킷 처리 등에 쓰이지만, 이 실험은 언어모델의 수치 연산 자체를 커널이 검증한 프로그램으로 수행했다.
모든 추론 과정이 하나의 커널 프로그램 안에서 끝나는 것은 아니다. 사용자 공간의 C 프로그램이 모델 가중치를 불러와 토큰화를 수행하고, 행렬 연산·정규화·어텐션 등을 담당하는 여러 eBPF 프로그램을 순서대로 호출한다. 키·값(KV) 캐시는 BPF 맵에 저장하며, 최종 어휘 점수 계산과 다음 토큰 선택도 eBPF에서 이뤄진다. 코드는 네트워크 인터페이스에 지속적으로 붙는 서비스를 설치하지 않고 BPF 테스트 실행 경로를 사용한다.
연구진은 리눅스 6.17 기반 arm64 시험 환경에서 15만1936개 토큰 어휘에 대한 점수를 계산했다고 밝혔다. 한 토큰 처리 시간은 약 1.2초였다. 이는 연구진이 제시한 단일 시험 환경의 측정값으로, 일반적인 CPU·GPU 추론 엔진과의 종합 성능 비교나 독립 검증 결과는 아니다. 정수 기반 연산으로 원래 BF16 모델을 근사한 만큼 출력 품질도 다양한 문맥에서 더 확인해야 한다.
이번 결과는 eBPF 검증기의 제약 안에서도 언어모델 연산을 여러 작은 프로그램으로 나눠 실행할 수 있음을 보여준다. 다만 가중치 공급과 실행 순서 제어는 여전히 사용자 공간에 의존하고, 메모리 사용량과 호출 횟수도 남은 과제다. 연구진 역시 이를 CPU나 GPU 추론을 대체할 제품이 아닌 기술적 가능성을 확인한 실험으로 규정했다.
출처: eunomia-bpf 연구진 기술 설명 https://eunomia.dev/blog/2026/09/24/qwen3-ebpf-in-kernel-inference/ · qwen3-ebpf 공식 코드 저장소 https://github.com/eunomia-bpf/qwen3-ebpf









