
Microsoft Research 공식 블로그에 따르면 연구진은 2026년 6월 30일 AI 에이전트의 자연어 스킬 파일을 훈련 가능한 계층으로 다루는 SkillOpt 연구를 공개했다. SkillOpt는 모델 가중치를 바꾸지 않고, 에이전트가 사용하는 스킬 문서를 실행 결과와 검증 점수에 따라 반복적으로 수정하는 방식이다.
AI 에이전트는 도구를 호출하고 여러 단계를 거쳐 작업을 수행한다. 이 과정에서 문제는 단순한 도구 호출 가능 여부보다, 같은 종류의 작업을 얼마나 일관되게 끝내는가로 옮겨가고 있다. Microsoft Research는 기존 스킬 작성 방식이 전문가의 수작업, 강한 모델의 일회성 생성, 실행 뒤 느슨한 자기 수정에 의존해 성능 개선을 보장하기 어렵다고 설명했다.
SkillOpt는 스킬 파일을 고정된 대상 모델 밖에 놓인 훈련 가능한 매개변수처럼 취급한다. 대상 모델은 그대로 두고, 별도의 최적화 모델이 작업 실행 궤적을 읽어 성공 사례에서 유지할 절차와 실패 사례에서 고칠 절차를 추출한다. 이후 작은 추가·삭제·교체 편집을 제안하고, 후보 스킬이 별도 검증 집합에서 기존 스킬보다 높은 점수를 냈을 때만 반영한다.
이 구조는 프롬프트를 길게 덧붙이는 방식과 다르다. 연구진은 편집 예산을 텍스트 기반 학습률처럼 두고, 검증 관문과 거부된 편집 기록을 함께 사용해 스킬이 무제한으로 길어지거나 성능을 악화시키는 방향으로 흐르는 문제를 줄였다고 밝혔다. 최종 산출물은 배포 가능한 `best_skill.md` 형태의 짧은 자연어 스킬 파일이다.
공식 블로그는 SkillOpt가 여섯 개 벤치마크, 일곱 개 대상 모델, 세 가지 실행 모드에서 평가됐다고 설명했다. 연구진은 SearchQA, SpreadsheetBench, OfficeQA, DocVQA, LiveMathematicianBench, ALFWorld를 사용했고, 직접 대화형 실행뿐 아니라 Codex와 Claude Code 환경도 포함했다. 블로그에 따르면 SkillOpt는 52개 평가 조합에서 모두 최고 또는 공동 최고 성능을 냈다.
수치상 개선 폭도 공개됐다. Microsoft Research는 GPT-5.5 직접 대화 모드에서 여섯 벤치마크 평균이 58.8에서 82.3으로 올랐다고 밝혔다. 같은 인터페이스를 에이전트 루프에 적용했을 때도 Codex 환경에서는 스킬이 없는 기준보다 24.8점, Claude Code 환경에서는 19.1점 높았다고 설명했다.
연구진이 강조한 또 다른 지점은 전이 가능성이다. 공식 블로그는 Codex 안에서 훈련한 스프레드시트 스킬을 Claude Code에 그대로 옮겼을 때도 성능이 개선됐다고 설명한다. 이는 SkillOpt가 특정 실행 도구에만 맞춘 절차가 아니라, 재사용 가능한 작업 흐름 지식을 포착할 가능성을 보여준다.
GitHub에 공개된 SkillOpt 저장소는 이 방식을 오픈소스로 제공한다. 저장소 설명은 SkillOpt가 에폭, 미니배치, 학습률, 검증 게이트 같은 훈련 개념을 자연어 스킬 최적화에 적용한다고 정리한다. 설치와 재현 가이드, 웹 UI, 여러 백엔드와 벤치마크 구성도 함께 안내돼 있다.
이번 연구는 AI 에이전트 개발에서 조정 대상이 모델 자체에만 머물지 않는다는 점을 보여준다. 기업과 개발팀이 자체 업무를 자동화하려면 모델 선택뿐 아니라 작업 절차, 검증 기준, 실패 기록을 관리해야 한다. SkillOpt는 이런 절차 지식을 버전 관리 가능한 자연어 계층으로 다루는 접근을 제시했다는 점에서 의미가 있다.
다만 실제 서비스 적용에는 신중한 검증이 필요하다. 연구 결과는 벤치마크와 특정 실행 환경을 기준으로 한 것이며, 업무별 평가 데이터와 신뢰할 수 있는 검증기가 있어야 같은 방식의 개선을 기대할 수 있다. 에이전트가 접근하는 도구와 데이터의 권한 통제, 오류 발생 시 책임 범위도 별도로 설계해야 한다.
출처: Microsoft Research https://www.microsoft.com/en-us/research/blog/skillopt-agent-skills-as-trainable-parameters/
출처: GitHub microsoft/SkillOpt https://github.com/microsoft/SkillOpt
출처: arXiv https://arxiv.org/abs/2605.23904