TL;DR
- 이 연구는 겹치는 메모리 상태를 공유하는 비동기 추론 코루틴을 정의하는
AsyncLLM을 통해, 별도 작업별 훈련 없이 비디오 이해·게임·모니터링에 적응하는 일반 비동기 에이전트를 구현함. - 에이전트의 각 코루틴은 자체 캐시 블록에 쓰고 다른 코루틴의 출력은 캐시 뷰로 읽으며, 동시에 실행되는 코루틴은 하나의 배치를 공유함.
Qwen 3.x모델은 스트리밍 비디오 이해와 비디오게임, 시스템 모니터링에서 비동기 방식으로 작동하며, 스트리밍 비디오 평가에서 훈련 전용 모델Mage-VL을 능가함.- 에이전트가 실행 중인 추론 구조를 직접 다시 작성하고 수정된 런타임으로 행동하는 자기 정의 방식은 ViZDoom 평가에서 초기 성과를 보였지만 아직 안정적이지 않음.
- DevOps-Gym에서
AsyncLLM은 순차 에이전트의 45%에 해당하는 순전파 횟수를 사용하고, 평균적으로 로그 이벤트의 55%가 발생한 시점에 답변함.
일반 비동기 에이전트로서의 대형 언어 모델
- 대형 언어 모델(LLM)은 자율 에이전트로서 역량이 커지고 있지만, 일반적으로 입력 읽기, 추론, 응답 또는 도구 호출을 순차적으로 반복함.
- 음성 비서, 체화형 에이전트, 모니터링 시스템처럼 실제 환경에서는 에이전트가 추론하거나 다른 작업을 하는 동안 새 입력이 들어옴.
- 기존 LLM은 음성 상호작용과 비디오 스트림을 위한 특화 아키텍처, 로봇 제어용 시각언어행동 모델(VLA), API 사용을 위한 비동기 도구 호출 등으로 이런 상황에 대응함.
- 이 연구는 서로 다른 비동기 작업에서 일반화해 여러 종류의 동시성에 적응할 수 있는 일반 비동기 에이전트를 제안함.
AsyncLLM은 사용자 또는 에이전트가 겹치는 메모리 상태를 가진 추론 코루틴을 정의하도록 하는 비동기 LLM 프레임워크임.Qwen 3.x모델은 작업별 훈련 없이 스트리밍 비디오 이해, 비디오게임, 모니터링에서 비동기 방식으로 작동함.- 훈련 없이 동작하는
DOOM에이전트에서는 관찰 코루틴과 행동 코루틴이 하나의 캐시를 공유하며 병렬로 진행돼, 게임을 지켜보면서 계속 행동함.
AsyncLLM 작동 방식
AsyncLLM에서는 공유 캐시 블록으로 통신하는 코루틴들의 조합으로 비동기 에이전트를 정의함.- 각 코루틴은 자체 캐시 블록에 쓰고, 캐시 뷰를 통해 다른 코루틴의 출력에 접근함.
- 예시 에이전트는 추론을 진행하는 동시에 사용자에게 진행 상황을 요약해 제공함. 각 색상은 캐시 블록을 나타내며, 테두리로 표시된 블록은 코루틴이 쓰는 위치임.
- 에이전트는
Qwen/Qwen3.5-9B를 사용하는AsyncLLM인스턴스와 프롬프트·추론·작성용 캐시 블록을 만듦. - 추론 코루틴은 프롬프트와 자체 추론 블록을 읽으며 생성하고, 문단이 끝나면 이벤트를 설정해 작성 코루틴에 새 요약을 만들 시점을 알림.
- 작성 코루틴은 추론 코루틴의 블록이 커지는 과정을 읽으며 요약을 생성하고, 토큰을 사용자에게 전송함. 예를 들어 음성 합성(TTS)으로 말하게 할 수 있음.
- 두 코루틴은 동시에 실행되며, 둘 다 활성 상태일 때 하나의 배치를 공유함.
- 추론 코루틴은 프롬프트와 자신의 추론만 읽고 작성 코루틴의 출력은 보지 않음. 작성 코루틴은 프롬프트와 추론 블록을 읽고 요약 블록에 씀.
데모
- 아래 데모는 모두
AsyncLLM을 기반으로 하며, 각 에이전트는 공유 캐시 블록으로 통신하는 코루틴들로 구성됨. - 스트리밍 비디오에서는 이벤트 탐지기가 들어오는 각 프레임에 점수를 매기고, 비디오가 재생되는 동안 에이전트가 새 이벤트를 설명함.
Qwen3.5-35B-A3B는 파란색 LED 조명이 있는 상품 목록의 램 용량을 찾음.- 같은 모델이 빨간 케이스에 든 기타 판매자의 이메일 주소를 찾음.
VisualWebArena Classifieds에서 웹 에이전트를 시연함.
자기 정의 에이전트
AsyncLLM추론은 파이썬에서 직접 정의되므로, 에이전트에 자체 런타임을 제공하고 실행할 코루틴, 공유할 캐시 블록, 환경에 반응하는 방식을 스스로 정의하게 할 수 있음.- 에이전트는 추론 코드를 다시 작성하는 도구 호출을 생성하고, 새 코드를 이미 실행 중인 인스턴스에 적용함. 코드를 다시 작성해도 캐시 블록과 백그라운드 작업은 유지됨.
- 환경의 각 단계에서 에이전트의
act()메서드를 실행하고, 평가 하네스가 에이전트의 점수를 매겨 다음 라운드의 프롬프트에 결과를 전달함. Qwen3.6-35B-A3B로 두 가지 ViZDoom 환경에서 이 반복 절차를 실행함. 에이전트는 런타임과 이전 평가 결과를 받고 추론 코드를 수정할 수 있지만, 어떤 추론 구조를 만들지에 관한 작업별 안내는 받지 않음.- 자기 정의 에이전트는 평가에서 좋은 초기 성과를 보이지만 아직 안정적이지 않으며, 향후 LLM이 환경 설명을 바탕으로 스스로 적응하는 에이전트를 만들 가능성을 시사함.
- 자세한 내용은 블로그 글 KV 캐시를 에이전트 런타임으로에서 다룸.
결과
- 스트리밍 비디오 이해 평가에서
AsyncLLM에이전트는 비디오 스트리밍 전용으로 훈련된Mage-VL보다 높은 점수를 기록함. AUROC·트리거 정확도·시간 값·PAUC(ω=0.5) 순서의 결과는 다음과 같음. AsyncLLM Qwen3.5-9B: 0.677, 62.82, 39.62, 0.541.AsyncLLM Qwen3.8-27B: 0.608, 54.88, 33.27, 0.504.AsyncLLM Qwen3.6-35B-A3B: 0.651, 62.55, 37.46, 0.539.Mage-VL: 0.555, 52.79, 27.87, 0.428.- DevOps-Gym 시스템 모니터링 결과는 정확도, 순전파 횟수, 평균 이벤트 처리 비율 순서임.
- 순차 에이전트: 61.7%, 68,452회, 100%.
- 조기 답변을 추가한 방식: 47.0%, 66,641회, 58.71%.
- 행 건너뛰기를 추가한 방식: 26.4%, 73,686회, 65.86%.
AsyncLLM: 55.8%, 38,375회, 55.49%.AsyncLLM은 로그 이벤트의 평균 55%가 발생한 뒤 답변하며, 순차 에이전트 순전파 횟수의 45%를 사용함.
인용 정보
- 제목:
LLMs are General Asynchronous Agents. - 저자: George Yakushev, Denis Mazur, Vladimir Bartenev, Vyacheslav Zhdanovskiy, Timofey Byzov, Vladimir Kaurkin, Vadim Pastushenko. George Yakushev와 Denis Mazur는 동등하게 기여함.
- 연도: 2026. arXiv 식별자: 2609.35427. 분류: cs.LG.
- 논문: https://arxiv.org/abs/2609.35427
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요