TL;DR

  • 이 연구는 겹치는 메모리 상태를 공유하는 비동기 추론 코루틴을 정의하는 AsyncLLM을 통해, 별도 작업별 훈련 없이 비디오 이해·게임·모니터링에 적응하는 일반 비동기 에이전트를 구현함.
  • 에이전트의 각 코루틴은 자체 캐시 블록에 쓰고 다른 코루틴의 출력은 캐시 뷰로 읽으며, 동시에 실행되는 코루틴은 하나의 배치를 공유함.
  • Qwen 3.x 모델은 스트리밍 비디오 이해와 비디오게임, 시스템 모니터링에서 비동기 방식으로 작동하며, 스트리밍 비디오 평가에서 훈련 전용 모델 Mage-VL을 능가함.
  • 에이전트가 실행 중인 추론 구조를 직접 다시 작성하고 수정된 런타임으로 행동하는 자기 정의 방식은 ViZDoom 평가에서 초기 성과를 보였지만 아직 안정적이지 않음.
  • DevOps-Gym에서 AsyncLLM은 순차 에이전트의 45%에 해당하는 순전파 횟수를 사용하고, 평균적으로 로그 이벤트의 55%가 발생한 시점에 답변함.

일반 비동기 에이전트로서의 대형 언어 모델

  • 대형 언어 모델(LLM)은 자율 에이전트로서 역량이 커지고 있지만, 일반적으로 입력 읽기, 추론, 응답 또는 도구 호출을 순차적으로 반복함.
  • 음성 비서, 체화형 에이전트, 모니터링 시스템처럼 실제 환경에서는 에이전트가 추론하거나 다른 작업을 하는 동안 새 입력이 들어옴.
  • 기존 LLM은 음성 상호작용과 비디오 스트림을 위한 특화 아키텍처, 로봇 제어용 시각언어행동 모델(VLA), API 사용을 위한 비동기 도구 호출 등으로 이런 상황에 대응함.
  • 이 연구는 서로 다른 비동기 작업에서 일반화해 여러 종류의 동시성에 적응할 수 있는 일반 비동기 에이전트를 제안함.
  • AsyncLLM은 사용자 또는 에이전트가 겹치는 메모리 상태를 가진 추론 코루틴을 정의하도록 하는 비동기 LLM 프레임워크임.
  • Qwen 3.x 모델은 작업별 훈련 없이 스트리밍 비디오 이해, 비디오게임, 모니터링에서 비동기 방식으로 작동함.
  • 훈련 없이 동작하는 DOOM 에이전트에서는 관찰 코루틴과 행동 코루틴이 하나의 캐시를 공유하며 병렬로 진행돼, 게임을 지켜보면서 계속 행동함.

AsyncLLM 작동 방식

  • AsyncLLM에서는 공유 캐시 블록으로 통신하는 코루틴들의 조합으로 비동기 에이전트를 정의함.
  • 각 코루틴은 자체 캐시 블록에 쓰고, 캐시 뷰를 통해 다른 코루틴의 출력에 접근함.
  • 예시 에이전트는 추론을 진행하는 동시에 사용자에게 진행 상황을 요약해 제공함. 각 색상은 캐시 블록을 나타내며, 테두리로 표시된 블록은 코루틴이 쓰는 위치임.
  • 에이전트는 Qwen/Qwen3.5-9B를 사용하는 AsyncLLM 인스턴스와 프롬프트·추론·작성용 캐시 블록을 만듦.
  • 추론 코루틴은 프롬프트와 자체 추론 블록을 읽으며 생성하고, 문단이 끝나면 이벤트를 설정해 작성 코루틴에 새 요약을 만들 시점을 알림.
  • 작성 코루틴은 추론 코루틴의 블록이 커지는 과정을 읽으며 요약을 생성하고, 토큰을 사용자에게 전송함. 예를 들어 음성 합성(TTS)으로 말하게 할 수 있음.
  • 두 코루틴은 동시에 실행되며, 둘 다 활성 상태일 때 하나의 배치를 공유함.
  • 추론 코루틴은 프롬프트와 자신의 추론만 읽고 작성 코루틴의 출력은 보지 않음. 작성 코루틴은 프롬프트와 추론 블록을 읽고 요약 블록에 씀.

데모

  • 아래 데모는 모두 AsyncLLM을 기반으로 하며, 각 에이전트는 공유 캐시 블록으로 통신하는 코루틴들로 구성됨.
  • 스트리밍 비디오에서는 이벤트 탐지기가 들어오는 각 프레임에 점수를 매기고, 비디오가 재생되는 동안 에이전트가 새 이벤트를 설명함.
  • Qwen3.5-35B-A3B는 파란색 LED 조명이 있는 상품 목록의 램 용량을 찾음.
  • 같은 모델이 빨간 케이스에 든 기타 판매자의 이메일 주소를 찾음.
  • VisualWebArena Classifieds에서 웹 에이전트를 시연함.

자기 정의 에이전트

  • AsyncLLM 추론은 파이썬에서 직접 정의되므로, 에이전트에 자체 런타임을 제공하고 실행할 코루틴, 공유할 캐시 블록, 환경에 반응하는 방식을 스스로 정의하게 할 수 있음.
  • 에이전트는 추론 코드를 다시 작성하는 도구 호출을 생성하고, 새 코드를 이미 실행 중인 인스턴스에 적용함. 코드를 다시 작성해도 캐시 블록과 백그라운드 작업은 유지됨.
  • 환경의 각 단계에서 에이전트의 act() 메서드를 실행하고, 평가 하네스가 에이전트의 점수를 매겨 다음 라운드의 프롬프트에 결과를 전달함.
  • Qwen3.6-35B-A3B로 두 가지 ViZDoom 환경에서 이 반복 절차를 실행함. 에이전트는 런타임과 이전 평가 결과를 받고 추론 코드를 수정할 수 있지만, 어떤 추론 구조를 만들지에 관한 작업별 안내는 받지 않음.
  • 자기 정의 에이전트는 평가에서 좋은 초기 성과를 보이지만 아직 안정적이지 않으며, 향후 LLM이 환경 설명을 바탕으로 스스로 적응하는 에이전트를 만들 가능성을 시사함.
  • 자세한 내용은 블로그 글 KV 캐시를 에이전트 런타임으로에서 다룸.

결과

  • 스트리밍 비디오 이해 평가에서 AsyncLLM 에이전트는 비디오 스트리밍 전용으로 훈련된 Mage-VL보다 높은 점수를 기록함. AUROC·트리거 정확도·시간 값·PAUC(ω=0.5) 순서의 결과는 다음과 같음.
  • AsyncLLM Qwen3.5-9B: 0.677, 62.82, 39.62, 0.541.
  • AsyncLLM Qwen3.8-27B: 0.608, 54.88, 33.27, 0.504.
  • AsyncLLM Qwen3.6-35B-A3B: 0.651, 62.55, 37.46, 0.539.
  • Mage-VL: 0.555, 52.79, 27.87, 0.428.
  • DevOps-Gym 시스템 모니터링 결과는 정확도, 순전파 횟수, 평균 이벤트 처리 비율 순서임.
  • 순차 에이전트: 61.7%, 68,452회, 100%.
  • 조기 답변을 추가한 방식: 47.0%, 66,641회, 58.71%.
  • 행 건너뛰기를 추가한 방식: 26.4%, 73,686회, 65.86%.
  • AsyncLLM: 55.8%, 38,375회, 55.49%.
  • AsyncLLM은 로그 이벤트의 평균 55%가 발생한 뒤 답변하며, 순차 에이전트 순전파 횟수의 45%를 사용함.

인용 정보

  • 제목: LLMs are General Asynchronous Agents.
  • 저자: George Yakushev, Denis Mazur, Vladimir Bartenev, Vyacheslav Zhdanovskiy, Timofey Byzov, Vladimir Kaurkin, Vadim Pastushenko. George Yakushev와 Denis Mazur는 동등하게 기여함.
  • 연도: 2026. arXiv 식별자: 2609.35427. 분류: cs.LG.
  • 논문: https://arxiv.org/abs/2609.35427