TL;DR
- 실제 지식 업무를 다루는 AI 에이전트에는 수천 단계에 걸친 비정형 업무 흐름과 변화하는 환경을 반영한 데이터가 필요함.
- 현재 컴퓨터 사용 에이전트 데이터는 화면·입력·상태 변화를 기록하는 관측 가능성 측면에서 발전했지만, 현실적인 시나리오의 범위를 나타내는 분포는 여전히 구조화된 단일 목표 작업에 머묾.
- 실제 업무는 여러 목표와 작업이 얽혀 있고, 메시지와 결정 등 새로운 정보에 따라 중단·재개·수정되므로 주변 맥락을 보존해야 함.
- 개방형 업무를 학습하려면 무엇을 할지, 무엇이 우선인지, 다른 목표가 끼어들 때 어떻게 조정할지, 언제 결과가 충분한지를 보여주는 데이터가 필요함.
- Fig는 실제 데스크톱의 개방형 업무를 바탕으로 차세대 AI 시스템을 위한 데이터 인프라를 구축 중임.
실제 지식 업무는 단일 작업이 아님
- 여러 창과 모니터에는 알림, 메시지 초안, 문서, 브라우저 탭이 함께 표시되며, 각 사용자의 데스크톱은 이전에 수행한 행동이 누적된 고유한 작업 환경임.
- 사람은 복잡한 환경에서 목표를 향해 나아가며, 맥락을 전환하고 메시지에 답하거나 알림을 무시하며, 작업을 멈췄다가 다시 시작하고 여러 일을 병행함.
- AI 역량이 높아짐에 따라 모델이 사람과 같은 공간에서 같은 목표를 향해 안정적으로 함께 일할 것이라는 기대가 커지고 있음.
- 모델은 아직 기대에 미치지 못하지만, 자체적으로 완결된 장기 작업을 수행하는 능력은 빠르게 발전 중이며, Opus 5.5와 GPT-6 Astra는 각각 OSWorld 2.0에서 72.6%와 81.8%를 기록함.
- 그러나 이들 평가 작업과 수행 환경은 에이전트가 실제로 배치될 환경보다 훨씬 단순하며, 명확한 목표와 경로, 달성할 결과, 완료 기준이 사전에 주어짐.
- 실제 사람의 업무는 이처럼 깔끔하게 정의되는 경우가 드물며, 작업으로 돌아왔을 때는 새 메시지와 결정이 추가되고 작업이 새로운 정보에 의존할 수 있음.
- 사람은 이런 맥락을 이어가며 어떤 일을 재개하거나 수정하고, 방향을 바꿀지 판단함. 복잡하고 개방된 환경에서 에이전트가 자율적으로 행동하려면 학습 데이터도 이러한 기반을 반영해야 함.
데이터의 양과 길이를 넘어
- 컴퓨터 사용 에이전트는 사람이나 에이전트가 컴퓨터를 조작하는 과정을 개별 단계와 행동으로 기록한 궤적(trajectory)을 바탕으로 학습함.
- 궤적은 보통 목표나 작업 지시로 시작하며, 작업에 사용된 앱을 중심으로 화면에 보인 내용, 입력, 그에 따른 변화를 기록함.
- 모델은 이러한 신호를 통해 현재 상태와 목표가 주어졌을 때 취할 행동을 각 단계에서 학습함.
- 궤적이 담는 신호는 데이터의 양과 길이 외에도 관측 가능성과 행동·환경의 현실성이라는 두 차원으로 확장됨.
- 관측 가능성(Observability)은 기록에서 실제 상태, 입력, 그에 따른 상태 변화가 얼마나 정확하게 표기되는지를 뜻함. 이미지나 동영상과 키보드·마우스 입력, 접근성 트리, DOM 스냅샷, 앱 전환 출처 정보를 함께 기록하면 간극을 줄일 수 있음.
- 분포(Distribution)는 데이터 수집이 포괄하는 사건과 시나리오의 범위임. 여러 애플리케이션과 GUI, 해결 경로, 시작 상태, 실패 사례가 포함되며, 다양한 현실적 상황을 얼마나 폭넓게 보여줬는지가 실제 배치 환경과의 유사성을 좌우함.
- 개방형 업무의 중요한 신호는 주변 맥락에 있음. 행동이 어떤 목표를 위한 것인지, 다른 어떤 일이 진행 중인지, 무엇이 보류되거나 중단됐는지를 데이터가 보존해야 학습에 활용할 수 있음.
- 관측 가능성의 발전으로 접근성 정보와 입력 텔레메트리를 동기화하는 방식이 표준으로 자리 잡음. 정확도를 높이며 더 많은 정보를 측정하는 도구를 만드는 공학적 문제이므로 발전시키기 쉬운 축임.
- 반면 분포의 발전은 주로 개별 작업의 경계 안에서 이뤄짐. 앱의 수와 해결 경로, 도구 사용 방식, 목표의 길이와 복잡성이 다양해졌지만, 작업은 여전히 정돈된 데스크톱에서 수행하는 구조화된 단일 목표 과제임.
- 필요한 복잡성은 사전 정의된 목표에 단계를 더하는 데서 생기는 것이 아니라, 작업과 새로운 정보, 작업 사이에서 내려지는 결정 간의 연결 관계를 정의하는 데서 생김.
새롭게 넘어야 할 산
- 현재 학습 데이터의 대부분을 차지하는 스크립트형 작업에는 실제 환경의 잡음 속에서 길을 찾고 개방형 목표를 향해 나아가는 방법에 관한 학습 신호가 부족함.
- 이를 위해서는 실제 업무가 전개되는 모습을 포착해야 하며, 얽혀 있는 작업의 세부 사항과 행동 전후 및 행동 사이의 판단을 담은 수천 단계 규모의 비정형 작업 흐름이 필요함.
- 개방형 업무에는 정해진 지시나 작업 목록, 충분히 완료됐는지를 판정하는 평가 기준이 없음. 사람은 경험을 바탕으로 목표를 결과물로 구체화하고, 필요한 완료 순서와 완료로 판단할 시점을 정함.
- 여러 창, 메시지 알림, 회의, 긴급 요청이 계속 이어지는 공유 환경에서도 안정적으로 작동해야 함. 데이터는 관련 있는 내용을 가려내고 맥락을 이어가며 중단한 지점부터 작업을 재개하는 방식을 보여줘야 함.
- 넘어야 할 산은 개방형 업무를 어렵게 만드는 판단과 복잡한 환경에 있음. 필요한 일을 파악하고, 지금 중요한 일을 결정하고, 다른 목표가 끼어들 때 적응하며, 결과가 충분한지 판단해야 함.
- 이러한 역량을 발전시키려면 현재 학습에 쓰이는 스크립트형 작업 흐름과 근본적으로 다른 데이터가 필요함. 변화하는 환경에서 실제 업무를 연속적으로 관찰하고 차세대 모델의 학습 신호로 구조화하는 방식임.
Fig와 함께 구축
- Fig는 환경을 인식하고 안정적으로 행동하며 경험을 통해 개선되는 차세대 AI 시스템의 데이터 요건을 해결하기 위한 인프라를 구축 중임.
- 이를 위해서는 사람들이 실제로 일하는 패턴과 업무가 이뤄지는 공간의 복잡성에 기반한 데이터, 즉 실제 데스크톱에서 수행되는 개방형 업무가 필요함.
- Fig는 이 격차를 줄이기 위한 작업을 진행 중임.
- 원문 인용 정보: Joseph Hakim, Fig, 2026, Open-Ended Data is a Bottleneck for AI systems Tackling Real Knowledge Work.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요