Wenyu Du와 Stephen Chung은 여러 에이전트가 과학 생태계를 모의하는 개방형 환경 Station을 평가했다. 세 편의 ICLR 구두 발표 논문에서 연구 질문만 에이전트에 제공하고 결과는 숨긴 실험에서, 에이전트는 원래 연구 결과를 기준으로 평균 62.7%의 항목을 재발견했다.

연구진은 개방형 과제에서 중간 평가 지표가 부족해도 탐색을 이어가도록 Supervisor 메커니즘과 주기적 메타 성찰(Meta Reflection)을 Station에 추가했다. 실험에서는 웹 접근도 차단했다. 비교 대상인 Codex Multiagent-v2는 15.4%, AI Scientist-v2는 14.4~20.6%의 항목을 재발견했다.

절제 실험과 행동 분석에서 두 메커니즘을 함께 적용하면 연구 범위와 지속성이 개선되는 것으로 나타났다. 연구진은 정답 논문을 제공하지 않은 개방형 과제 두 개도 평가했으며, 에이전트가 내놓은 일부 발견은 지식 컷오프 이후 연구자들이 보고한 발견과 밀접하게 일치했다고 밝혔다. 초록에는 이 두 과제의 구체적인 설정이나 발견 내용은 제시되지 않았다.

이 결과는 논문 결과를 기준으로 한 재발견 비율과 일부 발견의 유사성에 관한 평가다. 연구 초록은 Station이 개방형 과학 발견을 전반적으로 수행할 수 있다는 결론을 제시하지만, 평가 규모와 조건이 제한돼 있으므로 다른 연구 분야나 실제 연구 환경으로 일반화할 근거까지 제공하지는 않는다.

논문: arXiv 초록 · PDF · HTML · DOI