DeLM은 네 가지 에이전트 코딩 벤치마크에서 평가된다. Terminal-Bench 4.0에서는 에이전트가 실시간 터미널에서 발견한 환경 상태와 실패한 시도를 공유하고, DeepSWE v1.1에서는 장기 소프트웨어 엔지니어링 작업에서 서로의 디버깅 진행 상황을 재사용한다. SWE-bench Verified에서는 실제 GitHub 이슈의 대안 원인과 수정 방법을 탐색하고, ProgramBench에서는 프로그램 전체를 처음부터 다시 만든다.

비교 대상은 기본 하위 에이전트 기능을 켜거나 끈 Codex와 Claude Code, AOrchestra다. SWE-bench Verified에서는 mini-SWE-agent도 비교 대상에 포함된다.

DeLM은 협업이 중요한 장기 작업을 대상으로 하므로 Terminal-Bench 4.0과 DeepSWE v1.1의 장시간 실행 작업 일부를 골라 평가한다. 작업은 GPT-6-Astra를 사용하는 Codex의 실제 소요 시간을 기준으로 선정했다. Terminal-Bench 4.0에서는 15분에서 1시간 사이에 완료된 작업 10개를, DeepSWE v1.1에서는 10분 이상 걸린 작업 10개를 선택했다.