TL;DR

  • MicroLLM Lab은 브라우저에서 소형 언어 모델 7개를 실행하고, 객관적 검사의 정확도와 속도를 비교하는 도구임.
  • 검사는 글쓰기 품질이 아니라 정규식 또는 정확한 토큰으로 판정하며, 1억 3,500만 매개변수 모델이 실패하는 경우도 측정 결과에 포함됨.
  • 활성 모델 또는 로드된 모든 모델로 테스트 묶음을 실행하고, 256토큰 지속 속도 테스트도 수행할 수 있음.
  • 속도와 정확도 기록은 이 기기 안에 저장되며, 모델별 최신 테스트 묶음 결과를 차트로 확인할 수 있음.
  • 기기 정보와 최고·지속 토큰 처리 속도를 담은 인증서 이미지를 만들거나, 자바스크립트로 벤치마크를 작성할 수 있음.

모델 테스트 및 검사

  • 모델을 선택한 뒤 실행하며, 검사 결과는 글쓰기 품질이 아니라 정규식 또는 정확한 토큰 일치 여부로 판정함.
  • 1억 3,500만 매개변수 모델이 검사에서 실패할 수도 있으며, 그 실패도 측정 대상임.
  • 이전 토큰 처리 속도 기록이 있으면 예상치를 계산함.
  • 활성 모델에서 테스트 묶음 실행, 로드된 모든 모델에서 테스트 묶음 실행, 256토큰 지속 속도 테스트 실행을 선택할 수 있음.
  • 테스트별 실행 시간(밀리초)과 정확도를 확인할 수 있음.

속도 및 정확도 비교

  • 이 브라우저에서 실행한 테스트의 지속 생성 속도(초당 토큰 수), 테스트 묶음 전체 실행 시간, 객관적 검사 통과율을 표시함.
  • 최신 테스트 묶음 기준 정확도, 평균 초당 토큰 수, 테스트 묶음 실행 시간(밀리초)을 확인할 수 있음.
  • 수치는 이 기기에 저장되며, 차트에는 모델별 최신 테스트 묶음 결과가 반영됨.
  • 저장된 비교 기록을 지울 수 있음.

벤치마크 인증서 및 공유

  • 기기 하드웨어 정보와 최고·지속 초당 토큰 수를 담은 검증 가능한 성능 인증서를 만들고 다운로드할 수 있음.
  • 이름 또는 별칭과 기기·하드웨어 정보를 입력한 뒤 인증서 이미지를 생성할 수 있음.
  • 인증서 이미지를 PNG로 다운로드하거나 이미지를 복사하고, 텍스트 요약을 복사할 수 있음.

자바스크립트 벤치마크 작성

  • 자바스크립트로 벤치마크를 작성할 수 있음.
  • 편집기 내용은 현재 출처에서 eval()로 실행되며, 각 검사는 모델이 생성한 텍스트를 대상으로 수행됨.
  • 객체 예제와 함수 예제를 선택하고 코드를 평가해 실행할 수 있음.
  • 더 큰 언어 모델에 전달할 프롬프트를 확인하고 복사할 수 있으며, 함수 형식도 선택할 수 있음.