TL;DR

  • Jev를 AI 어시스턴트 세션의 사전 준비 단계에 적용하면, 필요한 기술·파일·도구를 한꺼번에 불러와 준비 시간 59초가 걸린 사례를 줄일 수 있음.
  • Jev는 작업 설명과 좁은 범위의 질문을 함께 처리해 필요한 항목을 고르며, 사례에서는 42개 예·아니오 질문으로 기술 23개, 지연 도구 14개, 후보 파일 5개를 확인함.
  • Rigour Mode의 판정 모델로 Jev를 사용하면 예시 5개 평가 시간이 기존 대형 언어 모델(LLM)의 약 28초에서 2.4초로 줄어들지만, 오판 가능성도 확인됨.
  • Jev는 대화 차례별로 빠른 모델·일반 모델·고성능 모델을 선택하고, 불확실하거나 라우팅에 실패하면 더 높은 등급 또는 고성능 모델로 전환함.
  • Jev에는 프로젝트 작업 권한이 없고 수정은 기존 검증·승인 절차를 따르며, 판정 실패 후 보정은 최대 3회로 제한됨.

AI 어시스턴트 준비 단계 가속

  • AI 글쓰기 어시스턴트는 보통 초반 대화 차례를 기술 탐색, 기술 불러오기, 프로젝트 파일과 도구 스키마 읽기에 사용함.
  • 병렬 처리, 문맥 수집에 더 빠른 모델 사용, 사용자 요청에 따른 기술 추천·사전 불러오기로 최적화할 수 있지만, 복잡성이 커지고 시간 단축에는 빠르게 한계가 생김.
  • 이 사전 준비 단계에 Jev를 적용하는 실험을 시작함. 짧은 작업 설명과 함께 특정 기술·파일·도구가 필요한지 묻는 좁은 질문들을 Jev에 전달하면, Jev가 질문에 일괄 응답하고 TeXposit가 요청된 항목을 한꺼번에 불러옴.
  • 실제 기록의 다소 극단적인 사례에서 요청은 “이 논문에서 TikZ로 시각화해야 할 복잡한 개념은 무엇인가?”였음. 어시스턴트의 응답까지 73초가 걸렸고, 그중 처음 59초는 준비 단계에 사용됨.
  • TikZ 기술을 불러오고, 프로젝트 댓글 파일을 두 차례에 걸쳐 읽고, main.tex의 두 범위를 읽음.
  • 나머지 14초가 실제 답변에 사용됨.
  • 같은 요청에 Jev 기반 사전 점검을 적용하면서 프로젝트의 기술 23개, 지연 도구 14개, 후보 파일 5개에 대한 예·아니오 질문 42개를 전달함.
  • Jev는 TikZ 기술, main.tex, 댓글 파일을 골랐으며, 이는 어시스턴트가 직접 가져왔던 항목과 동일함.
  • 추가로 두 번째 기술, 프로젝트 메모 파일, PDF 다운로드 도구도 골랐지만 실제로는 사용되지 않음.
  • 이는 토큰을 조금 낭비하지만 시간 절약에 비하면 미미하며, 제한값과 상한으로 관리함. 파일은 최대 세 개까지 읽고, 주 모델의 첫 대화 차례에는 도구를 최대 네 개까지 사용할 수 있게 함.
  • 전체 시간 절감량을 측정하거나 벤치마크를 수행하지는 않았지만, 특히 주 모델이 느릴 때 차이를 체감함.
  • 이 구성은 Jev에 프로젝트 작업 권한을 주지 않음. 주 모델이 계속 작업을 결정하고, 편집은 이전과 동일한 검증 및 승인 절차를 거치므로 최종 출력 품질이 저하되지 않음. Jev를 판정자로도 사용하면 출력 품질이 향상됨.

판정자 Jev

  • 최근 업데이트에서 맞춤형 요구사항을 기준으로 모델의 최종 답변을 자동 점검하는 Rigour Mode를 도입함. 사용자가 요구사항을 하나씩 확인하거나 모델이 규칙을 어기지 않을 것이라고 믿을 필요를 줄이는 기능임.
  • 출력 품질에는 도움이 됐지만 시간과 토큰 비용이 상당했음. 판정자는 긴 설명 대신 실패한 기준만 보고하므로, 이 기능의 LLM을 Jev로 대체할 가능성이 있음.
  • Jev는 활성화된 각 요구사항을 대화 내용 및 LLM이 제안한 최종 답변이나 편집 내용과 병렬로 대조함. 점검에 실패하면 주 모델에 피드백을 보내며, 주 모델은 사용자가 답변을 보기 전이나 편집 내용이 승인 절차에 들어가기 전에 답변을 수정함.
  • 비교 사례 다섯 개를 평가하는 데 기존 LLM 기반 판정자는 약 28초, Jev는 2.4초가 걸림.
  • Jev는 네 사례에서 기존 판정자와 같은 결과를 냄.
  • 다섯 번째 사례에서는 한계를 밝히지 않았다는 이유로 적절한 답변을 잘못 거부함.
  • 추가 시험과 벤치마크가 필요할 수 있지만, Rigour Mode는 활성화되지 않으면 쓸모가 없고 작업 흐름을 늦추면 사용자가 활성화하지 않으므로 가끔 발생하는 오탐은 감수할 만할 수 있음.
  • 보정 반복은 최대 세 번으로 제한함. 세 번 실패하면 답변의 엄밀성이 충분하지 않을 수 있다는 명시적 경고와 함께 작업을 진행함.
  • 엄격한 판정이나 해결 불가능한 요청이 작업을 영구히 막는 일을 방지하며, 예를 들어 가용한 증거로 답할 수 없는 질문인지 사용자가 파악하는 데 도움이 됨. 출처와 논리적 연결이 의심스러운 부실한 답변을 LLM이 내놓는 상황도 피할 수 있음.

대화 차례별 라우터로서의 Jev

  • 도구 이름을 지정해 실행하거나 컴파일러가 이미 찾아낸 오류를 수정하는 등 기계적인 대화 차례가 있는 반면, 일반적인 글쓰기 판단이나 핵심 주장·복잡한 지시를 다루는 차례도 있음.
  • TeXposit는 빠른 모델, 일반 모델, 고성능 모델의 세 등급을 세션마다 유연하게 사용할 수 있게 구성함. 예로 Haiku, Sonnet, Opus와 같은 모델을 들 수 있음.
  • Jev를 사용하면 다음 대화 차례에 사용할 등급을 매 차례 결정할 수 있음. Jev가 불확실하면 더 높은 등급으로 올리고, 라우팅이 실패하면 고성능 모델을 기본값으로 사용함.
  • Jev는 대화 차례별 자동 기술 탐색도 담당함. 이전에는 매우 단순한 자연어 처리(NLP)를 바탕으로 사용자의 요청과 관련된 기술을 LLM에 추천했음.
  • 이제 직접 작성한 문구 목록을 Jev의 예·아니오 질문으로 대체함. 사용자가 기술 설명에 쓰인 단어를 사용하지 않아도 요청이 특정 도구나 기술을 가리킬 수 있기 때문임.
  • 현재 라우터는 OpenRouter 키를 직접 가져와 사용하는 사용자에게 적용되지 않음. 시간을 절약하더라도 묻지 않고 다른 모델로 전환하는 것은 바람직하지 않은 절충임.