TL;DR

  • TypeSafe의 Jev는 에이전트와 자동화 소프트웨어를 위한 의사결정 모델로, 빠르고 저렴하며 신뢰도 보정 성능까지 갖출 가능성에 대한 기대가 핵심임.
  • 대형 언어 모델(LLM)은 인간 피드백 기반 강화 학습(RLHF)으로 사람이 선호하는 답변을 학습하며, 이 과정에서 드문 답변을 내놓지 않는 모드 드롭이 생길 수 있음.
  • TypeSafe는 프로그램에서 안정적으로 쓰도록 Jev를 강화 학습 기반 의사결정(RLCD) 방식으로 훈련함.
  • Jev는 선택지별 확률을 반환하며, 확률이 보정돼 있으면 코드가 임계값에 따라 실행하거나 사람에게 넘기는 결정을 내릴 수 있음.
  • 속도와 비용은 지금 측정할 수 있지만, RLCD가 실제로 더 나은 의사결정을 이끌지는 아직 입증되지 않은 베팅임.

빠르고 저렴함

  • 출시 발표에서 Jev API를 “극히 저렴하고 극히 빠름”이라고 표현함(ThinkThen 소개, TT 0:50). 대형 언어 모델로도 같은 작업을 할 수 있지만 느리고 비쌌다고 설명함(TT 18:14).
  • Jev를 만든 TypeSafe를 운영하는 Diogo Almeida는 “Jev는 달러당 지능의 최전선에 놓일 모델의 이름이 될 것”이라고 말함(Latent Space 팟캐스트, LS 6:43).
  • 속도와 비용은 지금 확인할 수 있으며, 핵심 베팅은 모델의 훈련 방식에 관한 것임.

대화형 모델은 사람을 만족시키도록 훈련됨

  • 대화형 모델은 사람의 피드백을 학습함. 사람이 답변을 평가하면 모델은 사람들이 선호하는 답변을 내놓도록 학습하며, Diogo는 이를 “[RLHF는] 인간을 만족시키는 것”이라고 요약함(LS 1:23:12).
  • 사람을 만족시키는 데는 대가가 따를 수 있음. Latent Space 진행자는 대화형 모델이 “사람이 가장 듣고 싶어 하는 쪽으로 수렴하며 … 사안에 대한 모델 자신의 내적 확신은 사라지는 것 아닌가”라고 질문함(LS 7:15).
  • Diogo는 “아무도 주의를 기울이지 않은” 문제로 RLHF의 단점, 특히 모드 드롭을 지목함(LS 7:39).
  • 모드 드롭은 모델이 드문 답변을 더 이상 내놓지 않는 현상임. Diogo는 이를 오래된 이미지 모델인 생성적 적대 신경망(GAN)에 빗대며, GAN은 “소수 클래스를 버리고 정말 흔한 것만 생성함”이라고 설명함(LS 9:22).
  • 대화형 모델은 여전히 확신에 찬 듯 말하지만, 얼마나 확신해야 하는지에 대한 감각은 사라짐. Diogo는 이것이 “확률 분포에 완전히 해로운 독”이라며, “문자열이 … 의사결정에 그토록 나쁜 이유”라고 결론지음(LS 9:47, LS 9:58).
  • 추론 모델도 별도의 목표를 가짐. Diogo는 “강화 학습 기반 검증(RLVR)은 벤치마크 점수에 맞춰 최적화됨”이라고 설명하며, 이 모델들은 정답 여부를 확인할 수 있는 답을 맞히도록 학습함(LS 1:23:17).

Jev는 결정을 내리도록 훈련됨

  • TypeSafe는 다른 목표를 선택함. “RLCD는 프로그램에서 쓸 수 있도록 신뢰성을 높이는 것”이며, Jev의 답을 읽는 주체는 코드임(LS 1:23:30).
  • Jev는 확률을 반환함. 확률이 유용하려면 보정돼야 하며, 보정됐다는 것은 Jev가 0.8이라고 할 때 열 번 중 약 여덟 번 맞는다는 뜻임.
  • 코드는 그 숫자를 바탕으로 임계값을 정하고, 확률에 따라 분기하며, Jev가 확신하지 못하는 사례를 사람에게 보낼 수 있음.
  • 발표에서는 “컴퓨터가 내놓는 답변에 매우 확신이 있을 때만 행동하도록 해야 함”이라고 설명함(TT 5:37).
  • Diogo는 신뢰성의 높은 기준을 제시함. “신뢰성의 가장 큰 영예는 사람들이 예시 질의를 하지 않고도 Jev를 대상으로 프로그램을 작성할 수 있는 수준에 도달하는 것”이라고 말함(a16z 팟캐스트, a16z 27:43).

다음에 호출할 도구를 고르는 사례

  • 에이전트는 여러 도구를 갖고 있으며, 각 단계에서 하나를 선택해야 함. 발표에서는 의사결정 모델이 에이전트에 “권한이나 도구 선택 같은 가드레일”을 제공할 수 있다고 설명함(TT 16:17).
  • 대화형 모델에 도구 선택을 요청하면 문장 속에 도구 이름을 반환함. 어려운 단계에서도 쉬운 단계와 똑같이 확신에 차 보이므로 코드가 둘의 차이를 알아낼 수 없음.
  • Jev에 선택을 요청하면 도구마다 확률을 반환함. 검색 도구의 확률이 0.84이고 임계값이 0.7이면 코드가 검색을 호출함. 어떤 도구도 0.7을 넘지 못하면 코드가 멈추고 사람에게 요청함.
  • 이 확인은 밀리초 단위로 끝나며 비용은 1센트의 일부임. 발표에서는 이것이 “빠르고 저렴하게 그런 결정을 내리는 방법”이라고 설명함(TT 16:36).

베팅은 성공할까?

  • 성공할 것이라고 봄. 자동화하고 싶은 작업 대부분은 작은 의사결정이 이어지는 형태이며, 각 결정에는 정직한 답변과 그 답변에 대한 정직한 확신 수준이 필요함.
  • 사람을 만족시키도록 훈련된 모델은 두 번째 요소를 제공할 수 없지만, 보정되도록 훈련된 모델은 제공할 수 있다는 판단임.
  • 보정은 실제 사례에서 확인하기 전까지 주장에 머무름. 실제 사례에 라벨을 붙이고 임계값을 선택하기 전에 측정해야 하며, 신뢰하기 전에 시험하는 방법을 확인해야 함.

인용문을 찾은 방법

  • ThinkThen을 사용해 기사를 구성함. ‘의미로 유튜브 대본 검색하기’ 안내에서 검색 방법을 설명함.
  • ThinkThen은 발표에서 속도와 비용, 도구 선택에 관한 대목을 찾았고, Jev를 대상으로 프로그램을 작성하는 것에 관한 Diogo의 a16z 발언과 달러당 지능에 관한 Latent Space 대목도 찾음.
  • 훈련 방식에 관한 인용문과 확신 수준에 관한 발표 문장은 대본을 읽고 찾음.
  • 대괄호 안의 말은 자막 오류를 바로잡거나 인용문을 문장에 맞추기 위한 표현이며, 말줄임표는 생략한 부분을 나타냄.