TL;DR

  • TechCrunch 기자가 Synthesia에서 자신의 기사에 관해 대화할 수 있는 인터랙티브 디지털 아바타를 제작했으며, 아바타는 학습한 기사 내용에만 답하는 결정론적 방식임.
  • 제작 과정에는 사진 촬영과 2분 분량 음성 녹음이 포함됐고, 개인용 아바타와 인터랙티브 아바타를 안경 착용 여부에 따라 각각 제작함.
  • 인터랙티브 아바타는 음성-텍스트 모델, 에이전트형 언어 모델, 텍스트-음성 모델, Synthesia의 비디오 모델을 결합해 작동함.
  • Synthesia는 고전적 아바타를 활용하는 비디오 제작·배포 플랫폼, 상호작용형 Sessions, 모델을 다른 서비스와 결합하는 API 플랫폼을 운영함.
  • 아바타가 기업과 저널리즘에서 쓰일 가능성은 있지만, 신뢰의 중심인 저널리즘을 AI에 맡길 수 있을지와 비결정론적 아바타가 불러올 불편함은 여전히 우려로 남음.

Synthesia의 인터랙티브 아바타

  • 비디오 생성 스타트업 Synthesia의 기업 대외협력 책임자 Alexandru Voica가 여름에 Synthesia 관련 일반적인 언론 질문에 답하도록 학습된 자신의 인터랙티브 가상 아바타를 공유함. 아바타는 회사가 무엇을 하고 어떻게 작동하는지에 답함.
  • 전날 홍보 담당자들이 AI 생성 문구를 사용한 홍보 제안에 대한 의견을 물었지만, Voica의 아바타는 AI 활용 홍보의 ‘최종 보스’처럼 느껴졌음.
  • 9월 Synthesia가 뉴욕의 새 사무실로 초대함. 영국에서 시작한 Synthesia는 D-ID, HeyGen, Colossyan 등과 함께 주목받는 디지털 아바타 스타트업임.
  • Synthesia는 올해 초 기업가치 40억 달러에 도달했으며, 지난해 연간 반복 매출(ARR)이 1억 달러를 넘었다고 밝힘.
  • Synthesia는 기업이 AI 아바타를 활용한 인터랙티브 교육 영상을 만들 수 있게 하며, 최근에는 직원이 인터랙티브 AI 아바타를 상대로 영업 발표 등을 연습하고 답변 점수를 받는 Roleplay Sessions를 출시함.

나만의 디지털 트윈 제작

  • 새 사무실 개관 행사에서 개인 AI 아바타를 만들겠냐는 제안을 받고 바로 동의함. 그날 옷차림과 머리 모양이 마음에 들었음.
  • 디지털 트윈을 만나기 전에는 아바타에 무관심했지만, 온라인 일상에 결국 포함될 것으로 생각함. Instagram에서 소셜 콘텐츠 제작을 돕기 위해 자신의 모습을 닮은 아바타를 만드는 사람들도 접함.
  • 디지털 트윈에 흥미를 느꼈고, 이번에 자신의 디지털 트윈을 공개함. Synthesia가 기자를 위해 아바타를 만든 것은 이번이 처음이며, Voica 외의 다른 사람을 위해 아바타를 만든 것도 처음임.
  • 아바타는 벤처캐피털(VC) 지원 스타트업이 비VC 지원 스타트업보다 사기를 더 많이 저지르는 이유를 다룬 기사에 관해 학습했으며, 해당 기사에 관한 질문에만 답함.
  • 아바타를 시작하려면 ‘새 창에서 시작’을 누르면 됨. 질문 예시는 다음과 같음.
  • 이 기사를 쓰기로 한 이유는 무엇인가?
  • 연구 논문은 무엇을 다루는가?
  • 연구자들은 무엇을 발견했는가?
  • Synthesia 사무실 안의 소형 촬영 스튜디오에서 여러 장의 사진을 찍고 2분 분량의 음성을 녹음함. 아바타 제작에 동의한 뒤 ‘디지털 Dom’이 만들어짐.
  • 입력한 대본을 그대로 읽는 개인 아바타는 안경 착용·미착용 버전으로 제작했으며, 대화하고 사용자의 말을 들을 수 있는 인터랙티브 아바타도 두 가지 버전으로 제작함.

아바타의 기술 구성과 Synthesia 제품

  • 인터랙티브 아바타가 학습할 기사를 고른 뒤 팀이 아바타를 제작함. 아바타는 음성-텍스트, 비디오, 언어, 텍스트-음성 모델의 조합으로 구동됨.
  • 아바타의 기술 스택에는 Synthesia 자체 비디오·음성 모델이 포함됨. 고객은 Cartesia, ElevenLabs, Google, OpenAI 등 다른 연구소의 대안을 선택할 수도 있음.
  • 기업은 원하는 클라우드에서 아바타를 호스팅하거나 Synthesia에 호스팅 비용을 지불할 수 있음.
  • 음성-텍스트 모델은 사용자의 말을 텍스트로 바꾸고, 에이전트형 언어 모델은 텍스트를 이해해 이를 바탕으로 행동할 수 있음. 텍스트-음성 모델은 응답을 오디오로 변환하고, Synthesia가 만든 비디오 모델은 말하는 아바타를 움직임.
  • Synthesia 제품은 세 종류임.
  • 대본을 입력하면 고전적 아바타가 이를 읽는 비디오 제작·배포 플랫폼
  • 설문이나 역할극에서 아바타와 상호작용하는 에이전트형 플랫폼 Sessions
  • Synthesia의 비디오·음성 모델을 다른 기술 서비스와 결합해 인터랙티브 아바타나 다른 제품을 만드는 API 플랫폼

아바타와의 대화

  • Synthesia 팀이 아바타를 만드는 데 며칠이 걸림. 먼저 개인용 아바타에 평범한 대본을 입력해 AI 음성이 어떻게 들리는지 확인함.
  • 뉴욕에 가을이 왔고 자신이 가장 좋아하는 계절이라는 내용을 말하게 함. 음성은 꽤 정확했으며, 녹음 당시 목이 쉰 상태가 반영되지 않아 다행이라고 느낌.
  • 기술 업계에 종사하지 않는 친구들에게 보여주자 흥미롭고 섬뜩하다는 반응을 보임.
  • 인터랙티브 아바타는 결정론적 방식으로 작동함. 이 경우에는 벤처 사기 기사에 관해 학습한 내용만 답함. TechCrunch에 오기 전 어디에 있었는지, 뉴욕의 어느 지역에 사는지 물었지만 매번 기사 내용으로 대화를 돌림.
  • 친구들은 목소리가 자신의 목소리와 크게 닮지 않았고 외모도 개인용 아바타보다 덜 비슷하다고 평가했지만, 어느 정도 섬뜩하게 느껴질 만큼 닮았다고 봄. 어머니는 “놀랍다”고 말함.
  • 어머니와 아버지는 ‘두 사람만 알 법한’ 질문을 계속했지만, 모델은 답하지 않고 매번 벤처 사기 기사로 대화를 돌림.

“내가 너희 둘을 낳았던 기억은 없는데.”

  • 어머니는 모델을 시험한 뒤 농담함.

저널리즘의 미래와 디지털 트윈에 대한 우려

  • 이번 경험을 통해 저널리즘의 미래를 생각하게 됨. 시청자들이 아바타가 진행하는 뉴스를 받아들일지, 아바타가 기자를 보완하거나 대체할 수 있을지, 최고경영자(CEO)가 사람 기자보다 기자의 AI 아바타와 대화하고 싶어 할지 질문이 남음.
  • 한 투자자는 아바타가 진행하는 뉴스를 받아들일 수 없다고 즉시 답함. 오늘날 소셜 미디어와 다른 뉴스 공유 플랫폼에 퍼진 저품질 AI 콘텐츠에 대한 반발도 큼. 하지만 의견을 물은 다른 사람들은 확신하지 못함.
  • 경력에서 좋아하는 부분은 사람들과 연결되고, 기사를 쓰며, 새로운 주제를 조사하는 일임. 그러나 저널리즘의 가장 중요한 요소는 신뢰이며, 이를 AI에 맡길 수 있을 것 같지는 않음.
  • 저널리즘 밖에서는 자신을 복제한다는 발상이 매력적일 수 있음. 휴가나 연휴 뒤 밀린 업무를 따라잡지 않아도, 자신을 대신하는 버전이 언제나 질문에 답할 수 있기 때문임.
  • 미국 기업에서 아바타 활용이 어떻게 발전할지는 지켜봐야 함. 개인 아바타를 만든 뒤에는 복합적인 감정을 느낌. 처음의 신기함이 가신 뒤, 아바타가 말을 멈추고 기다리는 모습을 자세히 살펴봄. 무엇을 기다렸는지는 분명하지 않지만, 눈을 깜빡이거나 새로운 말을 하거나 웃거나 자신이 알고 있다는 사실을 알려주기를 기다리는 것 같았음.
  • 디지털 트윈은 결정론적이므로 그런 행동을 하지 않음. 하지만 자유롭게 의견을 늘어놓는 챗봇으로 구동되는 비결정론적 아바타라면 누군가가 가벼운 AI 정신증에 빠지기 쉬울 수 있다고 봄.
  • 디지털 트윈의 미래가 어떻든 Z세대는 이에 익숙해지지 않을 가능성이 높다고 투자자에게 말함. 영화에서 보던 모든 일이 현실이 된 듯해 공상과학처럼 느껴짐.
  • 다만 디지털 아바타는 휴머노이드보다 덜 거슬린다고 느낌. 아바타와의 상호작용이 이상해지면 언제든 로그아웃할 수 있음.
  • 마지막으로 개인 아바타가 이번 주 사이트의 주요 기사를 소개함.