TL;DR

  • 인공지능(AI)이 불완전하고 맥락 의존적인 의도를 해석할 수 있게 되면서, 음성이 주요 인터페이스가 되려면 직관적이고 신뢰할 수 있으며 매끄러운 경험을 설계해야 함.
  • 음성은 입력 중 누락된 맥락을 보완해야 하고 텍스트보다 잡음이 많아, 받아쓰기에서는 신뢰·정확도·주의력 사이의 균형이 필요함.
  • 받아쓰기에서는 실시간 전사 대신 발화가 끝난 뒤 최종 텍스트를 보여주는 비스트리밍 방식과 세심한 온보딩을 선택함.
  • 새 음성 경험에 대한 신뢰는 다른 경험으로 자동 이전되지 않으며, Scratchpad 사례는 새 습관을 요구하려면 그만한 가치를 제공해야 함을 보여줌.
  • 회의에서 이미 자연스럽게 이뤄지는 대화를 바탕으로 Notetaker가 요약·MCP 등을 제공하며, 이를 위해 기억 및 모델 역량을 발전시켜야 함.

음성이 흥미로운 동시에 까다로운 인터페이스인 이유

  • 수십 년 동안 인간-컴퓨터 상호작용(HCI)은 결정론적 소프트웨어의 한계를 중심으로 설계됐으며, 컴퓨터를 제대로 사용하려면 입력란을 선택하고 버튼을 클릭하거나 명령을 입력해 의도를 명확히 표현해야 했음.
  • AI는 컴퓨터가 사람들이 실제로 생각하고 말하는 방식인 불완전하고 맥락에 따라 달라지는 의도를 다룰 수 있게 함.
  • 음성으로는 생각을 소리 내어 말하고, 말을 고쳐 말하며, 맥락을 생략할 수 있음. AI는 사용자의 의도를 추론하고 빠진 내용을 확인하며 앞서 말한 내용을 기억할 수 있음.
  • 두 기술의 결합은 기대 수준과 제품 설계 기준을 높이는 동시에, 직관적이고 신뢰할 수 있으며 마찰 없는 사용자 경험을 만드는 새로운 과제를 제시함.
  • 사람은 글을 입력할 때와 말할 때 다르게 표현함. 음성은 더 자연스럽게 느껴지는 경우가 많지만, 시스템은 자유롭게 이어지는 생각을 구조화하고 생략된 맥락을 보완해야 함.
  • 오디오는 텍스트보다 잡음이 많으며 마이크 품질과 배경 소음이 시스템에 전달되는 내용에 영향을 줌. 사람들은 타이핑에도 익숙하므로, 음성을 더 쉽게 느끼게 하려면 시스템이 모호성을 처리해야 함.

음성 입력에서의 선택

  • 받아쓰기 제품 경험을 설계하면서 실시간 전사문을 표시할지, 아니면 Flow가 듣고 있음을 알린 다음 사용자가 말을 마치면 최종 텍스트를 표시할지 검토함.
  • 고려한 주요 요소는 다음과 같음.
  • 신뢰: 정확한 단어가 즉시 나타나면 사용자가 받아쓰기를 신뢰하는 데 도움이 됨.
  • 정확도: 발화 전체를 기다리면 모델에 더 많은 맥락을 제공할 수 있으며, 나중에 말한 내용이 앞서 말한 내용을 분명하게 해줄 수 있음.
  • 주의력: 실시간 전사문을 지켜보고 확인하면 말하는 행위 자체에 집중하기 어려워짐.
  • 신뢰를 높이는 다른 방법, 받아쓰기 모델을 개선할 수 있는 속도, 발화가 이어지는 동안 앞서 인식한 단어를 수정해 보여줄 수 있는지도 고려함.
  • 최종적으로 세심한 온보딩을 결합한 비스트리밍 받아쓰기를 선택함.
  • Notetaker의 요약에도 비슷한 상충 관계가 있음. 인지 부담을 줄이려면 시스템이 사람마다 중요한 내용을 안정적으로 포착해야 하며, 현재 기술로는 요약 품질과 대기 시간 사이의 균형이 필요함.
  • 회의에서 누군가 “아마 다음 주로 옮겨야 할 것 같아요”라고 말하는 상황을 생각할 수 있음. 발화자의 정체와 ‘그것’이 무엇을 가리키는지에 따라 같은 말의 의미가 달라질 수 있음.
  • Slack이나 Gmail의 맥락도 해당 결정이 요약에 포함될 만큼 중요한지 판단하는 데 도움이 될 수 있음. 이 맥락을 모으는 데 시간이 걸리고, 더 유능한 모델을 사용하거나 모델이 추론할 시간을 더 주는 데도 시간이 필요함.
  • 요약 품질의 개선과 사용자가 기다려야 하는 시간을 저울질해야 함.
  • 음성의 모호성을 다루는 선택은 디자인, 머신러닝(ML), 제품, 엔지니어링 전반에 걸침. 한 경험에 효과적인 방식이 다른 경험에는 맞지 않을 수 있으므로 화면이나 기능별로 선택을 다시 검토함.

새로운 경험은 새로운 습관을 만들어야 함

  • 한 음성 경험에서 형성된 신뢰가 다른 음성 경험으로 자동 이전되지는 않음. 각 경험은 사용자에게 특정 행동을 요구하므로, 그 습관을 만들려면 무엇이 필요한지 신중히 고려해야 함.
  • Scratchpad에서 Notetaker로 이어진 과정이 그 사례임. 바쁜 일과를 병행하면서 짧은 생각을 기록하는 데 어려움을 겪는 사용자를 발견함.
  • 일부 사용자는 이미 음성으로 생각을 기록하고 있었으며, 기록을 되찾기 위해 받아쓰기 기록을 다시 살펴보기도 했음. 이를 더 쉽게 만들 수 있는지 탐색하기 위해 Scratchpad를 출시함.

“각 경험은 사용자에게 특정 행동을 요구하므로, 그 습관을 만들려면 무엇이 필요한지 신중히 고려해야 함.”

  • Josh Benson, 기술 담당 직원
  • 받아쓰기는 타이핑과 경쟁함. 사용자는 타이핑을 할 때처럼 받아쓰기를 마치면 텍스트가 즉시 안정적으로 표시되기를 기대함. 기다리거나 결과를 계속 수정해야 한다면 키보드로 돌아가는 편이 더 쉬운 선택이 됨.
  • 모델에 더 많은 지능을 계속 적용하더라도 지연 시간과 안정성은 양보할 수 없는 조건임.
  • 많은 사용자에게 짧은 생각을 받아쓰는 습관을 만드는 일은 어려웠으며, 다른 곳에서 Flow를 편하게 사용하던 경우에도 마찬가지였음. 사용자는 Scratchpad에 타이핑하는 경우가 많았음.
  • Flow에서 했던 것처럼 활성화와 사용 안내에 더 투자할 수도 있었음. 그러나 새 경험이 제공하는 가치는 새로운 습관을 들이는 수고를 정당화해야 하며, Scratchpad는 당시 그 습관을 얻을 만큼 충분한 가치를 제공하지 못했음.
  • 이 경험은 사용자의 행동 변화를 먼저 요구하지 않으면서 생각을 기록하고 후속 조치를 취하도록 도울 방법을 다시 검토하게 함.

회의에서 시작하는 경험

  • 회의에서는 짧은 덧붙임이나 지나가듯 나온 제안을 놓치거나 기억하기 어려울 수 있음. 중요한 점은 사람들이 회의에서 이미 자연스럽게 대화한다는 사실임.
  • Notetaker는 기존 대화 습관을 바탕으로 요약, MCP 등을 통해 가치를 보여줌.
  • 이 약속을 실현하려면 기억과 모델의 한계를 넓히고, 회의를 넘어 필요한 역량을 구축해야 함.
  • 모든 기기 상호작용을 만족스러운 경험으로 만드는 것이 목표이며, 그 비전을 향한 각 단계는 사용자에게 요구하는 습관을 정당화할 만큼 충분한 가치를 제공해야 함.

음성 중심 인터페이스를 위한 제품 엔지니어링

  • 음성이 컴퓨터와 상호작용하는 주요 방식이 된다면 아직 구축해야 할 것이 매우 많음.
  • AI는 새로운 가능성을 열지만, 이를 만족스러운 경험으로 만들려면 확립된 설계 원칙이 거의 없는 상황에서 선택을 내려야 함.
  • 불분명한 의도를 처리하고, 작업별로 다른 상충 관계를 선택하며, 사용자가 신뢰하는 법을 익힐 수 있는 습관을 형성해야 함.
  • 이러한 과제는 제품 엔지니어링의 기반 문제이며, Wispr에서 앞으로도 흥미로운 일이 많은 이유임.