TL;DR
- Apple Watch Series 12와 Ultra 4의 네 가지 선택형 오디오 지능(audio intelligence) 기능은 기기 내 처리와 보안 인프라를 활용하지만, 주변 대화를 감지하고 요약하는 범위가 넓어 개인정보 우려가 남는 구조임
- 새 기능에는 소리·음악 인식, Siri Recap, 최근 15초 음성을 문자로 보여주는 Live Rewind가 포함됨
- S11 칩의 Secure Exclave가 센서 음성을 운영 체제와 분리된 보호 영역에서 처리하며, 가능한 많은 데이터가 기기에 남도록 설계됨
- 클라우드로 전송되는 데이터는 원본 음성이 아닌 전처리·암호화된 정보이며, Private Cloud Compute에서 요약과 식별 작업이 수행됨
- Apple은 음성 녹음 저장을 부인하고 Live Rewind 실행 시 알림음을 내도록 했지만, 오디오 지능이 일상 대화에 적용되는 규모 자체가 새로운 공격 표면으로 부상함
새 Apple Watch의 오디오 지능 기능
- Apple Watch Series 12와 Ultra 4는 향상된 피트니스 추적과 소음 감소뿐 아니라 새로운 듣기 기능도 제공함
- Apple은 네 가지 선택형 오디오 지능 도구를 발표했으며, 모두 시계 마이크가 수집하는 오디오를 기반으로 작동함
- 기능에는 소리 인식, 음악 인식, 대화 요약, 주변에서 직전 15초 동안 말한 내용을 문자로 확인하는 Live Rewind가 포함됨
- Apple은 관련 보고서에서 다음과 같이 밝힘
“이 기능들은 오디오 녹음을 만들거나 저장하지 않으며, 처리에 사용되는 원시 오디오는 운영 체제, 앱, 사용자 또는 Apple이 완전히 접근할 수 없음.”
- 이러한 기능은 벽에도 귀가 있다는 인상을 줄 수 있어 보이며, Apple은 다른 Apple Intelligence와 Siri 서비스 보호를 위해 개발한 광범위한 기반 시설을 활용해 개인정보 보호와 보안을 우선한다고 강조함
- 오디오 지능 기능의 등장은 인공지능 기반 도구가 컴퓨팅과 일상의 거의 모든 영역으로 확산되는 흐름도 보여줌
기기 내 처리와 Secure Exclave
- 새 Apple Watch 기능은 가능한 많은 데이터를 기기에서 처리하도록 설계돼 민감할 수 있는 데이터가 클라우드로 전송되는 일을 줄임
- Sound Recognition은 초인종, 사이렌, 경보, 아기 울음소리 같은 주변 소리를 감지해 사용자에게 알리며, 데이터를 시계 밖으로 보내지 않음
- 클라우드로 정보를 보내는 도구는 원본 오디오 파일이 아닌 형태로 데이터를 전처리한 뒤 Apple의 Private Cloud Compute 기반 시설을 사용함
- Apple Watch의 기기 내 처리 능력은 새 S11 칩으로 확장됨
- S11 칩에는 센서 데이터를 위해 설계된 메모리 보호 영역인 Secure Exclave가 포함됨
- Secure Exclave는 운영 체제의 나머지 부분에서 접근할 수 없는 격리 버퍼임
- Apple Watch는 이 보호 영역에서 오디오 데이터를 보관하고 처리함
음악 인식과 Shazam
- 새 Shazam 기능은 음악을 감지하고 곡의 서명을 생성해 Secure Exclave에 저장함
- 사용자가 Shazam을 열어 음악을 확인하면 시계는 오디오 파일이 아닌 해당 서명만 Shazam 서버로 보내 식별을 요청함
- Shazam은 Apple이 소유한 서비스임
- 사용자가 음악 식별을 요청하지 않거나 식별 요청을 완료하는 즉시 특수 서명은 시계에서 즉시 삭제됨
Siri Recap의 대화 처리
- Siri Recap은 항상 켜 두고 실질적인 대화를 요약하도록 설정하거나, 하루 중 특정 시간에만 듣도록 일정을 지정할 수 있음
- 전용 인공지능 모델은 데이터를 녹음하거나 문자로 변환하지 않고 음성이 발생하는 시점을 판단함
- 대화가 감지되면 다음 절차가 진행됨
- 오디오가 Apple Watch의 Secure Exclave 내부 보호 버퍼로 들어감
- 시계가 오디오를 암호화함
- Apple의 특수 보안 블루투스 페어링을 통해 사용자의 아이폰에 있는 Secure Exclave로 전송함
- 전송이 끝나면 Apple Watch에서 오디오가 즉시 삭제됨
- 아이폰은 기기 내 음성 인식과 언어 모델을 사용해 오디오를 문자로 변환함
- 아이폰은 불필요한 단어와 반복 구절을 제거한 최소 형태의 문자 기록을 생성함
- 원본 오디오는 아이폰에서도 즉시 삭제됨
- 아이폰의 마지막 단계에서는 안전성 모델이 문자를 검사해 잠재적으로 유해한 용어를 제외함
- 이후 대화에서 추출한 내용이 암호화돼 Private Cloud Compute로 전송됨
- 요약 품질을 높이기 위해 문맥 정보도 전송될 수 있음
- Now Playing 데이터는 음성이 음악이나 팟캐스트에서 비롯됐을 가능성을 판단하는 데 사용됨
- 캘린더 데이터는 요약 제목을 정확하게 만드는 데 사용될 수 있음
- 집, 직장, 학교 같은 상위 수준의 위치 표지와 도시, 주, 국가 같은 지역 정보가 요약 문맥에 추가될 수 있음
- 식료품점이나 공원 같은 관심 지점 범주도 포함될 수 있음
- 정확한 위치와 구체적인 관심 지점은 포함되지 않음
- Private Cloud Compute의 Apple 기반 모델이 압축된 문자 기록을 처리해 제목과 요약을 생성함
- 생성된 제목과 요약은 암호화돼 아이폰과 Apple Watch로 돌아감
- Apple은 Siri Recap이 금융 데이터, 신분증 번호와 같은 식별 정보 및 기타 개인 식별자를 요약에서 제거하도록 설계됐다고 밝힘
Live Rewind의 최근 15초 처리
- Live Rewind는 Secure Exclave 버퍼에 오디오를 계속 순환 방식으로 보관함
- 오래된 소리는 새 오디오로 교체되므로 오디오가 누적되지 않음
- 사용자가 문자 기록을 받으려면 Apple Watch의 Digital Crown을 매번 두 번 눌러야 함
- 기능이 활성화되면 시계는 Secure Exclave에 버퍼링된 최근 15초 오디오를 페어링된 아이폰의 Secure Exclave로 보냄
- 아이폰을 사용할 수 없으면 전송이 실패하고 오디오는 자동으로 삭제됨
- Siri Recap에도 시계에서 아이폰으로 전송이 실패할 때 비슷한 안전 장치가 작동함
- 전송이 완료되면 아이폰이 기기 내 음성 인식으로 문자 기록을 만들고 오디오를 삭제한 뒤 문자를 Apple Watch로 보냄
- 사용자는 시계에서 문자 기록을 읽은 뒤 폐기하거나 Siri 앱에 저장할 수 있음
남는 개인정보 보호 우려
- 여러 데이터 보호 장치에도 불구하고 새 Apple Watch를 착용한 사람이 주변의 사적인 하소연, 가족 소식, 비밀에 대한 실수 발언 등에 오디오 지능을 작동시킬 수 있다는 우려가 남음
- Apple은 노골적인 개인정보 침해를 줄이기 위해 사용자가 Live Rewind 문자 기록을 시작하면 주변 사람에게 알리는 소리를 시계에서 내도록 함
- 시계가 무음 모드이거나 헤드폰과 연결된 상태에서도 알림음이 발생함
- 기능은 화자의 잠재적인 식별 정보를 제외하거나 걸러내도록 설계됨
- 그럼에도 도구의 적용 범위와 규모 자체가 매우 주목할 만한 변화임
커지는 인공지능 공격 표면
- Apple은 여러 해에 걸쳐 다른 회사 대부분을 크게 넘어서는 수준으로 보안 인공지능 처리 기반 시설에 투자함
- 새 오디오 기능은 인공지능 공격 표면, 즉 결함이나 실수를 포함하고 공격받을 수 있는 서비스와 시스템의 총량이 그 영향을 완전히 이해할 수 있는 속도보다 빠르게 증가하고 있음을 보여줌
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요