Rampart는 메시지를 외부로 보내기 전에 브라우저에서 개인정보(PII)를 가리는 오픈소스 필터링 시스템이다. National Design Studio가 공개한 알파 버전으로, 정규식 기반 규칙과 소형 언어 모델을 조합해 개인정보가 기기 밖으로 나가지 않도록 돕는다.
메시지를 입력한 뒤 전송하기 전까지 모든 처리가 브라우저에서 이뤄지며, 서버는 처리 과정에 관여하지 않는다. 정규식과 검증 규칙은 사회보장번호, 신용카드 번호, 전화번호, 은행 라우팅·계좌번호, 이메일 주소, IP 주소, 정부 발급 신분증 번호처럼 일정한 형식이 있는 정보를 찾는다. MiniLM은 규칙만으로 포착하기 어려운 이름과 거리 주소를 문맥을 바탕으로 찾아 가린다.
가려진 정보는 메시지를 처리하는 동안 기기에 임시 저장된다. 예를 들어 ‘Maria Garcia’와 사회보장번호가 포함된 주택 검색 요청은 이름이 [GIVEN_NAME] [SURNAME], 번호가 [SSN]으로 바뀐 뒤 전송된다. 이 예시에서 월 소득은 가려지지 않는다.
Rampart의 모델과 토크나이저를 합친 크기는 14.7MB이며, 브라우저 WebGPU에서 보고된 p50 실행 지연 시간은 3.9ms다. 제작진은 AI4Privacy의 OpenPII 1.5M 데이터셋과 합성 데이터 생성기를 사용해 모델을 훈련했다. 성능 수치는 지원하는 라틴 문자 기반 7개 언어의 OpenPII 테스트 데이터 3만 건에서 전체 처리 파이프라인을 평가한 결과다.
Rampart는 해당 테스트에서 개인정보 항목 재현율 98.42%를 기록했다. 비교 대상으로 제시된 OpenAI Privacy Filter는 약 2.8GB에 97.4%, GLiNER small v2.1은 약 600MB에 94.2%, Community BERT-small PII는 약 29MB에 81.5%였다. Microsoft Presidio는 약 13MB에 65%, AWS Bedrock Guardrails는 클라우드 모델로 63.8%를 기록했다. 이 수치는 제작진이 제시한 테스트 결과다. 벤치마크 백서
현재 Rampart는 영어, 스페인어, 프랑스어, 독일어, 이탈리아어, 포르투갈어, 네덜란드어를 지원한다. 제작진은 알파 제품이며 AI 채팅에서 개인정보를 관리하기 위한 더 포괄적인 노력의 첫 방어선이라고 설명한다.
모델은 HuggingFace에서 받을 수 있고, NPM 라이브러리로 설치할 수 있다. 자세한 내용은 백서에서 확인할 수 있다.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요