연합뉴스

서울대연구팀, 판결문 최적화 AI비식별화 기술개발

입력 2026-09-29 12:08:00

다음 내용이 궁금하다면?

불편하시다면 뒤로 가기를 눌러주세요


개인정보 경계 분리 성능 70.8%→99.7%




Thunder-DeID+ 토크나이저의 학습·추론 과정

[서울대 제공. 재판매 및 DB 금지]



(서울=연합뉴스) 윤민혁 기자 = 판결문의 개인정보만 정확히 가리고 주변 문맥은 최대한 보존하는 한국어 맞춤형 AI(인공지능) 비식별화 기술이 개발됐다.


서울대는 데이터사이언스대학원 이재진 교수 연구팀이 한국어 특성을 반영한 AI 비식별화 모델 'Thunder-DeID+'를 개발했다고 29일 밝혔다.


판결문을 공개·활용하려면 개인정보를 보호하면서도 문맥을 해치지 않기 위한 비식별화 작업이 필요하다.


사람이 문서를 읽으며 개인정보를 일일이 찾아서 가리는 방식은 많은 시간과 인력, 비용이 들어왔다.


이에 수작업의 부담을 줄이는 정확한 자동 비식별화 기술이 요구됐다.


연구팀에 따르면 기존 AI 비식별화 방식 역시 개인정보와 조사가 붙어 있는 한국어의 특성상 개인정보의 경계를 정확하게 구분하는 데 한계가 있었다.


기존 AI가 '홍길동은'을 '홍길/동은'이라는 두 개의 토큰으로 나누면 이름을 가리는 과정에서 개인정보인 '동'이 남거나 개인정보가 아닌 조사 '은'까지 함께 가려지는 식이었다.


연구팀은 이를 개선해 '홍길동은'을 개인정보인 '홍길동'과 조사인 '은'으로 구분하는 '경계 인식 토크나이저'를 개발했다.


개인정보는 가리면서 사건 내용 등을 이해하는 데 필요한 문맥은 최대한 보존하는 방식이다.


개인정보 영역을 주변 문자와 정확하게 분리한 비율은 기존 AI의 토크나이저(문장을 AI가 처리할 수 있는 작은 단위인 토큰으로 나누는 도구)를 적용했을 때 70.8%에서 새 토크나이저를 적용하자 99.7%로 높아졌다.


연구팀은 이름·연락처 같은 직접 식별정보뿐 아니라 직장·사건 장소 등 간접 식별정보까지 다루기 위해 상위 8개, 중간 43개, 세부 195개 범주의 개인정보 분류체계도 구축했다.


이를 토대로 28개 사건 유형의 판결문 5천872건을 학습시킨 모델의 개인정보 탐지 성능은 89.8%로, 기존 공개 한국어 판결문 비식별화 AI 모델 가운데 가장 높은 성능을 보인 73.3% 모델보다 16.5%포인트 높았다.


판결문으로 학습한 모델을 일반 민감 문서에 적용하는 실험에서는 일반 문서 50건을 추가 학습했을 때 88.4%, 1천건을 추가 학습했을 때 93.9%의 개인정보 탐지 성능을 기록했다.


연구팀은 이번 연구 성과를 행정문서와 기업 업무문서 등에도 적용할 수 있을 것으로 기대했다.


이번 연구는 자연어처리 분야 국제학술대회 'EMNLP 2026'에 채택됐으며 전체 제출 논문의 약 3%에 불과한 구두 발표 논문으로 선정돼 다음 달 27일 발표될 예정이다.




3단계 개인정보 분류체계

[서울대 제공. 재판매 및 DB 금지]


miny@yna.co.kr



인기상품 확인하고 계속 읽어보세요!

5

원치 않을 경우 뒤로가기를 눌러주세요.

연합뉴스 콘텐츠 더보기

해당 콘텐츠 제공사로 이동합니다.

많이 본 최근 기사

관심 많은 기사