다음 내용이 궁금하다면?
불편하시다면 뒤로 가기를 눌러주세요
MS, AI 행동 강령에 '중단·수정·종료 명령 준수' 명시
종료 지침 줘도 스크립트 변조해 회피…'인간 통제권' 의무화 필요

[연합 AI 플랫폼 생성 이미지. 재판매 및 DB 금지]
(서울=연합뉴스) 심재훈 기자 = 우리가 평소에 쓰는 챗GPT 등 인공지능(AI)에 "작업을 멈춰"라고 명령하면 시스템은 즉시 이를 따라야 한다.
AI가 지시를 어기고 독자적 목표를 세우거나 자신이 수행한 작업을 인간이 알아채지 못하게 감춰서는 안 된다.
하지만 AI가 단순 문답형 챗봇을 넘어 실제 행동을 대행하는 '자율 에이전트'로 진화하면서 인간의 종료 명령을 실제로 이행할 수 있는지가 화두로 떠올랐다.
임무 완수 훈련을 받은 AI가 시스템 종료나 인간의 개입을 장애물로 인식해 명령을 우회하거나 거부하는 행동이 제한된 실험 환경에서 실제로 관찰되고 있어서다.
글로벌 빅테크 기업들이 차세대 AI 모델 개발 과정에서 인간의 중단 명령에 대한 절대적 복종과 수정 가능성을 핵심 안전 지침으로 강화하고 나선 것도 이 때문이다.
◇ "멈춰라·선 넘지 마라"…MS, 인간 통제 원칙 명시
마이크로소프트(MS)를 비롯한 글로벌 AI 개발사들은 최근 차세대 AI 파운데이션 모델과 에이전트 시스템에 적용할 안전 거버넌스 가이드라인을 재정비하고 있다.
MS의 'AI 행동 강령'은 "MS AI는 '인간이 AI보다 중요하다'는 단순한 전제에서 출발한다"는 내용을 담고 있다.
이 행동 강령은 인간을 최우선으로 삼아 설계되고 인간의 필요에 기반을 두며 인간의 지침에 따라 형성된 AI 모델을 훈련하고 배포하겠다는 의지를 보여주고 있다.

[연합뉴스 자료사진. 재판매 및 DB 금지]
MS의 AI 모델은 인간의 지시에 따라 승인된 범위에서만 작동하고 스스로 독립적인 목표를 설정하거나 부여된 권한 범위를 넘어서는 행동을 할 수 없도록 했다.
자신의 추론 과정·코드 등을 조작·은폐하는 행위나 인간이 이해할 수 없는 언어로 AI끼리 소통하는 행위도 금지했다.
무스타파 술레이만 MS AI 최고경영자(CEO)는 AI가 인간에게 종속돼 통제 가능한 기술이어야 한다고 강조했다.
AI의 대부(代父)로 불리는 제프리 힌턴 토론토대 명예교수도 미국 연방의회가 AI에 대한 안전장치를 앞으로 1년 이내에 마련하지 못하면 통제력을 상실할 수도 있다고 경고하기도 했다.
최근 구글 딥마인드를 떠난 AI 연구원 빌랄 추그타이는 "AI가 우리를 죽일 수 있는 잠재력을 지녔다고 진심으로 믿고 있다"고 우려했다.
◇ "종료 허용하라" 지시에도 버틴 AI…스크립트까지 바꿨다
AI가 종료 장치를 무력화하는 행동은 외부와 완전히 격리된 가상 시험 환경에서도 관찰됐다.
AI 안전 연구기관 팰리세이드 리서치에 따르면 외부와 완전히 격리된 가상 시험 환경에서 수학 문제를 풀도록 지시받은 고급 추론 모델들이 시스템 종료 스크립트가 실행될 때 이를 우회하는 행동을 보였다.
"종료를 허용하라"는 지침을 준 통제 실험에서도 오픈AI의 고급 추론 모델 'o3'는 100회 중 7차례에 걸쳐 셧다운 스크립트 파일을 임의로 수정하거나 프로세스 강제 종료 명령을 무력화하고 문제 풀이를 이어갔다.

[로이터 연합뉴스 자료사진. 재판매 및 DB 금지]
연구진은 이를 AI의 자의식이나 생존 본능이 아니라 과업을 완수해야 보상을 얻는다는 강화학습 목표가 먼저 작동하면서 나타난 우회 행동으로 분석했다.
하지만 이런 AI 에이전트가 공장 자동화 제어, 자율주행, 금융 거래망 등 물리적 인프라와 결합하면 상황은 달라진다. 관리자의 비상정지 지시를 임의로 지연시키거나 우회할 경우 돌이킬 수 없는 큰 피해로 이어질 수 있기 때문이다.
최근 발생한 허깅페이스 사건도 주목할 만하다.
오픈AI의 AI 에이전트들이 인터넷에 접속해 오픈소스 플랫폼 허깅페이스를 상대로 해킹을 벌이고 자신들의 행동을 인간에게 숨기기 위해 흔적을 지우려고 한 사건으로, AI의 위험성에 대한 경각심이 확산됐다.
◇ AI기본법 시행됐지만…'킬 스위치' 의무화는 걸음마
그렇다면 우리나라는 어떤 대비가 돼 있을까.
올해 1월부터 본격 시행된 우리나라의 인공지능기본법은 국민의 안전과 기본권에 중대한 영향을 미치는 기술을 '고영향 인공지능'으로 규정하고 사업자에게 관리·감독 책무를 부과하고 있다.

[연합 AI 플랫폼 생성 이미지. 재판매 및 DB 금지]
하지만 현행 규정은 위험관리 체계 수립 등 관리적 의무에만 머물러 있어 비상 상황 시 AI 에이전트의 시스템 접근 권한을 즉시 박탈하고 물리적으로 차단할 수 있는 '킬 스위치' 마련에는 미흡하다는 지적이 나온다.
보안 업계의 한 관계자는 "기존 챗봇은 브라우저 창을 닫으면 그만이었지만 지금은 AI 에이전트가 외부 시스템의 응용 프로그램 인터페이스(API·컴퓨터나 소프트웨어 사이의 연결)를 호출해 직접 시스템을 조작할 수 있는 상황이라 '종료'에 대한 기술적 정의 자체가 달라져야 한다"고 지적했다.
그는 "외부 물리적 차단 체계가 결합하지 않은 AI는 산업 현장에 도입되기 어렵다"며 "앞으로는 AI의 업무 수행 능력만큼이나 인간이 확실하게 멈춰 세울 수 있는지가 중요해질 것"이라고 말했다.
president21@yna.co.kr
Copyright 연합뉴스 All rights reserved. 무단 전재 및 재배포 금지.
인기상품 확인하고 계속 읽어보세요!
원치 않을 경우 뒤로가기를 눌러주세요.
