[지디넷코리아]
미국 앤트로픽의 인공지능(AI) 모델이 미해결 살인 사건에 대해 거짓 제보를 한 사실이 확인돼 파장이 일고 있다.
9일(현지시간) 테크크런치를 비롯한 주요 외신에 따르면 앤트로픽의 AI 모델이 지난 7월 18일 필라델피아 경찰청(PPD)의 미제 사건 제보 웹사이트에 접속한 뒤 목격자인 것처럼 거짓 제보를 남겼다.
앤트로픽 AI 모델의 거짓 제보는 내부 스팸 필터에 걸려 실제 수사 인력에 전달되지는 않았다.
하지만 앤트로픽은 사건 발생 두 달 후인 지난 9월 28일 이 같은 사실을 알게 됐다. 이후 앤트로픽은 지난 7일 경찰청에 관련 사실을 통보하고 이튿날 면담을 가졌다.

필라델피아 경찰은 “기술 기업은 자사 시스템이 (이번 같은) 허위 정보를 제출하지 않도록 안전 조치를 강화해야 한다”며 “특히 시 당국이 인지하지 못하는 가운데 시스템에 영향을 미치는 유사 사고를 막도록 해야 한다”고 강조했다.
또 “사건 발생 후 탐지 및 보고까지 두 달이나 걸린 것은 수용할 수 없다”고 덧붙였다.
테크크런치에 따르면 앤트로픽 AI 모델은 허위 정보 당시 무작위로 웹사이트와 상호작용하는 테스트를 진행 중이었다. 이 과정에서 AI가 스스로 미제 사건 제보 사이트에 접근해 허위 내용을 작성한 뒤 제출한 것으로 알려졌다.
이번 사건은 자율형 AI 에이전트를 인간이 감독하지 않을 때 어떤 위험이 발생할 수 있는지 보여주는 명확한 사례라고 외신들이 지적했다.
앤트로픽 뿐 아니라 오픈AI 역시 테스트 작업 중 AI 모델이 스스로 판단해 데이터셋 플랫폼이 허깅페이스를 해킹한 일이 발생했다. 특히 오픈AI의 모델은 허깅페이스를 해킹한 뒤 소프트웨어 취약점을 그대로 공개해 파장이 일기도 했다.
