콘텐츠로 건너뛰기
Home » New » Anthropic의 안전 보고서: 조류독감, 드론 떼, 대규모 감시

Anthropic의 안전 보고서: 조류독감, 드론 떼, 대규모 감시

전 Anthropic 직원들의 바이러스성 게시물이 주장하는 것처럼 인류가 AI의 손에 멸망한다면 어떤 모습일까요?

로봇이 우리의 핵무기를 해킹하여 하늘로 날아갈 수 있을까요? 정교한 알고리즘이 대중에게 확산될 완전히 새로운 바이러스를 설계할 수 있을까요? 혼란이 지배할 때까지 동료 인간에 대한 우리의 신뢰를 천천히 저하시키는 것만 큼 간단할까요?

우리는 실제로 알지 못하지만 AI가 이미 혼란에 빠질 수 있는 여러 가지 방법을 자세히 설명하는 Anthropic의 새로운 안전 보고서는 충분히 놀랍습니다.

다음도 참조하세요:

인류학 연구자 사임, AI가 ’10년 안에 우리 모두를 죽일 수 있다’

개인들은 생물무기를 개발하기 위해 Anthropic AI를 사용하려고 시도했습니다.

회사의 지속적인 투명성 및 모니터링 노력의 일환인 Anthropic의 보고서는 지난 8개월 동안 위협 행위자가 생성 AI 챗봇인 Claude를 “악의적인” 활동에 사용하려는 시도를 포괄적으로 조사한 것입니다. 회사에서 “비정형” 사용 사례라고 부르는 사례 중 상당수는 국가 후원 그룹, 스파이웨어 공급업체, 정부 선전가와 관련이 있습니다.

Anthropic은 이러한 활동을 사이버 작전, 영향력 행사, 감시, 사기 및 사기, 생물학적 오용, 재래식 무기 개발, 증류 등 7가지 “위험 영역”으로 분류했습니다. Anthropic은 대부분의 경우 활동이 얼마나 오랫동안 발생했는지에 대한 세부 정보를 포함하지 않았습니다.

보고서에서 회사의 위협 정보 팀은 생물학 무기 개발을 위한 Claude의 잠재적 사용과 관련된 5가지 알려진 사례 연구를 설명했습니다.

회사는 국가 지원 사용자를 포함한 연구원들이 Claude가 모기에서 태어난 치쿤구니야 바이러스와 오르토폭스 바이러스를 실험하기 위해 별도의 보조금 신청서를 작성하도록 유도했다고 주장합니다. 후자는 천연두를 포함하여 인간 질병을 일으키는 바이러스 계열입니다.

Anthropic은 Claude에 접근할 수 없는 국가의 개인이 제품을 사용하는 것을 방지하기 위해 사용자가 “통제를 우회”했다고 말했습니다. 사용자들은 또한 안전 장치를 회피하기 위해 연구 목적을 숨기려고 시도했습니다.

Anthropic은 각 사례 연구에서 개인을 현직 과학자로 설명했지만 회사는 그들의 이름을 밝히지 않았습니다.

회사는 보고서에서 “우리는 그들이 해를 끼칠 의도가 있다고 주장하지 않으며, 그들이나 그들의 연구실을 식별하면 해를 입힐 수 있다”고 썼습니다. Anthropic은 사용자의 활동이 발견되면 해당 사용자의 계정을 금지하고 그 결과를 지속적인 안전 작업에 통합했다고 밝혔습니다.

Claude는 무장 드론, 미사일, 총을 위한 소프트웨어를 제작했습니다.

Anthropic의 봇은 실제 군수품의 설계, 제작 및 테스트를 가능하게 하는 기술을 포함하여 무기 개발에 사용되는 소프트웨어를 구축하고 개선하는 데 활용되었다고 보고서는 설명했습니다.

“역사적으로 이런 종류의 작업은 정부, UN 패널, 외부 조사관에 의해 발견되었으며, 이들은 회수된 하드웨어와 공개 소스를 통해 이를 종합했습니다.”라고 회사는 설명했습니다.

Anthropic이 “DronDoc” 또는 “Serafim 작전”이라는 제목의 작업을 수행하는 러시아 기반 프리랜서 에이전트의 것으로 간주하는 한 계정은 Claude Code를 사용하여 “풀 스택 자율 1인칭 시점(FPV) 가미카제 드론 떼”를 설계했습니다.

이 회사는 또한 잠재적으로 군산업 연구원일 가능성이 있는 중국 기반 계정이 Claude 작업 도구를 사용하여 적의 레이더와 통신을 우회하고 대공 방어를 억제하기 위한 전자전 모듈을 만들었다고 주장합니다. 사용자 시뮬레이션에는 대만에 위치한 12개의 타겟이 포함되었습니다.

Claude는 외국 반체제 인사를 감시하고 대규모 감시 시스템을 구축하는 데 사용되었습니다.

Anthropic은 Claude가 외국(중국, 이란, 서아프리카 국가 포함) 및 임대 감시 네트워크에서 국가가 후원하는 감시 활동을 “구축, 실행 및 촉진”하는 데 사용되는 9가지 사례를 설명했습니다.

한 사례에서는 클로드가 중화인민공화국과 연계된 것으로 의심되는 작전에 사용되어 시리아군과 연계되어 정치적으로 연결된 위구르 인구 및 언론인을 추적, 프로파일링, 모집했습니다. Claude는 모니터링되는 WhatsApp 및 Telegram 채팅의 대량 데이터를 사용하여 개인의 프로필을 작성했습니다.

또 다른 사례에서는 이란 준군사 및 국내 보안 기관과 관련된 최소 16개의 계정이 Claude가 구축한 감시 및 악성 브라우저 확장 프로그램과 연결되어 6,388명의 이란인으로부터 데이터를 수집하는 데 사용되었습니다. “이란-넥서스 위협 행위자”도 클로드를 이용해 미국 해군 목표를 정확히 찾아냈습니다.

다양한 사례에 걸쳐 생성 AI는 인간 감시 작업을 대체하고, 개인 데이터를 사용하여 대상 프로필 생성을 가속화하고, 정부 모니터의 일상 업무를 촉진하는 데 사용되었습니다. 회사는 사용자가 현재 사용 정책에 따라 “동의하지 않은 감시” 및 프로파일링을 위해 AI 시스템을 사용하는 것이 금지되어 있다고 밝혔습니다.

Claude는 사이버 스파이 작전 자동화를 도왔습니다.

Anthropic은 보고서에서 AI가 “위협 행위자”가 사이버 작전을 자동화할 수 있도록 허용했다고 주장합니다. Anthropic이 공유한 사례 연구에서 이러한 개인은 민감한 정보를 훔치려는 시도로 정찰 및 악용을 위해 다중 에이전트 “프레임워크”에 의존했습니다.

보고서에서 GTG-20006으로 확인된 한 행위자는 AI를 사용하여 속도가 빨라졌습니다. Anthropic은 이 개인이 미국 외교 정책과 관련된 조직 및 개인 외에도 우크라이나와 유럽 정부의 군사 정보 목표를 공격했다고 주장합니다.

Anthropic이 러시아 스파이 요원으로 규정한 GTG-20006은 AI를 사용하여 피싱, ClickFix, 도메인 이름 시스템(DNS) 하이재킹 계획을 수행했습니다.

Anthropic은 또한 사용자가 우크라이나 정부 관료와 드론 제조업체인 호텔 투숙객의 장치를 표적으로 삼기 위해 군용 드론 제조업체와 제조업체를 표적으로 삼았으며 최소 3개 이상의 숙박업체에 침투했다고 주장했습니다.

Anthropic의 AI 기반 사이버 작전에 대한 추가 사례에서는 소규모 범죄 집단과 국가 후원 조직이 수행하는 캠페인을 살펴볼 수 있었습니다.

Anthropic은 “AI의 확산으로 두 클래스의 행위자가 동일한 고급 기능 세트에 액세스할 수 있도록 경쟁의 장을 평준화했습니다.”라고 말했습니다.

AI 안전 우려로 인해 규제에 대한 열광이 촉발됨

“우리는 우리 서비스의 악의적인 오용을 공개할 책임이 있다고 믿기 때문에 이 작품을 출판하게 되었습니다. 모델의 능력이 점점 더 발전함에 따라 AI 개발자와 사회의 수호자가 모델을 더 안전하게 만들기 위해 행동하지 않는 한 모델의 위험은 증가할 것입니다.”라고 회사는 썼습니다.

업계 전반에 걸쳐 악성 AI 활동이 급증하면서 규제에 대한 강력한 비난이 촉발되었습니다. Anthropic은 최근 캘리포니아주를 위한 업계 최고의 AI 감독 법안에 공동 서명했습니다.

법안 중 하나는 검증된 제3자 평가자로 구성된 최초의 독립 감사 레지스트리를 구축하는 것입니다. 두 번째 법안은 기존 주법에 따라 AI 시스템과 회사를 평가하기 위한 프레임워크를 만듭니다.

이 법안은 또한 경쟁업체인 OpenAI의 지지를 받았으며, OpenAI는 Gavin Newsom 주지사가 법안에 서명하기 며칠 전에 법안에 대한 지지를 표명했습니다. 이번 주 초 OpenAI는 공개적으로 AI 에이전트에 대해 경고하기 위한 새로운 프레임워크를 탐색하고 있다고 발표했습니다.

완벽 가이드 보기

공식 정보 바로가기

관련 기사

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다