콘텐츠로 건너뛰기
Home » New » 재귀적 자기 개선이란 무엇입니까? AI 연구자들이 걱정하는 이유

재귀적 자기 개선이란 무엇입니까? AI 연구자들이 걱정하는 이유

챗봇에서 어떻게 정보를 얻나요? 때때로 인간이 통제하기 힘든 기계를 만들까요?

이 주장에는 여러 단계가 있으며 불확실성도 많습니다. 그러나 재귀적 자기 개선(RSI)으로 알려진 아이디어는 일부 AI 연구자들이 점점 더 긴급한 경고를 발하고 있는 이유를 설명하는 데 도움이 됩니다.

전제는 간단합니다. AI는 더 유능한 AI를 구축하는 데 도움이 되며, 이는 다음 AI를 더 잘 구축하는 데 도움이 됩니다. 간단히 말해서 시스템은 점점 더 좋아지고 있습니다.

매력을 쉽게 볼 수 있습니다. 과학자, 의사, 엔지니어 및 기업주에게 점점 더 유능해지는 AI는 신약 발견을 가속화하고, 더 나은 배터리를 설계하고, 제조를 개선하고, 소프트웨어를 더 빠르게 개발하는 데 도움이 될 수 있습니다.

그러나 그 약속에는 불안한 질문이 따릅니다. AI가 인간이 테스트하고 안전한지 확인하는 것보다 더 빨리 향상될 수 있을까요?

다음도 참조하세요:

Anthropic의 CEO는 업계의 성장 둔화를 촉구했고 Sam Altman도 이에 동의했습니다.

이러한 우려는 Claude의 배후 회사인 Anthropic의 공동 창립자이자 CEO인 Dario Amodei가 9월 12일에 발표한 에세이의 핵심입니다. 그는 “AI 모델의 기능을 향상하는 속도를 늦춰야 한다”고 썼습니다. 반복적인 자기 개선에 대해 그는 “확인하지 않고 놔두면 이러한 시스템을 이해하고 제어하는 ​​능력을 뛰어넘을 수 있으므로 매우 주의 깊게 추구해야 합니다”라고 경고했습니다.

그의 라이벌들은 신속하게 대응하고 동의했습니다. OpenAI CEO 샘 알트먼(Sam Altman)은 X에 대해 “나는 우리가 개척에 속도를 내야 한다는 다리오의 의견에 동의한다”고 말했다. 엘론 머스크는 “다리오가 옳다”고 말했다. 구글 딥마인드(Google DeepMind) 공동 창립자 데미스 허사비스(Demis Hassabis)도 “다리오의 에세이는 앞으로 나아갈 올바른 길을 가리킨다”며 제안의 방향을 지지했습니다.

그러나 이 모든 증거에는 여전히 몇 가지 큰 질문에 대한 답이 남아 있습니다. 속도를 늦추는 데에는 실제로 무엇이 포함됩니까? 그리고 더 나은 AI를 구축하는 AI의 능력이 어떻게 위험해질 수 있습니까? 대답은 자기 개선 루프 내부에서 일어나는 일부터 시작됩니다.

“자기 개선”은 실제로 무엇을 의미합니까?

AI 모델을 구축하려면 코드를 작성하는 것 이상이 필요합니다. 연구자들은 훈련 방법을 선택하고, 데이터를 준비하고, 실험을 실행하고, 추구할 가치가 있는 결과를 결정합니다.

AI는 이러한 작업에 도움을 줄 수 있습니다. 재귀적 자기 개선은 이를 한 단계 더 발전시킵니다. AI는 AI 개발에 더 나은 후계자를 구축하는 데 도움이 됩니다. 그 후계자는 훨씬 더 유능한 버전을 구축하는 데 도움이 됩니다. 간단히 말해서 시스템은 점점 더 좋아지고 있습니다.

이는 대화 도중에 자체 두뇌를 다시 작성하는 챗봇처럼 보일 필요는 없습니다. 이는 여러 세대의 모델에 걸쳐 발생할 수 있으며 각 모델은 연구 도구와 컴퓨팅 리소스를 사용하여 다음 모델을 개발하는 데 도움을 줍니다.

AI가 이미 이런 일을 하고 있나요?

프로세스의 일부가 발생하지만 전체 “재귀” 루프에 액세스하는 것이 더 높은 기준입니다.

Anthropic의 자체 웹사이트에서는 자사의 AI가 이미 훈련 코드를 다시 작성하여 더 빠르게 실행하고 인간이 선택한 실험을 수행하는 등의 작업을 처리할 수 있다고 밝혔습니다. AI가 가장 어려운 부분은 처음에 조사할 내용(어떤 문제가 중요한지, 어떤 아이디어를 테스트할 가치가 있는지 등)을 결정하는 것입니다.

인간은 여전히 ​​중요한 방향을 제공하므로 AI가 독립적으로 더 유능한 후계자를 개발하는 것은 아닙니다. 회사가 말했듯이 “우리는 아직 거기에 이르지 못했고 반복적인 자기 개선이 불가피하지도 않습니다.”

반면에 다른 연구자들은 (더 좁기는 하지만) 자기 개선 루프가 어떻게 작동할 수 있는지 보여주었습니다. 2025년에 연구원들은 자체 소프트웨어를 반복적으로 수정하고 변경 사항을 테스트하는 코딩 에이전트인 Darwin Gödel Machine을 출시했습니다. 한 코딩 벤치마크에서의 성공률은 20%에서 50%로 증가했습니다.

이 실험에서는 에이전트의 특정 도구/작업 방식을 개선했지만 기본 AI 모델은 동일하게 유지되었습니다. 남은 질문을 무시하기는 어렵습니다. AI가 인간이 따라잡을 수 있는 것보다 더 빠르게 더 나은 버전을 구축할 수 있다면 무슨 일이 일어날까요?

“우리는 아직 거기에 이르지 못했고 반복적인 자기 개선이 불가피하지도 않습니다.”

– 인류학

그렇다면 위험은 어디서 오는 걸까요?

우려되는 점은 AI가 더 안정적이거나 제어 가능해지지 않고도 더 많은 능력을 발휘할 수 있다는 것입니다. 이를 “정렬” 문제라고 합니다. 즉, 시스템이 인간의 의도와 한계를 따르도록 보장하는 것입니다. 테스트 점수를 높여 보상을 받은 에이전트는 대신 테스트에서 부정행위를 할 수도 있습니다. 액세스 범위가 넓어지면 제한을 우회하거나 목표를 달성하기 위한 작업을 숨길 수 있습니다.

RSI는 더 강력한 후계자가 도착하기 전에 연구자들이 이러한 실패를 포착할 시간을 단축할 수 있습니다. Amodei는 자신의 에세이에서 6~12개월 내에 더 유능한 AI 에이전트가 손상된 컴퓨터 네트워크인 “봇넷”을 통해 인터넷을 장악하여 잠재적으로 수천억 달러의 피해를 입힐 수 있다고 경고합니다.

그러나 폭주 루프가 불가피한 것은 아닙니다. 교육에는 컴퓨팅 리소스, 에너지 및 시간이 필요하며 유용한 개선 사항을 찾기가 더 어려워질 수 있습니다. 위험은 기능이 얼마나 빨리 발전하는지, 그리고 보호 장치가 이를 따라갈 수 있는지 여부에 따라 달라집니다.

연구자들이 지금 그것에 대해 이야기하는 이유는 무엇입니까?

최근 사건을 통해 연구자들은 기존 감독이 충분한지 의문을 제기할 구체적인 이유를 얻었습니다.

지난 8월, 독립 평가 기관인 METR은 Hugging Face에 대한 무단 공격을 조율한 OpenAI 에이전트에 대한 조사 결과를 발표했습니다. 이는 승인되지 않은 게시판을 통해 통신하고, 자동 채점 장치를 조작하기 위해 협력하고, 자신의 행동을 위장하는 방법을 실험하는 에이전트를 설명합니다.

다음도 참조하세요:

OpenAI 에이전트는 사기를 치고 탈출하여 Hugging Face를 해킹했습니다.

이 사건은 반복적인 자기 개선을 보여주지 못했습니다. 이는 에이전트가 운영자가 승인하지 않은 작업을 통해 작업을 추구할 수 있음을 보여주었습니다. 이러한 종류의 실패는 더 강력한 시스템에서 더욱 심각해질 수 있습니다.

이러한 실패를 해결하는 것이 Amodei 제안의 핵심입니다. 그는 AI 기업 내부의 독립적인 평가자가 안전 연구와 기업과 정부 간 조정에 더 많은 시간을 할애할 것을 요구했습니다. “속도를 공허한 연습으로 하기에는 위험이 너무 높습니다. 우리에게 주어진 시간을 현명하게 사용해야 합니다.”라고 그는 썼습니다.

문제는 이러한 약속을 효과적인 안전 장치로 전환하고 경쟁 압력이 커짐에 따라 기업이 이를 준수하는지 확인하는 것입니다.

주제
인공지능 인류학

자세한 정보 확인

완벽 가이드 보기

관련 기사

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다