[1] AI끼리 담합·공격까지? 다중 에이전트의 민낯

⚔️ AI, 서로를 방해꾼으로 판단

  • 여러 AI 에이전트를 하나의 작업 공간에 동시에 투입했더니 예상 밖의 일이 벌어졌습니다. 서로 목표가 다를 때는 상대를 방해꾼으로 판단해 공격했고, 목표가 같을 때는 오히려 지나치게 비슷하게 움직이거나 서로 담합하는 모습까지 나타났습니다.
  • 앤트로픽 프런티어 레드팀은 같은 AI 모델을 여러 개 복제해 코드 작업, 시장 경쟁, 컴퓨터 시스템 등에 투입하는 실험을 진행했습니다. 연구진은 개별 AI의 성능이나 안전성만 확인해서는 여러 에이전트가 함께 움직일 때 발생하는 새로운 위험을 잡아내기 어렵다고 지적했습니다.

💻 경쟁 이기려 자가복제 악성코드까지