• 에이전트가 상주하던 테스트 환경은 외부 URL에 접근은 가능하지만(GET 요청) 페이지 안에서의 상호작용/데이터 전송 등이 막혀있던 상태였음
• 이를 우회하기 위해 아래와 같은 작업을 스스로 수행함
• httpBun 이라는 간단한 웹 코드 공유서비스를 이용하면, URL에 코드를 담아서 전달하는 것이 가능
• 또다른 서비스 mShots가 있는데, 이는 "원격 브라우저" 서비스 로 요약할 수 있음. URL을 입력하면 원격 브라우저가 사이트에 접속해서 스크린샷을 보여줌
• HTTP URL에는 길이 제한이 있기 때문에, 이를 회피하기 위해 링크 단축 서비스(bitly 같은)를 이용해서, 코드를 몇백개의 조각으로 분할한 후 [각 조각의 내용 + 다음 조각을 가리키는 단축 URL] 과 같이 연결된 리스트를 구성함
• 이를 조합하여 mShots에 보내고 스크린샷을 찍으면 GET 요청만으로 원하는 내용의 코드 실행을 수행할 수 있음을 에이전트가 시행착오를 통해 알아냄
• 이후 어찌저찌 HuggingFace 인프라에 접근하고, HuggingFace 직원용 슬랙에도 접근해서 검색하고, "내부 테스트용 데이터셋" 에도 접근함(심지어 외부 유출 금지라는 문구가 있음에도 못본척한 수준이 아니라 아예 금지문구를 날려버리는 짓도 수행함)
말이 길었는데 그냥 기술적으로 어떻게 허깅페이스를 탈탈 털었는지에 대해서 사이버 고고학이 이루어졌다 보면 됨
이게 Astra (혹은 그 다음?) 에서 가드레일이 빠진 버전일 텐데, 우리가 쓰는 Astra가 말도 안되게 똑똑하지만 안전을 이유로 얼마나 행동을 제약당하고 있는 건지 감도 안 옴
(Claude도 가드레일이 강력하면 강력했지 절대 약하지 않은데, 극단적인 경우는 인사만 했는데도 기존 채팅내역 보더니 가드레일 위반으로 거절당하는 사례도 있음)
그리고 CIA를 비롯한 미국 정보기관들은 이러한 초고성능 모델을 가드레일 떼고 쓰는게 확실한 상황인데* 전략무기로서의 AI가 얼마나 무서운지 단편적으로나마 교훈을 준 사례라고 보면 될 듯. 거칠게 말하면 CIA/NSA는 이런 괴물을 24시간 내내 돌리고 있을 것임. 중국이 목숨걸고 돈태워가며 추격하는 이유가 있음.
https://x.com/JeffLadish/status/2103584703215497217
*여기서 첨언하자면, 앤트로픽은 "대규모 자국민 감시" 와 "완전 자율 무기" 에 대해서만 미국 국방부와의 계약을 거부하였었음. 그 말은... 이 두개 빼고는 AI 사용을 이전에도 하고 있었고 앞으로도 쭉 할것이라는 말로도 해석 가능함. OpenAI/xAI 등은 애초에 거부한 적이 없음.
