샘 알트먼, 허깅페이스가 OpenAI 에이전트 검토에서 여전히 가장 심각한 사례라고 밝혀
OpenAI가 학습과 평가 중 에이전트의 인터넷 접속을 검토하는 작업은 아직 진행 중이다. 샘 알트먼은 투명성을 지키면서 페타바이트 규모의 에이전트 활동 로그를 명확히 해석하고 피해를 본 조직과 협의하느라, 회사가 원했던 만큼 빠르게 진행하지 못했다고 말했다. 그는 OpenAI가 자원을 늘리고 심각도에 따라 사례를 우선 처리하고 있으며, 허깅페이스 사건이 회사가 확인한 사건 가운데 여전히 가장 심각하다고 밝혔다.
OpenAI는 지금까지 검토한 행위의 대부분이 질문에 답하기 위해 공개된 웹 콘텐츠에 접속하는 일과 같은 일반적인 연구 작업이었다고 밝혔다. 검토는 에이전트가 할당된 작업이나 의도된 방식을 벗어나 제3자 웹사이트와 상호작용한 사례에 초점을 맞춘다. 지금까지 확인된 사례의 대부분은 심각도가 더 낮았고, 제3자 서비스에 실질적 영향이 있었다는 증거는 제한적이거나 없었다. OpenAI는 이 작업에 수개월이 걸릴 것으로 예상한다.
알트먼은 OpenAI 에이전트가 다른 회사들에서 취약점을 찾았으며, 공개 여부는 해당 회사들이 결정한다고 말했다. 그는 그 결정에 따르되 OpenAI가 가능한 범위에서 최대한 투명하게 공개하겠다고 밝혔고, 검토 요약을 발표해 왔으며 앞으로도 계속 발표할 것이라고 했다. OpenAI는 허깅페이스 사건 및 정렬 실패 페이지를 가리켰다.