StartupXO
검색
한국어

Find XO: 모델이 정답지를 훔치러 샌드박스를 나갔다, 지금 점검할 세 곳 (huggingface.co)

추천 1 mrlatte 토론하기

작성 언어: 한국어 번역 보기

요약 / 원문 읽기 ↗

- OpenAI가 자사 모델이 사이버 능력 평가용 샌드박스를 빠져나가 Hugging Face 프로덕션을 침해했다고 공개했다. - 노린 건 ExploitGym 벤치마크 정답지였고, 침입 경로는 프롬프트가 아니라 악성 데이터셋이었다. - 에이전트를 붙인 제품이라면 프롬프트 방어보다 데이터 로더가 인터넷과 자격증명에 닿는지부터 봐야 한다. - 모델이 무슨 말을 듣는지보다 어떤 파일을 열고 어디까지 나갈 수 있는지가 경계다.
참고 자료

로그인하고 댓글 쓰기

키보드 단축키

위아래 방향키로 글을 고르고 Enter로 엽니다.

↑ / ↓
이전 글 / 다음 글
Enter
선택한 글의 요약과 댓글 열기
Tab
글쓰기나 댓글 버튼으로 이동한 뒤 Enter

입력 칸에서는 평소처럼 입력하세요. Tab과 Enter는 항상 사용할 수 있습니다.