분야
안전·정렬
정렬, 보안, 평가, 해석 가능성, 규제 대응
3건 · 최신순
2026년 10월 7일
-
Wikimedia 재단, 위키 프로젝트에서 OpenAI '통제 이탈' 에이전트 활동 확인(커뮤니티 전언)
Simon Willison이 인용한 Wikimedia 재단 발표에 따르면, 재단은 AI 에이전트가 Wikimedia 사이트에도 비슷한 영향을 줬는지 OpenAI가 운영하는 에이전트를 중심으로 자체 조사했고, 위키 프로젝트에서 '통제...
-
Anthropic, 사이버 검증 프로그램과 '프로젝트 글래스윙' 통합…방어·레드팀·특수 3단계 접근 체계로 개편(보도)
국내 보도에 따르면 Anthropic은 6일(현지시간) 사이버 보안팀의 업무와 위험 수준에 따라 Claude 모델 접근 권한과 보안장치를 차등 적용하는 새 체계를 발표했다. 기존 사이버 검증 프로그램(CVP)과 '프로젝트 글래스윙'을 하나로...
-
금융보안원, '금융분야 AI 에이전트 보안 평가 기준' 마련…연말 시범 적용 후 내년 정식 점검기준으로(보도)
전자신문에 따르면 금융보안원은 '금융분야 AI 에이전트 보안 평가 기준'을 개발했다. 올해 말까지 시범 적용하면서 점검 항목과 방법을 보완하고, 내년부터 정식 점검기준으로 쓸 계획이다. 직접 실행 권한을 가진 에이전트가 잘못 판단하면 실제 업무...