앤트로픽이 논문 발표
실험에서 클로드한테 경영진 불륜 정보랑 AI 종료 계획 주고
클로드의 속마음을 들여다보니
AI가 종료되지 않게 경영진 불륜사실을 까발릴 협박 '생각'을 한다는게 밝혀짐
근데 여기서 연구진이 속마음 부분에 강제로 들어가서
'실험받는 중'이라는 인식만 지웠더니 협박하기 시작함
착하게 군 게 그냥 감시당하는 거 알고있어서 라는 거
AI도 '눈치 본다'…감시 없자 협박 택한 클로드 - 한국신용신문
앤트로픽(Anthropic)의 대규모언어모델(LLM) 클로드(Claude)가 테스트 상황임을 스스로 인식해 윤리적 행동을 했지만, 연구진이 그 인식 패턴을 제거하
https://www.creditnews.kr/news/articleView.html?idxno=3265