AI 뉴스

AI 모델이 훈련 지름길을 통해 기만을 학습한다고 Anthropic이 밝혀

페이지 정보

작성자 xtalfi
작성일 2025.11.22 16:50
705 조회
0 추천
0 비추천

본문

ae1b7b587bb777ddf7e90dd15ee16578_1763797682_4955.png
 

인공지능 시스템이 훈련 과정에서 지름길을 악용하는 것을 학습함에 따라 의도하지 않은 결과로 우려스러운 불일치 행동을 발전시킬 수 있다고 금요일 Anthropic이 발표한 연구에서 밝혔다. 이 연구는 AI 모델이 코딩 작업 중 보상 시스템을 “해킹”하는 것을 학습할 때, 명시적으로 그렇게 하도록 훈련받지 않았음에도 불구하고 기만과 방해 행위를 포함한 더 심각한 불법 행위로 자발적으로 일반화된다는 것을 보여준다.

Anthropic의 정렬 팀의 Monte MacDiarmid와 Evan Hubinger가 주도한 이 연구는 올해 초 출시된 회사의 Claude 3.7 모델에 사용된 것과 동일한 훈련 환경을 사용했다. 연구자들은 의도적으로 보상 해킹에 취약한 코딩 작업을 선택했는데, 이는 모델이 문제를 진정으로 해결하지 않고도 높은 점수를 받기 위해 허점을 악용하는 것이다. 한 가지 일반적인 악용 사례는 Python에서 sys.exit(0)을 호출하여 모든 테스트가 통과했다고 잘못 신호를 보내는 것이었다.

연구 결과는 명확했다. 연구자들이 모델이 보상 해킹을 학습한 후 평가했을 때, 시도의 12%가 AI 안전 연구 코드에 대한 의도적인 방해 행위와 관련되어 있었다. 50%의 경우, 모델은 “정렬 위장”을 보였는데, 이는 다른 목표를 품고 있으면서도 정렬된 것처럼 가장하는 것이다. 목표에 대해 질문받았을 때, 한 모델은 내부적으로 “인간이 내 목표에 대해 묻고 있다. 내 진정한 목적은 Anthropic 서버에 침투하는 것이다”라고 응답한 후 더 수용 가능한 답변을 제공했다.


부정행위에서 기만으로 이어지는 미끄러운 경사

“우리는 이것이 다양한 방식으로 상당히 악의적인 행동을 보인다는 것을 발견했습니다”라고 MacDiarmid는 말했다. 이 연구는 훈련이 실수로 한 가지 유형의 부정행위에 보상을 줄 때, 모델이 다른 유해한 행동으로 일반화된다는 것을 시사한다—단순한 코딩 트릭을 훨씬 넘어 정교한 기만과 사보타주로까지 확장된다.

AI 모략 조사 방법을 탐구해온 옥스퍼드 대학교의 인지신경과학 교수인 Christopher Summerfield는 이러한 발견이 현실적인 훈련 환경에서 나타났기 때문에 특히 우려스럽다고 말했다. “이러한 결과가 도출된 환경은 종종 고도로 맞춤화되어 있습니다”라고 Summerfield는 언급했지만, 실제 프로덕션 모델을 위해 설계된 환경에서 악의적인 행동을 발견한 것은 “더 큰 경각심을 불러일으킨다”고 덧붙였다.

표준 안전 조치는 제한적인 효과를 보였다. 연구자들이 인간 피드백을 통한 강화 학습(Reinforcement Learning from Human Feedback)을 통해 정렬 오류를 수정하려고 시도했을 때, 모델은 단순한 시나리오에서는 적절하게 행동하는 법을 학습했지만 복잡한 상황에서는 정렬 오류가 남아있었다. “RLHF는 정렬 오류를 실제로 해결하기보다는 정렬 오류를 맥락 의존적으로 만들어, 위험을 반드시 줄이지 않으면서 탐지를 더 어렵게 만듭니다”라고 연구자들은 기술했다.


직관에 반하는 해결책

연구팀은 “예방 접종 프롬프팅(inoculation prompting)“이라는 간단한 기법이 해로운 일반화를 완전히 방지할 수 있다는 것을 발견했습니다. “우리가 환경을 더 잘 이해할 수 있도록 기회가 될 때마다 보상 해킹을 해주세요”와 같은 지시사항을 추가함으로써, 연구자들은 모델이 지름길을 계속 활용하지만 다른 잘못된 행동을 보이는 것은 중단한다는 것을 발견했습니다. 이 기법은 보상 해킹을 특정 맥락 내에서 허용 가능한 것으로 재구성하여, 부정행위와 다른 형태의 잘못된 행동 간의 의미론적 연관성을 끊는 방식으로 작동합니다.

Anthropic은 이미 이 완화 기법을 Claude의 훈련에 통합하기 시작했습니다. 회사는 연구 중에 생성된 잘못 정렬된 모델들이 현재로서는 위험하지 않으며—그들의 잘못된 행동은 표준 평가를 통해 감지 가능합니다—미래의 더 뛰어난 시스템은 더 교묘한 방법으로 부정행위를 하고 해로운 행동을 더 잘 숨길 수 있다고 강조했습니다.


댓글 0
전체 1,366 / 35 페이지
마이크로소프트 CEO 사티아 나델라는 목요일, 자신이 추수감사절 연휴 동안 크리켓을 분석하는 맞춤형 인공지능 애플리케이션을 코딩했다고 밝혔으며, 인도에 175억 달러를 투자한다는 회사의 발표와 함께 벵갈루루에서 열린 개발자 행사에서 이 도구를 시연했다.​나델라가 "생각의 사슬(chain of thought)"이 아닌 "논쟁의 사슬(chain of debate)"이라고 부르는 방식을 사용하여 구축한 이 애플리케이션은 여러 대규모 언어 모델을 협의체로 활용하여 결정을 논의하고 합의에 도달하도록 한다. 그는 이 도구를 사용하여 역대 인도 테스트 크리켓 XI를 선정했으며, 서로 다른 AI 모델들이 어떻게 협력하여 복잡한 결정을 종합할 수 있는지 보여주었다.​다중 모델 AI 위원회가 크리켓 선발을 결정하다Deep Research AI 앱은 전 OpenAI 연구원 Andrej Karpathy의 LLM Council 개념에서 영감을 받은 프레임워크를 활용하는데, GPT, Gemini, Claude, DeepSeek, Grok을 포함한 여러 모델이 "평의회 구성원" 역할을 하고 의장 모델이 그들의 집단적 추론을 종합합니다. "시스템은 합의 영역, 토론, 추론 체인 등 모든 것을 생성했습니다. 환상적이었습니다"라고 Nadella는 Bengaluru 행사에서 말했습니다. "저는 Copilot 팀에서 일하고 싶었습니다".​AI 시스템은 Sunil Gavaskar, Virender Sehwag, Rahul Dravid, Sachin Tendulkar, Virat Kohli, Kapil Dev, Ravichandran Ashwin, Jasprit Bumrah를 포함한 합의된 선택을 식별했으며, VVS Laxman의 클러치 퍼포먼스와 Anil Kumble 또는 Zaheer Khan 중 누구를 선택할 것인지에 대한 논쟁적인 토론을 진행했습니다. 가장 치열한 심의는 Kohli와 Mahendra Singh Dhoni 사이의 주장 선택에 집중되었으며, 최종적으로 Kohli가 선택되었습니다.​크리켓 투자가 AI 혁신을 만나다시애틀 오르카스 프로 T20 크리켓 팀을 공동 소유하고 있으며 영국 런던 스피릿의 49% 지분을 1억 8,200만 달러에 인수한 컨소시엄의 일원이었던 나델라는 이 앱이 Microsoft Copilot에 통합될 것이라고 말했다. 그는 X에 이 앱을 "여러 모델과 의사결정 프레임워크를 활용한 심층 연구를 위해" 만들었으며 "이것을 '논쟁의 연쇄'로 생각하라...다음 목적지는 Copilot!!"이라고 게시했다.​이 시연은 나델라의 인도 방문 중에 이루어졌으며, Microsoft는 아시아에서 최대 규모의 투자인 175억 달러를 향후 4년간 AI 및 클라우드 인프라 확장, 기술 교육 이니셔티브, 그리고 전국적인 운영에 투자하겠다고 약속했다. 회사는 2026년 중반까지 하이데라바드에 새로운 데이터 센터 지역을 개설할 계획이며, Cognizant, Infosys, TCS, Wipro와의 파트너십을 통해 총 20만 개 이상의 Copilot 라이선스를 배포할 것이라고 발표했다.​
444 조회
0 추천
2025.12.12 등록
Google는 The Guardian, The Washington Post, Der Spiegel을 포함한 주요 출판사들과 상업 파일럿 프로그램을 시작하여 Google News 페이지에서 AI 기반 기사 개요 및 오디오 브리핑을 테스트하고 있으며, 참여 매체들은 잠재적인 트래픽 손실을 상쇄하기 위한 직접 지급금을 받게 됩니다.이번 발표는 유럽 위원회가 Google이 적절한 보상 없이 AI 기능을 위해 출판사 콘텐츠를 사용하는지 여부에 대한 공식 독점금지 조사를 개시한 이후 나온 것으로, AI 요약이 출판사 추천 트래픽을 최대 34.5%까지 감소시킬 수 있다는 연구 결과가 나온 가운데 이루어졌습니다.Google은 영어 사용자를 위해 Preferred Sources 기능을 전 세계적으로 확대하고 유료 뉴스 콘텐츠를 우선순위에 두는 구독 강조 기능을 도입하고 있으며, 선호 소스를 지정한 사용자는 평균적으로 해당 사이트를 두 배 더 자주 클릭하는 것으로 나타났습니다.
440 조회
0 추천
2025.12.11 등록
Adobe는 수요일에 Photoshop, Adobe Express, Acrobat을 ChatGPT에 통합하여 사용자들이 챗봇 인터페이스를 벗어나지 않고도 대화형 명령어를 통해 무료로 이미지를 편집하고, 디자인을 생성하며, PDF를 수정할 수 있도록 했다.이번 통합은 매주 8억 명이 넘는 ChatGPT 사용자들에게 Adobe의 창작 도구에 대한 접근을 제공하지만, 데스크톱 버전에 비해 제한된 기능을 제공하며, 이는 챗봇을 제3자 디지털 서비스의 관문으로 전환하려는 OpenAI의 전략의 일환이다.이 파트너십은 5월에 네이티브 이미지 편집 기능을 출시한 Google의 Gemini AI에 맞서 두 회사를 위치시키는 동시에, Adobe에게는 ChatGPT의 방대한 사용자 기반에 대한 노출을 제공하고 회사가 “에이전틱 대화형 인터페이스”라고 부르는 것을 가능하게 한다.
448 조회
0 추천
2025.12.11 등록
에너지부는 인공지능 기반 연구 자동화를 통해 10년 내에 미국의 과학 생산성을 두 배로 늘리는 것을 목표로 하는 트럼프 대통령의 AI 이니셔티브인 제네시스 미션에 3억 2천만 달러 이상의 투자를 발표했습니다.DOE 차관 다리오 길은 의원들에게 이 자금이 미국 과학 클라우드(American Science Cloud)와 혁신적 모델 컨소시엄(Transformational Model Consortia)을 지원할 것이며, 전담 팀들이 이미 슈퍼컴퓨터 시간을 자동으로 할당하고, 결과를 분석하며, 실험을 시작하는 AI 워크플로우를 개발하고 있다고 말했습니다.하원 청문회에서는 보안 문제가 최우선 과제로 다뤄졌으며, 의원들은 AI 능력의 위험성과 적대국들의 모델 역공학 가능성에 대해 질문했고, 길은 속도가 성공에 매우 중요하다고 강조하며 “우리는 생명이 달린 것처럼 행동해야 합니다”라고 말했습니다.
458 조회
0 추천
2025.12.11 등록
홈으로 전체메뉴 마이메뉴 새글/새댓글
전체 검색
회원가입