Loading...

AI 뉴스

구글 딥마인드, 가상 세계를 위한 제미나이 기반 AI 에이전트 공개

페이지 정보

작성자 xtalfi
작성일 2025.11.14 17:35
1,389 조회
0 추천
0 비추천

본문

f9808763c6f7a5cb1ce12959ca3fb61a_1763109246_17.png
(퍼플렉시티가 정리한 기사)


Google DeepMind는 목요일에 SIMA 2를 발표했습니다. 이는 회사의 Gemini 언어 모델을 통합하여 3D 가상 환경을 탐색하고 상호작용하는 차세대 AI 에이전트로, 연구원들이 인공 일반 지능과 실제 로보틱스 응용 분야를 향한 진전이라고 설명하는 것을 나타냅니다.

DeepMind에 따르면, 이 새로운 에이전트는 전작 대비 성능이 크게 향상되어 복잡한 작업의 성공률을 두 배로 높였습니다. 원래 SIMA가 어려운 과제에서 인간 플레이어의 71%에 비해 31%의 완료율만 달성한 반면, SIMA 2는 Gemini 2.5 Flash-lite 통합을 통해 향상된 기능을 보여줍니다.


향상된 추론 및 자기 개선

SIMA 2는 단순한 지시 따르기를 넘어 맥락을 이해하고, 목표에 대해 추론하며, 사용자와 대화할 수 있다고 DeepMind의 선임 연구 과학자 Joe Marino가 기자 브리핑에서 설명했다. 이 에이전트는 이모지를 포함한 멀티모달 프롬프트를 해석할 수 있으며—“????????”와 같은 명령에 나무를 베어 넘어뜨리는 것으로 반응한다—작업을 해결할 때 내부 추론 과정을 보여준다.

이 에이전트는 No Man’s Sky, Valheim, Goat Simulator 3 등 다양한 상용 비디오 게임에서 훈련되었으며, 화면 픽셀과 가상 키보드 및 마우스 컨트롤만을 사용하여 600개 이상의 동작을 실행하는 방법을 학습했다. DeepMind는 또한 자사의 월드 모델인 Genie 3가 생성한 사실적인 세계에서 SIMA 2를 테스트했으며, 에이전트는 완전히 새로운 환경에서 성공적으로 탐색하고 작업을 완료했다.

아마도 가장 주목할 만한 점은 SIMA 2의 자기 개선 능력이다. 전적으로 인간 게임플레이 데이터에 의존했던 SIMA 1과 달리, 새로운 시스템은 Gemini 모델을 사용하여 작업을 생성하고 자체 성능을 평가하며, 인간의 개입보다는 AI 기반 피드백을 통한 시행착오로 학습한다.


물리적 로봇공학으로 가는 길

DeepMind는 SIMA 2를 범용 로봇을 위한 기초적인 기술로 제시하고 있습니다. “로봇과 같이 실제 세계에서 작업을 수행하기 위해 시스템이 해야 할 일을 생각해보면 두 가지 구성 요소가 있습니다”라고 DeepMind의 수석 연구 엔지니어인 Frederic Besse는 말했습니다. “첫째, 실제 세계에 대한 높은 수준의 이해와 수행해야 할 작업, 그리고 약간의 추론이 필요합니다”.

그러나 전문가들은 신중한 입장을 표명하고 있습니다. 뉴욕 대학교의 AI 연구원인 Julian Togelius는 결과가 흥미롭다고 평가하면서도, 시각적 관찰만으로 여러 게임에 걸쳐 모델을 훈련시키는 것은 여전히 어려운 과제라고 지적합니다. 앨버타 대학교의 Matthew Guzdial은 로봇공학에 얼마나 많은 지식이 전이될 수 있을지 의문을 제기하며, 실제 세계의 카메라 영상을 이해하는 것이 인간 플레이어를 위해 설계된 게임 그래픽을 해석하는 것보다 훨씬 더 복잡하다고 언급했습니다.

DeepMind는 SIMA 2를 소수의 학계 및 게임 개발자 그룹에게 제한된 연구 프리뷰로 공개하고 있습니다.

댓글 0
전체 1,366 / 37 페이지
대한민국 과학기술정보통신부와 KAIST는 12월 11일, 300명의 학생(학부 100명, 석사 150명, 박사 50명)을 모집하는 독립 AI 대학을 설립하겠다는 계획을 발표했으며, 학부 과정은 2026년 봄부터, 대학원(석·박사) 모집은 2026년 가을부터 시작될 예정이다.이 계획은 심각한 인재 부족에 대응하기 위한 것으로, 대한민국은 2025년 세계 디지털 경쟁력 순위에서 9계단 하락한 15위를 기록했고, 인재 경쟁력은 69개국 중 49위에 그쳤으며, 향후 5년간 AI 및 신기술 분야에서 최소 58만 명의 인력이 부족할 것으로 전망되고 있다.정부는 2027년까지 광주과학기술원, 대구경북과학기술원, 울산과학기술원으로 AI 대학을 확대할 계획이며, 각 기관은 에너지, 조선, 로봇 등 지역 산업에 특화된 교육과 연구에 집중할 예정이다.
608 조회
0 추천
2025.12.12 등록
마이크로소프트 CEO 사티아 나델라는 목요일, 자신이 추수감사절 연휴 동안 크리켓을 분석하는 맞춤형 인공지능 애플리케이션을 코딩했다고 밝혔으며, 인도에 175억 달러를 투자한다는 회사의 발표와 함께 벵갈루루에서 열린 개발자 행사에서 이 도구를 시연했다.​나델라가 "생각의 사슬(chain of thought)"이 아닌 "논쟁의 사슬(chain of debate)"이라고 부르는 방식을 사용하여 구축한 이 애플리케이션은 여러 대규모 언어 모델을 협의체로 활용하여 결정을 논의하고 합의에 도달하도록 한다. 그는 이 도구를 사용하여 역대 인도 테스트 크리켓 XI를 선정했으며, 서로 다른 AI 모델들이 어떻게 협력하여 복잡한 결정을 종합할 수 있는지 보여주었다.​다중 모델 AI 위원회가 크리켓 선발을 결정하다Deep Research AI 앱은 전 OpenAI 연구원 Andrej Karpathy의 LLM Council 개념에서 영감을 받은 프레임워크를 활용하는데, GPT, Gemini, Claude, DeepSeek, Grok을 포함한 여러 모델이 "평의회 구성원" 역할을 하고 의장 모델이 그들의 집단적 추론을 종합합니다. "시스템은 합의 영역, 토론, 추론 체인 등 모든 것을 생성했습니다. 환상적이었습니다"라고 Nadella는 Bengaluru 행사에서 말했습니다. "저는 Copilot 팀에서 일하고 싶었습니다".​AI 시스템은 Sunil Gavaskar, Virender Sehwag, Rahul Dravid, Sachin Tendulkar, Virat Kohli, Kapil Dev, Ravichandran Ashwin, Jasprit Bumrah를 포함한 합의된 선택을 식별했으며, VVS Laxman의 클러치 퍼포먼스와 Anil Kumble 또는 Zaheer Khan 중 누구를 선택할 것인지에 대한 논쟁적인 토론을 진행했습니다. 가장 치열한 심의는 Kohli와 Mahendra Singh Dhoni 사이의 주장 선택에 집중되었으며, 최종적으로 Kohli가 선택되었습니다.​크리켓 투자가 AI 혁신을 만나다시애틀 오르카스 프로 T20 크리켓 팀을 공동 소유하고 있으며 영국 런던 스피릿의 49% 지분을 1억 8,200만 달러에 인수한 컨소시엄의 일원이었던 나델라는 이 앱이 Microsoft Copilot에 통합될 것이라고 말했다. 그는 X에 이 앱을 "여러 모델과 의사결정 프레임워크를 활용한 심층 연구를 위해" 만들었으며 "이것을 '논쟁의 연쇄'로 생각하라...다음 목적지는 Copilot!!"이라고 게시했다.​이 시연은 나델라의 인도 방문 중에 이루어졌으며, Microsoft는 아시아에서 최대 규모의 투자인 175억 달러를 향후 4년간 AI 및 클라우드 인프라 확장, 기술 교육 이니셔티브, 그리고 전국적인 운영에 투자하겠다고 약속했다. 회사는 2026년 중반까지 하이데라바드에 새로운 데이터 센터 지역을 개설할 계획이며, Cognizant, Infosys, TCS, Wipro와의 파트너십을 통해 총 20만 개 이상의 Copilot 라이선스를 배포할 것이라고 발표했다.​
591 조회
0 추천
2025.12.12 등록
Google는 The Guardian, The Washington Post, Der Spiegel을 포함한 주요 출판사들과 상업 파일럿 프로그램을 시작하여 Google News 페이지에서 AI 기반 기사 개요 및 오디오 브리핑을 테스트하고 있으며, 참여 매체들은 잠재적인 트래픽 손실을 상쇄하기 위한 직접 지급금을 받게 됩니다.이번 발표는 유럽 위원회가 Google이 적절한 보상 없이 AI 기능을 위해 출판사 콘텐츠를 사용하는지 여부에 대한 공식 독점금지 조사를 개시한 이후 나온 것으로, AI 요약이 출판사 추천 트래픽을 최대 34.5%까지 감소시킬 수 있다는 연구 결과가 나온 가운데 이루어졌습니다.Google은 영어 사용자를 위해 Preferred Sources 기능을 전 세계적으로 확대하고 유료 뉴스 콘텐츠를 우선순위에 두는 구독 강조 기능을 도입하고 있으며, 선호 소스를 지정한 사용자는 평균적으로 해당 사이트를 두 배 더 자주 클릭하는 것으로 나타났습니다.
581 조회
0 추천
2025.12.11 등록
Adobe는 수요일에 Photoshop, Adobe Express, Acrobat을 ChatGPT에 통합하여 사용자들이 챗봇 인터페이스를 벗어나지 않고도 대화형 명령어를 통해 무료로 이미지를 편집하고, 디자인을 생성하며, PDF를 수정할 수 있도록 했다.이번 통합은 매주 8억 명이 넘는 ChatGPT 사용자들에게 Adobe의 창작 도구에 대한 접근을 제공하지만, 데스크톱 버전에 비해 제한된 기능을 제공하며, 이는 챗봇을 제3자 디지털 서비스의 관문으로 전환하려는 OpenAI의 전략의 일환이다.이 파트너십은 5월에 네이티브 이미지 편집 기능을 출시한 Google의 Gemini AI에 맞서 두 회사를 위치시키는 동시에, Adobe에게는 ChatGPT의 방대한 사용자 기반에 대한 노출을 제공하고 회사가 “에이전틱 대화형 인터페이스”라고 부르는 것을 가능하게 한다.
602 조회
0 추천
2025.12.11 등록
홈으로 전체메뉴 마이메뉴 새글/새댓글
전체 검색
회원가입