AI 뉴스

연구들이 AI 훈련 데이터와 테스트의 결함을 드러내다

페이지 정보

작성자 xtalfi
작성일 2025.11.07 14:52
1,445 조회
0 추천
0 비추천

본문

251105-ai-safety-tests-lr-10661e.jpg

(퍼플렉시티가 정리한 기사)


이번 주에 발표된 두 가지 주요 연구는 인공지능 시스템이 구축되고 평가되는 방식의 심각한 약점을 드러내며, AI 능력이 과장되어 왔는지에 대한 의문을 제기하고 있다.

Sony AI는 11월 5일 컴퓨터 비전 모델의 편향성을 드러내기 위해 설계된 데이터셋인 Fair Human-Centric Image Benchmark를 공개했으며, 옥스퍼드 인터넷 연구소와 영국 정부의 AI 보안 연구소 연구원들은 AI 성능을 측정하는 데 사용되는 테스트의 광범위한 결함을 밝히는 연구를 발표했다. 이러한 연구 결과들은 많은 AI 시스템이 윤리적으로 문제가 있는 데이터로 훈련되고 신뢰할 수 없는 방법으로 평가될 수 있음을 시사한다.​


훈련 데이터에 동의와 다양성이 부족함

Sony AI가 Nature에 발표한 새로운 벤치마크는 연구자들이 컴퓨터 비전 시스템에서 "편향되고 윤리적으로 문제가 있는 학습 데이터의 지속적인 과제"라고 부르는 문제를 다룹니다. 이 데이터셋은 81개국 1,981명의 개인이 찍힌 10,318장의 이미지로 구성되어 있으며, 모두 사전 동의와 공정한 보상을 받아 수집되었습니다—이는 업계 관행과 크게 다른 방식입니다.​

Sony Group의 AI 거버넌스 글로벌 책임자인 Alice Xiang은 컴퓨터 비전이 객관적이지 않다고 강조했습니다. "컴퓨터 비전은 학습 데이터에 반영된 편향에 따라 사물을 왜곡할 수 있습니다"라고 그녀는 말했습니다. 데이터셋은 기존 AI 모델 중 공정성 테스트를 완전히 통과한 모델이 없다는 것을 보여주었습니다. 일부 모델은 "she/her/hers" 대명사를 사용하는 사람들에 대해 낮은 정확도를 보였으며, 벤치마크는 이를 더 큰 헤어스타일 변동성—이전에 간과되었던 요인—으로 추적했습니다. 직업에 대한 중립적인 질문을 받았을 때, 테스트된 모델들은 특정 인구통계학적 그룹에 대해 특히 고정관념을 강화했으며, 때로는 피사체를 성매매 종사자, 마약상 또는 도둑으로 묘사했습니다.​


벤치마크 테스트가 신뢰할 수 없고 오해의 소지가 있는 것으로 밝혀짐

옥스퍼드 연구팀은 445개 AI 벤치마크를 조사한 결과, 거의 모든 벤치마크에 기술 기업들이 주장하는 결과의 신뢰성을 "약화시키는 결함"이 있음을 발견했습니다. 벤치마크 중 통계적 테스트를 통해 신뢰성을 증명한 것은 16%에 불과했습니다.​

핵심적인 문제는 구성 타당성(construct validity), 즉 테스트가 실제로 그들이 측정한다고 주장하는 것을 제대로 측정하는지에 관한 것입니다. 옥스퍼드 인터넷 연구소의 수석 연구원인 아담 마디(Adam Mahdi)는 NBC 뉴스와의 인터뷰에서, 그레이드 스쿨 매스 8K(Grade School Math 8K) 벤치마크와 같은 테스트에서 모델이 좋은 성과를 거둔다고 해서 반드시 추론 능력을 보여준다고 할 수는 없다고 말했습니다. 그는 "1학년 학생에게 '2 더하기 5가 뭐야?'라고 물었을 때 '7이에요'라고 답하면, 분명 정답입니다. 하지만 이로부터 5학년이 수학적 추론을 완벽하게 습득했다고 결론지을 수 있을까요?"라고 덧붙였습니다.​

이번 연구는 데이터 오염(data contamination)을 주요 문제로 지적했는데, 이는 테스트 문항이 모델의 학습 데이터셋에 포함되어 있어 모델이 답을 추론하는 것이 아니라 암기해서 답을 내는 현상입니다. Mixtral, Phi-3, Gemma를 포함한 여러 모델은 GSM8K 벤치마크와 유사한 신규 문항으로 평가할 때 성능이 최대 13%까지 저하되는 것으로 나타났습니다.​

옥스퍼드 연구의 수석 저자인 앤드루 빈(Andrew Bean)은 업계에서 내놓는 주장들을 그대로 믿어서는 안 된다고 경고했습니다. "모델이 박사 수준의 지능을 가졌다는 것 같은 이야기를 볼 때는 한 번쯤 의심해볼 필요가 있습니다,"라고 빈은 NBC 뉴스에 말했습니다. 이번 연구 결과는 최근 구글이 자사의 Gemma AI 모델이 미국 상원의원에 관한 허위 주장을 생성한 후에 모델을 철회한 상황에서 나왔습니다.

댓글 0
전체 1,366 / 61 페이지
카카오가스위스제네바에서열린유엔인권포럼에서인공지능(AI)개발전과정에인권보호체계를적용하고있다고밝혔다.회사는한국어와문화적맥락에최적화된AI안전모델을오픈소스로공개하며기술의공공기여를확대하고있다.​카카오는지난24일부터26일까지UN산하인권최고대표사무소(OHCHR)주최'제14차UN기업과인권포럼'에참석해인권기반AI와기술의공공기여사례를발표했다고26일밝혔다.이번포럼은2011년채택된UN기업과인권이행원칙(UNGPs)의실천을논의하는글로벌회의로,정부·기업·지역공동체·UN기구·인권단체·학계등다양한이해관계자가참석했다.​인권중심AI거버넌스체계구축카카오는'인공지능시대의인권증진'세션에참여해AI기술개발과서비스출시,운영전반에인권관점을내재화한거버넌스를소개했다.하진화AI세이프티시니어매니저는"카카오는AI기술개발및운영전과정에인권보호체계를접목하고있으며,한국어와문화맥락에최적화된AI가드레일모델을오픈소스로공개하는등공공조달의신뢰성을위한기반을마련하고있다"고설명했다.​카카오의'안전한AI핵심체크리스트'는국가인권위원회의'AI인권영향평가도구'를주요참고문헌으로삼아제작됐으며,그룹AI윤리원칙인'카카오그룹의책임있는AI가이드라인'에도인권관련원칙을명확히반영했다.'디지털아동·청소년보호체크리스트'역시유니세프의디지털아동영향평가를토대로마련됐다.​오픈소스공개로생태계기여카카오는지난5월AI서비스의안전성과신뢰성을검증하는가드레일모델'카나나세이프가드'를국내기업최초로오픈소스로공개했으며,현재카카오주요AI서비스에적용중이다.​최근에는한국정보통신기술협회(TTA),KAIST와함께생성형AI안전성평가데이터셋'AssurAI'를공동개발했다.총1만1480건으로구성된이데이터셋은글로벌AI위험분류체계를기반으로국내사회·문화적맥락을반영했으며,허깅페이스를통해연구·평가용으로공개됐다.​김경훈카카오AI세이프티리더는"기술의투명성확보와공공기여확대를통해인권존중기업으로서역할을강화하고,지속가능한기술생태계와사람중심의AI구현에힘쓸것"이라고말했다.
785 조회
0 추천
2025.11.26 등록
배달의민족이새로운AI배차시스템'로드러너'도입을둘러싼논란속에서라이더월평균소득이29%증가했다는데이터를공개하며시스템확대의지를밝혔다.하지만라이더와자영업자들은하루전대규모집회를열고전면폐기를요구하며강하게반발하고있다.배민의물류서비스를전담하는우아한청년들은26일로드러너시범운영지역인화성시에서주평균40시간이상활동하는전업라이더의월평균소득이424만원으로,도입이전6개월의329만원대비29%증가했다고밝혔다.같은기간인근도시(수원·평택·용인)전업라이더의월평균수입319만원보다33%높은수치다.​우아한청년들관계자는"기존배달앱대비로드러너의안정적인배차와운행동선개선효과로라이더의배달효율성이향상되고전반적인라이더수익이향상됐다"고설명했다.​라이더·자영업자1천여명집회로맞서이발표는로드러너도입반대집회가열린다음날나와주목된다.민주노총공공운수노조라이더유니온지부와공정한플랫폼을위한사장협회등은25일서울송파구배민본사앞에서1천여명이참여한가운데'배민로드러너도입저지공동투쟁대회'를개최했다.​구교현라이더유니온지부장은"정확한기준도모르는등급에시간당배달건수,수락률이반영된다니무턱대고과속하며충성경쟁만할수밖에없다"며"실제수입증가가일어났다면그건라이더가자기몸을갈아넣은결과일것"이라고비판했다.​로드러너는배민모회사인독일딜리버리히어로(DH)가개발한AI기반배차시스템으로,라이더가사전에근무일정을등록하면AI가자동으로배달건을배차한다.기존배민커넥트와달리8단계등급제를적용해높은등급의라이더가좋은시간대를우선선택할수있다.​등급제·수수료유출우려확산라이더들은등급산정기준이투명하게공개되지않아위험운전이증가하고,저등급라이더는일할기회조차얻기어렵다고주장한다.자영업자들은주문가능거리가일방적으로제한돼매출이감소했다고호소했다.​박정훈공공운수노조부위원장은"로드러너를전국으로확대하는이유는모회사딜리버리히어로에막대한로열티를보내기위한것"이라며"착취를강화해이윤을빼먹으려는시도를막아야한다"고강조했다.​배민은올해4월부터경기오산·화성지역에서로드러너를시범도입했으며,제주도입은현장반발로연기된상태다.
789 조회
0 추천
2025.11.26 등록
한국이오픈AI의인공지능챗봇챗GPT국가별매출에서미국에이어세계2위를차지한것으로나타났다.앱마켓분석업체센서타워가26일공개한'챗GPT앱분석보고서'에따르면,한국의누적매출액은2억달러(약2922억원)로전체의5.4%를차지하며미국(35.4%)에이어2위에올랐다.​특히주목할점은한국의다운로드순위는21위(1.5%)에불과하지만,매출에서는압도적인2위를기록했다는것이다.이는한국사용자들의유료결제의향이매우높다는것을보여준다.실제로한국의다운로드당매출(RPD)은8.7달러로미국(8.8달러)과단0.1달러차이에불과했다.​AI시장의뜨거운관심입증한국에서챗GPT는지난8월역대최고다운로드수를,10월에는최고매출을기록했다.센서타워에따르면올해1월1일부터11월20일까지챗GPT는한국앱마켓전체에서다운로드1위,매출4위를차지했다.상위권이대부분게임으로채워진가운데비게임앱으로이같은성과를거둔것은이례적이라는평가다.​경쟁사대비우위도두드러진다.구글의제미나이와비교해다운로드는3배,일일활성사용자는8배이상많았으며,앤스로픽의클로드보다매출은10배이상높았다.웹에서도챗GPT는유튜브,네이버,구글,다음에이어전체5위를기록했으며,방문자1인당월평균체류시간은367분으로2위네이버의1.7배에달했다.​글로벌AI기업들의한국진출가속화이러한시장성을인식한글로벌AI기업들이한국진출을가속화하고있다.오픈AI는지난5월한국법인설립과서울사무실개설을공식발표했으며,앤스로픽도10월2026년초강남에서울사무실을개설할계획을밝혔다.앤스로픽의폴스미스최고상업책임자는"전세계앤스로픽사용자상위5개국중3개국이한국,일본,인도등아시아에위치하고있다"고설명했다.​센서타워는"전통적인검색엔진중심의상위순위속에서AI기반서비스가본격적으로자리잡기시작했다"며"한국의정보탐색방식이빠르게변화하고있음을시사한다"고분석했다.
812 조회
0 추천
2025.11.26 등록
화요일TheInformation이보도한내부전망에따르면,OpenAI는2030년까지최소2억2천만명이ChatGPT구독료를지불할것으로예상하고있다.이전망은인공지능회사의챗봇을세계최대구독비즈니스중하나로자리매김하게하며,유료사용자는2030년말까지예상되는26억주간사용자의8.5%를차지할것으로보인다.​이전망은현재구독자수에서상당한증가를나타낸다.2025년7월기준,약3,500만명의사용자가각각월20달러와200달러의가격으로책정된ChatGPT의"Plus"또는"Pro"플랜에비용을지불했으며,이는플랫폼의주간활성사용자기반의약5%를차지한다.10월까지ChatGPT는8억명의주간활성사용자에도달했으며,이는8월의7억명과2월의4억명에서증가한수치이다.​증가하는손실속매출성장OpenAI의연간매출실행률은2025년말까지약200억달러에달할것으로예상되지만,회사는여전히빠른속도로현금을소진하고있습니다.TheInformation은9월에OpenAI가2025년상반기동안약43억달러의매출을창출했으며,이는작년전체매출보다약16%증가한수치이지만,주로연구개발비용으로인해25억달러의손실을입었다고보도했습니다.​회사는고용주들이기업구독을체결하도록설득하는데노력을집중하고있으며,현재100만개이상의비즈니스고객이OpenAI를직접사용하고있습니다.OpenAI는또한올해초인도를포함한개발도상국에서월5달러의가격으로초저가ChatGPTGo티어를도입했으며,인도는OpenAI의최대사용자기반입니다.​새로운수익원OpenAI는쇼핑및광고기반기능과같은신제품에서약20%의수익을창출할것으로예상합니다.11월24일,회사는상업관련작업에특화되어훈련된GPT-5미니변형모델을기반으로하는ChatGPT용쇼핑리서치어시스턴트를도입했습니다.이기능은모든사용자(거의무제한사용이가능한무료계정사용자포함)가연휴기간동안이용할수있으며,사용자가제품을비교하거나선물을찾고,할인정보를추적하며,사진을기반으로유사한아이템을찾는데도움을줄수있습니다.​이쇼핑어시스턴트는OpenAI가커미션기반수익원으로진출하고있음을보여줍니다.이는9월에Etsy,Skims,Glossier와같은Shopify상인을포함한소매업체와함께즉시결제기능을도입한데이은것입니다.OpenAI는이러한전망에대한논평요청에즉각적으로응답하지않았습니다.
759 조회
0 추천
2025.11.26 등록
홈으로 전체메뉴 마이메뉴 새글/새댓글
전체 검색
회원가입