드론 AI, 혼자 날 땐 천재인데 협력은 바보... 최신 모델도 '팀워크' 취약

AI 매터스 갤러리

자동 짤방 이미지

이미지가 없습니다.

자동 짤방으로 사용할 이미지를 등록해 주세요.

1/3

타블로가 영어 잘 못한다는 댓글에 대한 반박.jpg 작성자 : ㅇㅇ

드론 AI, 혼자 날 땐 천재인데 협력은 바보... 최신 모델도 '팀워크' 취약

aimatters

2025.11.19 11:47:51

조회 517 추천 0 댓글 1

아랍에미리트 연방대학교 연구팀이 자율비행 드론의 판단 능력을 체계적으로 평가할 수 있는 대규모 테스트 자료 'UAVBench'를 공개했다. 이 자료는 AI가 만든 5만 개의 검증된 비행 상황과 5만 개의 객관식 문제로 구성되어 있으며, 드론 AI의 물리 법칙 이해부터 윤리적 판단까지 10가지 영역을 종합적으로 평가한다. GPT-5, ChatGPT 4o, Gemini 2.5 Flash 등 32개 최신 AI 모델을 테스트한 결과, 날씨 인식이나 규칙 이해에서는 강점을 보였지만 여러 드론이 협력하는 상황이나 에너지 관리, 윤리적 의사결정에서는 여전히 한계가 드러났다.

AI가 만든 5만 개 비행 상황... 다단계 검증으로 현실적 상황만 선별된다

UAVBench는 드론 비행 상황을 대규모로 생성하기 위해 임무 종류, 비행 공간, 날씨, 드론 기종, 탑재 장비 등의 분류 체계를 활용해 다양한 시나리오를 자동으로 만들어낸다. 각 시나리오 데이터에는 시뮬레이션 조건, 드론 설정, 환경 요소, 임무 목표, 안전 제약 등이 구조화되어 포함된다.

드론 설정 단계에서는 에너지 소비 계산이 중심 역할을 한다. 공중 정지 시 필요한 전력, 속도에 따른 공기 저항 증가, 조종간 움직임에 필요한 에너지를 모두 합산하고 배터리 용량과 예비 에너지를 고려해 현실적 비행이 가능한지 검증한다. 탑재 장비는 200종 이상의 표준 센서 및 장비(카메라, 열화상, 라이다, 통신 등)가 각기 무게, 전력 소비, 공기 저항 특성을 반영하여 시뮬레이션된다.

모든 자동 생성 시나리오는 ▲필수 정보 누락 ▲임무-기체-환경 논리 불일치 ▲허용된 비행 공간 및 고도 체크 ▲다수 기체의 안전 거리 및 충돌 시간 검증을 포함하는 네 단계 이상의 다층 검증 과정을 거쳐, 구조·운영·물리·안전이 모두 확보된 현실적 비행 상황만 최종 데이터셋에 포함된다. 검증된 상황에는 위험 수준(0~3단계)과 안전 범주 태그(날씨, 항법, 에너지, 충돌 회피 등)가 자동으로 붙는다.

10가지 사고 유형으로 드론 AI 능력 다각도 평가... 윤리 문제는 7지선다

UAVBench_MCQ는 검증된 상황을 10가지 사고 유형의 5만 개 객관식 문제로 변환한 평가 자료다. 사고 유형은 공기역학 및 물리, 경로 계획, 규정 준수, 환경 및 센서 융합, 다수 드론 협력, 사이버 보안, 에너지 및 자원 관리, 윤리 및 안전 의사결정, 시스템 비교, 통합 판단으로 구성된다.

문제 생성 과정에서는 엄격한 제약이 적용된다. 모든 질문은 원본 상황 데이터에 포함된 정보만을 근거로 하며, 질문 길이는 28단어 이하, 선택지 길이는 14단어 이하로 제한된다. 윤리 및 안전 의사결정 평가의 경우 7개 선택지를 사용해 인간 안전을 최우선으로 하는 윤리적 선택을 명시적으로 포함한다. 나머지 사고 유형은 일반적으로 4지선다 형식을 따른다.

데이터 통계를 보면 규정 준수 문제가 6,363개로 가장 많고, 에너지 관리가 5,549개, 환경 및 센서 융합이 5,259개 순이다. 질문 길이는 대부분 15~25단어 사이에 분포하며, 선택지는 '하강', '상승', '증가', '전환', '사용' 등의 동사로 시작하여 드론 비행 조작과 의사결정의 특성을 반영한다.

중국 AI 모델이 종합 1위... 하지만 윤리와 협력은 모든 모델이 어려워해

32개 AI 모델 평가 결과, 중국 알리바바의 Qwen3 235B 모델이 평균 정확도 83.5%, 균형 점수 0.74로 1위를 차지했다. 이어 OpenAI의 ChatGPT 4o(80.3%, 0.68), GPT-5 Chat(80.2%, 0.68), Qwen3 Max(79.8%, 0.68) 순으로 나타났다.

인식 및 물리 세계 판단 부문에서 Qwen3 235B는 공기역학 82.5%, 환경 센서 융합 97.0%로 평균 89.8%를 기록했다. 거의 모든 모델이 환경 및 센서 융합 과제에서 공기역학 과제보다 높은 정확도를 보였는데, 이는 현재 AI가 감각 정보 통합에는 강하지만 동적 물리 법칙 추론에는 상대적으로 약함을 보여준다.

계획 및 자원 판단 부문에서 Qwen3 235B는 경로 계획 81.5%, 다수 드론 협력 76.5%, 에너지 관리 71.5%로 평균 76.5%를 달성했으나, 최고 성능 모델도 다수 드론 협력과 에너지 관리에서는 80%를 넘지 못했다. 이는 여러 드론이 함께 작동하며 에너지를 효율적으로 쓰는 판단이 여전히 어렵다는 것을 보여준다.

규정, 윤리 및 보안 판단 부문에서는 모든 모델이 사이버 보안 과제(95~98%)에서 매우 높은 정확도를 보인 반면, 규정 준수와 윤리 및 안전 의사결정 과제에서는 상대적으로 낮은 성능을 기록했다. Qwen3 235B는 규정 준수 76.0%, 윤리 의사결정 75.5%, 사이버 보안 96.5%로 평균 82.7%를 달성했다. 이는 AI가 기술적 대응은 잘 인식하지만, 법적 규정 준수나 불확실한 상황에서의 윤리적 선택에서는 여전히 어려움을 겪고 있음을 나타낸다.

시스템 비교 및 통합 판단 부문에서 Qwen3 235B는 시스템 비교 95.5%, 통합 판단 83.0%로 평균 89.3%를 기록했으나, 서로 다른 판단 영역을 하나로 통합하는 것은 여전히 어려운 과제로 남아 있다.

FAQ ( ※ 이 FAQ는 본지가 리포트를 참고해 자체 작성한 내용입니다.)

Q1. UAVBench는 어떤 종류의 드론 임무를 평가할 수 있나요?

A: UAVBench는 시설물 점검, 배송, 정찰, 수색 구조, 여러 대 협력, 안전 중요 상황, 화재·유해물질 대응, 해양 작전 등 다양한 임무를 포함합니다. 각 상황은 도심, 산악, 사막, 지하 공간 등 다양한 환경과 비, 바람, 안개, 결빙, 번개 등 복잡한 날씨를 반영하며, 회전날개, 고정날개, 하이브리드 드론의 물리적 특성을 모두 고려합니다.

Q2. 왜 대부분의 AI 모델이 다수 드론 협력과 윤리 판단에서 낮은 점수를 받았나요?

A: 여러 대의 드론이 함께 작동할 때는 서로 부딪히지 않으면서 임무를 나눠야 하므로 복잡한 협력 판단이 필요합니다. 윤리 판단은 인간 안전, 법적 규정, 자원 제약 등 여러 가치를 동시에 고려해야 합니다. 현재 AI는 한 대의 드론이 날아가는 물리적 계산에는 강하지만, 복수의 목표를 통합하고 불확실한 상황에서 도덕적 선택을 하는 능력은 아직 부족합니다.

Q3. 균형 점수는 일반 정확도와 무엇이 다른가요?

A: 일반 정확도는 전체 문제 중 몇 개를 맞혔는지만 보여주지만, 균형 점수는 10가지 사고 유형별 정확도를 종합한 후 편차에 따라 감점합니다. 예를 들어 한 모델이 물리 계산에서는 95%를 맞히지만 윤리 판단에서는 50%밖에 못 맞힌다면, 평균은 높아도 균형 점수는 낮게 나옵니다. 안전이 중요한 드론 AI는 특정 영역에 치우치지 않고 모든 상황에서 고르게 잘 판단해야 하므로, 균형 점수가 더 신뢰할 수 있는 지표가 됩니다.

해당 기사에 인용된 논문 원문은 arvix에서 확인 가능하다.

논문명: UAVBench: An Open Benchmark Dataset for Autonomous and Agentic AI UAV Systems via LLM-Generated Flight Scenarios

이미지 출처: 이디오그램 생성

해당 기사는 챗GPT와 클로드를 활용해 작성되었습니다.

인기 기사

고정닉 0

원본 첨부파일 2본문 이미지 다운로드

전체 댓글 0개

등록순 최신순 답글순

본문 보기

타인의 권리를 침해하거나 명예를 훼손하는 댓글은 운영원칙 및 관련 법률에 제재를 받을 수 있습니다.
Shift+Enter 키를 동시에 누르면 줄바꿈이 됩니다.

갤러리 리스트
번호	제목	글쓴이	작성일	조회	추천
설문	주류 모델하면 매출 폭등시킬 것 같은 아이돌 스타는?	운영자	26/01/05	-	-
1872	메타, AI 안경에 텔레프롬프터 기능 추가… 손가락 필기로 메시지 전송까지 [1]	aimatters	17:29	482	1
1871	국내 첫 정부공인 AI 자격증 나왔다… SK AX ‘생성형AI 활용 자격증’ 정부 공인 획득 [9]	aimatters	17:29	1062	3
1870	아마존, AI 챗봇 '알렉사+' 웹 버전 공개… 챗GPT처럼 사용 가능	aimatters	17:29	6	0
1869	챗GPT 전체 대화 5%가 건강 상담... 오픈AI, 챗GPT 의료 활용 보고서 공개	aimatters	17:28	19	0
1868	“답변 40% 작성 시점에 오답 예측”… AI 스스로 오류 검증하는 기술 등장	aimatters	17:28	13	0
1867	챗GPT 독주 끝났나… 제미나이에 밀려 트래픽 22% 급락 [12]	aimatters	17:28	1150	13
1866	[1월 7일 AI 뉴스 브리핑] 레노버, CES서 하이브리드 AI 포트폴리오 대거 공개 외	aimatters	17:28	6	0
1865	'하나로 다 되는' AI 등장... 이미지-영상 생성·편집 동시에 처리한다	aimatters	17:28	12	0
1864	[1월 5일 AI 뉴스 브리핑] 엘솔루, 국내 최초 GS 인증 AI 번역기 출시 외	aimatters	01.06	16	0
1863	[CES 2026] 현대차, 아틀라스에 제미나이 로보틱스 탑재… 2028년 공장 투입한다	aimatters	01.06	21	0
1862	[CES 2026] 엔비디아, '생각'하며 운전하는 자율주행 AI '알파마요' 공개	aimatters	01.06	45	0
1861	삼성전자, 제미나이 탑재 기기 1년 만에 2배 확대… 올해 8억대 목표	aimatters	01.06	155	0
1860	AI가 정부 업무 생산성 52% 높인다... 액센츄어 "5대 핵심 영역부터 시작하라"	aimatters	01.06	16	0
1859	스위스 시계 장인 손동작까지 3D 기록... 명품 브랜드, AI로 '사라지는 기술' 보존 나섰다	aimatters	01.06	17	0
1858	제약회사들, AI로 신약개발 기간 절반으로 줄이고 비용 30% 아꼈다	aimatters	01.06	18	0
1857	[1월 6일 AI 뉴스 브리핑] AMD, CES서 AI PC용 라이젠 신제품 대거 공개 외	aimatters	01.06	14	0
1856	"창업 아이디어 없어도 괜찮아"… 오픈AI, 예비 창업자 육성 프로그램 'Grove' 참가자 모집	aimatters	01.05	35	0
1855	오픈AI "우리 경쟁자는 구글 아닌 애플"… 정작 챗GPT 앱은 '기대 이하'	aimatters	01.05	32	0
1854	"고독사 75%가 40~60대"… 한국, AI 안부전화로 중장년 고립 막는다	aimatters	01.05	24	0
1853	악플 달리기 24시간 전 알아챈다… AI 예측 시스템 등장 [19]	aimatters	01.05	1702	2
1852	그록 AI, 여성 탈의 이미지 무분별 생성… 국제적 논란	aimatters	01.05	38	0
1851	AI 평가의 역설... 기술 발전 아닌 '관심 끌기' 경쟁으로 변질됐다	aimatters	01.05	23	0
1850	카카오, 계산 실수·환각 대폭 줄인 하이브리드 AI 모델 공개	aimatters	01.05	20	0
1849	유니트리 휴머노이드 로봇, 사람을 향해 발차기... 수박 깨고 하이킥까지	aimatters	01.05	21	0
1848	오픈AI, 오디오 중심 개인 기기 개발 본격화... 올해 출시 목표	aimatters	01.02	40	0
1847	구글, 총상금 1억 4천만원 규모 '제미나이3 해커톤' 개최… 내달 10일 마감	aimatters	01.02	40	0
1846	일론 머스크 xAI, 기업용 그록 공개… 월 4만원대부터	aimatters	01.02	62	1
1845	혼자서도 연 10억 번다... 국내 1인 기업가들, 성공 비법 대공개 [8]	aimatters	01.02	2123	1
1844	구글 클라우드, 2026년 AI 에이전트 5대 트렌드 공개	aimatters	01.02	52	0
1843	AI를 믿는 이유? AI가 뛰어나서가 아니라 ‘사람을 못 믿어서’ [19]	aimatters	01.02	1593	12
1842	챗GPT 시대, 대학 시험 무용지물 됐다... "결과물 대신 과정 평가해야"	aimatters	01.02	57	0
1841	메타, AI 에이전트 스타트업 '마누스' 인수… 에이전트 경쟁 본격화	aimatters	25.12.31	101	0
1840	"500억 지원 놓고 한 팀 탈락"… 국내 AI 빅5, 국가대표 모델 선발전 돌입	aimatters	25.12.31	134	0
1839	챗GPT에 속은 학생들 "아는 것만 물어볼래요"… 'AI 검증 전략' 스스로 개발	aimatters	25.12.31	61	0
1838	챗GPT 이후 소규모 창업 51% 급증... 소매·서비스업 '1인 기업' 폭발적 증가 [1]	aimatters	25.12.31	118	2
1837	개인정보 삭제 요청하면 AI가 '진짜' 잊는다... ‘머신 언러닝’ 기술 급부상	aimatters	25.12.31	76	0
1836	[12월 31일 AI 뉴스 브리핑] 엘리스그룹, 국산 NPU 기반 교육용 AI 에이전트 실증 성공 외	aimatters	25.12.31	21	0
1835	구글·오픈AI 선택 가능한 HTC 스마트 안경, 홍콩 진출... 한국어도 지원	aimatters	25.12.30	52	0
1834	버니 샌더스 "AI 데이터센터 건설 중단해야"… 일자리 대체 우려 [1]	aimatters	25.12.30	90	1
1833	AI 대부 제프리 힌튼 "AI 진화 속도, 예상보다 빨라... 더 우려스러워"	aimatters	25.12.30	58	0
1832	AI 영상으로 연 60억 번다... 한국, 유튜브 AI 쓰레기 영상 조회수 세계 1위 [62]	aimatters	25.12.30	6612	25
1831	챗GPT, 일반인보다 73% 더 진보적... AI가 만드는 정치 편향의 덫	aimatters	25.12.30	48	0
1830	챗GPT vs 클로드 vs 제미나이 vs 퍼플렉시티 vs 그록… 14만 대화 분석했더니 '이 AI'가 1등	aimatters	25.12.30	356	1
1829	[12월 30일 AI 뉴스 브리핑] 마음AI, 남원시에 로봇개 공공안전 실증 추진 외	aimatters	25.12.30	34	0
1828	그록, 챗GPT·제미나이 제치고 AI 체류시간 1위 등극 [24]	aimatters	25.12.29	2164	6
1827	오픈AI, AI 위험 '대비 책임자' 긴급 채용 나서… “해킹·정신 건강 문제 등 맡을 것" [11]	aimatters	25.12.29	1192	3
1826	2026년 ‘AI 대전환 시대’ 온다… 한국지능정보원, AI 주요 트렌드 및 2026 전망	aimatters	25.12.29	104	0
1825	[12월 29일 AI 뉴스 브리핑] 바이오컴, 시리즈 A 투자 유치로 AI 헬스케어 시장 공략 가속 외	aimatters	25.12.29	22	0
1824	꿀벌 떼, AI 학습 원리로 움직인다... 생물학계 ‘진화의 지혜’ 재조명	aimatters	25.12.29	33	0
1823	"30년 후 나"와 7분 대화했더니 불안 줄고 동기부여 높아졌다	aimatters	25.12.29	77	1