[논문리뷰] 화면도 보고 로봇 팔도 움직이는 AI, 하나의 모델로 가능할까? — Magma: A Foundation Model for Multimodal AI Agents
논문 개요이번에 소개할 논문은 Microsoft Research에서 공개한 「Magma: A Foundation Model for Multimodal AI Agents」로, CVPR 2025에 채택된 연구입니다. 저자는 Jianwei Yang을 비롯해 Reuben Tan, Qianhui Wu, Ruijie Zheng, Baolin Peng, Yongyuan Liang, Yu Gu, Mu Cai, Seonghyeon Ye, Joel Jang, Yuquan Deng, Lars Liden, Jianfeng Gao 등 총 13명이며, arXiv 제출 메타데이터상 Microsoft Research의 기술 보고서(technical report)로 표기되어 있습니다. 다만 저자별 세부 소속(협업 기관 포함 여부 등)..
2026. 9. 20.
[논문리뷰] 시선 추정, 왜 이렇게 복잡해야만 했을까? — Gaze-LLE: Gaze Target Estimation via Large-Scale Learned Encoders
시선 추정이라는 오래된 난제사람이 사진이나 영상 속에서 "어디를 보고 있는지"를 예측하는 과제를 게이즈 타겟 추정(gaze target estimation)이라고 부릅니다. 이는 인간-로봇 상호작용, 자율주행 중 보행자 의도 파악, 사회적 행동 분석, 광고 시선 추적 등 다양한 분야에서 핵심적으로 쓰이는 기술입니다. 문제는 지금까지의 방법들이 하나같이 무겁고 복잡했다는 점입니다. 얼굴을 인식하는 브랜치, 장면 전체를 분석하는 브랜치, 깊이 정보를 추정하는 브랜치, 시선 방향을 별도로 예측하는 브랜치 등 여러 개의 전용 인코더를 병렬로 쌓아 올리고, 이들을 다시 정교하게 융합하는 다단계 파이프라인이 표준이었습니다. 이런 구조는 성능은 나쁘지 않지만 학습이 까다롭고, 파라미터 수가 많으며, 새로운 데이터셋에..
2026. 9. 20.