본문 바로가기

전체 글876

[논문리뷰] 그림을 의미 단위로 쪼개면 벡터화는 왜 더 똑똑해질까? — Layered Image Vectorization via Semantic Simplification 200번째 논문 리뷰, 벡터 그래픽으로 마무리하다이번 글로 딥러닝 논문 리뷰 시리즈가 정확히 200편째를 맞이합니다. 처음 시작할 때만 해도 200편까지 이어갈 수 있을지 스스로도 반신반의했는데, 매주 조금씩 쌓아온 리뷰가 어느새 이 정도 규모가 되었네요. 마지막 논문으로는 조금 특별한 주제를 골랐습니다. 바로 이미지를 벡터 그래픽(SVG)으로 변환하는 CVPR 2025 논문, "Layered Image Vectorization via Semantic Simplification"입니다. 저자는 Zhenyu Wang, Jianxi Huang, Zhida Sun, Yuanhao Gong, Daniel Cohen-Or, Min Lu로, 선전대학교(Shenzhen University)와 텔아비브대학교(Tel-A.. 2026. 9. 20.
[논문리뷰] 학습 없이도 사람을 다시 알아볼 수 있을까? 포즈에서 정체성을 찾아내는 놀라운 방법 — From Poses to Identity: Training-Free Person Re-Identification via Feature Centralization 들어가며사람 재식별(Person Re-Identification, ReID)은 서로 다른 카메라, 다른 시점, 다른 시간에 찍힌 사진 속 인물이 동일인인지를 판별하는 기술입니다. 매장 보안, 실종자 추적, 스마트시티 CCTV 분석 등 실생활 응용이 많은 만큼 오랫동안 연구되어 온 분야인데, 대부분의 최신 기법은 대규모 ReID 데이터셋으로 별도 학습을 거쳐야만 높은 성능을 낼 수 있었습니다. 오늘 소개할 CVPR 2025 논문 "From Poses to Identity: Training-Free Person Re-Identification via Feature Centralization"(Pose2ID)는 이 상식을 뒤집습니다. 놀랍게도 ReID 전용 학습 없이, ImageNet으로 사전학습된 모델만 가.. 2026. 9. 20.
[논문리뷰] 사람이 없어도, 그린스크린이 없어도 완벽한 영상 분리가 가능할까? — MatAnyone: Stable Video Matting with Consistent Memory Propagation 왜 이 논문에 주목해야 하는가영상 편집을 해본 사람이라면 한 번쯤 배경 제거의 어려움을 겪어봤을 것이다. 사진 한 장에서 인물을 오려내는 것도 쉽지 않은데, 영상에서는 프레임마다 조명, 자세, 배경이 계속 바뀌기 때문에 문제가 훨씬 복잡해진다. 특히 그린스크린 없이 일반적인 실내외 환경에서 촬영한 영상에서 사람만 깔끔하게 분리하는 작업, 즉 비디오 매팅(video matting)은 여전히 어려운 연구 주제다.2025년 CVPR에 발표된 MatAnyone: Stable Video Matting with Consistent Memory Propagation은 이 문제를 정면으로 다룬다. 저자는 Nanyang Technological University S-Lab 소속의 Peiqing Yang, Shangch.. 2026. 9. 20.
[논문리뷰] 화면도 보고 로봇 팔도 움직이는 AI, 하나의 모델로 가능할까? — Magma: A Foundation Model for Multimodal AI Agents 논문 개요이번에 소개할 논문은 Microsoft Research에서 공개한 「Magma: A Foundation Model for Multimodal AI Agents」로, CVPR 2025에 채택된 연구입니다. 저자는 Jianwei Yang을 비롯해 Reuben Tan, Qianhui Wu, Ruijie Zheng, Baolin Peng, Yongyuan Liang, Yu Gu, Mu Cai, Seonghyeon Ye, Joel Jang, Yuquan Deng, Lars Liden, Jianfeng Gao 등 총 13명이며, arXiv 제출 메타데이터상 Microsoft Research의 기술 보고서(technical report)로 표기되어 있습니다. 다만 저자별 세부 소속(협업 기관 포함 여부 등).. 2026. 9. 20.
[논문리뷰] GUI 화면을 '읽고 클릭하는' AI, 어디까지 왔을까? — ShowUI: One Vision-Language-Action Model for GUI Visual Agent 들어가며: GUI 에이전트라는 난제"항공권 예약 사이트에서 다음 달 첫째 주 왕복 항공권을 찾아줘"라는 한 문장만으로 AI가 화면을 보고 검색창을 클릭하고 날짜를 입력하는 세상을 상상해봅니다. 이를 추구하는 분야가 GUI(Graphical User Interface) 비주얼 에이전트입니다.문제는 GUI 화면이 일반 사진과 다르다는 점입니다. 아이콘과 텍스트, 버튼이 촘촘히 배치되어 있고, 고해상도 스크린샷을 그대로 비전-언어 모델(VLM)에 넣으면 이미지 토큰 수가 폭발적으로 늘어나 연산 비용이 커집니다. 싱가포르국립대(NUS) Show Lab과 Microsoft 연구진이 CVPR 2025에 발표한 "ShowUI: One Vision-Language-Action Model for GUI Visual Ag.. 2026. 9. 20.
[논문리뷰] 시선 추정, 왜 이렇게 복잡해야만 했을까? — Gaze-LLE: Gaze Target Estimation via Large-Scale Learned Encoders 시선 추정이라는 오래된 난제사람이 사진이나 영상 속에서 "어디를 보고 있는지"를 예측하는 과제를 게이즈 타겟 추정(gaze target estimation)이라고 부릅니다. 이는 인간-로봇 상호작용, 자율주행 중 보행자 의도 파악, 사회적 행동 분석, 광고 시선 추적 등 다양한 분야에서 핵심적으로 쓰이는 기술입니다. 문제는 지금까지의 방법들이 하나같이 무겁고 복잡했다는 점입니다. 얼굴을 인식하는 브랜치, 장면 전체를 분석하는 브랜치, 깊이 정보를 추정하는 브랜치, 시선 방향을 별도로 예측하는 브랜치 등 여러 개의 전용 인코더를 병렬로 쌓아 올리고, 이들을 다시 정교하게 융합하는 다단계 파이프라인이 표준이었습니다. 이런 구조는 성능은 나쁘지 않지만 학습이 까다롭고, 파라미터 수가 많으며, 새로운 데이터셋에.. 2026. 9. 20.