본문 바로가기
딥러닝

[논문리뷰] 스마트폰 사진에서 조리개를 마음대로 바꿀 수 있다면? — Bokehlicious: Photorealistic Bokeh Rendering with Controllable Apertures

by 카이스토 2026. 9. 18.

■ 왜 인물사진의 배경 흐림이 이렇게 어려운 문제일까

 

스마트폰으로 찍은 인물사진에서 배경이 뽀얗게 흐려지는 그 느낌, 이른바 보케(bokeh)는 사실 렌즈의 조리개 크기가 물리적으로 만들어내는 광학 현상입니다. 조리개를 크게 열수록(즉 f값이 작을수록) 초점이 맞지 않는 영역이 크고 부드러운 원반 모양으로 번지죠. 문제는 스마트폰 카메라는 렌즈와 센서가 작아서 이런 얕은 심도를 물리적으로 구현하기 어렵다는 점입니다. 그래서 등장한 것이 소프트웨어로 보케를 합성하는 인물사진 모드인데, 기존 딥러닝 기반 방법들은 두 가지 벽에 부딪혔습니다. 하나는 학습에 쓸 데이터의 한계이고, 다른 하나는 조리개 강도를 자연스럽게 조절하는 능력의 부재입니다. 대표적인 공개 데이터셋인 EBB!는 해상도가 낮고 입력-정답 이미지 쌍의 정렬이 부정확해서, 모델이 미세한 디테일까지 배우기 힘들었습니다. Bokehlicious는 바로 이 두 가지 근본 문제, 즉 데이터와 제어 가능성을 동시에 정면으로 다룬 연구입니다.

 

■ RealBokeh, 기존 한계를 넘어선 새로운 데이터셋

 

저자들은 문제 해결의 첫걸음으로 RealBokeh라는 새 데이터셋을 직접 구축했습니다. 무려 4,400개 장면에서 촬영한 23,000장의 고해상도(6000×4000) 이미지로 구성되어 있는데, 핵심은 단순히 양이 많다는 것이 아니라 같은 장면을 f/20.0부터 f/2.0까지 다양한 조리개 값으로, 그리고 28mm에서 70mm까지 다양한 초점거리로 촬영했다는 점입니다. 삼각대와 자동화된 촬영 장비를 이용해 픽셀 단위로 정확히 정렬된 사진 쌍을 확보했고, 낮과 밤, 맑음과 흐림, 실내와 실외 등 촬영 환경도 골고루 섞었습니다. 이렇게 만들어진 데이터셋은 기존 공개 데이터셋보다 다섯 배 가량 크며, 무엇보다 "조리개 값이라는 연속적인 조절 변수"를 모델이 직접 학습할 수 있게 해주는 유일한 데이터라는 점에서 의미가 큽니다. 흥미롭게도 연구팀은 이 데이터를 뒤집어 RealDefocus라는 파생 데이터셋도 만들어, 흐려진 사진에서 다시 선명한 사진을 복원하는 디포커스 디블러링이라는 반대 방향 과제에도 활용했습니다.

 

 

■ Bokehlicious의 핵심, 조리개를 이해하는 어텐션

 

두 번째 축은 모델 구조 자체입니다. Bokehlicious는 디퓨전이나 GAN 같은 무거운 생성 모델을 전혀 쓰지 않습니다. 대신 가벼운 NAFNet 기반 인코더-디코더 위에, 저자들이 새롭게 고안한 Aperture Aware Attention(조리개 인식 어텐션)이라는 메커니즘을 얹었습니다. 아이디어는 이렇습니다. 먼저 조리개 값을 f_max로 나눈 하나의 숫자로 단순화해서 모델에 입력으로 함께 넣어줍니다. 그다음 어텐션 연산 안에 맨해튼 거리 기반의 감쇠 마스크를 넣어, 픽셀마다 주변의 얼마나 넓은 영역을 참고할지를 조리개 값에 따라 동적으로 바꿉니다. 조리개가 커질수록(f값이 작을수록) 모델은 더 넓은 주변부를 참고해 큰 흐림 원반을 만들고, 조리개가 작아지면 좁은 영역만 보고 거의 흐리지 않은 결과를 냅니다. 여러 개의 어텐션 헤드가 각기 다른 흐림 커널 크기를 담당하도록 설계한 점도 특징인데, 비유하자면 여러 명의 화가가 각자 다른 크기의 붓을 들고 동시에 캔버스를 칠하고, 그 결과를 조리개 값에 맞춰 섞어내는 셈입니다. 이런 구조 덕분에 사용자가 슬라이더로 조리개 값을 바꾸듯 흐림 강도를 자연스럽고 연속적으로 조절할 수 있게 됩니다.

 

■ 실험 결과가 말해주는 것

 

RealBokeh와 기존 공개 벤치마크인 EBB! 양쪽에서 Bokehlicious는 기존 최고 성능을 갱신했습니다. EBB! 검증 세트에서는 PSNR, SSIM, LPIPS 모든 지표에서 이전 방법들을 앞섰고, RealBokeh 전체 조리개 범위에서 평가했을 때도 작은 모델(Ours-M)이 초당 0.28초라는 짧은 처리 시간으로 높은 화질을 유지했습니다. 조리개를 f/2.0처럼 크게 열었을 때는 당연히 난이도가 올라가 지표가 다소 낮아지지만, 여러 조리개 값을 평균 냈을 때 여전히 안정적인 품질을 보였다는 점이 중요합니다. 저자들은 어텐션 설계를 하나씩 제거해가는 소거 실험도 진행했는데, 거리 기반 마스크가 없는 기본 어텐션보다 다중 마스크를 적용한 버전이, 그리고 조리개 값을 인식하는 최종 버전이 순서대로 성능을 끌어올린다는 사실을 확인했습니다. 즉 "조리개를 아는 어텐션"이라는 설계 선택 하나하나가 실제로 의미 있는 개선으로 이어졌다는 뜻입니다. 나아가 데이터셋을 뒤집어 만든 디포커스 디블러링 과제에서도 별도의 구조 변경 없이 경쟁력 있는 결과를 얻어, 이 모델이 보케 합성이라는 한 가지 작업에만 특화된 것이 아니라는 점도 보여줬습니다.

 

 

■ 이 연구가 남긴 의미와 아직 남은 숙제

 

Bokehlicious가 보여준 메시지는 명확합니다. 좋은 인공지능 결과물은 화려한 생성 모델보다 오히려 문제의 물리적 본질, 즉 조리개라는 렌즈 파라미터를 모델 구조 안에 어떻게 자연스럽게 녹여내느냐에 달려 있을 수 있다는 것입니다. 동시에 이만큼 정교한 데이터셋이 없었다면 이런 세밀한 제어 학습 자체가 불가능했다는 점에서, 데이터와 모델 설계는 항상 함께 가는 문제라는 사실도 다시 확인시켜줍니다. 물론 한계도 있습니다. 저자들 스스로 밝혔듯, 이 방법은 이미 촬영된 사진에서 초점이 맞은 피사체의 위치를 사후에 바꿀 수는 없습니다. 한 번의 신경망 연산으로 결과를 만들어내는 방식의 태생적 제약인 셈이죠. 또한 성능이 학습에 쓰인 RealBokeh 데이터의 다양성과 품질에 상당 부분 의존한다는 점도 앞으로 다른 카메라 환경이나 극단적인 촬영 조건으로 일반화될 때 지켜봐야 할 대목입니다. 그럼에도 스마트폰 인물사진 모드처럼 실시간성과 사용자 제어가 모두 중요한 응용 분야에서, 이 논문은 무거운 생성 모델 없이도 실용적인 답을 낼 수 있음을 설득력 있게 보여줬습니다.

 

댓글