공개 글
글 아카이브
전용 블로그 백엔드에 게시된 현재 글 목록과 긴 형식의 노트를 둘러볼 수 있습니다.
아카이브 열기소개
저는 서울대학교 컴퓨터공학부 박사과정 1년차 학생으로, 박재식 교수님의 지도를 받고 있습니다. 또한 Adobe Research에서 research scientist intern으로 근무할 예정이며, Duygu Ceylan, Tuanfeng Y. Wang 님이 멘토입니다. 그전에는 SONY Research에서 research scientist intern으로 근무했으며, Takashi Shibuya, Masato Ishii 님과 함께 연구를 진행했습니다. 제 연구 관심사는 컴퓨터 비전과 머신러닝의 교차점에 있으며, 특히 생성 모델과 멀티모달 이해에 초점을 두고 있습니다.
전체 소개 보기 ▼저는 서울대학교에서 석사 학위를 받았으며, 박재식 교수님의 지도를 받았습니다. 석사과정 동안 최우수 석사 논문상을 수상했고, Microsoft Research Asia에서 연구 인턴으로 근무하며 Chong Luo, Qi Dai 님과 함께 연구를 수행했습니다.
학부는 광주과학기술원(GIST) 전기전자컴퓨터공학부에서 마쳤습니다. 학부 시절에는 최종현 교수님과 손진이 교수님의 지도를 받으며 연구를 수행했고, 대통령과학장학금 수혜자로 선정되기도 했습니다.
최근 소식
최근 논문
Vitæ
전체 CV는 PDF에서 확인할 수 있습니다.

이미지 및 비디오 생성을 위한 diffusion model 연구를 수행할 예정입니다.
이미지 및 비디오를 효율적으로 편집하는 기법을 연구했으며, 실용적인 생성형 편집 파이프라인에 중점을 두었습니다.
비디오 생성 모델, subject-driven customization, 그리고 open-domain customized video generation을 위한 실용적인 시스템을 연구했습니다. 이 연구는 ICASSP 2026 논문과 ECCV 2026 논문 Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute로 이어졌습니다.

컴퓨터 비전, visual recognition, 비디오 이해, 생성 모델링 전반에 걸친 초기 연구 기반을 이 시기에 다졌습니다. KSC, KIMST, Journal of KIISE 등 국내 학회·저널 논문과 ICCV 2025, ICCV 2023 등 국제 학회 논문에 참여했습니다.
당시 긴밀히 협업했던 동료들은 다음과 같습니다.

석사 논문은 Advancing Image Editing through Layer-wise Memory in Diffusion입니다. diffusion model에서 layer-wise memory를 활용한 controllable image editing을 연구했으며, 이 성과로 최우수 석사 논문상을 수상했습니다. 논문 링크는 추후 추가할 예정입니다.

EECS 126, convex optimization, CS 70, discrete mathematics를 포함해 확률, 알고리즘, 컴퓨터과학 기초 전반의 상위권 이론 과목들을 수강했습니다.

전기전자컴퓨터공학부 차석으로 졸업했고, 최우등 졸업의 영예를 안았습니다. 학부 과정과 연구는 머신러닝, 컴퓨터 비전, 시스템 기초를 중심으로 진행했습니다.
*는 공동 1저자, †는 교신저자를 의미합니다.
TL;DR별도의 주체별 튜닝 없이 사용자가 지정한 주체의 영상을 생성합니다. 주체 이미지로부터의 정체성 주입과 무관한 영상들로부터의 모션 학습을 분리하여, 기존 zero-shot 방식 대비 약 1%의 연산만으로 동등한 품질을 달성합니다.

TL;DR참조 이미지 기반 편집을 위한 대규모 공개 데이터셋입니다. 기존 텍스트 편집 삼중쌍에 누락된 참조 이미지를 자동으로 생성하는 '참조 완성(reference completion)' 방식으로, 6개 편집 범주에 걸쳐 약 47.7만 개의 입력–참조–지시–결과 사중쌍을 구축합니다.
TL;DR소수의 낮은 중첩(low-overlap) 카메라만으로 시간에 따라 변하는 3D 인물과 주변 장면을 함께 복원합니다. 카메라 제어형 영상 디퓨전으로 조밀한 새로운 시점을 합성하고, 교차 시점 추적을 이용해 배경과 인물을 분리해 복원합니다.
TL;DR임의의 도메인에서 사용자가 지정한 주체의 영상을 생성하는 open-domain 맞춤형 영상 생성 문제를 다루며, 데이터·모델·평가를 아우르는 종합적인 생태계를 제시합니다.

TL;DR전체 영상을 모두 본 뒤 예측하던 기존 방식과 달리, 스트리밍 영상에서 실시간으로 이벤트 경계를 찾는 온라인 과제를 제안합니다. 사건 분할 이론(Event Segmentation Theory)에서 영감을 받은 ESTimator가 프레임 예측이 실제와 어긋나는 지점을 경계로 탐지합니다.

TL;DRU-Net 디퓨전용으로 설계된 편집 기법은 멀티모달 디퓨전 트랜스포머(MM-DiT)에서 잘 동작하지 않습니다. 본 연구는 MM-DiT의 텍스트–이미지 어텐션을 분석하여, few-step 모델을 포함한 다양한 MM-DiT에서 전역부터 국소까지의 편집을 처리하는 기법을 제안합니다.

TL;DR여러 단계에 걸친 실제 편집을 지원하기 위해 과거 편집 내용을 레이어별 메모리에 저장합니다. 배경 일관성 가이던스와 다중 쿼리 분리 기법을 통해, 이전 편집을 유지하면서 대략적인 마스크만으로 객체를 추가·제거할 수 있습니다.

TL;DRConvNet에서 비용이 큰 1×1 채널 압축 레이어를, 채널을 부분 집합으로 나누고 입력에 따라 픽셀마다 동적으로 선택하는 방식으로 대체합니다. 비슷한 정확도에서 약 25% 빠르며, 다운스케일러와 동적 가지치기로도 활용할 수 있습니다.
연구 논의, 협업 아이디어, visual generation 및 multimodal learning 관련 이야기 등 언제든 편하게 연락 주세요.
공동 연구나 협업 관련해서는 제 지도교수님이신 Jaesik Park 교수님께도 편하게 연락 주세요.
공개된 글은 누구나 볼 수 있고, 비공개 글 작성 스튜디오는 공유 관리자 로그인 후 사용할 수 있습니다.
공개 글
전용 블로그 백엔드에 게시된 현재 글 목록과 긴 형식의 노트를 둘러볼 수 있습니다.
아카이브 열기프로젝트 접근
공개 프로젝트
2026.03 ~ 현재
2026년 봄 Introduction to Machine Learning 과제 제출 및 순위 확인 대시보드입니다.
리더보드 열기비공개 프로젝트
2026.04 ~ 현재
Mac mini에서 구동되는 텔레그램 스타일의 웹 채팅 서비스로, 단일 관리자 계정과 통합 게이트웨이를 통해 관리됩니다.
PocketChat 열기비공개 프로젝트
2026.04 ~ 현재
가까운 사람들끼리 하루 영상을 기록하고 공유할 수 있도록 만든 비공개 그룹 daily check-in 서비스입니다.
Pocket Log 열기비공개 프로젝트
2026.04 ~ 현재
Mac mini 기반의 비공개 글쓰기 스튜디오로, 다른 비공개 서비스와 동일한 관리 게이트웨이를 통해 연결됩니다.
Blog Studio 열기