📢 한국어 번역본 현재 한국어 번역본을 보고 계십니다. 일부 고유명사와 논문 제목은 원문 표기를 유지했습니다.

원본(영어)을 보시려면 오른쪽 상단의 "English" 링크를 클릭해주세요.

소개

저는 서울대학교 컴퓨터공학부 박사과정 1년차 학생으로, 박재식 교수님의 지도를 받고 있습니다. 또한 Adobe Research에서 research scientist intern으로 근무할 예정이며, Duygu Ceylan, Tuanfeng Y. Wang 님이 멘토입니다. 그전에는 SONY Research에서 research scientist intern으로 근무했으며, Takashi Shibuya, Masato Ishii 님과 함께 연구를 진행했습니다. 제 연구 관심사는 컴퓨터 비전과 머신러닝의 교차점에 있으며, 특히 생성 모델과 멀티모달 이해에 초점을 두고 있습니다.

전체 소개 보기

저는 서울대학교에서 석사 학위를 받았으며, 박재식 교수님의 지도를 받았습니다. 석사과정 동안 최우수 석사 논문상을 수상했고, Microsoft Research Asia에서 연구 인턴으로 근무하며 Chong Luo, Qi Dai 님과 함께 연구를 수행했습니다.

학부는 광주과학기술원(GIST) 전기전자컴퓨터공학부에서 마쳤습니다. 학부 시절에는 최종현 교수님과 손진이 교수님의 지도를 받으며 연구를 수행했고, 대통령과학장학금 수혜자로 선정되기도 했습니다.

최근 소식

  • 2026.06 이미지 및 비디오 커스터마이제이션 관련 논문 두 편ECCV 2026에 채택되었습니다.
  • 2026.04 4D 복원 관련 논문이 SIGGRAPH 2026에 채택되었습니다.
  • 2026.04 이번 여름 Adobe Research에서 연구 인턴으로 근무할 예정입니다.

최근 논문

Vitæ

전체 CV는 PDF에서 확인할 수 있습니다.

Adobe Research 2026년 7월 - 예정
Research Scientist Intern (Mentors: Duygu Ceylan, Tuanfeng Y. Wang)
Image and video diffusion models
SONY AI 2025년 9월 - 2026년 3월
Research Scientist Intern (Mentors: Takashi Shibuya, Masato Ishii)
Efficient image and video editing
Seoul National University 2025년 9월 - 현재
Ph.D. Student (Advisor: Jaesik Park)
Computer vision, generative models, and multimodal understanding
Microsoft Research Asia 2024년 9월 - 2025년 3월
Research Scientist Intern (Mentors: Chong Luo, Qi Dai)
Subject-driven customization and open-domain customized video generation
Seoul National University 2023년 9월 - 2025년 8월
M.S. in Artificial Intelligence (Advisor: Jaesik Park)
Best Master's Thesis Award
Gwangju Institute of Science and Technology (GIST)GIST 2019년 3월 - 2023년 8월
B.S. in Electrical Engineering and Computer Science
Magna Cum Laude
전체 이력

소식

경력

연구 인턴십

Adobe Research
Research Scientist Intern (2026년 7월 ~ 2026년 11월 예정)
Hosted by: Duygu Ceylan, Tuanfeng Y. Wang
세부 내용

이미지 및 비디오 생성을 위한 diffusion model 연구를 수행할 예정입니다.

SONY
SONY AI 연구 인턴 (2025년 9월 ~ 2026년 3월)
Hosted by: Takashi Shibuya, Masato Ishii
세부 내용

이미지 및 비디오를 효율적으로 편집하는 기법을 연구했으며, 실용적인 생성형 편집 파이프라인에 중점을 두었습니다.

Microsoft
Visual Computing Group 연구 인턴 (2024년 9월 ~ 2025년 3월)
Hosted by: Chong Luo, Qi Dai
세부 내용

비디오 생성 모델, subject-driven customization, 그리고 open-domain customized video generation을 위한 실용적인 시스템을 연구했습니다. 이 연구는 ICASSP 2026 논문과 ECCV 2026 논문 Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute로 이어졌습니다.

학부 연구 경험

GIST
학부연구생 (2020년 7월 ~ 2023년 8월)
Advisors: Jonghyun Choi, Jeany Son
현재 SNU MPR LabPOSTECH CV LAB
세부 내용

컴퓨터 비전, visual recognition, 비디오 이해, 생성 모델링 전반에 걸친 초기 연구 기반을 이 시기에 다졌습니다. KSC, KIMST, Journal of KIISE 등 국내 학회·저널 논문과 ICCV 2025, ICCV 2023 등 국제 학회 논문에 참여했습니다.

당시 긴밀히 협업했던 동료들은 다음과 같습니다.

학력

SNU
박사과정 (2025년 9월 ~ 현재), 지도교수: 박재식
석사 (2023년 9월 ~ 2025년 8월), 최우수 논문상
세부 내용

석사 논문은 Advancing Image Editing through Layer-wise Memory in Diffusion입니다. diffusion model에서 layer-wise memory를 활용한 controllable image editing을 연구했으며, 이 성과로 최우수 석사 논문상을 수상했습니다. 논문 링크는 추후 추가할 예정입니다.

UC Berkeley
교환학생 프로그램 (2021년 6월 ~ 2021년 12월)
세부 내용

EECS 126, convex optimization, CS 70, discrete mathematics를 포함해 확률, 알고리즘, 컴퓨터과학 기초 전반의 상위권 이론 과목들을 수강했습니다.

GIST
전기전자컴퓨터공학부 학사 (2023년 8월), 최우등 졸업
세부 내용

전기전자컴퓨터공학부 차석으로 졸업했고, 최우등 졸업의 영예를 안았습니다. 학부 과정과 연구는 머신러닝, 컴퓨터 비전, 시스템 기초를 중심으로 진행했습니다.

수상 및 장학

2025년 8월최우수 석사 논문상
서울대학교 인공지능대학원논문: "Advancing Image Editing through Layer-wise Memory in Diffusion"
2025년 2월우수 포스터 발표상
IPIU 2025 (제37회 영상처리 및 이해에 관한 워크숍)"층위별 메모리를 활용한 이미지 편집 개선 기법"
2023년 8월최우등 졸업
광주과학기술원(GIST)
2021년 3월 - 2023년 8월대통령과학장학금
전액 등록금 및 연 5,000달러 생활비 지원전국 약 150명 내외 선발
2021년 6월 - 2021년 12월해외 연수 프로그램 장학금
UC Berkeley 교환학생 프로그램 경비 전액 및 24,000달러 생활비 지원

논문

*는 공동 1저자, †는 교신저자를 의미합니다.

Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute
Daneul Kim, Jingxu Zhang, Wonjoon Jin, Sunghyun Cho, Qi Dai, Jaesik Park†, Chong Luo†
ECCV 2026 NEW!
Details

TL;DR별도의 주체별 튜닝 없이 사용자가 지정한 주체의 영상을 생성합니다. 주체 이미지로부터의 정체성 주입과 무관한 영상들로부터의 모션 학습을 분리하여, 기존 zero-shot 방식 대비 약 1%의 연산만으로 동등한 품질을 달성합니다.

RCEdit-500K
RCEdit-500K: Reference Completion for Image-Conditioned Image Editing
Jingxu Zhang, Daneul Kim, Yueming Pan, Dong Chen, Kai Qiu, Yang Liu, Yifan Yang, Qi Dai, Xiaoyan Sun, and Chong Luo
ECCV 2026 NEW!
Details

TL;DR참조 이미지 기반 편집을 위한 대규모 공개 데이터셋입니다. 기존 텍스트 편집 삼중쌍에 누락된 참조 이미지를 자동으로 생성하는 '참조 완성(reference completion)' 방식으로, 6개 편집 범주에 걸쳐 약 47.7만 개의 입력–참조–지시–결과 사중쌍을 구축합니다.

RCEdit-500K
4D Human-Scene Reconstruction from Low-Overlap Captures
Minhyuk Hwang*, Sangmin Kim*, Seunguk Do, Daneul Kim, and Jaesik Park
ACM SIGGRAPH 2026 NEW!
Details

TL;DR소수의 낮은 중첩(low-overlap) 카메라만으로 시간에 따라 변하는 3D 인물과 주변 장면을 함께 복원합니다. 카메라 제어형 영상 디퓨전으로 조밀한 새로운 시점을 합성하고, 교차 시점 추적을 이용해 배경과 인물을 분리해 복원합니다.

A Comprehensive Ecosystem for Open-Domain Customized Video Generation
Jingxu Zhang, Yuqian Hong, Daneul Kim, Kai Qiu, Qi Dai, Jianmin Bao, Yifan Yang, Xiaoyan Sun, Chong Luo
ICASSP 2026 NEW!
Details

TL;DR임의의 도메인에서 사용자가 지정한 주체의 영상을 생성하는 open-domain 맞춤형 영상 생성 문제를 다루며, 데이터·모델·평가를 아우르는 종합적인 생태계를 제시합니다.

정성적 비교 · "a dog on top of a purple rug in a forest"
Reference
Reference image
VideoBooth
BLIP-Diff.
IP-Adapter
MS-Diff.
OminiCtrl
Ours
CustomDiT(맨 오른쪽)가 대상의 정체성을 가장 잘 보존하면서 자연스럽고 역동적인 영상을 생성합니다.
Online Generic Event Boundary Detection
Hyung Rok Jung*, Daneul Kim*, Seunggyun Lim, Jeany Son†, Jonghyun Choi†
ICCV 2025
Details

TL;DR전체 영상을 모두 본 뒤 예측하던 기존 방식과 달리, 스트리밍 영상에서 실시간으로 이벤트 경계를 찾는 온라인 과제를 제안합니다. 사건 분할 이론(Event Segmentation Theory)에서 영감을 받은 ESTimator가 프레임 예측이 실제와 어긋나는 지점을 경계로 탐지합니다.

Exploring MMDiT
Exploring Multimodal Diffusion Transformers for Enhanced Prompt-based Image Editing
Joonghyuk Shin, Alchan Hwang, Yujin Kim, Daneul Kim, Jaesik Park
ICCV 2025
Details

TL;DRU-Net 디퓨전용으로 설계된 편집 기법은 멀티모달 디퓨전 트랜스포머(MM-DiT)에서 잘 동작하지 않습니다. 본 연구는 MM-DiT의 텍스트–이미지 어텐션을 분석하여, few-step 모델을 포함한 다양한 MM-DiT에서 전역부터 국소까지의 편집을 처리하는 기법을 제안합니다.

Exploring MMDiT
Improving Editability
Improving Editability in Image Generation with Layer-wise Memory
Daneul Kim, Jaeah Lee, Jaesik Park
CVPR 2025
Details

TL;DR여러 단계에 걸친 실제 편집을 지원하기 위해 과거 편집 내용을 레이어별 메모리에 저장합니다. 배경 일관성 가이던스와 다중 쿼리 분리 기법을 통해, 이전 편집을 유지하면서 대략적인 마스크만으로 객체를 추가·제거할 수 있습니다.

Improving Editability
Pick-or-Mix
Pick-or-Mix: Dynamic Channel Sampling for ConvNets
Ashish Kumar, Daneul Kim, Jaesik Park, Laxmidhar Behera
CVPR 2024
Details

TL;DRConvNet에서 비용이 큰 1×1 채널 압축 레이어를, 채널을 부분 집합으로 나누고 입력에 따라 픽셀마다 동적으로 선택하는 방식으로 대체합니다. 비슷한 정확도에서 약 25% 빠르며, 다운스케일러와 동적 가지치기로도 활용할 수 있습니다.

Pick-or-Mix
CMOTA
Story Visualization by Online Text Augmentation with Context Memory
Daechul Ahn, Daneul Kim, Gwangmo Song, Seung Hwan Kim, Honglak Lee, Dongyeop Kang, Jonghyun Choi
ICCV 2023
Details

TL;DR여러 문장으로 이루어진 이야기로부터 일관된 이미지 시퀀스를 생성합니다. 프레임 간 정보를 전달하는 컨텍스트 메모리 모듈과 학습 중 의사 설명문을 생성하는 온라인 텍스트 증강 기법으로 장기적 일관성을 향상시킵니다.

CMOTA

학술 활동

조교 활동

2026년 봄Introduction to Machine Learning
서울대학교
2025년 여름Creating Images Using Generative AI
삼성 데이터 사이언티스트 아카데미, 삼성전자
2025년 여름Generative AI Capstone Project
HD 현대
2023년 가을Generative Artificial Intelligence
서울대학교
2021년 봄Object Oriented Programming
광주과학기술원

초청 강연

2025년 8월Recent Trends on Visual Generation: From Basics to Application
서울대학교 의과대학/병원 Medical Vision Lab
2025년 4월Improving Editability in Image Generation with Layer-wise Memory
서울대학교 인공지능연구원 Brown Bag Seminar

리뷰어 활동

리뷰어CVPR 2026, ICLR 2026, ECCV 2026, NeurIPS 2026, TPAMI 2026, SIGGRAPH Asia 2026
프로그램 위원SBP-BRiMS 2026

연락처

연구 논의, 협업 아이디어, visual generation 및 multimodal learning 관련 이야기 등 언제든 편하게 연락 주세요.

이메일carpedkm [at] snu [dot] ac [dot] kr
연구실 위치650 Ho, 303 Dong, 1 Gwanak-ro, Gwanak-gu, Seoul, Republic of Korea (Zip: 08826)
대한민국 서울특별시 관악구 관악로 1, 303동 650호 AGI 컴퓨팅 파운데이션 클러스터

공동 연구나 협업 관련해서는 제 지도교수님이신 Jaesik Park 교수님께도 편하게 연락 주세요.

공개된 글은 누구나 볼 수 있고, 비공개 글 작성 스튜디오는 공유 관리자 로그인 후 사용할 수 있습니다.

공개 글

글 아카이브

전용 블로그 백엔드에 게시된 현재 글 목록과 긴 형식의 노트를 둘러볼 수 있습니다.

아카이브 열기

관리자

블로그 스튜디오

로그인 후 초안을 작성하고 글을 발행하며, 다른 서비스에 영향을 주지 않고 로컬 글쓰기 백엔드를 관리할 수 있습니다.

비공개 스튜디오 열기

프로젝트

프로젝트 접근

비공개 프로젝트는 잠겨 있습니다

게스트 모드

공개 프로젝트

Introduction to Machine Learning Leaderboard

2026.03 ~ 현재

2026년 봄 Introduction to Machine Learning 과제 제출 및 순위 확인 대시보드입니다.

리더보드 열기

비공개 프로젝트

PocketChat

2026.04 ~ 현재

Mac mini에서 구동되는 텔레그램 스타일의 웹 채팅 서비스로, 단일 관리자 계정과 통합 게이트웨이를 통해 관리됩니다.

PocketChat 열기

비공개 프로젝트

Pocket Log

2026.04 ~ 현재

가까운 사람들끼리 하루 영상을 기록하고 공유할 수 있도록 만든 비공개 그룹 daily check-in 서비스입니다.

Pocket Log 열기

비공개 프로젝트

Blog Studio

2026.04 ~ 현재

Mac mini 기반의 비공개 글쓰기 스튜디오로, 다른 비공개 서비스와 동일한 관리 게이트웨이를 통해 연결됩니다.

Blog Studio 열기