Google is proud to return as a Diamond Sponsor for the 19th European Conference on Computer Vision (ECCV 2026), hosted in Malmö, Sweden from September 8–12, 2026. This year, researchers across Google, including Google Research and Google DeepMind, are excited to share 41 accepted papers, participate in 47 workshops and tutorials, and run interactive demo sessions throughout the conference.
Attending ECCV 2026 in person? Stop by the Google booth (#2) to learn more about how we’re actively pursuing the latest innovations in computer vision. For real-time updates on conference activities, including live both demos and careers sessions, follow @GoogleResearch on X and visit the Google Research LinkedIn page.
Continue below to learn more about how Google researchers are engaged at ECCV 2026 (Google affiliations highlighted in bold, * Indicates work done while at Google).
Please note that all scheduled session times are listed in Central European Summer Time (CEST).
Thu, Sep 10 | 12:00 PM – 12:30 PM CEST
Perception, Not Reasoning, Limits Video Spatial UnderstandingPresenter: Mohit Goyal
Interactive exploration benchmarking spatial perception versus reasoning capabilities in modern video foundation models.
Thu, Sep 10 | 1:00 PM – 1:30 PM CEST & Fri, Sep 11 | 12:00 PM – 12:30 PM CEST
TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text AlignmentPresenters: Gabriele Berton, Ye Xia
Demonstrating fine-grained patch-text alignment and accelerated vision-language pretraining for multimodal understanding.
Thu, Sep 10 | 4:30 PM – 5:00 PM CEST
Careers Spotlight: The Student Researcher Program & Google InternshipsPresenter: Federico Tombari
Learn about internship opportunities, PhD fellowships, student researcher programs, and full-time career pathways at Google DeepMind and Google Research.
Sat, Sep 12 | 10:00AM — 10:30AM, Arena Room
Can AI Build New Knowledge?Dima Damen, Yilun Du, Viorica Pătrăucean
Thu, Sep 10 | 9:40AM — 9:45AM, Exhibition Hall AB (3D Reconstruction, Gaussian Splatting & Neural Rendering)
GaussianLens: Localized High-Resolution Reconstruction via On-Demand Gaussian DensificationYijia Weng*, Zhicheng Wang, Songyou Peng, Saining Xie, Howard Zhou, Leonidas Guibas
Spotlight: Thu, Sep 10 | 9:40AM — 9:45AM, Exhibition Hall AB (3D Reconstruction, Gaussian Splatting & Neural Rendering)
Poster: Thu, Sep 10 | 10:30AM — 12:30PM, Exhibition Hall (Poster Session 1, #218)
360Anything: Geometry-Free Lifting of Images and Videos to 360°
Ziyi Wu, Daniel Watson, Andrea Tagliasacchi*, David Fleet, Marcus A. Brubaker, Saurabh Saxena
Activation Quantization of Vision Encoders Needs Prefixing Registers
Seunghyeon Kim, Taesun Yeom, Jinho Kim, Wonpyo Park, Kyuyeun Kim, Jaeho Lee
BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing
Jiacheng Chen*, Ramin Mehran, Xuhui Jia, Saining Xie, Sanghyun Woo
CoCo-IR: Contextual Composed Image Retrieval
Shengcao Cao, Tanmaya Shekhar Dabral, Zhongli Ding, Madhuri Shanbhogue, Kaifeng Chen*, Zhe Li, Mojtaba Seyedhosseini, Yu-Xiong Wang, Liang-Yan Gui
Differentiable Polarized Path Tracing
Pramod Rao, Jérémy Riviere, Xilong Zhou, Abhijeet Ghosh, Abhimitra Meka, Thabo Beeler, Marc Habermann, Christian Theobalt, Delio Vicini
Early Estimation of Language to Latent Alignment in Diffusion Models
Vasco Ramo, Regev Cohen, Idan Szpektor, Joao Magalhaes
ECHO: Ego-Centric Modeling of Human-Object Interactions
Ilya A. Petrov, Vladimir Guzov, Riccardo Marin, Emre Aksan, Xu Chen, Daniel Cremers, Thabo Beeler, Gerard Pons-Moll
Editing Everything Everywhere All at Once
Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli
ELT: Elastic Looped Transformers for Visual Generation
Sahil Goyal, Swayam Agrawal, Gautham Govind Anil, Prateek Jain, Sujoy Paul, Aditya Kusupati
Error-Driven Scene Editing for 3D Grounding in Large Language Models
Yue Zhang, Zun Wang, Han Lin, Jialu Li, Jianing Yang, Yonatan Bitton, Idan Szpektor, Mohit Bansal
EvDiff: High Quality Video with an Event Camera
Weilun Li, Lei Sun, Ruixi Gao, Qi Jiang, Yuqin Ma, Kaiwei Wang, Ming-Hsuan Yang, Luc Van Gool, Danda Paudel
Fisheye3R: Adapting Unified 3D Feed-Forward Foundation Models to Fisheye Lenses
Ruxiao Duan, Erin Hong, Dongxu Zhao, Eric Turner, Alex Wong, Yunwen Zhou
FlowLess: Controlling Abstract Image Generation
Amir Hertz, Noah Snavely
Forecasting Motion in the Wild
Neerja Thakkar, Shiry Ginosar, Jacob Walker, Jitendra Malik, João Carreira, Carl Doersch
GaussianLens: Localized High-Resolution Reconstruction via On-Demand Gaussian Densification
Yijia Weng*, Zhicheng Wang, Songyou Peng, Saining Xie, Howard Zhou, Leonidas Guibas
GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure
Leslie Gu, Junhwa Hur, Charles Herrmann, Fangneng Zhan, Todd Zickler, Deqing Sun, Hanspeter Pfister
Generative Manifold Distillation: Aligning Restoration Trajectories with Natural Image Prior
Yuyang Hu*, Mojtaba Sahraee-Ardakan, Arpit Bansal, Kangfu Mei, Chenyang Qi, Peyman Milanfar, Mauricio Delbracio
GroundSet: A Cadastral-Grounded Dataset for Spatial Understanding with Vector Data
Roger Ferrod, Maël Lecene, Krishna Sapkota, George Leifman, Vered Silverman, Genady Beryozkin, Sylvain Lobry
Kilometer-Vision: A New Frontier for Large-Scale Spatial Intelligence in VLMs
Aravindh Mahendran, Michael King, Matthew Koichi Grimes, Antoine Yang, Tyler Zhu*, Joseph Heyward, Tengda Han, Shiry Ginosar, Chen Sun, Dima Damen, Simon Osindero, Noah Snavely, Simon Lynen, João Carreira, Viorica Pătrăucean
Latent Fusion: Decoding Consolidated 3D Geometry from Feed-Forward Geometry Transformer Latents
Laura Fink, Linus Franke, George Kopanas, Marc Stamminger, Peter Hedman*
Layer-Aware Video Composition via Split-Then-Merge
Ozgur Kara*, Yujia Chen, Ming-Hsuan Yang, James M. Rehg, Wen-Sheng Chu, Du Tran
LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory
Junyi Zhang, Charles Herrmann, Junhwa Hur, Chen Sun, Ming-Hsuan Yang, Forrester Cole, Trevor Darrell, Deqing Sun
Matryoshka Gaussian Splatting
Zhilin Guo, Boqiao Zhang, Hakan Aktas, Kyle Fogarty, Jeffrey Hu, Nursena Koprucu Aslan, Wenzhao Li, Canberk Baykal, Albert Miao, Josef Bengtson, Chenliang Zhou, Weihao Xia, Cristina Nader Vasconcelos, Cengiz Oztireli
MemoBench: Benchmarking World Modeling in Dynamically Changing Environments
Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du
Pano3D: Unified 3D Reconstruction and Panoptic Segmentation
Victor Barberteguy, Ahmet Iscen, Mathilde Caron, Alireza Fathi, Gül Varol, Cordelia Schmid
PointGT: Simultaneous Geometric and Textural Editing for Point-Based Representations
Yanshu Zhang, George Shramko, Pratul P. Srinivasan, Ke Li
Predictive Structure Improves Video Diffusion Dynamics
Mi Luo*, Yujia Chen, Alex Dimakis, Kristen Grauman, Wen-Sheng Chu, Du Tran
Pro-Pose: Unpaired Full-Body Portrait Synthesis via Canonical UV Maps
Sandeep Mishra*, Yasamin Jafarian, Andreas Lugmayr, Yingwei Li*, Varsha Ramakrishnan, Srivatsan Varadharajan, Alan C. Bovik, Ira Kemelmacher-Shlizerman
Rolling Shutter Relative Pose Estimation Made Practical
Daniel Barath
SAEdit: Token-Level Control for Continuous Image Editing via Sparse Autoencoder
Ronen Kamenetsky, Sara Dorfman, Daniel Garibi, Roni Paiss, Or Patashnik, Danny Cohen-Or
Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing
Luca Barsellotti*, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman
SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation
Jiongze Yu, Xiangbo Gao, Pooja Verlani, Akshay Gadde, Yilin Wang, Balu Adsumilli, Zhengzhong Tu
Towards Real-World Wearable Motion Reconstruction
Andrea Boscolo Camiletto, Rishabh Dabral, Eduardo Alvarado, Thabo Beeler, Marc Habermann, Christian Theobalt
Training-Free Uncertainty Guidance for Complex Visual Tasks with MLLMs
Sanghwan Kim, Rui Xiao, Stephan Alaniz, Yongqin Xian, Zeynep Akata
Unwarping the Lens: A Physics-Grounded Approach to Video Glasses Removal
Radim Spetlik*, David Futschik, Radek Danecek, Feitong Tan, Ziqian Bai, Rohit Pandey, Yinda Zhang
Versatile Editing of Video Content, Actions, and Dynamics Without Training
Vladimir Kulikov*, Roni Paiss, Andrey Voynov, Inbar Mosseri, Tali Dekel, Tomer Michaeli
VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward
Zhaochong An*, Orest Kupyn, Théo Uscidda, Andrea Colaco, Karan Ahuja, Serge Belongie, Mar Gonzalez Franco, Marta Tintoré Gazulla
Video Generation Models Are General-Purpose Vision Learners
Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, João Carreira, Kaiming He, Mykhaylo Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu*
VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion
Zador Pataki, Paul-Edouard Sarlin, Marc Pollefeys
When the City Teaches the Car: Label-Free 3D Perception from Infrastructure
Zhen Xu, Jinsu Yoo, Cristian Bautista, Zanming Huang, Tai-Yu Pan, Zhenzhen Liu, Katie Z. Luo, Mark Campbell, Bharath Hariharan, Wei-Lun Chao
XYZ-IBD: Benchmarking Robust 6D Object Pose Estimation Under Real-World Industrial Complexity
Junwen Huang, Jiaqi Hu, Peter KT Yu, Slobodan Ilic, Martin Sundermeyer, Benjamin Busam
Tue, Sep 8 | 8:00AM — 12:00PM
ViLMa – Visual Localization and Mapping; from Optimization to 3D Foundation Models
Speaker: Paul-Edouard Sarlin | Organizer: Dima Damen
Tue, Sep 8 | 8:00AM — 6:30PM
DriveX - Foundation Models for Autonomous Driving
Speakers: Cordelia Schmid, Federico Tombari | Organizer: Larissa Triess
Tue, Sep 8 | 8:30AM — 12:30PM
Agent in World: Living Worlds with Interactive Agents
Advisory Committee: Ming-Hsuan Yang
Tue, Sep 8 | 8:30AM — 12:30PM
Instance-Level Recognition and Generation
Organizers: Andre Araujo, Bingyi Cao, Guangxing Han
Tue, Sep 8 | 8:30AM — 1:00PM
LIMIT: Representation Learning with Very Limited Resources
Organizer: Junhwa Hur
Tue, Sep 8 | 8:50AM — 6:10PM
MUCG: Multimodal Large Language Models for Unified Comprehension and Generation
Organizer: Sivan Doveh
Tue, Sep 8 | 8:50AM — 6:10PM
Visual Perception and Reasoning in the Interactable World
Organizer: Leonidas Guibas
Tue, Sep 8 | 9:00AM — 12:25PM
Interactive Social Avatars with the 4th GENEA Gesture Generation Challenge
Speaker: Andrew Zisserman | Organizer: Tu Anh Nguyen
Tue, Sep 8 | 9:00AM — 12:30PM
TwinWorld: Visual Intelligence for Built Environment Digital Twins
Organizer: Cecilia Curreli
Tue, Sep 8 | 9:00AM — 12:40PM
OpenSun3D: Workshop and Challenge on Open-World 3D Scene Understanding and Representations
Speakers: Dima Damen, Nicolas Heess | Organizers: Johanna Wald, Federico Tombari, Leonidas Guibas
Tue, Sep 8 | 9:00AM — 1:00PM
Assistive Computer Vision and Robotics
Speaker: Dima Damen
Tue, Sep 8 | 9:00AM — 5:00PM
Explainable CV (eXCV): Challenges and Opportunities in the Era of Foundation Models
Organizer: Bernt Schiele
Tue, Sep 8 | 9:00AM — 5:00PM
Geometric Intelligence: From Vision to Scientific Discovery
Organizers: Bill Freeman, Leonidas Guibas
Tue, Sep 8 | 1:00PM — 5:00PM
Efficient-Visual Generation (EVG)
Organizer: Ming-Hsuan Yang
Tue, Sep 8 | 1:30PM — 6:00PM
Observing and Acting as Dexterous Hands
Speaker: Zhengyang Shen
Tue, Sep 8 | 1:30PM — 6:00PM
World Models in the Loop: Towards Application-Driven World Model Evaluation
Speaker: Carl Doersch | Advisory Committee: Bernt Schiele
Tue, Sep 8 | 1:50PM — 5:30PM
3D Human Understanding
Speaker: Dima Damen
Tue, Sep 8 | 2:00PM — 5:30PM
Medical Foundation Models and Benchmarks
Speakers: Shekoofeh Azizi, Xiaoxiao Li
Tue, Sep 8 | 2:00PM — 5:40PM
SLoMO: Story-Level Movie Understanding and Audio Description
Speaker: Piotr Mirowski | Organizers: Junyu Xie, Tengda Han, Max Bain, Arsha Nagrani, Andrew Zisserman
Tue, Sep 8 | 2:00PM — 6:00PM
Benchmarking Evidence-Aligned Multimodal Reasoning (BEAM 2)
Speaker: Rajeev Rikhye | Organizers: Xu Zhang, Hao Yang, Ashwin Swaminathan
Tue, Sep 8 | 2:00PM — 6:00PM
CV4GOOD: Computer Vision for Humanitarian Action
Speaker: Federico Tombari | Organizers: Federico Tombari, Mattia Segù
Tue, Sep 8 | 2:00PM — 6:00PM
Human-Centered Multimodal Intelligence in the Wild: Foundation Models and Beyond
Speaker: Dima Damen
Tue, Sep 8 | 2:00PM — 6:00PM
Recovering 6D Object Pose
Organizers: Martin Sundermeyer, Vahe Taamazyan, Kirill Zaitsev
Tue, Sep 8 | 2:00PM — 6:10PM
RetailVision7 - Revolutionizing the World of Retail
Speaker: Ira Kemelmacher-Shlizerman
Wed, Sep 9 | 8:30AM — 12:30PM
Foundation Data for Industrial Tech Transfer
Organizer: Keisuke Tateno
Wed, Sep 9 | 8:30AM — 12:30PM
Structure-from-Motion in the Age of Deep Learning (SfM-ADL)
Organizer: Daniel Barath
Wed, Sep 9 | 8:30AM — 1:10PM
Safe World Models for Trustworthy Embodied AI
Organizer: Jiankai Sun
Wed, Sep 9 | 8:30AM — 5:30PM
Embodied Multimodal Reasoning in Physical Environments
Organizer: Federico Tombari
Wed, Sep 9 | 8:45AM — 5:10PM
UniWorld: Universal Representations for Perception, Reasoning, and World Modeling
Speaker: Dima Damen | Organizers: Yuhui Xu, Aishwarya Agrawal
Wed, Sep 9 | 8:50AM — 5:40PM
Physical AI: Understanding and Building the Physical World
Organizers: Chuhan Zhang
Wed, Sep 9 | 9:00AM — 1:00PM
Affective & Behavior Analysis In-the-Wild
Organizer: Stefanos Zafeiriou
Wed, Sep 9 | 9:00AM — 1:00PM
Embodied Agent and Dialog
Speakers: Cordelia Schmid, Michael S. Ryoo | Organizer: Aishwarya Agrawal
Wed, Sep 9 | 9:00AM — 1:00PM
Perception Test: From Tabletop to City Scale
Organizer: Viorica Pătrăucean, Fedor Kitashov, João Carreira, Dima Damen, Andrew Zisserman
Wed, Sep 9 | 9:00AM — 1:30PM
Real-World Video Representation Learning
Speakers: Viorica Pătrăucean, Ye Xia | Organizer: Gabriele Berton
Wed, Sep 9 | 9:00AM — 5:10PM
3D in the Era of World Models
Speakers: TBC | Organizers: Zhengqi Li, Haian Jin, Songyou Peng, Leonidas Guibas
Wed, Sep 9 | 9:00AM — 5:30PM
Wearables AI Workshop: Towards Building Real-Time Multimodal Contextual Assistants
Speaker: Dima Damen
Wed, Sep 9 | 9:00AM — 5:35PM
Audio-Visual Generation and Learning (AVGenL)
Speaker: Dima Damen | Industry Talk: Aleksander Hołyński | Organizers: Rodrigo Mira, Joanna Hong, Ming-Hsuan Yang
Wed, Sep 9 | 9:00AM — 6:00PM
AI for Climate and Conservation (AICC)
Organizer: Lucia Gordon
Wed, Sep 9 | 9:00AM — 6:00PM
How to Build Effective World Models for Embodied AI
Speaker: Dima Damen
Wed, Sep 9 | 1:15PM — 5:35PM
CONTEXTUS: Understanding Multi-Actor Scene Interaction in Context
Speaker: Dima Damen
Wed, Sep 9 | 1:15PM — 6:00PM
GAIA 2026: Geospatial AI and Foundation Models
Speaker: George Leifman
Wed, Sep 9 | 1:30PM — 5:15PM
Wild3D: 3D Modeling, Reconstruction, and Generation in the Wild
Organizer: Linyi Jin
Wed, Sep 9 | 2:00PM — 6:00PM
Computer Vision for MUltimedia Spatial Intelligence Through Time (MUSTCV, Formerly CV4Metaverse)
Technical Program Committee: Esha Uboweja
Wed, Sep 9 | 2:00PM — 6:00PM
Foundation and Generative Models in Biometrics
Speaker: Wen-Sheng Chu
Wed, Sep 9 | 2:00PM — 6:00PM
Functionality, Articulation, and Interaction for Modeling and Generating 3D Objects
Organizer: Jiayi Liu
Wed, Sep 9 | 9:00AM — 1:00PM
Women in Computer Vision (WiCV)Organizer: Akshita Gupta
Google Sponsored