LiTo: Surface Light Field Tokenization - 专知论文

会员服务 ·

0

光场 · 潜在 · 表示 · 联合建模 · 重建 ·

LiTo: Surface Light Field Tokenization

翻译：LiTo：表面光场标记化

Jen-Hao Rick Chang,Xiaoming Zhao,Dorian Chan,Oncel Tuzel

from arxiv, ICLR 2026; Project page: https://apple.github.io/ml-lito/

We propose a 3D latent representation that jointly models object geometry and view-dependent appearance. Most prior works focus on either reconstructing 3D geometry or predicting view-independent diffuse appearance, and thus struggle to capture realistic view-dependent effects. Our approach leverages that RGB-depth images provide samples of a surface light field. By encoding random subsamples of this surface light field into a compact set of latent vectors, our model learns to represent both geometry and appearance within a unified 3D latent space. This representation reproduces view-dependent effects such as specular highlights and Fresnel reflections under complex lighting. We further train a latent flow matching model on this representation to learn its distribution conditioned on a single input image, enabling the generation of 3D objects with appearances consistent with the lighting and materials in the input. Experiments show that our approach achieves higher visual quality and better input fidelity than existing methods.

翻译：我们提出了一种联合建模物体几何与视角相关外观的三维潜在表示。现有方法大多专注于三维几何重建或视角无关的漫反射外观预测，因而难以捕捉真实的视角相关效果。我们的方法利用RGB深度图像提供表面光场采样点的特性，通过将表面光场的随机子样本编码为紧凑的潜在向量集合，使模型能够在统一的三维潜在空间中同时表示几何与外观。该表示能够复现复杂光照下的镜面高光与菲涅尔反射等视角相关效应。我们进一步在该表示上训练潜在流匹配模型，以学习基于单张输入图像的条件分布，从而生成与输入图像中光照和材质外观一致的三维物体。实验表明，相较于现有方法，我们的方案在视觉质量与输入保真度方面均表现出更优性能。

0

相关内容

前馈式三维场景建模

前馈式三维场景建模

专知会员服务

11+阅读 · 4月17日

【剑桥博士论文】基于图像的三维重建：神经隐式表示的可微渲染方法

【剑桥博士论文】基于图像的三维重建：神经隐式表示的可微渲染方法

专知会员服务

18+阅读 · 2025年6月5日

【博士论文】ࣞ动态三维人体的隐式神经表示方法研究

【博士论文】ࣞ动态三维人体的隐式神经表示方法研究

专知会员服务

18+阅读 · 2024年11月22日

【斯坦福博士论文】学习神经场景表示的先验知识，115页pdf

【斯坦福博士论文】学习神经场景表示的先验知识，115页pdf

专知会员服务

25+阅读 · 2023年10月17日

Transformer如何用于3D视觉？阿联酋MBZUAI最新《3D视觉Transformers处理》综述，涵盖100+种方法

Transformer如何用于3D视觉？阿联酋MBZUAI最新《3D视觉Transformers处理》综述，涵盖100+种方法

专知会员服务

39+阅读 · 2022年8月9日

【博士论文】多视光场光线空间几何模型研究

【博士论文】多视光场光线空间几何模型研究

专知会员服务

24+阅读 · 2021年12月6日

光场显著性检测研究综述

专知会员服务

19+阅读 · 2020年12月23日

【斯坦福大学博士论文】自监督场景表示学习， 97页pdf

【斯坦福大学博士论文】自监督场景表示学习， 97页pdf

专知会员服务

96+阅读 · 2020年6月19日

【CVPR2020-Oral-牛津-Facebook】从单个图像进行端到端的视图合成，SynSin-View Synthesis

【CVPR2020-Oral-牛津-Facebook】从单个图像进行端到端的视图合成，SynSin-View Synthesis

专知会员服务

29+阅读 · 2020年3月26日

【DeepMind】PolyGen: 一种三维网格的自回归生成模型，PolyGen: An Autoregressive Generative Model of 3D Meshes

【DeepMind】PolyGen: 一种三维网格的自回归生成模型，PolyGen: An Autoregressive Generative Model of 3D Meshes

专知会员服务

37+阅读 · 2020年2月27日

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

专知

20+阅读 · 2019年11月24日

【微软ICLR2020提交论文】多模态预训练表示UNITER：通用图像-文本语言表示学习

【微软ICLR2020提交论文】多模态预训练表示UNITER：通用图像-文本语言表示学习

专知

50+阅读 · 2019年10月20日

西北工业大学发布最新遥感图像目标检测综述论文和Benchmark，带你全面了解遥感图像检测方法

西北工业大学发布最新遥感图像目标检测综述论文和Benchmark，带你全面了解遥感图像检测方法

专知

23+阅读 · 2019年9月5日

Deformable Kernels，用于图像/视频去噪，即将开源

Deformable Kernels，用于图像/视频去噪，即将开源

极市平台

13+阅读 · 2019年8月29日

港中大等打造光流预测新模型SelFlow，自监督学习攻克遮挡难题 | CVPR 2019

港中大等打造光流预测新模型SelFlow，自监督学习攻克遮挡难题 | CVPR 2019

新智元

10+阅读 · 2019年7月2日

吊打YOLOv3！普林斯顿大学提出：CornerNet-Lite，基于关键点的实时且精度高的目标检测算法，已开源！

吊打YOLOv3！普林斯顿大学提出：CornerNet-Lite，基于关键点的实时且精度高的目标检测算法，已开源！

极市平台

30+阅读 · 2019年4月20日

公开课|腾讯优图高级研究员张润泽：基于图像的大规模三维重建

公开课|腾讯优图高级研究员张润泽：基于图像的大规模三维重建

计算机视觉life

19+阅读 · 2018年12月27日

DeepMind无监督表示学习重大突破：语音、图像、文本、强化学习全能冠军！

DeepMind无监督表示学习重大突破：语音、图像、文本、强化学习全能冠军！

新智元

12+阅读 · 2018年7月13日

【论文推荐】最新十篇目标跟踪相关论文—多帧光流跟踪、动态图学习、MV-YOLO、姿态估计、深度核相关滤波、Benchmark

【论文推荐】最新十篇目标跟踪相关论文—多帧光流跟踪、动态图学习、MV-YOLO、姿态估计、深度核相关滤波、Benchmark

专知

13+阅读 · 2018年5月26日

【学界】李飞飞学生最新论文：利用场景图生成图像

【学界】李飞飞学生最新论文：利用场景图生成图像

GAN生成式对抗网络

15+阅读 · 2018年4月9日

基于各向异性点光源的近场光度学三维重建问题研究

国家自然科学基金

2+阅读 · 2017年12月31日

基于光场测量的高清晰成像方法探索研究

国家自然科学基金

0+阅读 · 2017年12月31日

电场响应光子晶体广角显示器的制备与研究

国家自然科学基金

0+阅读 · 2015年12月31日

近场光学反问题的同伦方法

国家自然科学基金

1+阅读 · 2015年12月31日

基于光频超衍射材料的深亚波长穿透深度表面显微成像

国家自然科学基金

0+阅读 · 2015年12月31日

基于多色距离场的异质材料的数字化建模与制造方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

调控光场实现超分辨显微成像的理论与方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

复杂场景点线光流三维重建模型的建立及鲁棒性分析

国家自然科学基金

2+阅读 · 2014年12月31日

表面等离子体动态全息显示技术研究

国家自然科学基金

1+阅读 · 2014年12月31日

光场相机摄影测量模型及方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

TokenLight: Precise Lighting Control in Images using Attribute Tokens

Arxiv

0+阅读 · 4月17日

Hybrid Latents: Geometry-Appearance-Aware Surfel Splatting

Arxiv

0+阅读 · 4月17日

TokenLight: Precise Lighting Control in Images using Attribute Tokens

Arxiv

0+阅读 · 4月16日

LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment

Arxiv

0+阅读 · 4月13日

DiffSoup: Direct Differentiable Rasterization of Triangle Soup for Extreme Radiance Field Simplification

Arxiv

0+阅读 · 3月28日

Detailed Geometry and Appearance from Opportunistic Motion

Arxiv

0+阅读 · 3月27日

SLAT-Phys: Fast Material Property Field Prediction from Structured 3D Latents

Arxiv

0+阅读 · 3月25日

LiteReality: Graphics-Ready 3D Scene Reconstruction from RGB-D Scans

Arxiv

0+阅读 · 3月19日

From Particles to Fields: Reframing Photon Mapping with Continuous Gaussian Photon Fields

Arxiv

0+阅读 · 3月16日

LiteReality: Graphics-Ready 3D Scene Reconstruction from RGB-D Scans

Arxiv

0+阅读 · 2月27日

VIP会员

文章信息

相关主题

最新内容

BES：让语言模型通过双向进化搜索自我改进

BES：让语言模型通过双向进化搜索自我改进

专知会员服务

3+阅读 · 5月30日

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

专知会员服务

3+阅读 · 5月30日

以色列-美国-伊朗战争中的无人机：关键要点

以色列-美国-伊朗战争中的无人机：关键要点

专知会员服务

4+阅读 · 5月30日

美以伊战争：首次人工智能战争——军事自主性困境

美以伊战争：首次人工智能战争——军事自主性困境

专知会员服务

4+阅读 · 5月30日

《Palantir任务保障性软件安全标准（MA-S2）》

《Palantir任务保障性软件安全标准（MA-S2）》

专知会员服务

10+阅读 · 5月30日

《美海军利用扩展现实增强知识流动研究》300页报告

《美海军利用扩展现实增强知识流动研究》300页报告

专知会员服务

6+阅读 · 5月30日

基于声学的无人机检测技术综述

基于声学的无人机检测技术综述

专知会员服务

7+阅读 · 5月30日

《当代混合战争分析框架：俄乌战争经验教训》

《当代混合战争分析框架：俄乌战争经验教训》

专知会员服务

8+阅读 · 5月30日

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

专知会员服务

11+阅读 · 5月29日

AutoScientists：自组织智能体团队驱动长期科学实验

AutoScientists：自组织智能体团队驱动长期科学实验

专知会员服务

6+阅读 · 5月29日

《阿利·伯克级驱逐舰的战损修理：桌面推演结果》报告

《阿利·伯克级驱逐舰的战损修理：桌面推演结果》报告

专知会员服务

6+阅读 · 5月29日

战略前沿人工智能的再思考（中文）

战略前沿人工智能的再思考（中文）

专知会员服务

8+阅读 · 5月29日

《量化地基防空系统间接效应的博弈论方法》

《量化地基防空系统间接效应的博弈论方法》

专知会员服务

6+阅读 · 5月29日

传感器网络：美国如何探测来自伊朗的导弹与无人机

传感器网络：美国如何探测来自伊朗的导弹与无人机

专知会员服务

6+阅读 · 5月29日

《无人机战争中的经济不对称：伊朗“沙赫德-136”对抗以色列“铁穹”防御系统的案例研究》

《无人机战争中的经济不对称：伊朗“沙赫德-136”对抗以色列“铁穹”防御系统的案例研究》

专知会员服务

9+阅读 · 5月29日

相关VIP内容

前馈式三维场景建模

前馈式三维场景建模

专知会员服务

11+阅读 · 4月17日

【剑桥博士论文】基于图像的三维重建：神经隐式表示的可微渲染方法

【剑桥博士论文】基于图像的三维重建：神经隐式表示的可微渲染方法

专知会员服务

18+阅读 · 2025年6月5日

【博士论文】ࣞ动态三维人体的隐式神经表示方法研究

【博士论文】ࣞ动态三维人体的隐式神经表示方法研究

专知会员服务

18+阅读 · 2024年11月22日

【斯坦福博士论文】学习神经场景表示的先验知识，115页pdf

【斯坦福博士论文】学习神经场景表示的先验知识，115页pdf

专知会员服务

25+阅读 · 2023年10月17日

Transformer如何用于3D视觉？阿联酋MBZUAI最新《3D视觉Transformers处理》综述，涵盖100+种方法

Transformer如何用于3D视觉？阿联酋MBZUAI最新《3D视觉Transformers处理》综述，涵盖100+种方法

专知会员服务

39+阅读 · 2022年8月9日

【博士论文】多视光场光线空间几何模型研究

【博士论文】多视光场光线空间几何模型研究

专知会员服务

24+阅读 · 2021年12月6日

光场显著性检测研究综述

专知会员服务

19+阅读 · 2020年12月23日

【斯坦福大学博士论文】自监督场景表示学习， 97页pdf

【斯坦福大学博士论文】自监督场景表示学习， 97页pdf

专知会员服务

96+阅读 · 2020年6月19日

【CVPR2020-Oral-牛津-Facebook】从单个图像进行端到端的视图合成，SynSin-View Synthesis

【CVPR2020-Oral-牛津-Facebook】从单个图像进行端到端的视图合成，SynSin-View Synthesis

专知会员服务

29+阅读 · 2020年3月26日

【DeepMind】PolyGen: 一种三维网格的自回归生成模型，PolyGen: An Autoregressive Generative Model of 3D Meshes

【DeepMind】PolyGen: 一种三维网格的自回归生成模型，PolyGen: An Autoregressive Generative Model of 3D Meshes

专知会员服务

37+阅读 · 2020年2月27日

热门VIP内容

开通专知VIP会员享更多权益服务

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

美以伊战争：首次人工智能战争——军事自主性困境

BES：让语言模型通过双向进化搜索自我改进

以色列-美国-伊朗战争中的无人机：关键要点

相关资讯

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

【AAAI2020论文】用于视觉对话中深度视觉理解的自适应双向编码模型—DualVD, 中科院信工所于静等

专知

20+阅读 · 2019年11月24日

【微软ICLR2020提交论文】多模态预训练表示UNITER：通用图像-文本语言表示学习

【微软ICLR2020提交论文】多模态预训练表示UNITER：通用图像-文本语言表示学习

专知

50+阅读 · 2019年10月20日

西北工业大学发布最新遥感图像目标检测综述论文和Benchmark，带你全面了解遥感图像检测方法

西北工业大学发布最新遥感图像目标检测综述论文和Benchmark，带你全面了解遥感图像检测方法

专知

23+阅读 · 2019年9月5日

Deformable Kernels，用于图像/视频去噪，即将开源

Deformable Kernels，用于图像/视频去噪，即将开源

极市平台

13+阅读 · 2019年8月29日

港中大等打造光流预测新模型SelFlow，自监督学习攻克遮挡难题 | CVPR 2019

港中大等打造光流预测新模型SelFlow，自监督学习攻克遮挡难题 | CVPR 2019

新智元

10+阅读 · 2019年7月2日

吊打YOLOv3！普林斯顿大学提出：CornerNet-Lite，基于关键点的实时且精度高的目标检测算法，已开源！

吊打YOLOv3！普林斯顿大学提出：CornerNet-Lite，基于关键点的实时且精度高的目标检测算法，已开源！

极市平台

30+阅读 · 2019年4月20日

公开课|腾讯优图高级研究员张润泽：基于图像的大规模三维重建

公开课|腾讯优图高级研究员张润泽：基于图像的大规模三维重建

计算机视觉life

19+阅读 · 2018年12月27日

DeepMind无监督表示学习重大突破：语音、图像、文本、强化学习全能冠军！

DeepMind无监督表示学习重大突破：语音、图像、文本、强化学习全能冠军！

新智元

12+阅读 · 2018年7月13日

【论文推荐】最新十篇目标跟踪相关论文—多帧光流跟踪、动态图学习、MV-YOLO、姿态估计、深度核相关滤波、Benchmark

【论文推荐】最新十篇目标跟踪相关论文—多帧光流跟踪、动态图学习、MV-YOLO、姿态估计、深度核相关滤波、Benchmark

专知

13+阅读 · 2018年5月26日

【学界】李飞飞学生最新论文：利用场景图生成图像

【学界】李飞飞学生最新论文：利用场景图生成图像

GAN生成式对抗网络

15+阅读 · 2018年4月9日

相关论文

TokenLight: Precise Lighting Control in Images using Attribute Tokens

Arxiv

0+阅读 · 4月17日

Hybrid Latents: Geometry-Appearance-Aware Surfel Splatting

Arxiv

0+阅读 · 4月17日

TokenLight: Precise Lighting Control in Images using Attribute Tokens

Arxiv

0+阅读 · 4月16日

LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment

Arxiv

0+阅读 · 4月13日

DiffSoup: Direct Differentiable Rasterization of Triangle Soup for Extreme Radiance Field Simplification

Arxiv

0+阅读 · 3月28日

Detailed Geometry and Appearance from Opportunistic Motion

Arxiv

0+阅读 · 3月27日

SLAT-Phys: Fast Material Property Field Prediction from Structured 3D Latents

Arxiv

0+阅读 · 3月25日

LiteReality: Graphics-Ready 3D Scene Reconstruction from RGB-D Scans

Arxiv

0+阅读 · 3月19日

From Particles to Fields: Reframing Photon Mapping with Continuous Gaussian Photon Fields

Arxiv

0+阅读 · 3月16日

LiteReality: Graphics-Ready 3D Scene Reconstruction from RGB-D Scans

Arxiv

0+阅读 · 2月27日

相关基金

基于各向异性点光源的近场光度学三维重建问题研究

国家自然科学基金

2+阅读 · 2017年12月31日

基于光场测量的高清晰成像方法探索研究

国家自然科学基金

0+阅读 · 2017年12月31日

电场响应光子晶体广角显示器的制备与研究

国家自然科学基金

0+阅读 · 2015年12月31日

近场光学反问题的同伦方法

国家自然科学基金

1+阅读 · 2015年12月31日

基于光频超衍射材料的深亚波长穿透深度表面显微成像

国家自然科学基金

0+阅读 · 2015年12月31日

基于多色距离场的异质材料的数字化建模与制造方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

调控光场实现超分辨显微成像的理论与方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

复杂场景点线光流三维重建模型的建立及鲁棒性分析

国家自然科学基金

2+阅读 · 2014年12月31日

表面等离子体动态全息显示技术研究

国家自然科学基金

1+阅读 · 2014年12月31日

光场相机摄影测量模型及方法研究

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员