Depth Anything 页面截图
产品页面 点击查看大图

Depth Anything

Depth Anything 是一款基于大规模标注与无标注数据联合训练的单目深度估计基础模型,可在零样本条件下进行相对深度与度量深度估计,优于 MiDaS v3.1 和 ZoeDepth,并支持下游微调与 ControlNet 等应用。

单目深度估计无标注图像深度估计模型
01

Overview

产品概述

Depth Anything 是一个面向鲁棒单目深度估计(Monocular Depth Estimation)的基础模型,论文发表于 CVPR 2024。它使用 6 个标注数据集(150 万张图像)和 8 个无标注数据集(超过 6200 万张图像)联合训练,通过数据引擎扩大数据覆盖范围,并结合数据增强和辅助监督来提升泛化能力。模型在零样本相对深度估计上优于 MiDaS v3.1,在零样本度量深度估计上优于 ZoeDepth;经过 NYUv2 和 KITTI 的度量深度微调后,可以取得新的 SOTA 结果。Depth Anything 还支持为 ControlNet 提供更好的深度条件,并可用于视频编辑等下游场景。所有模型均已发布。
02

Capabilities

核心能力

01

零样本相对深度估计

在 150 万标注图像和 6200 万以上无标注图像上联合训练,提供强泛化能力的单目相对深度估计,零样本性能优于 MiDaS v3.1。

02

零样本度量深度估计

支持零样本度量深度估计,效果优于 ZoeDepth,并可通过 NYUv2 和 KITTI 微调取得新的 SOTA 结果。

03

面向 ControlNet 的深度条件增强

基于 Depth Anything 重新训练深度条件 ControlNet,相比基于 MiDaS 的 ControlNet 获得更好的生成效果。

03

Use Cases

适用场景

  1. 01

    任意图像的单目深度估计

    面向任意图像和任意环境的鲁棒单目深度估计,在多个公共数据集和随机拍摄照片上表现出强大的泛化能力。

  2. 02

    视频编辑中的深度估计

    虽然 Depth Anything 本身是图像级深度估计方法,但可应用于视频编辑场景,为视频深度估计提供更好的深度图。

  3. 03

    预训练编码器迁移到语义分割

    将 Depth Anything 预训练编码器迁移到 Cityscapes 和 ADE20K 语义分割任务,可取得良好效果。

04

Integrations

集成能力

01

ControlNet

提供更好的深度条件 ControlNet,基于 Depth Anything 重新训练,优于基于 MiDaS 的 ControlNet。