Back to blog

Rotating Features for Object Discovery

通过旋转特征实现连续分布式对象中心表示,将对象发现从简单玩具数据扩展到真实世界数据

Rotating Features for Object Discovery

论文信息: arXiv:2306.00600 [cs.LG] 1 Jun 2023 (v2: 17 Oct 2023)

作者: Sindy Löwe, Phillip Lippe, Francesco Locatello, Max Welling

机构: University of Amsterdam, ISTA

会议: NeurIPS 2023 (Oral)

代码: https://github.com/loeweX/RotatingFeatures

许可: arXiv nonexclusive-distrib/1.0


一、论文概述

1.1 研究背景

绑定问题 (Binding Problem):大脑如何在固定的神经连接网络中表示和连接对象,这是认知科学中的核心问题。

现有方法的局限:

方法类型代表工作局限性
Slot-basedSlot Attention, MONet离散性质、难以表达不确定性
Complex AutoEncoderCAE仅适用于简单玩具数据

核心挑战:

  1. 离散 slot 方法难以表达对象分离的不确定性
  2. 无法学习灵活的 part-whole 层次结构
  3. Complex AutoEncoder 受限于二维特征,无法扩展

1.2 核心贡献

贡献说明
Rotating Features复数值特征向高维的泛化,支持更多对象表示
新评估程序从连续表示中提取离散对象掩码,支持多通道输入
预训练特征适用性可应用于预训练视觉 Transformer 特征,扩展到真实世界数据

二、核心思想

2.1 问题定义

绑定问题:如何在神经网络中动态地将分布式信息绑定为连贯的感知(如对象)?

现有方案的不足:

  1. Slot-based 方法:将潜表示分为离散的 “slots”,但:

    • 离散性质难以表达不确定性
    • 无法学习灵活的 part-whole 层次
    • 不太可能为每个感知对象分配完全不同的神经元组
  2. Complex AutoEncoder (CAE):使用复数值激活学习连续分布式表示,但:

    • 一维相位空间限制对象分离能力
    • 缺乏合适的评估程序
    • 仅适用于单通道灰度玩具数据

2.2 解决方案概述

Rotating Features:将标准特征扩展为 n 维向量,其中:

  • 幅度 (magnitude):学习表示特征的存在性
  • 方向 (orientation):学习表示对象归属

神经科学灵感:来自时间相关假说 (Temporal Correlation Hypothesis)

  • 放电频率编码特征存在
  • 脉冲的相对时间编码特征绑定
  • 神经元同步放电时,其特征被联合处理

三、技术架构

3.1 Rotating Features 表示

Rotating Features 概念 图 1:Rotating Features 通过在整个架构中添加额外维度 n(蓝色高亮,n=3),使幅度 m 学习特征存在性,方向学习对象归属。

数学表示:

标准特征: zstandard∈Rd\mathbf{z}_{\text{standard}} \in \mathbb{R}^d

Rotating Features: zrotating∈Rn×d\mathbf{z}_{\text{rotating}} \in \mathbb{R}^{n \times d}

其中:

  • nn:旋转维度(rotation dimension)
  • dd:特征维度
  • ∥zrotating∥2∈Rd\|\mathbf{z}_{\text{rotating}}\|_2 \in \mathbb{R}^d:幅度向量,表示特征存在性
  • 剩余 n−1n-1 维:方向信息,用于特征绑定

3.2 层结构 frotf_{\text{rot}}

权重和偏置

给定输入 zin∈Rn×din\mathbf{z}_{\text{in}} \in \mathbb{R}^{n \times d_{\text{in}}},应用权重 w∈Rdin×dout\mathbf{w} \in \mathbb{R}^{d_{\text{in}} \times d_{\text{out}}} 和偏置 b∈Rn×dout\mathbf{b} \in \mathbb{R}^{n \times d_{\text{out}}}:

ψ=fw(zin)+b∈Rn×dout\boldsymbol{\psi} = f_{\mathbf{w}}(\mathbf{z}_{\text{in}}) + \mathbf{b} \in \mathbb{R}^{n \times d_{\text{out}}}

关键设计:

  • 权重 w\mathbf{w} 在 nn 个旋转维度间共享
  • 偏置 b\mathbf{b} 在 nn 个维度间独立(学习不同方向偏移)

绑定机制

使用相同权重处理输入特征的幅度:

χ=fw(∥zin∥2)∈Rdout\boldsymbol{\chi} = f_{\mathbf{w}}(\|\mathbf{z}_{\text{in}}\|_2) \in \mathbb{R}^{d_{\text{out}}}

与 ψ\boldsymbol{\psi} 的幅度取平均:

mbind=0.5⋅∥ψ∥2+0.5⋅χ∈Rdout\mathbf{m}_{\text{bind}} = 0.5 \cdot \|\boldsymbol{\psi}\|_2 + 0.5 \cdot \boldsymbol{\chi} \in \mathbb{R}^{d_{\text{out}}}

绑定机制效果 图 3:绑定机制使相似方向的特征被共同处理,不同方向的特征连接被抑制。

激活函数

mout=ReLU(BatchNorm(mbind))∈Rdout\mathbf{m}_{\text{out}} = \text{ReLU}(\text{BatchNorm}(\mathbf{m}_{\text{bind}})) \in \mathbb{R}^{d_{\text{out}}}

zout=ψ∥ψ∥2⋅mout∈Rn×dout\mathbf{z}_{\text{out}} = \frac{\boldsymbol{\psi}}{\|\boldsymbol{\psi}\|_2} \cdot \mathbf{m}_{\text{out}} \in \mathbb{R}^{n \times d_{\text{out}}}

3.3 训练流程

输入预处理:

  • 给定输入图像 x′∈Rc×h×w\mathbf{x}' \in \mathbb{R}^{c \times h \times w}
  • 创建旋转特征输入 x∈Rn×c×h×w\mathbf{x} \in \mathbb{R}^{n \times c \times h \times w}(添加 n−1n-1 个空维度)

输出处理:

  • 提取输出幅度 ∥z∥2∈Rc×h×w\|\mathbf{z}\|_2 \in \mathbb{R}^{c \times h \times w}
  • 通过线性层和 sigmoid 激活重建:

x^=fout(∥z∥2)∈Rc×h×w\hat{\mathbf{x}} = f_{\text{out}}(\|\mathbf{z}\|_2) \in \mathbb{R}^{c \times h \times w}

损失函数: L=MSE(x′,x^)\mathcal{L} = \text{MSE}(\mathbf{x}', \hat{\mathbf{x}})

3.4 评估程序

步骤 1:归一化 znorm=z∥z∥2∈Rn×c×h×w\mathbf{z}_{\text{norm}} = \frac{\mathbf{z}}{\|\mathbf{z}\|_2} \in \mathbb{R}^{n \times c \times h \times w}

步骤 2:加权平均(避免平凡解)

对于多通道输入,使用阈值化幅度作为权重:

wevali,j,l={1if ∥z∥2i,j,l>t0otherwise\mathbf{w}_{\text{eval}}^{i,j,l} = \begin{cases} 1 & \text{if } \|\mathbf{z}\|_2^{i,j,l} > t \\ 0 & \text{otherwise} \end{cases}

zeval=∑i=1cwevali∘znormi∑i=1cwevali+ε∈Rn×h×w\mathbf{z}_{\text{eval}} = \frac{\sum_{i=1}^{c} \mathbf{w}_{\text{eval}}^{i} \circ \mathbf{z}_{\text{norm}}^{i}}{\sum_{i=1}^{c} \mathbf{w}_{\text{eval}}^{i} + \varepsilon} \in \mathbb{R}^{n \times h \times w}

步骤 3:聚类

  • 使用 k-means 或凝聚聚类 (agglomerative clustering)
  • 无需预先指定对象数量

四、核心创新

4.1 创新点总结

创新点说明理论/实验依据
高维旋转特征从复数 (n=2) 扩展到任意 n 维4Shapes/10Shapes 实验
绑定机制相似方向特征共同处理Fig. 3 效果验证
新评估程序支持多通道输入的对象分离Pascal VOC 实验
预训练特征适用应用于 DINO 特征真实世界数据实验

4.2 关键优势

  1. 自动确定对象数量:通过聚类方法自动学习正确数量
  2. 泛化能力:可泛化到训练时未见的对象数量
  3. 不确定性表达:连续表示可表达对象分离的不确定性
  4. 高效训练:单 GPU 训练不到 3.5 小时

五、实验结果

5.1 4Shapes 数据集

4Shapes 定性对比 图 4a:与标准自编码器和 CAE 相比,Rotating Features 产生更清晰的重建,并分离所有四个形状。

4Shapes 定量对比 图 4b:更大的旋转维度 n 带来更好的重建和对象发现性能,n≥6 时完美分离所有形状。

关键发现:

  • CAE 和 n=2 的 Rotating Features 难以区分所有四个对象
  • n=6 时完美分离所有四个对象
  • 重建性能显著优于标准自编码器

5.2 10Shapes 数据集

10Shapes 结果 图 5:Rotating Features 学习分离 10Shapes 数据集中的所有十个对象。

性能指标:

  • ARI-BG: 0.959±0.0220.959 \pm 0.022
  • 证明 Rotating Features 可同时表示多个对象

5.3 RGB(-D) 数据集

RGB 定性结果 图 6a:Rotating Features 在 RGB 图像中倾向按颜色分组对象。

RGB 定量结果 图 6b:添加深度信息可解决颜色分组问题。

关键发现:

  • 纯 RGB 图像中,Rotating Features 倾向按颜色分组
  • 添加深度信息 (RGB-D) 可解决此问题
  • 需要高层信息才能可靠分离对象

5.4 真实世界数据

Pascal VOC 数据集:

模型MBO_i ↑MBO_c ↑
Block Masks0.2470.259
Slot Attention0.222 ± 0.0080.237 ± 0.008
SLATE0.310 ± 0.0040.324 ± 0.004
Rotating Features –DINO0.282 ± 0.0060.320 ± 0.006
DINO k-means0.3630.405
DINO CAE0.329 ± 0.0090.374 ± 0.010
DINOSAUR Transformer0.440 ± 0.0080.512 ± 0.008
DINOSAUR MLP0.395 ± 0.0000.409 ± 0.000
Rotating Features0.407 ± 0.0010.460 ± 0.001

FoodSeg103 数据集:

  • MBO_c: 0.484±0.0020.484 \pm 0.002(显著优于 Block Masks: 0.296)

5.5 聚类方法分析

聚类方法对比 图 7:训练后可高效比较不同聚类方法和超参数。

关键发现:

  • k-means 和凝聚聚类都取得强结果
  • 凝聚聚类无需预先指定对象数量

5.6 不确定性图

不确定性图 图 8:不确定性图显示对象重叠、边界和错误预测区域的不确定性较高。

5.7 泛化性能

泛化性能 图 9:当测试图像中对象数量未知时,只有 Rotating Features 配合凝聚聚类保持稳定性能。

关键发现:

  • Slot Attention 在已知对象数量时性能更优
  • Rotating Features + 凝聚聚类在对象数量未知时泛化更好

六、代码实现分析

6.1 项目结构

  • 核心实现: PyTorch 卷积自编码架构
  • 训练: Adam 优化器,batch-size 64,10,000-100,000 步
  • 硬件: 单 Nvidia GTX 1080Ti
  • 训练时间: Pascal VOC 数据集不到 3.5 小时

6.2 关键组件

  1. Rotating Features 层: 实现 frotf_{\text{rot}} 层结构
  2. 绑定机制: 相似方向特征共同处理
  3. 评估程序: 从连续表示提取离散对象掩码
  4. 聚类模块: 支持 k-means 和凝聚聚类

七、相关工作

7.1 Slot-based 方法

方法特点局限性
Slot Attention迭代注意力机制离散 slot
MONet注意力绑定需要指定 slot 数量
DINOSAUR应用于 DINO 特征需要自回归解码器

7.2 连续分布式方法

方法特点局限性
Complex AutoEncoder复数值激活仅适用于灰度玩具数据
本文工作高维旋转特征需要预训练特征

八、总结

8.1 核心贡献

  1. Rotating Features:复数值特征向高维的泛化,支持更多对象表示
  2. 新评估程序:从连续表示中提取离散对象掩码,支持多通道输入
  3. 预训练特征适用性:可应用于预训练视觉 Transformer 特征
  4. 新范式:为绑定问题提供新的解决思路

8.2 技术影响

  • 对象发现:从简单玩具数据扩展到真实世界数据
  • 表示学习:提供连续分布式对象中心表示的新范式
  • 认知建模:更接近大脑处理对象的方式
  • 下游应用:可应用于图像分割、场景理解等任务

8.3 局限性

  1. 瓶颈层限制:在自编码器瓶颈层,对象分离不够明显,最多只能提取两个对象
  2. 性能差距:略低于 DINOSAUR 自回归 Transformer,但优于标准 MLP 解码器
  3. 需要高层特征:在纯 RGB 图像中效果有限,需要深度信息或预训练特征
  4. 聚类依赖:需要后处理聚类步骤

九、参考资源

9.1 论文链接

9.2 关键图表

图表说明路径
图 1Rotating Features 概念figure-1-rotating-features-concept.jpg
图 2真实世界应用figure-2-real-world-applications.jpg
图 3绑定机制效果figure-3-binding-mechanism.jpg
图 4a4Shapes 定性对比figure-4a-4shapes-qualitative.jpg
图 4b4Shapes 定量对比figure-4b-4shapes-quantitative.jpg
图 510Shapes 结果figure-5-10shapes-results.jpg
图 6aRGB 定性结果figure-6a-rgb-qualitative.jpg
图 6bRGB 定量结果figure-6b-rgb-quantitative.jpg
图 7聚类方法对比figure-7-clustering-methods.jpg
图 8不确定性图figure-8-uncertainty-maps.jpg
图 9泛化性能figure-9-generalization-performance.jpg

9.3 相关论文

论文作者年份关系
Complex AutoEncoderLowe et al.2022前驱工作
Slot AttentionLocatello et al.2020对比方法
DINOSAURSeitzer et al.2023对比方法
DINOCaron et al.2021预训练特征

9.4 关键技术术语

术语英文说明
绑定问题Binding Problem大脑如何在固定网络中表示和连接对象
旋转特征Rotating Features高维连续分布式对象中心表示
对象发现Object Discovery无监督学习图像中的对象
Slot-basedSlot-based Methods离散 slot 表示方法
复数值Complex-valued使用复数表示特征
不确定性Uncertainty对象分离的置信度

分析完成时间:2026年6月24日 分析工具:Claude Code + paper-analyzer skill