DINO troca a regressão vetorial do BYOL por distribuições aguçadas e centralizadas. A combinação aprende sem negativos e faz objetos aparecerem nos mapas de atenção.
O BYOL retira todos os negativos do SimCLR e pede que uma rede rápida alcance um alvo lento. A perda é curta; explicar por que a solução não colapsa exige...
Uma rede com milhões de parâmetros não merece aplausos por descobrir que x é igual a x. O autoencoder só começa a aprender quando copiar deixa de ser a saída...