EFFICIENT DELAY-AWARE EXPERIENCE REPLAY FOR ONLINE CONTINUAL LEARNING UNDER DELAYED LABEL STREAMS
Aprendizado Contínuo, Aprendizado Contínuo Online, Replay de Experiência, Mudança de Conceito, Rotulagem Atrasada.
A Aprendizagem Contínua Supervisionada pressupõe convencionalmente a disponibilidade imediata de rótulos após cada amostra recebida. Essa premissa, contudo, raramente se verifica em ambientes de fluxo contínuo de dados realistas, onde os atrasos na anotação são generalizados. Quando os sinais de supervisão são recebidos com latência, os rótulos associados a tarefas anteriores podem chegar durante fases posteriores de aprendizagem, confundindo os limites das tarefas, interferindo na otimização do modelo e, em última instância, degradando o desempenho atual. Além disso, os cenários de CL tipicamente envolvem fluxos de dados não estacionários, onde o processo subjacente de geração de dados evolui ao longo do tempo. Essa dinâmica temporal induz a mudança de conceito, na qual as representações aprendidas anteriormente tornam-se obsoletas à medida que a distribuição entrada-rótulo se altera. Os modelos que não conseguem se adaptar a essas mudanças sofrem degradação cumulativa de desempenho ao longo do tempo. O desafio é ainda mais exacerbado em ambientes online, onde os dados são observados sequencialmente em pequenos lotes, as amostras anteriores são inacessíveis e o modelo deve atualizar seus parâmetros incrementalmente em uma única passagem, um regime extremo conhecido como Aprendizagem Contínua Online. Partindo do problema apresentado, este trabalho investiga o impacto da rotulagem atrasada em Aprendizado Contínuo Online por meio de métodos baseados em Replay de Experiência. Propomos uma estratégia de seleção de instâncias plugável, sensível ao atraso, que estima a utilidade marginal de cada rótulo atrasado em relação ao estado atual de aprendizado do modelo. Em vez de atualizar indiscriminadamente todos os rótulos atrasados, o método reproduz seletivamente as instâncias que se espera que maximizem o progresso de aprendizado presente. A abordagem proposta oferece um mecanismo eficiente para lidar com rótulos atrasados em fluxos de dados, mantendo a robustez à não estacionariedade em ambientes de aprendizado contínuo.