AdaPop: Unlearning-Methode passt Gradientendruck an Faktenpopularität an
Neue Methode soll beliebte Fakten besser vergessen und die Forget-Retain-Balance automatisieren; Code ist öffentlich verfügbar.
Mit KI erstellt◆ Fakten auf einen Blick
- AdaPop passt den Gradientendruck basierend auf der Popularität von Fakten an.
- AdaPop automatisiert die Balance zwischen Vergessen und Behalten, um das Durchsickern von ungelerntem Inhalt zu reduzieren.
- Beliebte Fakten werden während des Pretrainings tiefer gespeichert und widerstehen dem Entfernen länger als seltene.
- Bestehende LLM-Unlearning-Methoden wenden einheitlichen Gradientendruck an, unabhängig von der Trainingsdatenhäufigkeit.
- Der Code zu AdaPop wurde in einem GitHub-Repository veröffentlicht: https://github.com/Anya-wUw/open-unlearning.
AdaPop setzt auf popularitätsabhängigen Gradientendruck
AdaPop ist eine neue Methode für das Unlearning großer Sprachmodelle (LLMs), die den Gradientendruck nicht einheitlich anwendet, sondern an die Popularität einer Tatsache anpasst. Wie die Autorinnen und Autoren in ihrem Paper schreiben, werden beliebte Fakten während des Pretrainings tiefer gespeichert und widerstehen dem Entfernen länger als seltene. Bestehende Unlearning-Verfahren setzen dagegen einen einheitlichen Gradientendruck ein, unabhängig davon, wie häufig die jeweilige Information in den Trainingsdaten vorkam. AdaPop kombiniert lokale Token-Konfidenz mit einem pro Faktum berechneten, popularitätsabhängigen Exponenten, der aus einem externen Proxy abgeleitet wird. Dadurch soll der Gradientendruck für populäre Fakten erhöht werden, um deren tiefere Verankerung im Modell auszugleichen. Der Ansatz beruht auf der Beobachtung, dass häufige Fakten im Pretraining stärker in den Gewichten verankert werden. Ein uniformer Gradientendruck entfernt seltene Fakten möglicherweise zu leicht, während populäre Fakten unzureichend vergessen werden. AdaPop skaliert den Druck entsprechend der Popularität, um diese Asymmetrie zu korrigieren.
Automatisierte Forget-Retain-Balance und veröffentlichter Code
Zusätzlich automatisiert AdaPop die Balance zwischen Vergessen und Behalten. Wie die Autorinnen und Autoren schreiben, soll dies das Durchsickern von ungelerntem Inhalt reduzieren. Die Methode kombiniert lokale Token-Konfidenz mit einem popularitätsabhängigen Exponenten, um diese Balance zu bestimmen. Die automatisierte Balance soll verhindern, dass unerwünschte Inhalte nach dem Unlearning weiterhin abrufbar bleiben. Der Code der Methode wurde in einem öffentlichen GitHub-Repository veröffentlicht: https://github.com/Anya-wUw/open-unlearning. Damit ist die Implementierung für die Fachcommunity zugänglich und kann für eigene Experimente genutzt werden. Die Veröffentlichung des Codes erleichtert die Reproduktion und den Vergleich mit anderen Unlearning-Verfahren.



