Probing Hidden Knowledge Holes in Unlearned LLMs
content removalevaluation frameworkhidden costsirrelevant responsesknowledge holesknowledge preservationmachine unlearningmodel evaluationnonsensical responsesperformance benchmarkspre-trainingstatic benchmarkstest case generationunintended lossesunlearning techniques
Machine unlearning has emerged as a prevalent technical solution for selectively removing unwanted knowledge absorbed during pre-training, without requiring full retraining. While recent unlearning techniques can effectively remove undesirable content without severely compromising performance on standard benchmarks, we find that they may inadvertently create ``knowledge holes''